Korrigieren, was niemand sehen kann
Ein gescanntes PDF, das durch eine OCR gelaufen ist, trägt den Scan als Bild und die erkannten Wörter als unsichtbaren Text darüber. Erkennt die Software ein Wort falsch, sieht das Bild weiterhin perfekt aus — still scheitern nur Suche, Kopieren und Screenreader.
Dieses Werkzeug bearbeitet genau diese verborgene Ebene. Der Scan wird nicht neu kodiert, nicht neu komprimiert und nicht neu gezeichnet.
Wie die Datei verändert wird
Der Content-Stream einer Seite ist eine Liste von Operatoren: manche zeichnen das gescannte Bild, andere positionieren und zeigen Text. Der Stream wird tokenisiert, und ersetzt wird nur der Zeichenketten-Operand eines unsichtbaren Textoperators. Die Bedeutung aller übrigen Bytes bleibt erhalten — Positionierungsoperatoren, Grafikzustand und der Operator, der den Scan malt, gehen unverändert durch.
Deshalb kann sich die korrigierte Seite nicht verschieben, nicht unschärfer werden und nicht neu komprimiert werden. Das ist kein Versprechen, sondern die Folge davon, dass nichts neu erzeugt wird.
Eine Überprüfung, die man lesen kann
Nach dem Schreiben wird das Ergebnis erneut geöffnet, und auf jeder geänderten Seite laufen drei Prüfungen:
- Text — die korrigierten Wörter sind das, was ein Textextraktor jetzt zurückgibt.
- Unsichtbarkeit — die Ebene ist weiterhin im Rendermodus 3 gezeichnet, und die Zahl der sichtbaren Glyphen ist unverändert.
- Pixel — die korrigierte Seite wird gerendert und Pixel für Pixel mit dem Original verglichen. Der Anteil geänderter Pixel soll null sein.
Alle drei Ergebnisse werden vor dem Download angezeigt, ob bestanden oder nicht.
Wann das Werkzeug ablehnt
Manche Seiten lassen sich nicht sicher neu schreiben: ein Content-Stream mit einem nicht dekodierbaren Filter, oder ein Textblock, der sichtbare und unsichtbare Glyphen so mischt, dass die Unversehrtheit der sichtbaren nicht garantiert werden kann. Solche Seiten werden namentlich abgelehnt und bleiben exakt so, wie sie waren. Eine Ablehnung ist die richtige Antwort — eine still beschädigte Datei nicht.
Zeichen, die die Schriften des PDFs nicht darstellen können, werden ebenso behandelt: wo möglich wird eine Standard-Helvetica eingebettet, um den Ersatztext zu tragen; wo das nicht reicht, wird die Änderung übersprungen und benannt.
Datenschutz
Parsen, Bearbeiten, Speichern und Prüfen geschehen in Ihrem Browser. Das PDF wird nie hochgeladen.
Tiny Online Tools







