Tiny Online Tools logoTiny Online ToolssearchTools suchen…grid_viewAlle Tools
Startseitechevron_rightPDF-Toolschevron_rightPDF-OCR-Text korrigierenPDF-OCR-Text korrigieren

PDF-OCR-Text korrigieren

Korrigieren Sie falsch erkannte Wörter in der verborgenen OCR-Ebene eines Scans, ohne das Bild anzutasten.

upload_file

Zum Durchsuchen klicken oder Dateien hierher ziehen und ablegen

Gescanntes PDF mit OCR-Ebene auswählen

Akzeptiert: .pdf,application/pdf

Ahnliche Tools

PDF-OCR-Ebene anzeigen

PDF-OCR-Ebene anzeigen

Sehen Sie den unsichtbaren OCR-Text eines gescannten PDFs genau dort, wo er auf der Seite sitzt.

PDF-Scan- oder Textseiten-Erkennung

PDF-Scan- oder Textseiten-Erkennung

Unterscheiden Sie echten Text vom nackten Scan und vom Scan mit OCR-Ebene, Seite für Seite.

PDF-Lesereihenfolge bearbeiten

PDF-Lesereihenfolge bearbeiten

Sehen und ändern Sie die Lesereihenfolge eines getaggten PDFs — per Ziehen oder per Klick auf die Seite.

PDF auf versteckte Daten prüfen

PDF auf versteckte Daten prüfen

Zeigt, was eine PDF mitführt, aber nicht anzeigt: Metadaten, ausgeblendete Ebenen, Anhänge, JavaScript, unsichtbaren Text und Text unter Schwärzungsbalken.

SVG-Pfad-Editor

SVG-Pfad-Editor

Bearbeite und visualisiere SVG-Pfaddaten (d-Attribut) interaktiv.

PNG in AVIF umwandeln

PNG in AVIF umwandeln

Wandle PNG-Bilder in das moderne AVIF-Format um und erhalte deutlich kleinere Dateien.

Kalenderwochen-Rechner

Kalenderwochen-Rechner

Ermitteln Sie ISO-8601-Kalenderwoche, US-Woche, Tag des Jahres und verbleibende Tage für jedes Datum.

apps

Mehr Tools

Durchsuchen Sie unsere vollstandige Sammlung kostenloser Online-Tools.

Korrigieren, was niemand sehen kann

Ein gescanntes PDF, das durch eine OCR gelaufen ist, trägt den Scan als Bild und die erkannten Wörter als unsichtbaren Text darüber. Erkennt die Software ein Wort falsch, sieht das Bild weiterhin perfekt aus — still scheitern nur Suche, Kopieren und Screenreader.

Dieses Werkzeug bearbeitet genau diese verborgene Ebene. Der Scan wird nicht neu kodiert, nicht neu komprimiert und nicht neu gezeichnet.

Wie die Datei verändert wird

Der Content-Stream einer Seite ist eine Liste von Operatoren: manche zeichnen das gescannte Bild, andere positionieren und zeigen Text. Der Stream wird tokenisiert, und ersetzt wird nur der Zeichenketten-Operand eines unsichtbaren Textoperators. Die Bedeutung aller übrigen Bytes bleibt erhalten — Positionierungsoperatoren, Grafikzustand und der Operator, der den Scan malt, gehen unverändert durch.

Deshalb kann sich die korrigierte Seite nicht verschieben, nicht unschärfer werden und nicht neu komprimiert werden. Das ist kein Versprechen, sondern die Folge davon, dass nichts neu erzeugt wird.

Eine Überprüfung, die man lesen kann

Nach dem Schreiben wird das Ergebnis erneut geöffnet, und auf jeder geänderten Seite laufen drei Prüfungen:

  1. Text — die korrigierten Wörter sind das, was ein Textextraktor jetzt zurückgibt.
  2. Unsichtbarkeit — die Ebene ist weiterhin im Rendermodus 3 gezeichnet, und die Zahl der sichtbaren Glyphen ist unverändert.
  3. Pixel — die korrigierte Seite wird gerendert und Pixel für Pixel mit dem Original verglichen. Der Anteil geänderter Pixel soll null sein.

Alle drei Ergebnisse werden vor dem Download angezeigt, ob bestanden oder nicht.

Wann das Werkzeug ablehnt

Manche Seiten lassen sich nicht sicher neu schreiben: ein Content-Stream mit einem nicht dekodierbaren Filter, oder ein Textblock, der sichtbare und unsichtbare Glyphen so mischt, dass die Unversehrtheit der sichtbaren nicht garantiert werden kann. Solche Seiten werden namentlich abgelehnt und bleiben exakt so, wie sie waren. Eine Ablehnung ist die richtige Antwort — eine still beschädigte Datei nicht.

Zeichen, die die Schriften des PDFs nicht darstellen können, werden ebenso behandelt: wo möglich wird eine Standard-Helvetica eingebettet, um den Ersatztext zu tragen; wo das nicht reicht, wird die Änderung übersprungen und benannt.

Datenschutz

Parsen, Bearbeiten, Speichern und Prüfen geschehen in Ihrem Browser. Das PDF wird nie hochgeladen.