Tiny Online Tools logoTiny Online ToolssearchTools suchen…grid_viewAlle Tools
Startseitechevron_rightPDF-Toolschevron_rightPDF-Scan- oder Textseiten-ErkennungPDF-Scan- oder Textseiten-Erkennung

PDF-Scan- oder Textseiten-Erkennung

Unterscheiden Sie echten Text vom nackten Scan und vom Scan mit OCR-Ebene, Seite für Seite.

upload_file

Zum Durchsuchen klicken oder Dateien hierher ziehen und ablegen

PDF zum Analysieren auswählen

Akzeptiert: .pdf,application/pdf

Ahnliche Tools

PDF-OCR-Text korrigieren

PDF-OCR-Text korrigieren

Korrigieren Sie falsch erkannte Wörter in der verborgenen OCR-Ebene eines Scans, ohne das Bild anzutasten.

PDF-OCR-Ebene anzeigen

PDF-OCR-Ebene anzeigen

Sehen Sie den unsichtbaren OCR-Text eines gescannten PDFs genau dort, wo er auf der Seite sitzt.

PDF auf versteckte Daten prüfen

PDF auf versteckte Daten prüfen

Zeigt, was eine PDF mitführt, aber nicht anzeigt: Metadaten, ausgeblendete Ebenen, Anhänge, JavaScript, unsichtbaren Text und Text unter Schwärzungsbalken.

PDF-Link-Extraktor

PDF-Link-Extraktor

Listet jeden Link eines PDFs — extern, intern, E-Mail und die bloßen URLs im Text ohne Annotation — mit Seite, Ankertext und Risikohinweisen.

IP-Bereich-Generator

IP-Bereich-Generator

Erzeuge alle IP-Adressen innerhalb eines CIDR-Blocks oder eines benutzerdefinierten IP-Bereichs.

PDF drehen

PDF drehen

Drehe PDF-Seiten, um die Ausrichtung zu korrigieren.

Text-Ausrichten-Tool

Text-Ausrichten-Tool

Richte Text so aus, dass Zeilen ueber eine feste Breite gleichmaessig verteilt sind.

apps

Mehr Tools

Durchsuchen Sie unsere vollstandige Sammlung kostenloser Online-Tools.

Warum „hat dieses PDF Text?" die falsche Frage ist

Ein PDF kann auf Seite eins durchsuchbar und auf Seite zwei eine Fotografie sein. Die übliche Prüfung — Text extrahieren, etwas finden, Erfolg vermelden — liegt in beiden Fällen falsch. Und sie liegt auch im häufigsten Fall der Praxis falsch: bei einem Scan, der bereits durch eine OCR gelaufen ist und tatsächlich durchsuchbar ist, obwohl jedes sichtbare Pixel ein Bild ist.

Diese Erkennung arbeitet Seite für Seite und sammelt sechs unabhängige Signale, bevor sie irgendetwas behauptet:

  • Extrahierter Text — wie viele Wörter und Zeichen ein Extraktor tatsächlich zurückgibt.
  • Textrendermodi — Glyphen im Modus 3 sind unsichtbar. Genau so schreibt OCR-Software erkannte Wörter über einen Scan, und es ist der einzige verlässliche Weg, einen OCR-Scan von einer digital erzeugten Seite zu unterscheiden.
  • Gezeichnete Bilder — wo jedes Bild landet und welchen Anteil der Seite es bedeckt.
  • Effektive DPI und Farbtiefe — ein 1-Bit-Bild mit CCITT- oder JBIG2-Kompression ist die Ausgabe eines Scanners, kein Foto und kein Logo.
  • Vektorpfade — eine Seite aus einem Textprogramm hat fast immer Linien, Rahmen oder Strichgrafik. Ein nackter Scan hat keine.

Was Sie bekommen

Jede Seite wird als digital erzeugter Text, gescanntes Bild, Scan + OCR-Ebene, gemischt oder leer eingestuft, mit einer Sicherheitsangabe und — das ist der entscheidende Teil — der Liste der Fakten, die zu dieser Einstufung geführt haben. Wenn Sie einem Urteil widersprechen, sehen Sie genau, welches Signal es ausgelöst hat.

Die Zusammenfassung beantwortet die Frage, mit der Sie gekommen sind: ist das Dokument durchgehend durchsuchbar, und wenn nicht, welche Seiten brauchen eine OCR? Der vollständige Bericht lässt sich als CSV oder JSON exportieren.

Grenzen

Nichts in einem PDF erklärt „ich bin ein Scan", also ist dies eine Schlussfolgerung. Eine Seite, deren Text in Konturen umgewandelt wurde, hat keine Textobjekte und sieht aus wie ein Scan. Ein Scan mit schlechter OCR-Ebene ist technisch durchsuchbar, praktisch aber nutzlos. Beides wird mit Belegen gemeldet statt mit einer selbstbewusst klingenden Vermutung.

Datenschutz

Die Datei verlässt Ihren Rechner nie. Analyse, Rendering, Miniaturansichten und Bericht laufen vollständig im Browser.