La couche que personne ne voit
Quand un scan passe par un OCR, le moteur de reconnaissance ne remplace pas l'image. Il laisse le scan exactement tel quel et écrit par-dessus les mots reconnus dans le mode de rendu 3 du PDF — « ni remplissage ni contour ». Le texte est là, sélectionnable et consultable, mais aucune visionneuse n'en peindra jamais un seul pixel.
C'est une conception sensée, et cela rend la qualité de l'OCR impossible à juger. Une recherche qui ne renvoie rien vous dit que le mot manque ; elle ne vous dit pas si le moteur a lu Reçu comme Reçv, ni s'il a décalé une colonne entière d'une ligne vers le haut.
Ce que cet outil montre
Chaque mot reconnu est retracé dans le cadre exact dont il provient, par-dessus le scan dont il est issu. Quatre affichages :
- Cadres seuls — des contours, pour juger couverture et alignement sans que le texte gêne.
- Texte sur l'image — les mots reconnus tracés en semi-transparence sur le scan, avec un curseur d'opacité. Là où la reconnaissance a dérapé, le mot tracé glisse visiblement par rapport au mot scanné en dessous.
- Texte seul — la couche seule sur papier blanc, c'est-à-dire ce que reçoit en pratique un lecteur d'écran.
- Image seule — le scan tel quel, pour comparer.
Basculez entre cadres de mot, de ligne et de bloc, cherchez dans le texte reconnu et voyez les correspondances surlignées sur la page, et cliquez sur un cadre pour le retrouver dans la liste.
Juger la qualité
Par page, vous obtenez le nombre de mots et de caractères, la part du texte réellement invisible, la taille moyenne du cadre de mot, et un taux de couverture : quelle fraction de la surface de la page les cadres OCR occupent. Un moteur qui a abandonné à mi-page se trahit par une couverture faible bien avant que vous ne remarquiez les mots manquants.
Les mots dont la forme est statistiquement bizarre sont signalés : absence de voyelle, lettres mêlées de chiffres, fragments d'un seul caractère, suites de symboles, cadres nettement décalés par rapport à leurs voisins. Ce sont des suspicions, pas des erreurs.
Export
Texte brut, JSON avec chaque cadre et sa police, ou HTML de type hOCR pour la suite de la chaîne. Les coordonnées sont des points PDF, origine en haut à gauche.
Confidentialité
Rien n'est envoyé. Le PDF est analysé, rendu et mesuré entièrement dans votre navigateur.
Tiny Online Tools







