Tiny Online Tools logoTiny Online ToolssearchRechercher des outils…grid_viewTous les outils
Accueilchevron_rightOutils PDFchevron_rightCorrecteur OCR de PDFCorrecteur OCR de PDF

Correcteur OCR de PDF

Corrigez les mots mal reconnus dans la couche OCR cachée d'un PDF scanné sans toucher au scan.

upload_file

Cliquez pour parcourir ou glissez-deposez des fichiers ici

Choisissez un PDF scanné avec couche OCR

Accepte : .pdf,application/pdf

Outils similaires

Visionneuse de Couche OCR de PDF

Visionneuse de Couche OCR de PDF

Affichez le texte OCR invisible d'un PDF scanné exactement là où il se trouve sur la page.

Détecteur de PDF Scanné ou Consultable

Détecteur de PDF Scanné ou Consultable

Distinguez le vrai texte d'un scan et d'un scan océrisé, page par page.

Extracteur de liens PDF

Extracteur de liens PDF

Liste tous les liens d'un PDF — externes, internes, e-mail et les URL brutes du texte sans annotation — avec page, texte affiché et signalements de risque.

Éditeur d'Ordre de Lecture PDF

Éditeur d'Ordre de Lecture PDF

Visualisez et modifiez l'ordre de lecture d'un PDF balisé, par glisser-déposer ou en cliquant la page.

Générateur UUID v1

Générateur UUID v1

Générez des UUID v1 avec horodatage intégré.

Générateur d’UUID

Générateur d’UUID

Générez des identifiants UUID v4 uniques.

Générateur de Box Shadow

Générateur de Box Shadow

Créez des ombres CSS visuellement avec un aperçu en temps réel.

apps

Plus d'outils

Parcourez notre collection complète d'outils en ligne gratuits.

Corriger ce que personne ne voit

Un PDF scanné passé par un OCR porte le scan sous forme d'image et les mots reconnus sous forme de texte invisible par-dessus. Quand le moteur se trompe sur un mot, l'image reste parfaite : ce sont la recherche, le copier-coller et les lecteurs d'écran qui échouent en silence.

Cet outil modifie cette couche cachée. Le scan n'est ni ré-encodé, ni recompressé, ni retracé.

Comment le fichier est modifié

Le flux de contenu d'une page est une liste d'opérateurs : certains dessinent l'image scannée, d'autres positionnent et affichent du texte. Le flux est analysé et seul l'opérande chaîne d'un opérateur de texte invisible est remplacé. Le sens de tous les autres octets est préservé : opérateurs de positionnement, état graphique et opérateur qui peint le scan traversent sans être touchés.

C'est pour cela que la page corrigée ne peut ni se décaler, ni se flouter, ni se recompresser. Ce n'est pas une promesse, c'est la conséquence de ne rien régénérer.

Une vérification lisible

Après écriture, le résultat est rouvert et trois contrôles sont exécutés sur chaque page modifiée :

  1. Texte — les mots corrigés sont bien ce qu'un extracteur renvoie désormais.
  2. Invisibilité — la couche est toujours tracée en mode de rendu 3, et le nombre de glyphes visibles n'a pas changé.
  3. Pixels — la page corrigée est rendue puis comparée au rendu original, pixel par pixel. La proportion modifiée doit être nulle.

Les trois résultats sont affichés avant le téléchargement, qu'ils passent ou qu'ils échouent.

Quand l'outil refuse

Certaines pages ne peuvent pas être réécrites sans risque : un flux de contenu utilisant un filtre indécodable, ou un bloc de texte mêlant glyphes visibles et invisibles au point qu'on ne peut plus garantir l'intégrité des visibles. Ces pages sont refusées nommément et laissées telles quelles. Refuser est la bonne réponse ; livrer un fichier silencieusement corrompu ne l'est pas.

Les caractères que les polices du PDF ne savent pas exprimer sont traités de la même façon : quand c'est possible, une Helvetica standard est intégrée pour porter le remplacement ; quand cela ne suffit pas, la modification est ignorée et signalée.

Confidentialité

Analyse, modification, enregistrement et vérification ont lieu dans votre navigateur. Le PDF n'est jamais envoyé.