Tiny Online Tools logoTiny Online ToolssearchRechercher des outils…grid_viewTous les outils
Accueilchevron_rightOutils PDFchevron_rightDétecteur de PDF Scanné ou ConsultableDétecteur de PDF Scanné ou Consultable

Détecteur de PDF Scanné ou Consultable

Distinguez le vrai texte d'un scan et d'un scan océrisé, page par page.

upload_file

Cliquez pour parcourir ou glissez-deposez des fichiers ici

Choisissez un PDF à analyser

Accepte : .pdf,application/pdf

Outils similaires

Visionneuse de Couche OCR de PDF

Visionneuse de Couche OCR de PDF

Affichez le texte OCR invisible d'un PDF scanné exactement là où il se trouve sur la page.

Correcteur OCR de PDF

Correcteur OCR de PDF

Corrigez les mots mal reconnus dans la couche OCR cachée d'un PDF scanné sans toucher au scan.

Inspecteur de données cachées PDF

Inspecteur de données cachées PDF

Révèle ce qu'un PDF transporte sans l'afficher : métadonnées, calques masqués, pièces jointes, JavaScript, texte invisible et texte sous les caviardages.

Extracteur de données structurées PDF

Extracteur de données structurées PDF

Transforme un PDF en JSON structuré — titres, paragraphes, listes, tableaux et images — depuis l'arbre balisé ou par inférence de mise en page.

Ajouter un filigrane a un PDF

Ajouter un filigrane a un PDF

Ajoutez un filigrane texte a un PDF.

Outil de Signature PDF

Outil de Signature PDF

Dessinez une signature et placez-la sur n'importe quelle page d'un PDF. Glissez, redimensionnez, téléchargez dans le navigateur.

Convertisseur IP vers binaire

Convertisseur IP vers binaire

Convertissez des adresses IPv4 en notation binaire pointée pour le subnetting et les tâches réseau.

apps

Plus d'outils

Parcourez notre collection complète d'outils en ligne gratuits.

Pourquoi « ce PDF contient-il du texte ? » est la mauvaise question

Un PDF peut être consultable en page un et être une photographie en page deux. La vérification habituelle — extraire du texte, en trouver, conclure — se trompe dans les deux cas, et se trompe aussi dans le cas le plus fréquent : un scan déjà passé par un OCR, réellement consultable alors que chaque pixel visible est une image.

Ce détecteur travaille page par page et rassemble six signaux indépendants avant de se prononcer :

  • Le texte extrait — combien de mots et de caractères un extracteur récupère réellement.
  • Les modes de rendu du texte — les glyphes tracés dans le mode 3 sont invisibles. C'est exactement ainsi qu'un logiciel d'OCR écrit les mots reconnus par-dessus un scan, et c'est le seul moyen fiable de distinguer un scan océrisé d'une page native.
  • Les images tracées — où chaque image se pose et quelle fraction de la page elle couvre.
  • Le DPI effectif et la profondeur de bits — une image 1 bit compressée en CCITT ou JBIG2 est une sortie de scanner, pas une photo ni un logo.
  • Les tracés vectoriels — une page composée par un traitement de texte comporte presque toujours des filets, des cadres ou des traits. Un scan nu n'en a aucun.

Ce que vous obtenez

Chaque page est étiquetée texte natif, image scannée, scan + couche OCR, mixte ou vide, avec un niveau de confiance et — c'est là l'essentiel — la liste des faits qui ont produit l'étiquette. Si un verdict vous semble faux, vous voyez précisément quel signal l'a déterminé.

Le résumé du document répond à la question que vous vous posiez : est-il consultable de bout en bout et, sinon, quelles pages doivent passer par un OCR ? Exportez le rapport complet en CSV ou JSON pour votre chaîne d'archivage.

Limites

Rien dans un PDF ne déclare « je suis un scan » : il s'agit donc d'une déduction. Une page dont le texte a été vectorisé n'a plus d'objets texte et ressemble trait pour trait à un scan. Un scan doté d'une mauvaise couche OCR est techniquement consultable mais pratiquement inutile. Les deux cas sont rapportés avec leurs preuves plutôt qu'avec une supposition à l'air assuré.

Confidentialité

Le fichier ne quitte jamais votre ordinateur. Analyse, rendu, miniatures et rapport : tout s'exécute dans votre navigateur.