Tiny Online Tools logoTiny Online ToolssearchRechercher des outils…grid_viewTous les outils
Accueilchevron_rightOutils PDFchevron_rightExtracteur de données structurées PDFExtracteur de données structurées PDF

Extracteur de données structurées PDF

Transforme un PDF en JSON structuré — titres, paragraphes, listes, tableaux et images — depuis l'arbre balisé ou par inférence de mise en page.

upload_file

Cliquez pour parcourir ou glissez-deposez des fichiers ici

Choisissez un PDF dont lire la structure

Accepte : .pdf,application/pdf

Outils similaires

Extracteur de tableaux PDF

Extracteur de tableaux PDF

Repère les tableaux d'un PDF et les exporte en CSV ou XLSX, en affichant la méthode de détection et la confiance de chaque tableau.

Extracteur de factures PDF

Extracteur de factures PDF

Récupère le fournisseur, le numéro de facture, les dates, le numéro de TVA, les totaux et les lignes d'une facture PDF, avec une confiance par champ.

Extracteur de liens PDF

Extracteur de liens PDF

Liste tous les liens d'un PDF — externes, internes, e-mail et les URL brutes du texte sans annotation — avec page, texte affiché et signalements de risque.

Inspecteur de JavaScript PDF

Inspecteur de JavaScript PDF

Trouve tous les scripts d'un PDF — actions de document, événements de page et d'annotation, calculs de formulaire — et les affiche sans jamais les exécuter.

Éditeur de boîtes de page PDF

Éditeur de boîtes de page PDF

Consultez et modifiez MediaBox, CropBox, BleedBox, TrimBox et ArtBox, avec superposition visuelle, alertes d'impression et fonds perdus prédéfinis.

JSON Déaplatir

JSON Déaplatir

Développez les clés JSON à notation par points plats dans une structure d'objet imbriquée.

PDF en texte

PDF en texte

Extrayez instantanement le texte brut de fichiers PDF dans votre navigateur. Sans televersement et sans inscription.

apps

Plus d'outils

Parcourez notre collection complète d'outils en ligne gratuits.

Ce que cet outil lit vraiment

La plupart des convertisseurs « PDF vers JSON » rendent un mur de texte plat. Un document n'est pas plat : il a des titres, des paragraphes, des listes, des tableaux et des figures, et perdre cette hiérarchie est précisément ce qui rend le résultat inutilisable pour indexer, migrer ou alimenter une chaîne de recherche. Cet outil reconstruit la hiérarchie — et, surtout, vous dit d'où vient chaque réponse.

Source 1 — l'arbre de structure balisé

Un PDF accessible embarque un arbre de structure : le producteur a écrit noir sur blanc que cette suite de glyphes est un H2 et celle-là un P, les figures portant un texte de remplacement. Quand il existe, cet arbre est la déclaration du document sur lui-même et il est repris tel quel, niveaux de titre et /Alt des figures compris. Ces pages sont marquées balisées.

Source 2 — l'inférence de mise en page

La plupart des PDF n'ont pas cet arbre. La structure doit alors être déduite de la géométrie :

  • La hauteur de ligne modale — la taille dans laquelle la majorité des caractères de la page sont composés — sert de corps de texte.
  • Une ligne nettement plus haute que le corps est un titre, et l'écart décide du niveau.
  • Une ligne qui commence par une puce ou un repère 1. et qui est en retrait par rapport à la marge du corps est un élément de liste ; les lignes consécutives forment une seule liste.
  • Les lignes de corps consécutives à interligne normal sont recollées en un paragraphe, si bien qu'une phrase répartie sur quatre lignes arrive en une seule phrase.
  • Les tableaux viennent du détecteur de tableaux, et les lignes situées dans un tableau détecté sont retirées du flux pour ne pas émettre deux fois le même contenu.

Ces pages sont marquées déduites, et l'étiquette n'est pas décorative. L'inférence se trompe parfois sur une mise en page à deux colonnes, un en-tête courant ou un exergue ; vérifiez le plan face à l'aperçu avant de vous y fier.

Exploiter le résultat

Chaque bloc porte son rectangle englobant : un nœud JSON peut donc être ramené à un endroit précis de la page. Cliquez sur une ligne du plan pour la surligner dans l'aperçu, ou sur une zone surlignée pour rejoindre sa ligne. Le JSON se copie ou se télécharge en entier.

Confidentialité

Le fichier ne quitte jamais votre appareil. L'analyse, la reconstruction de la structure et l'export se déroulent dans le navigateur, sans aucune requête réseau pendant le traitement.