Sortir un tableau d'un PDF
Un PDF ne contient pas de tableaux. Il contient du texte posé à des coordonnées et, parfois, des traits dessinés autour de ce texte. Le tableau, c'est vous qui le voyez en regardant la page. Tout outil qui prétend « lire les tableaux » devine ; la seule question honnête est de savoir à quel point la devinette est bonne, et cet outil vous le dit.
Deux façons de deviner
La détection par filets utilise les bordures réellement dessinées par le producteur. Les filets horizontaux et verticaux sont regroupés en grille et chaque mot tombe dans la cellule qui lui revient. Quand le document a des bordures, le résultat est quasi exact — d'où la confiance élevée annoncée.
La détection par blancs vise la majorité des documents réels, qui n'ont aucune bordure. La page est balayée à la recherche d'espaces verticaux restés vides sur de nombreuses lignes consécutives ; ces gouttières deviennent les limites de colonnes. Cela marche très bien sur les états financiers, les tarifs et les rapports, et cela peut se laisser tromper par un paragraphe sur deux colonnes.
Laissez la méthode sur Auto : les deux passes s'exécutent et le meilleur résultat, sans chevauchement, est conservé.
Régler le résultat
- Les lignes et colonnes minimales filtrent le bruit. Un « tableau » de deux lignes et deux colonnes est très souvent un titre suivi d'une date.
- Pages accepte
all,1-3ou2,5,9. Analyser une page d'un rapport de 400 pages est bien plus rapide que le parcourir en entier. - Chaque tableau détecté peut être supprimé avant l'export. La détection est heuristique : s'il a trouvé un paragraphe, retirez-le ici plutôt que de nettoyer le tableur ensuite.
Export
- Un CSV par tableau, ou tous réunis dans un ZIP.
- Un CSV combiné, avec une ligne de repère entre les tableaux pour que les frontières survivent.
- Un XLSX avec une feuille par tableau, prêt pour Excel, LibreOffice, Numbers ou Google Sheets. Les cellules qui sont de vrais nombres sont écrites comme des nombres ; ce qui n'en a que l'apparence, comme un code de facture avec un zéro initial, reste du texte.
Chaque CSV porte une marque d'ordre des octets UTF-8, pour que les accents survivent à l'ouverture dans Excel sous Windows.
Confidentialité
Le PDF est ouvert, analysé et exporté entièrement dans votre navigateur. Rien n'est envoyé et aucune requête réseau n'est faite pendant le traitement.
Tiny Online Tools







