Tiny Online Tools logoTiny Online ToolssearchBuscar herramientas…grid_viewTodas las herramientas
Iniciochevron_rightHerramientas PDFchevron_rightExtractor de datos estructurados de PDFExtractor de datos estructurados de PDF

Extractor de datos estructurados de PDF

Convierte un PDF en JSON estructurado —títulos, párrafos, listas, tablas e imágenes— a partir del árbol etiquetado o de la inferencia de maquetación.

upload_file

Haz clic para buscar o arrastra y suelta archivos aqui

Selecciona un PDF para leer su estructura

Aceptado: .pdf,application/pdf

Herramientas similares

Extractor de imágenes PDF

Extractor de imágenes PDF

Saca las imágenes originales incrustadas en un PDF —los JPEG byte a byte y el resto como PNG— con tamaño real, tamaño impreso y PPP efectivos.

Extractor de facturas PDF

Extractor de facturas PDF

Extrae proveedor, número de factura, fechas, NIF, totales y líneas de detalle de una factura PDF en tu navegador, con confianza en cada campo.

Extractor de tablas PDF

Extractor de tablas PDF

Encuentra las tablas de un PDF y expórtalas a CSV o XLSX, mostrando el método de detección y la confianza de cada tabla.

Editor de Orden de Lectura PDF

Editor de Orden de Lectura PDF

Mira y cambia el orden en que un lector de pantalla anuncia un PDF etiquetado, arrastrando o haciendo clic.

Gaussian Splat a Malla

Gaussian Splat a Malla

Reconstruye una superficie poligonal aproximada a partir de una captura Gaussian splat y expórtala como GLB, PLY, STL u OBJ.

Rotar Imagen

Rotar Imagen

Rota imágenes en ángulos personalizados.

Convertidor de Archivos de Bordado

Convertidor de Archivos de Bordado

Convierte un archivo de bordado a DST o EXP, los dos únicos formatos que esta herramienta puede escribir correctamente. Lee DST, EXP, JEF, PES y PEC.

apps

Mas herramientas

Explora nuestra coleccion completa de herramientas gratuitas en linea.

Qué lee realmente esta herramienta

La mayoría de los conversores «PDF a JSON» devuelven un muro plano de texto. Un documento no es plano: tiene títulos, párrafos, listas, tablas y figuras, y perder esa jerarquía es justo lo que vuelve inútil el resultado para indexar, migrar o alimentar una canalización de recuperación. Esta herramienta reconstruye la jerarquía y, sobre todo, te dice de dónde salió cada respuesta.

Fuente 1 — el árbol de estructura etiquetado

Un PDF accesible lleva un árbol de estructura: el productor escribió explícitamente que esta secuencia de glifos es un H2 y aquella un P, con texto alternativo en las figuras. Cuando existe, ese árbol es la declaración del propio documento sobre sí mismo y aquí se usa literalmente, incluidos los niveles de encabezado y el /Alt de las figuras. Esas páginas se marcan como etiquetadas.

Fuente 2 — inferencia de maquetación

La mayoría de los PDF no tienen ese árbol. Entonces la estructura hay que inferirla de la geometría:

  • La altura de línea modal —el tamaño en el que está compuesta la mayoría de los caracteres de la página— se toma como el cuerpo de texto.
  • Una línea claramente más alta que el cuerpo es un título, y cuánto más alta decide el nivel.
  • Una línea que empieza por una viñeta o un marcador 1. y está sangrada más allá del margen del cuerpo es un elemento de lista; las consecutivas forman una sola lista.
  • Las líneas de cuerpo consecutivas con interlineado normal se vuelven a unir en un párrafo, de modo que una frase repartida en cuatro líneas llega como una sola frase.
  • Las tablas provienen del detector de tablas, y las líneas dentro de una tabla detectada se retiran del flujo para no emitir el mismo contenido dos veces.

Esas páginas se marcan como inferidas, y la etiqueta no es decorativa. La inferencia se equivoca de vez en cuando con una maquetación a dos columnas, un encabezado corrido o una cita destacada; contrasta el esquema con la vista previa antes de fiarte.

Usar el resultado

Cada bloque lleva su rectángulo delimitador, así que puedes llevar un nodo JSON de vuelta a un lugar de la página. Haz clic en cualquier fila del esquema para resaltarla en la vista previa, o en una región resaltada para saltar a su fila. El JSON se copia o se descarga entero.

Privacidad

El archivo no sale de tu dispositivo. El análisis, la recuperación de la estructura y la exportación ocurren en el navegador, sin ninguna petición de red durante el proceso.