Tiny Online Tools logoTiny Online ToolssearchBuscar herramientas…grid_viewTodas las herramientas
Iniciochevron_rightHerramientas PDFchevron_rightExtractor de datos estructurados de PDFExtractor de datos estructurados de PDF

Extractor de datos estructurados de PDF

Convierte un PDF en JSON estructurado —títulos, párrafos, listas, tablas e imágenes— a partir del árbol etiquetado o de la inferencia de maquetación.

upload_file

Haz clic para buscar o arrastra y suelta archivos aqui

Selecciona un PDF para leer su estructura

Aceptado: .pdf,application/pdf

Herramientas similares

Extractor de imágenes PDF

Extractor de imágenes PDF

Saca las imágenes originales incrustadas en un PDF —los JPEG byte a byte y el resto como PNG— con tamaño real, tamaño impreso y PPP efectivos.

Extractor de facturas PDF

Extractor de facturas PDF

Extrae proveedor, número de factura, fechas, NIF, totales y líneas de detalle de una factura PDF en tu navegador, con confianza en cada campo.

Extractor de tablas PDF

Extractor de tablas PDF

Encuentra las tablas de un PDF y expórtalas a CSV o XLSX, mostrando el método de detección y la confianza de cada tabla.

Editor de Orden de Lectura PDF

Editor de Orden de Lectura PDF

Mira y cambia el orden en que un lector de pantalla anuncia un PDF etiquetado, arrastrando o haciendo clic.

Encriptar PDF

Encriptar PDF

Protege con contraseña un PDF con cifrado estándar RC4-128. Restringe impresión, copia y modificación.

Extractor de enlaces PDF

Extractor de enlaces PDF

Lista todos los enlaces de un PDF —externos, internos, de correo y las URL sueltas del texto sin anotación— con página, texto visible y avisos de riesgo.

PDF a JPG

PDF a JPG

Convierte paginas PDF en imagenes JPG de alta calidad.

apps

Mas herramientas

Explora nuestra coleccion completa de herramientas gratuitas en linea.

Qué lee realmente esta herramienta

La mayoría de los conversores «PDF a JSON» devuelven un muro plano de texto. Un documento no es plano: tiene títulos, párrafos, listas, tablas y figuras, y perder esa jerarquía es justo lo que vuelve inútil el resultado para indexar, migrar o alimentar una canalización de recuperación. Esta herramienta reconstruye la jerarquía y, sobre todo, te dice de dónde salió cada respuesta.

Fuente 1 — el árbol de estructura etiquetado

Un PDF accesible lleva un árbol de estructura: el productor escribió explícitamente que esta secuencia de glifos es un H2 y aquella un P, con texto alternativo en las figuras. Cuando existe, ese árbol es la declaración del propio documento sobre sí mismo y aquí se usa literalmente, incluidos los niveles de encabezado y el /Alt de las figuras. Esas páginas se marcan como etiquetadas.

Fuente 2 — inferencia de maquetación

La mayoría de los PDF no tienen ese árbol. Entonces la estructura hay que inferirla de la geometría:

  • La altura de línea modal —el tamaño en el que está compuesta la mayoría de los caracteres de la página— se toma como el cuerpo de texto.
  • Una línea claramente más alta que el cuerpo es un título, y cuánto más alta decide el nivel.
  • Una línea que empieza por una viñeta o un marcador 1. y está sangrada más allá del margen del cuerpo es un elemento de lista; las consecutivas forman una sola lista.
  • Las líneas de cuerpo consecutivas con interlineado normal se vuelven a unir en un párrafo, de modo que una frase repartida en cuatro líneas llega como una sola frase.
  • Las tablas provienen del detector de tablas, y las líneas dentro de una tabla detectada se retiran del flujo para no emitir el mismo contenido dos veces.

Esas páginas se marcan como inferidas, y la etiqueta no es decorativa. La inferencia se equivoca de vez en cuando con una maquetación a dos columnas, un encabezado corrido o una cita destacada; contrasta el esquema con la vista previa antes de fiarte.

Usar el resultado

Cada bloque lleva su rectángulo delimitador, así que puedes llevar un nodo JSON de vuelta a un lugar de la página. Haz clic en cualquier fila del esquema para resaltarla en la vista previa, o en una región resaltada para saltar a su fila. El JSON se copia o se descarga entero.

Privacidad

El archivo no sale de tu dispositivo. El análisis, la recuperación de la estructura y la exportación ocurren en el navegador, sin ninguna petición de red durante el proceso.