Tiny Online Tools logoTiny Online ToolssearchBuscar ferramentas…grid_viewTodas as ferramentas
Iniciochevron_rightFerramentas de PDFchevron_rightExtrator de dados estruturados de PDFExtrator de dados estruturados de PDF

Extrator de dados estruturados de PDF

Converte um PDF em JSON estruturado — títulos, parágrafos, listas, tabelas e imagens — a partir da árvore etiquetada ou por inferência de layout.

upload_file

Clique para procurar ou arraste e solte arquivos aqui

Selecione um PDF para ler a estrutura

Aceito: .pdf,application/pdf

Ferramentas semelhantes

Extrator de faturas PDF

Extrator de faturas PDF

Extrai fornecedor, número da fatura, datas, NIF, totais e linhas de detalhe de uma fatura PDF no navegador, com confiança em cada campo.

Extrator de tabelas PDF

Extrator de tabelas PDF

Encontra as tabelas de um PDF e exporta-as para CSV ou XLSX, mostrando o método de deteção e a confiança de cada tabela.

Editor de Ordem de Leitura PDF

Editor de Ordem de Leitura PDF

Veja e altere a ordem por que um leitor de ecrã anuncia um PDF etiquetado, arrastando ou clicando.

Extrator de imagens PDF

Extrator de imagens PDF

Retira as imagens originais incorporadas num PDF — os JPEG byte a byte e o resto em PNG — com tamanho real, tamanho desenhado e PPP efetivos.

PNG para SVG

PNG para SVG

Envolva uma imagem raster em um contenedor SVG ou converta pixel art em retangulos coloridos.

Gerador de Gradiente Mesh

Gerador de Gradiente Mesh

Crie fundos de gradiente estilo mesh em SVG misturando vários pontos de cor radiais — assim como um mesh gradient CSS.

Gerador de nomes de empresa

Gerador de nomes de empresa

Gere nomes de empresa aleatorios para testes, mockups e brainstorming.

apps

Mais ferramentas

Explore nossa colecao completa de ferramentas online gratuitas.

O que esta ferramenta lê de facto

A maioria dos conversores «PDF para JSON» devolve um muro plano de texto. Um documento não é plano: tem títulos, parágrafos, listas, tabelas e figuras, e perder essa hierarquia é exatamente o que torna o resultado inútil para indexar, migrar ou alimentar um pipeline de recuperação. Esta ferramenta reconstrói a hierarquia e, mais importante, diz-lhe de onde veio cada resposta.

Fonte 1 — a árvore de estrutura etiquetada

Um PDF acessível traz uma árvore de estrutura: o produtor escreveu explicitamente que esta sequência de glifos é um H2 e aquela um P, com texto alternativo nas figuras. Quando existe, essa árvore é a declaração do próprio documento sobre si mesmo e é usada literalmente, incluindo os níveis de título e o /Alt das figuras. Essas páginas são marcadas como etiquetadas.

Fonte 2 — inferência de layout

A maioria dos PDF não tem essa árvore. Então a estrutura tem de ser inferida da geometria:

  • A altura de linha modal — o tamanho em que está composta a maior parte dos caracteres da página — é tomada como o corpo de texto.
  • Uma linha claramente mais alta que o corpo é um título, e o quanto mais alta define o nível.
  • Uma linha que começa por um marcador ou por 1. e está indentada para além da margem do corpo é um item de lista; as consecutivas formam uma única lista.
  • Linhas de corpo consecutivas com entrelinha normal voltam a juntar-se num parágrafo, de modo que uma frase repartida por quatro linhas chega como uma só frase.
  • As tabelas vêm do detetor de tabelas, e as linhas dentro de uma tabela detetada são retiradas do fluxo para não emitir o mesmo conteúdo duas vezes.

Essas páginas são marcadas como inferidas, e o rótulo não é decorativo. A inferência engana-se de vez em quando com um layout de duas colunas, um cabeçalho corrido ou uma citação destacada; confirme o esquema na pré-visualização antes de confiar.

Usar o resultado

Cada bloco traz o seu retângulo delimitador, portanto é possível levar um nó JSON de volta a um sítio da página. Clique em qualquer linha do esquema para a realçar na pré-visualização, ou numa região realçada para saltar para a sua linha. O JSON pode ser copiado ou descarregado inteiro.

Privacidade

O ficheiro nunca sai do seu dispositivo. A análise, a recuperação da estrutura e a exportação acontecem no navegador, sem qualquer pedido de rede durante o processamento.