Tiny Online Tools logoTiny Online ToolssearchBuscar ferramentas…grid_viewTodas as ferramentas
Iniciochevron_rightFerramentas de PDFchevron_rightExtrator de dados estruturados de PDFExtrator de dados estruturados de PDF

Extrator de dados estruturados de PDF

Converte um PDF em JSON estruturado — títulos, parágrafos, listas, tabelas e imagens — a partir da árvore etiquetada ou por inferência de layout.

upload_file

Clique para procurar ou arraste e solte arquivos aqui

Selecione um PDF para ler a estrutura

Aceito: .pdf,application/pdf

Ferramentas semelhantes

Extrator de faturas PDF

Extrator de faturas PDF

Extrai fornecedor, número da fatura, datas, NIF, totais e linhas de detalhe de uma fatura PDF no navegador, com confiança em cada campo.

Extrator de tabelas PDF

Extrator de tabelas PDF

Encontra as tabelas de um PDF e exporta-as para CSV ou XLSX, mostrando o método de deteção e a confiança de cada tabela.

Editor de Ordem de Leitura PDF

Editor de Ordem de Leitura PDF

Veja e altere a ordem por que um leitor de ecrã anuncia um PDF etiquetado, arrastando ou clicando.

Extrator de imagens PDF

Extrator de imagens PDF

Retira as imagens originais incorporadas num PDF — os JPEG byte a byte e o resto em PNG — com tamanho real, tamanho desenhado e PPP efetivos.

Ferramenta de Texturas PBR

Ferramenta de Texturas PBR

Gera e repara mapas de textura PBR no teu navegador, grátis e sem enviar nada.

Numeração de Páginas PDF

Numeração de Páginas PDF

Adicione números de página a um PDF com posição, formato, tamanho da fonte e número inicial personalizáveis.

Validador de endereços IP

Validador de endereços IP

Valide endereços IPv4, IPv6 e notação CIDR com detalhes do tipo de endereço e da sub-rede.

apps

Mais ferramentas

Explore nossa colecao completa de ferramentas online gratuitas.

O que esta ferramenta lê de facto

A maioria dos conversores «PDF para JSON» devolve um muro plano de texto. Um documento não é plano: tem títulos, parágrafos, listas, tabelas e figuras, e perder essa hierarquia é exatamente o que torna o resultado inútil para indexar, migrar ou alimentar um pipeline de recuperação. Esta ferramenta reconstrói a hierarquia e, mais importante, diz-lhe de onde veio cada resposta.

Fonte 1 — a árvore de estrutura etiquetada

Um PDF acessível traz uma árvore de estrutura: o produtor escreveu explicitamente que esta sequência de glifos é um H2 e aquela um P, com texto alternativo nas figuras. Quando existe, essa árvore é a declaração do próprio documento sobre si mesmo e é usada literalmente, incluindo os níveis de título e o /Alt das figuras. Essas páginas são marcadas como etiquetadas.

Fonte 2 — inferência de layout

A maioria dos PDF não tem essa árvore. Então a estrutura tem de ser inferida da geometria:

  • A altura de linha modal — o tamanho em que está composta a maior parte dos caracteres da página — é tomada como o corpo de texto.
  • Uma linha claramente mais alta que o corpo é um título, e o quanto mais alta define o nível.
  • Uma linha que começa por um marcador ou por 1. e está indentada para além da margem do corpo é um item de lista; as consecutivas formam uma única lista.
  • Linhas de corpo consecutivas com entrelinha normal voltam a juntar-se num parágrafo, de modo que uma frase repartida por quatro linhas chega como uma só frase.
  • As tabelas vêm do detetor de tabelas, e as linhas dentro de uma tabela detetada são retiradas do fluxo para não emitir o mesmo conteúdo duas vezes.

Essas páginas são marcadas como inferidas, e o rótulo não é decorativo. A inferência engana-se de vez em quando com um layout de duas colunas, um cabeçalho corrido ou uma citação destacada; confirme o esquema na pré-visualização antes de confiar.

Usar o resultado

Cada bloco traz o seu retângulo delimitador, portanto é possível levar um nó JSON de volta a um sítio da página. Clique em qualquer linha do esquema para a realçar na pré-visualização, ou numa região realçada para saltar para a sua linha. O JSON pode ser copiado ou descarregado inteiro.

Privacidade

O ficheiro nunca sai do seu dispositivo. A análise, a recuperação da estrutura e a exportação acontecem no navegador, sem qualquer pedido de rede durante o processamento.