Tiny Online Tools logoTiny Online ToolssearchBuscar ferramentas…grid_viewTodas as ferramentas
Iniciochevron_rightFerramentas de PDFchevron_rightExtrator de tabelas PDFExtrator de tabelas PDF

Extrator de tabelas PDF

Encontra as tabelas de um PDF e exporta-as para CSV ou XLSX, mostrando o método de deteção e a confiança de cada tabela.

upload_file

Clique para procurar ou arraste e solte arquivos aqui

Selecione um PDF para procurar tabelas

Aceito: .pdf,application/pdf

Ferramentas semelhantes

Extrator de dados estruturados de PDF

Extrator de dados estruturados de PDF

Converte um PDF em JSON estruturado — títulos, parágrafos, listas, tabelas e imagens — a partir da árvore etiquetada ou por inferência de layout.

Extrator de faturas PDF

Extrator de faturas PDF

Extrai fornecedor, número da fatura, datas, NIF, totais e linhas de detalhe de uma fatura PDF no navegador, com confiança em cada campo.

Extrator de imagens PDF

Extrator de imagens PDF

Retira as imagens originais incorporadas num PDF — os JPEG byte a byte e o resto em PNG — com tamanho real, tamanho desenhado e PPP efetivos.

Extrator de links PDF

Extrator de links PDF

Lista todos os links de um PDF — externos, internos, de e-mail e os URL soltos no texto sem anotação — com página, texto visível e alertas de risco.

Calculadora de Impressão 3D

Calculadora de Impressão 3D

Estime quanto uma impressão 3D vai custar de fato antes de iniciá-la.

Decodificador de Entidades HTML

Decodificador de Entidades HTML

Decodifica entidades HTML em caracteres legíveis. Suporta todas as entidades nomeadas, decimais e hexadecimais.

Decodificador URL

Decodificador URL

Decodifica URLs codificadas.

apps

Mais ferramentas

Explore nossa colecao completa de ferramentas online gratuitas.

Tirar uma tabela de um PDF

Um PDF não contém tabelas. Contém texto colocado em coordenadas e, por vezes, linhas desenhadas à volta desse texto. A tabela é algo que você vê ao olhar para a página. Qualquer ferramenta que diga «ler as tabelas» está a adivinhar; a única pergunta honesta é o quão boa é a adivinha, e aqui isso é dito.

Duas formas de adivinhar

A deteção com linhas usa as molduras que o gerador realmente desenhou. As réguas horizontais e verticais são agrupadas numa grelha e cada palavra cai na célula que lhe corresponde. Quando o documento tem molduras, o resultado é quase exato, e por isso é reportado com confiança alta.

A deteção por espaços serve para a maioria dos documentos reais, que não têm molduras. A página é varrida à procura de intervalos verticais que ficam em branco em muitas linhas seguidas; esses corredores tornam-se os limites das colunas. Funciona bem em demonstrações financeiras, listas de preços e relatórios, e pode enganar-se com um parágrafo em duas colunas.

Deixe o método em Automático e as duas passagens são executadas, mantendo o melhor resultado sem sobreposições.

Afinar o resultado

  • As linhas e colunas mínimas filtram o ruído. Uma «tabela» de duas linhas e duas colunas é muitas vezes um título com uma data.
  • Páginas aceita all, 1-3 ou 2,5,9. Analisar uma página de um relatório de 400 é muito mais rápido do que analisá-lo todo.
  • Cada tabela detetada pode ser removida antes da exportação. A deteção é heurística: se encontrou um parágrafo, retire-o aqui em vez de limpar a folha de cálculo depois.

Exportação

  • Um CSV por tabela, ou todos juntos num ZIP.
  • Um CSV combinado, com uma linha marcadora entre tabelas para que as fronteiras se mantenham.
  • Um XLSX com uma folha por tabela, pronto para Excel, LibreOffice, Numbers ou Google Sheets. As células que são números puros são escritas como números; o que apenas parece número, como um código de fatura com zero à esquerda, permanece texto.

Cada CSV leva marca de ordem de bytes UTF-8, para que os acentos sobrevivam à abertura no Excel do Windows.

Privacidade

O PDF é aberto, analisado e exportado inteiramente no seu navegador. Nada é enviado e nenhum pedido de rede é feito durante o processo.