O que este extrator encontra e os outros não
Um PDF pode carregar um anexo em três lugares completamente diferentes, e a maioria das ferramentas só olha o primeiro.
- A árvore de nomes
/Names /EmbeddedFiles. É uma árvore balanceada, não uma lista. Assim que um documento passa de alguns poucos anexos, o produtor a divide em nós/Kids, e uma ferramenta que lê apenas o vetor raiz informa zero arquivos em um PDF que claramente tem vários. - As anotações
/FileAttachment. O clipe que você vê na página. O arquivo fica pendurado na anotação e muitas vezes não está registrado na árvore de nomes. - Os arquivos associados
/AF. Foram acrescentados no PDF 2.0 e é aí que está a relevância comercial: as faturas eletrônicas ZUGFeRD, Factur-X, XRechnung e Order-X transportam assim o seu XML legível por máquina. Se o seu sistema contábil rejeita uma fatura, é esse o conteúdo a examinar.
O mesmo fluxo costuma ser alcançável por duas dessas rotas, então os arquivos são identificados pela referência de objeto e mesclados, com todas as origens exibidas.
O que aparece de cada arquivo
Nome, descrição, tipo MIME declarado, tamanho declarado e real, datas de criação e modificação, a soma MD5 quando o produtor a gravou, o papel /AFRelationship e a página onde o anexo está.
A verificação de tipo
O tipo declarado é o que o PDF afirma. Esta ferramenta também lê os primeiros bytes do arquivo e informa o que eles realmente são. Um anexo chamado notas.txt que começa com PK é um arquivo ZIP; um que começa com MZ é um executável do Windows. Ambos são sinalizados, e vale saber disso antes de abrir qualquer coisa.
Pré-visualização e download
Texto, CSV, JSON e XML aparecem na própria página; PNG, JPEG, GIF, WebP e BMP são exibidos como imagens. O resto é apenas download. Nada é executado e nada é enviado pela rede.
Baixe um anexo isolado ou todos de uma vez em um ZIP.
Privacidade
O PDF é analisado no seu navegador com JavaScript. Ele nunca é enviado, então documentos confidenciais e seus anexos permanecem na sua máquina.
Tiny Online Tools







