Tiny Online Tools logoTiny Online ToolssearchBuscar ferramentas…grid_viewTodas as ferramentas
Iniciochevron_rightFerramentas de PDFchevron_rightDetector de PDF Digitalizado ou PesquisávelDetector de PDF Digitalizado ou Pesquisável

Detector de PDF Digitalizado ou Pesquisável

Distinga texto real de uma digitalização e de uma digitalização com camada OCR, página a página.

upload_file

Clique para procurar ou arraste e solte arquivos aqui

Selecione um PDF para analisar

Aceito: .pdf,application/pdf

Ferramentas semelhantes

Corretor de OCR de PDF

Corretor de OCR de PDF

Corrija palavras mal reconhecidas na camada OCR oculta de um PDF digitalizado sem tocar na digitalização.

Visualizador de Camada OCR de PDF

Visualizador de Camada OCR de PDF

Veja o texto OCR invisível de um PDF digitalizado desenhado exatamente onde ele está na página.

Inspetor de dados ocultos em PDF

Inspetor de dados ocultos em PDF

Revela o que um PDF carrega mas não mostra: metadados, camadas ocultas, anexos, JavaScript, texto invisível e texto sob tarjas de tachamento.

Extrator de links PDF

Extrator de links PDF

Lista todos os links de um PDF — externos, internos, de e-mail e os URL soltos no texto sem anotação — com página, texto visível e alertas de risco.

Gerador de PIN forte

Gerador de PIN forte

Gere códigos PIN seguros, evitando padrões óbvios repetidos ou sequenciais.

Extrator de imagens PDF

Extrator de imagens PDF

Retira as imagens originais incorporadas num PDF — os JPEG byte a byte e o resto em PNG — com tamanho real, tamanho desenhado e PPP efetivos.

PDF para WebP

PDF para WebP

Converta paginas PDF em imagens WebP de alta qualidade no navegador.

apps

Mais ferramentas

Explore nossa colecao completa de ferramentas online gratuitas.

Porque «este PDF tem texto?» é a pergunta errada

Um PDF pode ser pesquisável na página um e uma fotografia na página dois. A verificação habitual — extrair texto, encontrar algum e declarar vitória — erra em ambos os casos, e erra também no caso mais comum na prática: uma digitalização que já passou por OCR, que é genuinamente pesquisável embora cada píxel visível seja uma imagem.

Este detector trabalha página a página e reúne seis sinais independentes antes de dizer o que quer que seja:

  • Texto extraído — quantas palavras e caracteres um extrator devolve realmente.
  • Modos de renderização do texto — os glifos desenhados no modo 3 são invisíveis. É exatamente assim que o software de OCR escreve as palavras reconhecidas sobre uma digitalização, e é a única forma fiável de distinguir uma digitalização com OCR de uma página digital nativa.
  • Imagens desenhadas — onde cada imagem assenta e que fração da página cobre.
  • DPI efetivo e profundidade de bits — uma imagem de 1 bit comprimida com CCITT ou JBIG2 é a saída de um digitalizador, não uma fotografia nem um logótipo.
  • Traçados vetoriais — uma página composta por um processador de texto quase sempre tem filetes, molduras ou linhas. Uma digitalização pura não tem nenhum.

O que recebe

Cada página é rotulada como texto digital nativo, imagem digitalizada, digitalização + camada OCR, mista ou vazia, com um nível de confiança e — esta é a parte que interessa — a lista de factos que produziram o rótulo. Se discordar de um veredicto, consegue ver exatamente que sinal o motivou.

O resumo do documento responde à pergunta com que chegou: é pesquisável de ponta a ponta e, se não, que páginas precisam de OCR? Exporte o relatório completo em CSV ou JSON para o seu fluxo de arquivo.

Limites

Nada dentro de um PDF declara «sou uma digitalização», por isso isto é inferência. Uma página cujo texto foi convertido em contornos não tem objetos de texto e parece idêntica a uma digitalização. Uma digitalização com uma má camada de OCR é tecnicamente pesquisável mas inútil na prática. Ambos os casos são reportados com a sua evidência em vez de um palpite que soe seguro.

Privacidade

O ficheiro nunca sai do seu computador. Tudo — análise, renderização, miniaturas e relatório — corre no seu navegador.