Tiny Online Tools logoTiny Online ToolssearchBuscar ferramentas…grid_viewTodas as ferramentas
Iniciochevron_rightFerramentas de PDFchevron_rightCorretor de OCR de PDFCorretor de OCR de PDF

Corretor de OCR de PDF

Corrija palavras mal reconhecidas na camada OCR oculta de um PDF digitalizado sem tocar na digitalização.

upload_file

Clique para procurar ou arraste e solte arquivos aqui

Selecione um PDF digitalizado com camada OCR

Aceito: .pdf,application/pdf

Ferramentas semelhantes

Visualizador de Camada OCR de PDF

Visualizador de Camada OCR de PDF

Veja o texto OCR invisível de um PDF digitalizado desenhado exatamente onde ele está na página.

Detector de PDF Digitalizado ou Pesquisável

Detector de PDF Digitalizado ou Pesquisável

Distinga texto real de uma digitalização e de uma digitalização com camada OCR, página a página.

Extrator de links PDF

Extrator de links PDF

Lista todos os links de um PDF — externos, internos, de e-mail e os URL soltos no texto sem anotação — com página, texto visível e alertas de risco.

Inspetor de JavaScript em PDF

Inspetor de JavaScript em PDF

Encontra todos os scripts dentro de um PDF — ações de documento, eventos de página e anotação e cálculos de formulário — e permite lê-los sem executá-los.

Buscador de Cor Dominante

Buscador de Cor Dominante

Encontre as cores dominantes em qualquer imagem com códigos hex e porcentagens.

Gerador de nomes de usuario

Gerador de nomes de usuario

Gere nomes de usuario aleatorios em varios estilos para contas e testes.

Gerador HMAC

Gerador HMAC

Gere assinaturas HMAC a partir de texto.

apps

Mais ferramentas

Explore nossa colecao completa de ferramentas online gratuitas.

Corrigir aquilo que ninguém vê

Um PDF digitalizado que passou por OCR transporta a digitalização como imagem e as palavras reconhecidas como texto invisível por cima. Quando o reconhecedor erra uma palavra, a imagem continua perfeita — o que falha em silêncio é a pesquisa, o copiar e colar e os leitores de ecrã.

Esta ferramenta edita essa camada oculta. A digitalização não é recodificada, recomprimida nem redesenhada.

Como o ficheiro é alterado

O fluxo de conteúdo da página é uma lista de operadores: uns desenham a imagem digitalizada, outros posicionam e mostram texto. O fluxo é analisado e só o operando de texto de um operador de texto invisível é substituído. O significado de todos os outros bytes é preservado — os operadores de posicionamento, o estado gráfico e o operador que pinta a digitalização passam intactos.

É por isso que a página corrigida não pode deslocar-se, desfocar-se nem recomprimir-se. Não é uma promessa; é a consequência de não se regenerar nada.

Uma verificação que pode ler

Depois de escrever, o resultado é reaberto e correm três verificações em cada página alterada:

  1. Texto — as palavras corrigidas são o que um extrator de texto devolve agora.
  2. Invisibilidade — a camada continua desenhada no modo de renderização 3, e a contagem de glifos visíveis não mudou.
  3. Píxeis — a página corrigida é renderizada e comparada com a renderização original, píxel a píxel. A proporção alterada deve ser zero.

Os três resultados são mostrados antes do download, passem ou falhem.

Quando recusa

Algumas páginas não podem ser reescritas em segurança: um fluxo de conteúdo com um filtro indescodificável, ou um bloco de texto que mistura glifos visíveis e invisíveis de tal forma que não é possível garantir que os visíveis fiquem intactos. Essas páginas são recusadas pelo nome e ficam exatamente como estavam. Recusar é a resposta certa — entregar um ficheiro silenciosamente corrompido não é.

Os caracteres que as fontes do PDF não conseguem exprimir seguem o mesmo princípio: sempre que possível é incorporada uma Helvetica padrão para transportar a substituição e, quando isso não chega, a edição é ignorada e indicada.

Privacidade

A análise, a edição, a gravação e a verificação acontecem no seu navegador. O PDF nunca é enviado.