Tiny Online Tools logoTiny Online ToolssearchПоиск инструментов…grid_viewВсе инструменты
Главнаяchevron_rightPDF инструментыchevron_rightДетектор сканов и текстовых PDFДетектор сканов и текстовых PDF

Детектор сканов и текстовых PDF

Отличайте настоящий текст от скана и от скана со слоем OCR — постранично, с доказательствами.

upload_file

Нажмите для выбора или перетащите файлы сюда

Выберите PDF для анализа

Допустимо: .pdf,application/pdf

Похожие инструменты

Редактор OCR-слоя PDF

Редактор OCR-слоя PDF

Исправьте неверно распознанные слова в скрытом OCR-слое скана, не тронув само изображение.

Поиск скрытых данных в PDF

Поиск скрытых данных в PDF

Показывает то, что PDF несёт, но не показывает: метаданные, скрытые слои, вложения, JavaScript, невидимый текст и текст под чёрными плашками.

Просмотрщик OCR-слоя PDF

Просмотрщик OCR-слоя PDF

Смотрите невидимый OCR-текст сканированного PDF ровно там, где он расположен на странице.

Извлечение ссылок из PDF

Извлечение ссылок из PDF

Показывает все ссылки в PDF — внешние, внутренние, почтовые и «голые» URL в тексте без аннотаций — со страницей, видимым текстом и пометками риска.

Генератор фальшивых номеров телефонов

Генератор фальшивых номеров телефонов

Генерирует фальшивые номера телефонов в форматах разных стран, используя зарезервированные или вымышленные префиксы, безопасные для тестов.

Редактор 3D-моделей

Редактор 3D-моделей

Редактируйте 3D-сцену прямо в браузере — без загрузки на сервер и без похода в Blender.

TIFF в JPG

TIFF в JPG

Конвертируйте TIFF/TIF в JPG. Поддержка LZW, PackBits и несжатых TIFF в браузере.

apps

Больше инструментов

Просмотрите нашу полную коллекцию бесплатных онлайн-инструментов.

Почему «есть ли в этом PDF текст?» — неверный вопрос

PDF может быть текстовым на первой странице и фотографией на второй. Обычная проверка — извлечь текст, что-то найти, объявить победу — ошибается в обоих случаях. И ошибается в самом частом на практике случае: скан, уже прошедший OCR, действительно доступен для поиска, хотя каждый видимый пиксель на нём — изображение.

Этот детектор работает постранично и собирает шесть независимых признаков, прежде чем что-либо утверждать:

  • Извлечённый текст — сколько слов и символов реально возвращает извлекатель.
  • Режимы отрисовки текста — глифы в режиме 3 невидимы. Именно так программы OCR записывают распознанные слова поверх скана, и это единственный надёжный способ отличить сканированную страницу с OCR от настоящей текстовой.
  • Нарисованные изображения — где каждое из них располагается и какую долю страницы занимает.
  • Эффективное разрешение и глубина цвета — однобитное изображение со сжатием CCITT или JBIG2 — это вывод сканера, а не фотография и не логотип.
  • Векторные контуры — страница, свёрстанная текстовым редактором, почти всегда содержит линейки, рамки или штриховую графику. У голого скана их нет.

Что вы получаете

Каждая страница помечается как настоящий текст, скан-изображение, скан + слой OCR, смешанная или пустая, с оценкой уверенности и — это главное — со списком фактов, которые привели к такому выводу. Если вердикт кажется вам неверным, видно, какой именно признак его вызвал.

Сводка отвечает на вопрос, с которым вы пришли: доступен ли документ для поиска целиком, а если нет — каким страницам нужен OCR. Полный отчёт выгружается в CSV или JSON.

Ограничения

Ничто внутри PDF не заявляет «я скан», поэтому это вывод, а не измерение. Страница, текст которой переведён в кривые, не имеет текстовых объектов и выглядит в точности как скан. Скан с плохим слоем OCR формально доступен для поиска, но практически бесполезен. Оба случая сообщаются вместе с доказательствами, а не в виде уверенно звучащей догадки.

Конфиденциальность

Файл никогда не покидает ваш компьютер. Разбор, отрисовка, миниатюры и отчёт — всё выполняется в браузере.