Tiny Online Tools logoTiny Online ToolssearchПоиск инструментов…grid_viewВсе инструменты
Главнаяchevron_rightPDF инструментыchevron_rightПросмотрщик OCR-слоя PDFПросмотрщик OCR-слоя PDF

Просмотрщик OCR-слоя PDF

Смотрите невидимый OCR-текст сканированного PDF ровно там, где он расположен на странице.

upload_file

Нажмите для выбора или перетащите файлы сюда

Выберите сканированный PDF или PDF с OCR

Допустимо: .pdf,application/pdf

Похожие инструменты

Редактор OCR-слоя PDF

Редактор OCR-слоя PDF

Исправьте неверно распознанные слова в скрытом OCR-слое скана, не тронув само изображение.

Детектор сканов и текстовых PDF

Детектор сканов и текстовых PDF

Отличайте настоящий текст от скана и от скана со слоем OCR — постранично, с доказательствами.

Поиск скрытых данных в PDF

Поиск скрытых данных в PDF

Показывает то, что PDF несёт, но не показывает: метаданные, скрытые слои, вложения, JavaScript, невидимый текст и текст под чёрными плашками.

Текст в PDF

Текст в PDF

Преобразуйте обычный текст в PDF-документ с настраиваемым шрифтом, размером и макетом страницы.

Менеджер закладок PDF

Менеджер закладок PDF

Загрузите, перестройте и перезапишите дерево закладок PDF: перетаскивайте строки, меняйте страницы, сохраняйте нетронутые адреса переходов.

Пикселизация изображения

Пикселизация изображения

Пикселизируйте любое изображение для 8-битного ретро-стиля или сокрытия чувствительного контента. Размер блока регулируется, в браузере.

Извлечение таблиц из PDF

Извлечение таблиц из PDF

Находит таблицы внутри PDF и выгружает их в CSV или XLSX, показывая способ распознавания и уверенность для каждой таблицы.

apps

Больше инструментов

Просмотрите нашу полную коллекцию бесплатных онлайн-инструментов.

Слой, который никто не видит

Когда скан проходит через OCR, распознаватель не заменяет изображение. Он оставляет скан ровно таким, каким тот был, и записывает распознанные слова поверх него в режиме отрисовки PDF номер 3 — «ни заливки, ни обводки». Текст есть, он выделяется и ищется, но ни одна программа просмотра никогда не нарисует ни одного его пикселя.

Это разумное решение, и именно оно делает качество OCR непроверяемым. Поиск, не давший результата, сообщает, что слова нет; он не сообщает, прочитал ли распознаватель «Получено» как «Полученo» и не сдвинул ли целую колонку на строку вверх.

Что показывает этот инструмент

Каждое распознанное слово отрисовывается обратно в ту самую рамку, из которой оно получено, поверх скана, откуда оно пришло. Четыре режима:

  • Только рамки — контуры, чтобы оценить покрытие и выравнивание, пока текст не мешает.
  • Текст поверх изображения — распознанные слова полупрозрачно поверх скана, с регулятором непрозрачности. Там, где распознавание сместилось, нарисованное слово заметно съезжает относительно отсканированного.
  • Только текст — слой сам по себе на белой бумаге, то есть фактически то, что получает программа чтения с экрана.
  • Только изображение — скан как есть, для сравнения.

Переключайтесь между рамками слов, строк и блоков, ищите по распознанному тексту и видьте подсвеченные совпадения на странице, нажимайте на любую рамку, чтобы перейти к ней в списке.

Как оценить качество

По каждой странице выводятся количество слов и символов, доля действительно невидимого текста, средний размер рамки слова и показатель покрытия — какую часть площади страницы занимают рамки OCR. Распознаватель, сдавшийся на середине страницы, выдаёт себя низким покрытием задолго до того, как вы заметите пропавшие слова.

Слова со статистически необычной формой помечаются: без гласных, смесь букв и цифр, односимвольные обрывки, цепочки символов, рамки, резко выбивающиеся из соседних. Это подозрения, а не ошибки.

Экспорт

Обычный текст, JSON с каждой рамкой и шрифтом, или HTML в формате hOCR для дальнейшей обработки. Координаты даны в пунктах PDF с началом отсчёта в левом верхнем углу.

Конфиденциальность

Ничего никуда не загружается. PDF разбирается, отрисовывается и измеряется целиком в вашем браузере.