Tiny Online Tools logoTiny Online ToolssearchПоиск инструментов…grid_viewВсе инструменты
Главнаяchevron_rightPDF инструментыchevron_rightИзвлечение структуры PDFИзвлечение структуры PDF

Извлечение структуры PDF

Превращает PDF в структурированный JSON — заголовки, абзацы, списки, таблицы и изображения — по тегам документа или по разметке страницы.

upload_file

Нажмите для выбора или перетащите файлы сюда

Выберите PDF, структуру которого нужно прочитать

Допустимо: .pdf,application/pdf

Похожие инструменты

Извлечение таблиц из PDF

Извлечение таблиц из PDF

Находит таблицы внутри PDF и выгружает их в CSV или XLSX, показывая способ распознавания и уверенность для каждой таблицы.

Извлечение вложений из PDF

Извлечение вложений из PDF

Находит и сохраняет все файлы, вложенные в PDF, включая вложения в аннотациях и связанные файлы PDF 2.0.

Извлечение ссылок из PDF

Извлечение ссылок из PDF

Показывает все ссылки в PDF — внешние, внутренние, почтовые и «голые» URL в тексте без аннотаций — со страницей, видимым текстом и пометками риска.

Извлечение изображений из PDF

Извлечение изображений из PDF

Достаёт из PDF встроенные оригиналы: JPEG — байт в байт, остальное — в PNG, с размером в пикселях, размером на странице и эффективным DPI.

Скрытие PDF

Скрытие PDF

Рисуйте черные прямоугольники поверх конфиденциальных областей страниц PDF прямо в браузере.

Детектор сканов и текстовых PDF

Детектор сканов и текстовых PDF

Отличайте настоящий текст от скана и от скана со слоем OCR — постранично, с доказательствами.

Просмотрщик метаданных PDF

Просмотрщик метаданных PDF

Просматривайте полные метаданные PDF-файлов, включая автора, даты, размеры страниц и многое другое.

apps

Больше инструментов

Просмотрите нашу полную коллекцию бесплатных онлайн-инструментов.

Что этот инструмент действительно читает

Большинство конвертеров «PDF в JSON» отдают плоскую стену текста. Документ не плоский: в нём есть заголовки, абзацы, списки, таблицы и иллюстрации, и именно потеря иерархии делает результат бесполезным для индексации, миграции или подачи в поисковый конвейер. Этот инструмент восстанавливает иерархию и, что важнее, сообщает, откуда взялся каждый ответ.

Источник 1 — дерево тегов

Доступный PDF несёт дерево структуры: создатель явно записал, что вот эта последовательность глифов — H2, а та — P, а у иллюстраций указан альтернативный текст. Если дерево есть, это собственное утверждение документа о себе, и оно используется дословно, включая уровни заголовков и /Alt у иллюстраций. Такие страницы помечаются как тегированные.

Источник 2 — вывод по разметке

У большинства PDF такого дерева нет. Тогда структуру приходится выводить из геометрии:

  • Модальная высота строки — размер, которым набрано большинство символов страницы, — принимается за основной кегль.
  • Строка заметно выше основного текста считается заголовком, а насколько выше — определяет уровень.
  • Строка, начинающаяся с маркера или 1. и сдвинутая правее левого края основного текста, — элемент списка; идущие подряд объединяются в один список.
  • Идущие подряд строки основного текста с обычным интерлиньяжем снова склеиваются в абзац, поэтому фраза, разбитая на четыре строки, приходит одной фразой.
  • Таблицы берутся из детектора таблиц, а строки внутри найденной таблицы убираются из потока, чтобы одно и то же содержимое не выдавалось дважды.

Такие страницы помечаются как выведенные, и эта пометка не украшение. Вывод иногда ошибается на двухколоночной вёрстке, колонтитулах и врезках — сверьте оглавление с предпросмотром, прежде чем полагаться на него.

Как использовать результат

У каждого блока есть ограничивающий прямоугольник, поэтому узел JSON можно вернуть на конкретное место страницы. Нажмите строку в оглавлении, чтобы подсветить блок в предпросмотре, или нажмите подсвеченную область, чтобы перейти к её строке. JSON копируется или скачивается целиком.

Конфиденциальность

Файл не покидает ваше устройство. Разбор, восстановление структуры и выгрузка происходят в браузере, без единого сетевого запроса во время обработки.