Tiny Online Tools logoTiny Online ToolssearchПоиск инструментов…grid_viewВсе инструменты
Главнаяchevron_rightPDF инструментыchevron_rightИзвлечение таблиц из PDFИзвлечение таблиц из PDF

Извлечение таблиц из PDF

Находит таблицы внутри PDF и выгружает их в CSV или XLSX, показывая способ распознавания и уверенность для каждой таблицы.

upload_file

Нажмите для выбора или перетащите файлы сюда

Выберите PDF для поиска таблиц

Допустимо: .pdf,application/pdf

Похожие инструменты

Извлечение ссылок из PDF

Извлечение ссылок из PDF

Показывает все ссылки в PDF — внешние, внутренние, почтовые и «голые» URL в тексте без аннотаций — со страницей, видимым текстом и пометками риска.

Извлечение данных счёта из PDF

Извлечение данных счёта из PDF

Достаёт из PDF-счёта поставщика, номер, даты, налоговый номер, суммы и позиции — прямо в браузере, с оценкой уверенности для каждого поля.

Извлечение изображений из PDF

Извлечение изображений из PDF

Достаёт из PDF встроенные оригиналы: JPEG — байт в байт, остальное — в PNG, с размером в пикселях, размером на странице и эффективным DPI.

Извлечение структуры PDF

Извлечение структуры PDF

Превращает PDF в структурированный JSON — заголовки, абзацы, списки, таблицы и изображения — по тегам документа или по разметке страницы.

Сжать PDF

Сжать PDF

Уменьшите размер PDF-документа без загрузки на сервер.

Веб-оптимизатор 3D-моделей

Веб-оптимизатор 3D-моделей

Оптимизируйте 3D-модель для веба по реальному бюджету производительности — бесплатно и полностью в браузере.

Генератор идентификаторов сессий

Генератор идентификаторов сессий

Генерируйте случайные идентификаторы сессий с различными алфавитами и длинами.

apps

Больше инструментов

Просмотрите нашу полную коллекцию бесплатных онлайн-инструментов.

Как достать таблицу из PDF

В PDF нет таблиц. В нём есть текст, расставленный по координатам, и иногда линии, нарисованные вокруг этого текста. Таблицу видите вы, когда смотрите на страницу. Любой инструмент, который обещает «прочитать таблицы», на самом деле догадывается; честный вопрос — насколько хороша догадка, и здесь ответ показан прямо.

Два способа догадаться

Распознавание по линиям опирается на рамки, которые действительно нарисовал создатель документа. Горизонтальные и вертикальные линии собираются в сетку, и каждое слово попадает в свою ячейку. Когда рамки есть, результат почти точен — поэтому уверенность высокая.

Распознавание по пробелам рассчитано на большинство реальных документов, где рамок нет вовсе. Страница просматривается в поисках вертикальных промежутков, остающихся пустыми на многих подряд идущих строках; эти коридоры становятся границами столбцов. Способ хорошо работает на финансовой отчётности, прайс-листах и отчётах и может ошибиться на тексте в две колонки.

Оставьте режим Автоматически — выполняются оба прохода, а сохраняется более уверенный непересекающийся результат.

Настройка результата

  • Минимум строк и столбцов отсекает шум. «Таблица» из двух строк и двух столбцов чаще всего оказывается заголовком с датой.
  • Поле Страницы принимает all, 1-3 или 2,5,9. Разобрать одну страницу из отчёта на 400 страниц намного быстрее, чем весь отчёт.
  • Любую найденную таблицу можно удалить до выгрузки. Распознавание эвристическое: если оно приняло абзац за таблицу, уберите его здесь, а не чистите потом электронную таблицу.

Выгрузка

  • Отдельный CSV на каждую таблицу или все сразу в ZIP.
  • Объединённый CSV со строкой-разделителем между таблицами, чтобы границы не потерялись.
  • XLSX с отдельным листом на каждую таблицу — открывается в Excel, LibreOffice, Numbers и Google Таблицах. Ячейки, содержащие настоящие числа, записываются числами; то, что лишь похоже на число, например код счёта с ведущим нулём, остаётся текстом.

В каждом CSV есть метка порядка байтов UTF-8, поэтому кириллица не превращается в кракозябры при открытии в Excel для Windows.

Конфиденциальность

PDF открывается, разбирается и выгружается целиком в вашем браузере. Ничего не загружается на сервер, и во время работы не выполняется ни одного сетевого запроса.