Tiny Online Tools logoTiny Online Toolssearch搜索工具…grid_view全部工具
首页chevron_rightPDF工具chevron_rightPDF 表格提取器PDF 表格提取器

PDF 表格提取器

找出 PDF 里的表格并导出为 CSV 或 XLSX,同时标明每个表格的识别方式与置信度。

upload_file

点击浏览 或将文件拖放到这里

选择要扫描表格的 PDF

接受格式:.pdf,application/pdf

相似工具

PDF JavaScript 检查器

PDF JavaScript 检查器

找出 PDF 内部的每一段脚本——文档动作、页面与注释事件、表单计算——并在不执行的前提下阅读它们。

PDF 元数据清理器

PDF 元数据清理器

从 PDF 中抹去作者、软件、时间戳、XMP 及其他隐藏信息,并给出每一项确实已被删除的证据。

PDF 图片提取器

PDF 图片提取器

取出 PDF 中内嵌的原始图片 —— JPEG 逐字节原样导出,其余转为 PNG —— 并给出像素尺寸、绘制尺寸与有效 DPI。

PDF 字体检查器

PDF 字体检查器

列出 PDF 中的每一种字体,包含子集标签、子类型、嵌入状态以及真正使用它的页码。

音频转换器

音频转换器

将音频文件(MP3、OGG、AAC、FLAC)转换为 WAV,并支持自定义采样率以及单声道/立体声选项。

PDF 元数据编辑器

PDF 元数据编辑器

查看并编辑 PDF 元数据,包括标题、作者、主题、关键词和创建者。

Office 文件通用检查器

Office 文件通用检查器

打开 DOCX、XLSX、PPTX、ODT、XPS、MHTML、CHM 和 Publisher 文件,在浏览器中查看其部件、关系与元数据。

apps

更多工具

浏览我们完整的免费在线工具集合。

如何把表格从 PDF 里取出来

PDF 里并没有表格。它只有按坐标摆放的文字,有时再加上几条画在文字周围的线。表格是你看这页时脑子里形成的。任何号称“读取表格”的工具其实都在猜,唯一诚实的问题是猜得有多准——这个工具会把答案直接告诉你。

两种猜法

按线条识别使用文档实际画出的边框。横线与竖线被聚成一张网格,每个词落进它所在的单元格。文档有边框时结果几乎精确,所以置信度报得很高。

按空白识别面向绝大多数现实文档——它们根本没有边框。工具会横扫整页,寻找在连续多行上始终留白的竖直间隙,这些“走廊”就成了列边界。它在财务报表、价目表和报告上表现很好,也可能被双栏排版的段落骗过。

把方式留在自动,两种识别都会跑一遍,保留更强且互不重叠的结果。

微调结果

  • 最少行数与列数用来滤掉噪声。两行两列的“表格”往往只是一个标题加一个日期。
  • 页码接受 all、1-3 或 2,5,9。在 400 页的报告里只扫一页,比全扫快得多。
  • 每个识别出的表格都可以在导出前删除。识别是启发式的:如果它把一段正文当成了表格,在这里删掉,好过导出后再去清理电子表格。

导出

  • 每个表格一个 CSV,或全部打包成 ZIP。
  • 合并 CSV,表格之间插入一行标记,边界不会丢失。
  • XLSX,每个表格一个工作表,可直接用 Excel、LibreOffice、Numbers 或 Google 表格打开。纯数字的单元格写成数字以便求和;只是看起来像数字的内容(例如以 0 开头的发票编号)保持文本。

每个 CSV 都带 UTF-8 字节顺序标记,中文在 Windows 版 Excel 中不会变成乱码。

隐私

PDF 的打开、解析与导出全部在你的浏览器内完成。不上传任何内容,处理过程中也不发起任何网络请求。