Tiny Online Tools logoTiny Online Toolssearch搜索工具…grid_view全部工具
首页chevron_rightPDF工具chevron_rightPDF 表格提取器PDF 表格提取器

PDF 表格提取器

找出 PDF 里的表格并导出为 CSV 或 XLSX,同时标明每个表格的识别方式与置信度。

upload_file

点击浏览 或将文件拖放到这里

选择要扫描表格的 PDF

接受格式:.pdf,application/pdf

相似工具

PDF JavaScript 检查器

PDF JavaScript 检查器

找出 PDF 内部的每一段脚本——文档动作、页面与注释事件、表单计算——并在不执行的前提下阅读它们。

PDF 元数据清理器

PDF 元数据清理器

从 PDF 中抹去作者、软件、时间戳、XMP 及其他隐藏信息,并给出每一项确实已被删除的证据。

PDF 图片提取器

PDF 图片提取器

取出 PDF 中内嵌的原始图片 —— JPEG 逐字节原样导出,其余转为 PNG —— 并给出像素尺寸、绘制尺寸与有效 DPI。

PDF 字体检查器

PDF 字体检查器

列出 PDF 中的每一种字体,包含子集标签、子类型、嵌入状态以及真正使用它的页码。

文本转 PascalCase

文本转 PascalCase

把文本转换为适合类名和标识符的 PascalCase。

高级骰子掷骰器

高级骰子掷骰器

支持完整符号的骰子掷骰:XdY+Z、保留最高/最低、爆炸骰子。

SVG 螺旋生成器

SVG 螺旋生成器

生成阿基米德螺旋和对数 SVG 螺旋,全面控制圈数、半径、描边粗细和渐变填充——非常适合装饰形状、徽标和背景。

apps

更多工具

浏览我们完整的免费在线工具集合。

如何把表格从 PDF 里取出来

PDF 里并没有表格。它只有按坐标摆放的文字,有时再加上几条画在文字周围的线。表格是看这页时脑子里形成的。任何号称“读取表格”的工具其实都在猜,唯一诚实的问题是猜得有多准——这个工具会把答案直接告诉你。

两种猜法

按线条识别使用文档实际画出的边框。横线与竖线被聚成一张网格,每个词落进它所在的单元格。文档有边框时结果几乎精确,所以置信度报得很高。

按空白识别面向绝大多数现实文档——它们根本没有边框。工具会横扫整页,寻找在连续多行上始终留白的竖直间隙,这些“走廊”就成了列边界。它在财务报表、价目表和报告上表现很好,也可能被双栏排版的段落骗过。

把方式留在自动,两种识别都会跑一遍,保留更强且互不重叠的结果。

微调结果

  • 最少行数与列数用来滤掉噪声。两行两列的“表格”往往只是一个标题加一个日期。
  • 页码接受 all1-32,5,9。在 400 页的报告里只扫一页,比全扫快得多。
  • 每个识别出的表格都可以在导出前删除。识别是启发式的:如果它把一段正文当成了表格,在这里删掉,好过导出后再去清理电子表格。

导出

  • 每个表格一个 CSV,或全部打包成 ZIP。
  • 合并 CSV,表格之间插入一行标记,边界不会丢失。
  • XLSX,每个表格一个工作表,可直接用 Excel、LibreOffice、Numbers 或 Google 表格打开。纯数字的单元格写成数字以便求和;只是看起来像数字的内容(例如以 0 开头的发票编号)保持文本。

每个 CSV 都带 UTF-8 字节顺序标记,中文在 Windows 版 Excel 中不会变成乱码。

隐私

PDF 的打开、解析与导出全部在你的浏览器内完成。不上传任何内容,处理过程中也不发起任何网络请求。