如何把表格从 PDF 里取出来
PDF 里并没有表格。它只有按坐标摆放的文字,有时再加上几条画在文字周围的线。表格是你看这页时脑子里形成的。任何号称“读取表格”的工具其实都在猜,唯一诚实的问题是猜得有多准——这个工具会把答案直接告诉你。
两种猜法
按线条识别使用文档实际画出的边框。横线与竖线被聚成一张网格,每个词落进它所在的单元格。文档有边框时结果几乎精确,所以置信度报得很高。
按空白识别面向绝大多数现实文档——它们根本没有边框。工具会横扫整页,寻找在连续多行上始终留白的竖直间隙,这些“走廊”就成了列边界。它在财务报表、价目表和报告上表现很好,也可能被双栏排版的段落骗过。
把方式留在自动,两种识别都会跑一遍,保留更强且互不重叠的结果。
微调结果
- 最少行数与列数用来滤掉噪声。两行两列的“表格”往往只是一个标题加一个日期。
- 页码接受
all、1-3或2,5,9。在 400 页的报告里只扫一页,比全扫快得多。 - 每个识别出的表格都可以在导出前删除。识别是启发式的:如果它把一段正文当成了表格,在这里删掉,好过导出后再去清理电子表格。
导出
- 每个表格一个 CSV,或全部打包成 ZIP。
- 合并 CSV,表格之间插入一行标记,边界不会丢失。
- XLSX,每个表格一个工作表,可直接用 Excel、LibreOffice、Numbers 或 Google 表格打开。纯数字的单元格写成数字以便求和;只是看起来像数字的内容(例如以 0 开头的发票编号)保持文本。
每个 CSV 都带 UTF-8 字节顺序标记,中文在 Windows 版 Excel 中不会变成乱码。
隐私
PDF 的打开、解析与导出全部在你的浏览器内完成。不上传任何内容,处理过程中也不发起任何网络请求。
Tiny Online Tools







