这个工具究竟读到了什么
大多数“PDF 转 JSON”工具给你的是一堵扁平的文字墙。文档并不扁平:它有标题、段落、列表、表格和插图,丢掉这层层级,正是让结果无法用于索引、迁移或喂给检索管线的原因。这个工具会把层级重建出来——更重要的是,它会告诉你每个答案的来源。
来源一:标签结构树
无障碍 PDF 会带一棵结构树:制作者明确写下了这段字形是 H2、那段是 P,插图还带有替代文字。只要这棵树存在,它就是文档对自己的陈述,工具会原样采用,包括标题层级和插图的 /Alt 文本。这样读出的页面标记为已标签。
来源二:版面推断
绝大多数 PDF 没有这棵树,结构就只能从几何位置推断:
- 众数行高——页面上大多数字符所用的字号——被当作正文字号。
- 明显高于正文的行是标题,高出多少决定层级。
- 以项目符号或
1.开头、且缩进超出正文左边界的行是列表项;连续的若干行合成一个列表。 - 行距正常的连续正文行会重新合并成一个段落,于是被拆到四行的一句话会以一句话的形式呈现。
- 表格来自表格检测器,检测到的表格内部的行会从正文流中移除,避免同一内容出现两次。
这样读出的页面标记为推断,这个标记不是装饰。推断偶尔会在双栏排版、页眉页脚或引文块上出错,请先对照页面预览再采信。
使用输出
每个块都带有外接矩形,因此 JSON 节点可以映射回页面上的具体位置。点击大纲中的任意一行即可在预览中高亮它,点击高亮区域则跳到对应的行。JSON 可整体复制或下载。
隐私
文件不会离开你的设备。解析、结构还原与导出全部在浏览器内完成,处理期间不发起任何网络请求。
Tiny Online Tools







