Tiny Online Tools logoTiny Online Toolssearch搜索工具…grid_view全部工具
首页chevron_rightPDF工具chevron_rightPDF 结构化数据提取器PDF 结构化数据提取器

PDF 结构化数据提取器

把 PDF 变成结构化 JSON —— 标题、段落、列表、表格与图片 —— 来源可以是标签树,也可以是版面推断。

upload_file

点击浏览 或将文件拖放到这里

选择要读取结构的 PDF

接受格式:.pdf,application/pdf

相似工具

PDF JavaScript 检查器

PDF JavaScript 检查器

找出 PDF 内部的每一段脚本——文档动作、页面与注释事件、表单计算——并在不执行的前提下阅读它们。

PDF 元数据清理器

PDF 元数据清理器

从 PDF 中抹去作者、软件、时间戳、XMP 及其他隐藏信息,并给出每一项确实已被删除的证据。

PDF 图片提取器

PDF 图片提取器

取出 PDF 中内嵌的原始图片 —— JPEG 逐字节原样导出,其余转为 PNG —— 并给出像素尺寸、绘制尺寸与有效 DPI。

PDF 字体检查器

PDF 字体检查器

列出 PDF 中的每一种字体,包含子集标签、子类型、嵌入状态以及真正使用它的页码。

CAD文件转换器

CAD文件转换器

将 STEP、IGES 和 BREP CAD 文件转换为 STL、OBJ、GLB 或 PLY,网格细分质量可调。

SVG 波浪线生成器

SVG 波浪线生成器

生成 SVG 波浪线图案,可调振幅、波长、相位偏移和交替颜色。免费创建复古背景、分隔线和纹理,无需上传。

新拟态效果生成器

新拟态效果生成器

生成新拟态(Neumorphism)UI 样式的 CSS 代码。

apps

更多工具

浏览我们完整的免费在线工具集合。

这个工具究竟读到了什么

大多数“PDF 转 JSON”工具给你的是一堵扁平的文字墙。文档并不扁平:它有标题、段落、列表、表格和插图,丢掉这层层级,正是让结果无法用于索引、迁移或喂给检索管线的原因。这个工具会把层级重建出来——更重要的是,它会告诉你每个答案的来源。

来源一:标签结构树

无障碍 PDF 会带一棵结构树:制作者明确写下了这段字形是 H2、那段是 P,插图还带有替代文字。只要这棵树存在,它就是文档对自己的陈述,工具会原样采用,包括标题层级和插图的 /Alt 文本。这样读出的页面标记为已标签

来源二:版面推断

绝大多数 PDF 没有这棵树,结构就只能从几何位置推断

  • 众数行高——页面上大多数字符所用的字号——被当作正文字号。
  • 明显高于正文的行是标题,高出多少决定层级。
  • 以项目符号或 1. 开头、且缩进超出正文左边界的行是列表项;连续的若干行合成一个列表。
  • 行距正常的连续正文行会重新合并成一个段落,于是被拆到四行的一句话会以一句话的形式呈现。
  • 表格来自表格检测器,检测到的表格内部的行会从正文流中移除,避免同一内容出现两次。

这样读出的页面标记为推断,这个标记不是装饰。推断偶尔会在双栏排版、页眉页脚或引文块上出错,请先对照页面预览再采信。

使用输出

每个块都带有外接矩形,因此 JSON 节点可以映射回页面上的具体位置。点击大纲中的任意一行即可在预览中高亮它,点击高亮区域则跳到对应的行。JSON 可整体复制或下载。

隐私

文件不会离开你的设备。解析、结构还原与导出全部在浏览器内完成,处理期间不发起任何网络请求。