把答案从填好的 PDF 表单里取出来
一份回收的表单,就是被困在文档里的数据。PDF 表单数据提取器读取一份表单——或三十份——中的值,并输出 JSON、CSV、FDF 或 XFDF,全部在你的浏览器中完成。
类型正确的值
- 文本字段输出为字符串,多行文本同样如此。
- 复选框同时输出布尔值和它真正提交的导出值。该值来自控件的
/AP /N键:常见的是1、On或某个产品编码,因此想当然地按Yes处理会悄悄产生错误数据。 - 单选按钮输出所选的导出值,而不是圆点旁印着的标签。
- 下拉列表给出所选项;列表框给出数组。
- 签名字段报告已签名或未签名,若签名字典中带有签名者姓名也会一并给出。
批量模式才是重点
把一份申请表所有回收副本一起放进来,工具会构建一张宽表:每份文档一行,每个字段名一列,表头是所有字段名的并集。导出为 CSV 后用表格软件打开即可。多出或缺少可选章节的表单依然能对齐——缺少某字段的文档只是把该单元格留空。
XFA 表单
有些 PDF——尤其是 LiveCycle 时代的政府与银行表单——把答案保存在 XFA 的 XML 数据集中,而不是 AcroForm 的字段值里。静态 XFA 会两边同步;动态 XFA 不会,于是大多数提取工具什么都取不到。本工具同样读取 datasets 包,将其与 AcroForm 值合并,并为每个答案标注来源,还会指出两个来源互相矛盾的情况。
FDF 与 XFDF
两者都是表单数据的标准交换格式,这里也都按规范书写:字段通过 /Kids 嵌套,使导入时能落到正确的嵌套字段;非拉丁文本采用 UTF-16BE;多选值写成重复的 <value> 元素。把任意一种导入 Acrobat 中的空白表单副本,答案就会重新出现。
隐私
每份文档都由 pdf-lib 在你的浏览器中解析。填好的表单通常包含个人信息;这里不会上传任何内容,所有导出文件都在本地生成。
Tiny Online Tools







