PDF 会藏些什么
PDF 是一个容器,不是一张图片。大量内容可以在里面随文件流转,却从不出现在屏幕上,而且这些内容大多能熬过邮件发送、打印成 PDF 和上传到门户。
元数据。 Info 字典保存作者姓名、创作程序和时间戳。XMP 包里往往还有第二份更旧的副本——包括 Info 字典早已没有的字段,比如把这份文件和它的来源文件绑在一起的原始文档 ID。
图层。 可选内容组可以在默认配置里被关掉。内容依然在那里;忽略该配置的阅读器,或者打开图层面板的用户,都会看到它。
JavaScript。 文档级脚本、打开动作、页面动作、注释动作,以及表单字段的计算与校验脚本。本工具会把它们全部列出,且一个也不执行。
不可见文字。 渲染模式 3 什么都不画,却仍可选中、可搜索——OCR 图层如此,被人刻意藏起来的文字也是如此。
页面之外的内容。 画在裁剪框以外的东西会被阅读器裁掉,但仍在文件里,一旦去掉裁剪框就会原样回来。
涂黑检查
真实文档中后果最严重的失误:在名字上画一个黑色矩形然后保存。那个矩形什么也没盖住——下面的文字仍在内容流里,两下点击就能复制出来。
本工具会寻找填充的深色矩形,并报告任何完全落在其中的文字,把文字显示给你,并在页面预览上把矩形画出来。只要这里出现结果,这份文件就没有被真正涂黑。
它看不到什么
无法解码的流不会被搜索,加密文档会被作为限制明确说明,而不是悄悄跳过。一份干净的报告只表示这些检查没有发现问题,并不是可以公开发布的证明。
隐私
一切都在你的浏览器中解析。文件从不上传——检查一份让你不放心的文档,这是唯一合理的做法。
Tiny Online Tools







