修正谁也看不见的东西
做过 OCR 的扫描 PDF,把扫描件作为图像保存,把识别出的词作为不可见文字叠在上面。识别程序把某个词认错时,图像看起来依然完美 —— 静悄悄出问题的是搜索、复制粘贴和屏幕阅读器。
这个工具编辑的正是那一层隐藏内容。扫描图不会被重新编码、重新压缩或重新绘制。
文件是怎样被修改的
页面内容流是一串操作符:有的绘制扫描图像,有的负责定位和显示文字。工具会解析这串操作符,并且只替换不可见文字操作符中的字符串操作数。其余每一个字节的含义都被保留 —— 定位操作符、图形状态,以及绘制扫描图的那个操作符,都原封不动地通过。
这正是校正后的页面不可能位移、模糊或被重新压缩的原因。这不是一句承诺,而是「什么都不重新生成」带来的必然结果。
看得懂的验证
写入完成后,工具会重新打开结果文件,并对每个被修改的页面执行三项检查:
- 文字 —— 文字提取器现在返回的正是校正后的词。
- 不可见性 —— 文字层仍以渲染模式 3 绘制,且可见字形的数量没有变化。
- 像素 —— 校正后的页面被渲染出来,与原始渲染逐像素比对,改变比例应为零。
无论通过与否,这三项结果都会在下载前展示出来。
什么时候会拒绝
有些页面无法安全重写:内容流使用了无法解码的过滤器,或者某个文字块把可见与不可见字形混在一起,以致无法保证可见部分完好。这些页面会被逐一点名拒绝,并保持原样。拒绝才是正确的做法;悄悄交出一个损坏的文件不是。
PDF 字体无法表达的字符同样如此:在可行的情况下会嵌入一款标准 Helvetica 来承载替换内容;当这仍不足够时,该处修改会被跳过并明确列出。
隐私
解析、编辑、保存与验证全部在你的浏览器内完成,PDF 绝不会被上传。
Tiny Online Tools







