Tiny Online Tools logoTiny Online Toolssearch搜索工具…grid_view全部工具
首页chevron_rightPDF工具chevron_rightPDF OCR 文字校正PDF OCR 文字校正

PDF OCR 文字校正

修正扫描 PDF 隐藏 OCR 层里的识别错误,扫描图像保持逐像素不变。

upload_file

点击浏览 或将文件拖放到这里

选择带 OCR 层的扫描 PDF

接受格式:.pdf,application/pdf

相似工具

PDF OCR 图层查看器

PDF OCR 图层查看器

把扫描 PDF 中隐形的 OCR 文字按原位画出来,直观检验识别质量。

PDF 扫描件与可搜索检测

PDF 扫描件与可搜索检测

逐页分辨真实文字、纯扫描图像,以及带 OCR 文字层的扫描件,并给出判定依据。

PDF 元数据编辑器

PDF 元数据编辑器

查看并编辑 PDF 元数据,包括标题、作者、主题、关键词和创建者。

PDF JavaScript 检查器

PDF JavaScript 检查器

找出 PDF 内部的每一段脚本——文档动作、页面与注释事件、表单计算——并在不执行的前提下阅读它们。

SVG转JSX

SVG转JSX

将SVG标记转换为具有正确camelCase属性的React JSX组件。

AVIF 转 JPG

AVIF 转 JPG

在浏览器中将现代 AVIF 图片转换为通用的 JPG 格式。

正则提取器

正则提取器

在浏览器中使用正则表达式从文本里提取匹配内容。

apps

更多工具

浏览我们完整的免费在线工具集合。

修正谁也看不见的东西

做过 OCR 的扫描 PDF,把扫描件作为图像保存,把识别出的词作为不可见文字叠在上面。识别程序把某个词认错时,图像看起来依然完美 —— 静悄悄出问题的是搜索、复制粘贴和屏幕阅读器。

这个工具编辑的正是那一层隐藏内容。扫描图不会被重新编码、重新压缩或重新绘制。

文件是怎样被修改的

页面内容流是一串操作符:有的绘制扫描图像,有的负责定位和显示文字。工具会解析这串操作符,并且只替换不可见文字操作符中的字符串操作数。其余每一个字节的含义都被保留 —— 定位操作符、图形状态,以及绘制扫描图的那个操作符,都原封不动地通过。

这正是校正后的页面不可能位移、模糊或被重新压缩的原因。这不是一句承诺,而是「什么都不重新生成」带来的必然结果。

看得懂的验证

写入完成后,工具会重新打开结果文件,并对每个被修改的页面执行三项检查:

  1. 文字 —— 文字提取器现在返回的正是校正后的词。
  2. 不可见性 —— 文字层仍以渲染模式 3 绘制,且可见字形的数量没有变化。
  3. 像素 —— 校正后的页面被渲染出来,与原始渲染逐像素比对,改变比例应为零。

无论通过与否,这三项结果都会在下载前展示出来。

什么时候会拒绝

有些页面无法安全重写:内容流使用了无法解码的过滤器,或者某个文字块把可见与不可见字形混在一起,以致无法保证可见部分完好。这些页面会被逐一点名拒绝,并保持原样。拒绝才是正确的做法;悄悄交出一个损坏的文件不是。

PDF 字体无法表达的字符同样如此:在可行的情况下会嵌入一款标准 Helvetica 来承载替换内容;当这仍不足够时,该处修改会被跳过并明确列出。

隐私

解析、编辑、保存与验证全部在你的浏览器内完成,PDF 绝不会被上传。