谁也看不见的那一层
扫描件做 OCR 时,识别程序并不会替换图像。它把扫描图原封不动地留下,再用 PDF 渲染模式 3(「既不填充也不描边」)把识别出的词写在上面。文字确实在那里,可以选中、可以搜索,但任何阅读器都不会绘制它的哪怕一个像素。
这是合理的设计,却让 OCR 质量变得无从判断。搜不到某个词,只能说明它缺失;它不会告诉你识别程序是不是把「已收到」读成了别的字,也不会告诉你它是不是把整整一栏往上错了一行。
这个工具让你看到什么
每一个识别出的词都会被画回它原本所在的方框里,覆盖在它来源的扫描图之上。四种视图:
- 只看词框 —— 只有轮廓,可以在文字不碍事的情况下评估覆盖范围和对齐情况。
- 文字叠加图像 —— 识别出的词半透明地画在扫描图上,并配有透明度滑块。识别一旦偏移,画出的词就会明显地从下方扫描出的字上滑开。
- 只看文字 —— 空白纸上只留文字层,这实际上就是屏幕阅读器所拿到的内容。
- 只看图像 —— 原始扫描图,便于对照。
可在词框、行框、块框之间切换,在识别文本中搜索并看到页面上的高亮,也可以点击任意方框跳转到列表中的对应项。
判断质量
每一页都会给出词数与字符数、真正不可见文字的比例、平均词框尺寸,以及一个覆盖率数值 —— OCR 词框实际占据了页面面积的多少。识别程序若在半页处放弃,覆盖率会先暴露问题,远早于你察觉到缺失的词。
形状在统计上异常的词会被标出:没有元音、字母混着数字、单字符碎片、连续符号、词框与邻近词严重不协调。这些是 可疑项,不是错误。
导出
纯文本、含每个边界框与字体信息的 JSON,或供下游工具使用的 hOCR 风格 HTML。坐标使用 PDF 点,原点在左上角。
隐私
不会上传任何内容。PDF 的解析、渲染和测量全部在你的浏览器内完成。
Tiny Online Tools







