为什么「这个 PDF 里有文字吗」是个错误的问题
一个 PDF 可能第一页可搜索、第二页却是照片。常见的检查方式 —— 提取文字、找到一些、宣布成功 —— 在这两种情况下都会给出错误答案;在实际工作中最常见的情况下同样会出错:一份已经做过 OCR 的扫描件,尽管每一个可见像素都是图像,却是真正可以搜索的。
这个检测工具逐页工作,在下结论之前会收集六项彼此独立的信号:
- 提取到的文字 —— 文字提取器实际能取回多少词和字符。
- 文字渲染模式 —— 以模式 3 绘制的字形是不可见的。OCR 软件正是这样把识别出的词写在扫描图之上,这也是区分「已 OCR 的扫描件」与「原生文字页」的唯一可靠办法。
- 绘制的图像 —— 每张图落在页面的什么位置,占据页面多大比例。
- 有效 DPI 与位深 —— 采用 CCITT 或 JBIG2 压缩的 1 位图像是扫描仪的产物,而不是照片或标志。
- 矢量路径 —— 由排版软件生成的页面几乎总有线条、边框或线稿;纯扫描件一条也没有。
你会得到什么
每一页会被标记为 原生文字、扫描图像、扫描 + OCR 层、混合 或 空白,附带置信度,以及最关键的一点:得出该结论的事实清单。如果你不认同某个判定,可以清楚地看到是哪一项信号促成了它。
文档摘要回答你真正关心的问题:整份文档是否全篇可搜索;如果不是,哪些页面需要做 OCR。整份报告可导出为 CSV 或 JSON,方便接入归档流程。
局限
PDF 内部没有任何地方声明「我是扫描件」,所以这里做的是推断。文字被转成轮廓的页面没有文字对象,看起来与扫描件完全相同;OCR 质量很差的扫描件在技术上可搜索,实际却毫无用处。这两种情况都会连同依据一起如实报告,而不是给出一个听起来很笃定的猜测。
隐私
文件始终不会离开你的电脑。解析、渲染、缩略图和报告全部在浏览器中完成。
Tiny Online Tools







