Tiny Online Tools logoTiny Online Toolssearch搜索工具…grid_view全部工具
首页chevron_rightPDF工具chevron_rightPDF 扫描件与可搜索检测PDF 扫描件与可搜索检测

PDF 扫描件与可搜索检测

逐页分辨真实文字、纯扫描图像,以及带 OCR 文字层的扫描件,并给出判定依据。

upload_file

点击浏览 或将文件拖放到这里

选择要分析的 PDF

接受格式:.pdf,application/pdf

相似工具

PDF OCR 图层查看器

PDF OCR 图层查看器

把扫描 PDF 中隐形的 OCR 文字按原位画出来,直观检验识别质量。

PDF OCR 文字校正

PDF OCR 文字校正

修正扫描 PDF 隐藏 OCR 层里的识别错误,扫描图像保持逐像素不变。

PDF JavaScript 检查器

PDF JavaScript 检查器

找出 PDF 内部的每一段脚本——文档动作、页面与注释事件、表单计算——并在不执行的前提下阅读它们。

PDF 元数据清理器

PDF 元数据清理器

从 PDF 中抹去作者、软件、时间戳、XMP 及其他隐藏信息,并给出每一项确实已被删除的证据。

SVG 透视网格生成器

SVG 透视网格生成器

生成具有可自定义消失点的一点透视 SVG 网格。免费创建深度背景、复古未来场景和插画参考,无需上传。

图片圆角工具

图片圆角工具

为任意图片添加自定义半径的圆角效果。

PDF 页面尺寸分析器

PDF 页面尺寸分析器

在浏览器中找出 PDF 里混杂的 Letter、A4、A3 与自定义页面尺寸、异常旋转以及被裁切的页面。

apps

更多工具

浏览我们完整的免费在线工具集合。

为什么「这个 PDF 里有文字吗」是个错误的问题

一个 PDF 可能第一页可搜索、第二页却是照片。常见的检查方式 —— 提取文字、找到一些、宣布成功 —— 在这两种情况下都会给出错误答案;在实际工作中最常见的情况下同样会出错:一份已经做过 OCR 的扫描件,尽管每一个可见像素都是图像,却是真正可以搜索的。

这个检测工具逐页工作,在下结论之前会收集六项彼此独立的信号:

  • 提取到的文字 —— 文字提取器实际能取回多少词和字符。
  • 文字渲染模式 —— 以模式 3 绘制的字形是不可见的。OCR 软件正是这样把识别出的词写在扫描图之上,这也是区分「已 OCR 的扫描件」与「原生文字页」的唯一可靠办法。
  • 绘制的图像 —— 每张图落在页面的什么位置,占据页面多大比例。
  • 有效 DPI 与位深 —— 采用 CCITT 或 JBIG2 压缩的 1 位图像是扫描仪的产物,而不是照片或标志。
  • 矢量路径 —— 由排版软件生成的页面几乎总有线条、边框或线稿;纯扫描件一条也没有。

你会得到什么

每一页会被标记为 原生文字扫描图像扫描 + OCR 层混合空白,附带置信度,以及最关键的一点:得出该结论的事实清单。如果你不认同某个判定,可以清楚地看到是哪一项信号促成了它。

文档摘要回答你真正关心的问题:整份文档是否全篇可搜索;如果不是,哪些页面需要做 OCR。整份报告可导出为 CSV 或 JSON,方便接入归档流程。

局限

PDF 内部没有任何地方声明「我是扫描件」,所以这里做的是推断。文字被转成轮廓的页面没有文字对象,看起来与扫描件完全相同;OCR 质量很差的扫描件在技术上可搜索,实际却毫无用处。这两种情况都会连同依据一起如实报告,而不是给出一个听起来很笃定的猜测。

隐私

文件始终不会离开你的电脑。解析、渲染、缩略图和报告全部在浏览器中完成。