Tiny Online Tools logoTiny Online Toolssearchツールを検索…grid_viewすべてのツール
ホームchevron_rightPDFツールchevron_rightPDF スキャン/検索可能判定PDF スキャン/検索可能判定

PDF スキャン/検索可能判定

本物のテキストか、素のスキャンか、OCR 層付きのスキャンかを、根拠つきでページごとに判定します。

upload_file

クリックして選択 またはここにファイルをドラッグ&ドロップ

解析する PDF を選択

対応形式: .pdf,application/pdf

関連ツール

PDF OCR テキスト修正

PDF OCR テキスト修正

スキャン PDF の隠れた OCR レイヤーの誤認識を直します。スキャン画像は 1 ピクセルも変わりません。

PDF OCR レイヤー表示

PDF OCR レイヤー表示

スキャン PDF の見えない OCR テキストを、実際の位置どおりに描き出して確認できます。

PDF JavaScript 検査

PDF JavaScript 検査

PDF の中のスクリプトをすべて見つけます。文書アクション、ページと注釈のイベント、フォームの計算まで。実行はせずに読めます。

PDF アクセシビリティチェック

PDF アクセシビリティチェック

PDF のタグ、読み上げ順序、代替テキスト、言語、見出し階層を、機械が確認できる WCAG 規則で点検します。

PDFページ抽出

PDFページ抽出

PDFファイルから特定のページを抽出します。

オーディオコンプレッサー

オーディオコンプレッサー

しきい値、ニー、比率、アタック、リリースを調整して音声にダイナミクス圧縮を適用します。

透明ピクセル自動トリミング

透明ピクセル自動トリミング

PNG画像の透明な余白を自動的にトリミングします。不透明なピクセルのバウンディングボックスを検出し、その範囲に画像を切り抜きます。

apps

もっと見る

無料オンラインツールの全コレクションを見る。

「この PDF にテキストはあるか」は間違った問いです

PDF は 1 ページ目が検索可能で、2 ページ目が写真ということがあります。よくある確認方法 —— テキストを抽出し、何か見つかったら合格とする —— は、そのどちらも取り違えます。そして実務でもっとも多いケースでも間違えます。すでに OCR を通したスキャンは、見えているピクセルがすべて画像であっても、本当に検索できるからです。

このツールはページ単位で動作し、結論を出す前に互いに独立した 6 つの手がかりを集めます。

  • 抽出されたテキスト — 抽出器が実際に取り出せる単語数と文字数。
  • テキストの描画モード — モード 3 で描かれたグリフは見えません。OCR ソフトが認識結果をスキャン画像の上に書き込むときの方法そのもので、OCR 済みスキャンと本来のテキストページを見分ける唯一確実な手段です。
  • 描かれた画像 — 各画像がページのどこに置かれ、面積の何割を占めるか。
  • 実効 DPI とビット深度 — CCITT や JBIG2 で圧縮された 1 ビット画像は、写真でもロゴでもなくスキャナーの出力です。
  • ベクターパス — 組版ソフトが作ったページには罫線や枠線がほぼ必ずあります。素のスキャンには一本もありません。

得られるもの

各ページは 本来のテキストスキャン画像スキャン + OCR 層混在空白 のいずれかに分類され、確度と、そして何より重要な「その分類を導いた事実の一覧」が添えられます。判定に納得できないときは、どの手がかりが効いたのかをその場で確認できます。

文書全体のまとめは、あなたが本当に知りたいことに答えます。最後まで検索できるのか、できないならどのページに OCR が必要なのか。レポート全体は CSV または JSON で書き出せます。

限界

PDF の中に「私はスキャンです」と書かれた場所はないため、これは推論です。テキストをアウトライン化したページにはテキストオブジェクトがなく、スキャンと区別がつきません。OCR の質が低いスキャンは技術的には検索できても実用にはなりません。どちらも、自信ありげな断定ではなく根拠つきで報告します。

プライバシー

ファイルがパソコンの外に出ることはありません。解析、レンダリング、サムネイル、レポートのすべてがブラウザー内で完結します。