このツールが実際に読んでいるもの
「PDF を JSON に」と称するツールの多くは、平坦なテキストの塊を返します。文書は平坦ではありません。見出し、段落、リスト、表、図があり、その階層を失うことこそが、検索インデックス作成・移行・検索パイプラインへの投入で結果を役に立たなくします。このツールは階層を復元し、さらに重要なこととして、各答えがどこから来たのかを明示します。
情報源 1 — タグ構造ツリー
アクセシブルな PDF は構造ツリーを持ちます。作成者が「このグリフ列は H2」「あれは P」と明示的に書き込み、図には代替テキストが付いています。ツリーがある場合、それは文書自身による自己申告であり、見出しレベルや図の /Alt も含めてそのまま採用します。そのページはタグ付きと表示されます。
情報源 2 — レイアウト推定
大半の PDF にそのツリーはありません。その場合、構造は配置から推定するしかありません。
- 最頻の行の高さ(ページ上のほとんどの文字が組まれているサイズ)を本文サイズとみなします。
- 本文より明確に大きい行は見出しで、その差が見出しレベルを決めます。
- 行頭が箇条書き記号や
1.で始まり、本文の左端より内側に字下げされている行はリスト項目です。連続すると 1 つのリストになります。 - 通常の行間で続く本文行は 1 つの段落に結合されるため、4 行に分かれた文が 1 文として得られます。
- 表は表検出器から得ます。検出された表の内側の行は本文の流れから除かれるので、同じ内容が二重に出力されません。
そのページは推定と表示されます。この表示は飾りではありません。段組み、柱、抜き書きなどで推定は時々外れます。信頼する前にプレビューと照合してください。
出力の使い方
すべてのブロックが外接矩形を持つため、JSON のノードをページ上の位置に戻せます。アウトラインの行をクリックするとプレビューで強調表示され、強調領域をクリックするとその行に移動します。JSON はまとめてコピー/ダウンロードできます。
プライバシー
ファイルが端末を離れることはありません。解析・構造復元・書き出しはすべてブラウザー内で行われ、処理中のネットワーク通信は一切ありません。
Tiny Online Tools







