Tiny Online Tools logoTiny Online Toolssearchツールを検索…grid_viewすべてのツール
ホームchevron_rightPDFツールchevron_rightPDF 構造化データ抽出ツールPDF 構造化データ抽出ツール

PDF 構造化データ抽出ツール

PDF を構造化 JSON(見出し・段落・リスト・表・画像)に変換します。タグ構造ツリー、またはレイアウト推定を情報源にします。

upload_file

クリックして選択 またはここにファイルをドラッグ&ドロップ

構造を読み取る PDF を選択

対応形式: .pdf,application/pdf

関連ツール

PDF リンク抽出ツール

PDF リンク抽出ツール

PDF 内のすべてのリンク(外部・内部・メール、および注釈のない本文中の裸の URL)をページ・アンカー文字・危険度つきで一覧にします。

PDF 埋め込みファイル抽出

PDF 埋め込みファイル抽出

PDF に添付されたファイルをすべて検出して保存します。注釈に隠れた添付や PDF 2.0 の関連ファイルも見つけます。

PDF 表抽出ツール

PDF 表抽出ツール

PDF の中の表を見つけて CSV や XLSX に書き出します。表ごとに検出方式と信頼度を表示します。

PDF JavaScript 検査

PDF JavaScript 検査

PDF の中のスクリプトをすべて見つけます。文書アクション、ページと注釈のイベント、フォームの計算まで。実行はせずに読めます。

メッシュグラデーションジェネレーター

メッシュグラデーションジェネレーター

複数の放射状カラーポイントを混ぜ合わせて、鮮やかなメッシュ風 SVG グラデーション背景を作成します — CSS の mesh gradient のように。

画像をASCIIアートに変換

画像をASCIIアートに変換

ブラウザで輝度マッピングを使用して画像をASCIIアートに変換します。

JavaScript フォーマッター

JavaScript フォーマッター

JavaScript コードを読みやすく整形します。

apps

もっと見る

無料オンラインツールの全コレクションを見る。

このツールが実際に読んでいるもの

「PDF を JSON に」と称するツールの多くは、平坦なテキストの塊を返します。文書は平坦ではありません。見出し、段落、リスト、表、図があり、その階層を失うことこそが、検索インデックス作成・移行・検索パイプラインへの投入で結果を役に立たなくします。このツールは階層を復元し、さらに重要なこととして、各答えがどこから来たのかを明示します。

情報源 1 — タグ構造ツリー

アクセシブルな PDF は構造ツリーを持ちます。作成者が「このグリフ列は H2」「あれは P」と明示的に書き込み、図には代替テキストが付いています。ツリーがある場合、それは文書自身による自己申告であり、見出しレベルや図の /Alt も含めてそのまま採用します。そのページはタグ付きと表示されます。

情報源 2 — レイアウト推定

大半の PDF にそのツリーはありません。その場合、構造は配置から推定するしかありません。

  • 最頻の行の高さ(ページ上のほとんどの文字が組まれているサイズ)を本文サイズとみなします。
  • 本文より明確に大きい行は見出しで、その差が見出しレベルを決めます。
  • 行頭が箇条書き記号や 1. で始まり、本文の左端より内側に字下げされている行はリスト項目です。連続すると 1 つのリストになります。
  • 通常の行間で続く本文行は 1 つの段落に結合されるため、4 行に分かれた文が 1 文として得られます。
  • 表は表検出器から得ます。検出された表の内側の行は本文の流れから除かれるので、同じ内容が二重に出力されません。

そのページは推定と表示されます。この表示は飾りではありません。段組み、柱、抜き書きなどで推定は時々外れます。信頼する前にプレビューと照合してください。

出力の使い方

すべてのブロックが外接矩形を持つため、JSON のノードをページ上の位置に戻せます。アウトラインの行をクリックするとプレビューで強調表示され、強調領域をクリックするとその行に移動します。JSON はまとめてコピー/ダウンロードできます。

プライバシー

ファイルが端末を離れることはありません。解析・構造復元・書き出しはすべてブラウザー内で行われ、処理中のネットワーク通信は一切ありません。