Tiny Online Tools logoTiny Online Toolssearchツールを検索…grid_viewすべてのツール
ホームchevron_rightPDFツールchevron_rightPDF 表抽出ツールPDF 表抽出ツール

PDF 表抽出ツール

PDF の中の表を見つけて CSV や XLSX に書き出します。表ごとに検出方式と信頼度を表示します。

upload_file

クリックして選択 またはここにファイルをドラッグ&ドロップ

表を探す PDF を選択

対応形式: .pdf,application/pdf

関連ツール

PDF 構造化データ抽出ツール

PDF 構造化データ抽出ツール

PDF を構造化 JSON(見出し・段落・リスト・表・画像)に変換します。タグ構造ツリー、またはレイアウト推定を情報源にします。

PDF JavaScript 検査

PDF JavaScript 検査

PDF の中のスクリプトをすべて見つけます。文書アクション、ページと注釈のイベント、フォームの計算まで。実行はせずに読めます。

PDF リンク抽出ツール

PDF リンク抽出ツール

PDF 内のすべてのリンク(外部・内部・メール、および注釈のない本文中の裸の URL)をページ・アンカー文字・危険度つきで一覧にします。

PDF 埋め込みファイル抽出

PDF 埋め込みファイル抽出

PDF に添付されたファイルをすべて検出して保存します。注釈に隠れた添付や PDF 2.0 の関連ファイルも見つけます。

JSON 差分

JSON 差分

2 つの JSON オブジェクトを比較します。

PDF から WebP へ変換

PDF から WebP へ変換

PDF ページをブラウザー内で高品質な WebP 画像に変換します。

音声チャンネル変換

音声チャンネル変換

音声チャンネル変換はブラウザ上でステレオをモノラルにする、または片方のチャンネルを抽出するためのツールです。公開、授業、デモ、日常の動画・音声整理をすばやくプライベートに行えます。

apps

もっと見る

無料オンラインツールの全コレクションを見る。

PDF から表を取り出すということ

PDF に表は入っていません。入っているのは座標に置かれた文字と、ときどきその周りに引かれた線だけです。表は、そのページを見たあなたの頭の中にできます。「表を読み取る」と称するツールはどれも推測しています。誠実な問いは推測の精度がどれくらいかであり、このツールはそれをそのまま表示します。

二通りの推測

罫線方式は、作成者が実際に引いた枠線を使います。水平線と垂直線をグリッドにまとめ、各単語を該当するセルへ落とし込みます。枠線のある文書ではほぼ正確なので、信頼度も高く報告されます。

空白方式は、枠線がまったくない大多数の実文書のためのものです。連続する多くの行で空白のままになっている縦の隙間をページ全体から探し、その「溝」を列の境界とします。財務諸表や価格表、報告書ではよく機能し、二段組の段落には騙されることがあります。

方式を自動のままにすれば両方が実行され、重なりのない強いほうの結果が残ります。

結果の調整

  • 最小行数・最小列数はノイズを取り除きます。2 行 2 列の「表」は、たいてい見出しと日付です。
  • ページ欄は all1-32,5,9 を受け付けます。400 ページの報告書から 1 ページだけ調べるほうが、全部を調べるよりずっと速く済みます。
  • 検出された表は書き出し前に削除できます。検出はヒューリスティックです。段落を拾ってしまったら、あとで表計算ソフトを掃除するのではなく、ここで消してください。

書き出し

  • 表ごとに 1 つの CSV、またはまとめて ZIP。
  • 結合 CSV。表と表のあいだにマーカー行が入るので境界が失われません。
  • XLSX。表ごとに 1 シートで、Excel・LibreOffice・Numbers・Google スプレッドシートでそのまま開けます。純粋な数値のセルは数値として書き出され、先頭が 0 の請求番号のように数値に見えるだけのものはテキストのまま残ります。

どの CSV にも UTF-8 の BOM が付くので、Windows 版 Excel で開いても日本語が文字化けしません。

プライバシー

PDF の読み込み・解析・書き出しはすべてブラウザー内で完結します。アップロードは一切行わず、処理中にネットワーク通信も発生しません。