PDF から表を取り出すということ
PDF に表は入っていません。入っているのは座標に置かれた文字と、ときどきその周りに引かれた線だけです。表は、そのページを見たあなたの頭の中にできます。「表を読み取る」と称するツールはどれも推測しています。誠実な問いは推測の精度がどれくらいかであり、このツールはそれをそのまま表示します。
二通りの推測
罫線方式は、作成者が実際に引いた枠線を使います。水平線と垂直線をグリッドにまとめ、各単語を該当するセルへ落とし込みます。枠線のある文書ではほぼ正確なので、信頼度も高く報告されます。
空白方式は、枠線がまったくない大多数の実文書のためのものです。連続する多くの行で空白のままになっている縦の隙間をページ全体から探し、その「溝」を列の境界とします。財務諸表や価格表、報告書ではよく機能し、二段組の段落には騙されることがあります。
方式を自動のままにすれば両方が実行され、重なりのない強いほうの結果が残ります。
結果の調整
- 最小行数・最小列数はノイズを取り除きます。2 行 2 列の「表」は、たいてい見出しと日付です。
- ページ欄は
all、1-3、2,5,9を受け付けます。400 ページの報告書から 1 ページだけ調べるほうが、全部を調べるよりずっと速く済みます。 - 検出された表は書き出し前に削除できます。検出はヒューリスティックです。段落を拾ってしまったら、あとで表計算ソフトを掃除するのではなく、ここで消してください。
書き出し
- 表ごとに 1 つの CSV、またはまとめて ZIP。
- 結合 CSV。表と表のあいだにマーカー行が入るので境界が失われません。
- XLSX。表ごとに 1 シートで、Excel・LibreOffice・Numbers・Google スプレッドシートでそのまま開けます。純粋な数値のセルは数値として書き出され、先頭が 0 の請求番号のように数値に見えるだけのものはテキストのまま残ります。
どの CSV にも UTF-8 の BOM が付くので、Windows 版 Excel で開いても日本語が文字化けしません。
プライバシー
PDF の読み込み・解析・書き出しはすべてブラウザー内で完結します。アップロードは一切行わず、処理中にネットワーク通信も発生しません。
Tiny Online Tools







