PDFIntact

PDFから、表と本文をそのまま取り出す

2段組のPDFをコピーすると段が混ざる

論文や学会誌、白書のように本文が2段に組まれたPDFを選択してコピーし、 Wordに貼る。すると左の段の1行の次に右の段の1行が来て、 2つの文章が1行ずつ交互に折り重なります。 文の途中で話題が変わるので、どこまでが1つの文なのかも分からなくなります。

原因は、PDFが段組の構造をまったく持っていないことです。 ファイルに入っているのは「この座標にこの字形を描け」という指示だけで、 どこからどこまでが1つの段なのかは、どこにも書かれていません。 コピーやテキスト抽出は描かれた位置を上から下へ行単位でたどるので、 同じ高さに並んだ左右の段が、1行ずつ交互に拾われます。

ですから段は紙面の配置から読み直すしかありません。 PDFIntact はページの中から本文・見出し・表・図のブロックを先に見つけ、その読み順に並べ直してから Word・Markdown・JSON に書き出します。 段組そのものは再現しません。読み順どおりに並んだ1段の文書として入ります。

いま試す

お手元のPDFで確認できます

診断はブラウザの中だけで行います。ファイルはどこにも送信されません。登録も不要です。何ページ・いくつの表や図が取り出せるかを、買う前に確認できます。

実例

行の拾われ方が変わります

左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。

コピーしたとき(描かれた位置の順)

左の段 1行目
右の段 1行目
左の段 2行目
右の段 2行目
左の段 3行目
右の段 3行目

PDFIntact を通したとき(読み順)

左の段 1行目
左の段 2行目
左の段 3行目
右の段 1行目
右の段 2行目
右の段 3行目

形式ごとに、どう入るか

同じ読み順でも、書き出す形式によって入り方が違います。

Word(.docx)

読み順のまま、1段の段落として並びます。段組は再現しません。

Markdown(.md)

同じ範囲を、ページごとの見出しの下に読み順で置きます。

JSON

ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。

Excel(.xlsx)

本文は入りません。Excelに書き出すのは表とグラフだけです。

脚注・キャプション・ページ番号

これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。

よくある質問

2段組のPDFをコピーすると段が混ざるのはなぜですか
PDFが段を段として保存していないためです。ファイルに入っているのは「この座標にこの字形を描け」という指示だけで、どこからどこまでが1つの段なのかはどこにも書かれていません。コピーは描かれた位置を上から下へ行単位でたどるので、同じ高さに並んだ左右の段が1行ずつ交互に拾われます。
段組はどのように直りますか
ページの中から本文・見出し・表・図のブロックを先に見つけ、その読み順で1本に並べ直してから書き出します。段組そのものは再現しません。Word・Markdownには、読み順どおりに並んだ1段の文書として入ります。
脚注や図のキャプションはどうなりますか
本文とは別のブロックとして、読み順のその位置に段落として入ります。実際の検証でも、図のキャプションが本文と分けて取れること、脚注の区切り線より下が別ブロックになること、ページ番号(柱)が本文に混ざらないことを確認しています。Wordの脚注機能には入れません。段落として入ります。
どの形式に書き出せますか
Word・Markdown・JSONです。JSONにはブロックの種別・ページ番号・ページ内の座標が入るので、どの段のどの位置から来た文章かを後から辿れます。Excelには本文が入りません。Excelに書き出すのは表とグラフだけです。
読み順が正しければ、文字も正しく読めていますか
それは別の話です。読み順が保たれていても文字の読み取りが崩れることはあり、実際にそうなった検体もあります。だからブロックごとに、読み取った値か・推定か・読み取れなかったかを確度の帯で示します。結果は必ず元のPDFと照合してください。

ほかの症状もまとめて診断する書き出し形式の違い