PDFIntact

PDFから、表と本文をそのまま取り出す

PDFの数式をコピーすると崩れる

論文や仕様書の数式を選択してコピーし、Wordに貼る。すると指数が下の行に落ち、分数の分子と分母が横に並び、根号だけが取り残される。 直すより打ち直したほうが早い、という状態になります。

原因は、PDFが数式の構造をまったく持っていないことです。 ファイルに入っているのは「この座標にこの字形を描け」という指示だけで、 分数の横線は引かれた1本の線、指数は少し上に小さく描かれた別の文字にすぎません。 どれが分数でどれが指数なのかは、ファイルのどこにも書かれていません。 コピーは描かれた順に文字を拾うだけなので、上下の関係はそこで消えます。

ですから数式は紙面の配置から読み直すしかありません。 PDFIntact はページの中から数式のブロックを見つけ、読み取ったままのLaTeX記法で Word・Markdown・JSON に書き出します。 Excelには入りません。Excelに書き出せるのは表とグラフだけです。

いま試す

お手元のPDFで確認できます

診断はブラウザの中だけで行います。ファイルはどこにも送信されません。登録も不要です。何ページ・いくつの表や図が取り出せるかを、買う前に確認できます。

実例

数式はこの形で書き出します

下は実際の論文PDFから取り出した数式です。数式のブロックは記法を剥がさず、そのまま残します。本文や表に紛れ込んだ上付き・下付きの記法だけは、読める形に直してから書き出します。

$$ \boldsymbol{y}(k)=\sum_{i=1}^{P}A_{i}\boldsymbol{y}(k-i)+\boldsymbol{e}(k) $$

形式ごとに、どう入るか

同じ数式でも、書き出す形式によって入り方が違います。

Word(.docx)

読み順のその位置に、等幅の段落として入ります。Wordの数式オブジェクトにはしません。

Markdown(.md)

本文の流れの中に、記法をそのまま置きます。

JSON

種別「数式」・ページ番号・ページ内の座標つきで、書き換えのない値が入ります。

Excel(.xlsx)

入りません。Excelに書き出すのは表とグラフだけです。

よくある質問

PDFの数式をコピーすると崩れるのはなぜですか
PDFが数式を数式として保存していないためです。分数の横線は引かれた線、指数は少し上に小さく描かれた文字でしかなく、どちらがどれなのかはファイルのどこにも書かれていません。コピーは描かれた順に文字を拾うだけなので、上下の関係がそこで失われます。
数式はどの形式で取り出せますか
Word・Markdown・JSONです。数式のブロックは、読み取ったままのLaTeX記法で書き出します。Excelには入りません。Excelに書き出せるのは表とグラフだけだからです。
Wordに書き出すと数式として編集できますか
できません。読み順のその位置に、等幅の段落のテキストとして、記法を保ったまま入ります。Wordの数式オブジェクトには変換しません。
本文や表に混ざった上付き・下付き文字はどうなりますか
本文や表のセルに紛れ込んだ「$ ^{1} $」のようなインライン記法は、中身だけを残して書き出します。実際のPDFでは脚注番号がこの記法で返ってくることがあり、そのまま出すと読めない文字列になるためです。数式そのもののブロックには手を入れません。
数式の値が推定値になることはありますか
ありません。形から値を推定するのは、数値の書かれていないグラフに対して行う処理で、数式のブロックはその処理を通しません。読み取ったものがそのまま出ます。それでも、結果は必ず元のPDFと照合してください。

ほかの症状もまとめて診断する書き出し形式の違い