PDF をテキストに

PDF からコピーすると、途中で切れた語、段の端で折れた行、四十行ごとに現れる会社名がついてきます。ここでは文字を取り出して整えます。どの整形も自分で入れる切り替えで、ファイルはこのタブから出ません。

またはここにドロップ

テキスト層のある PDF(スキャンではないもの)。60 MB まで

ファイルはこの端末に留まります。タブの中で開かれ、どこにも送られません。読み込むものもありません。PDF リーダーはこのページの一部です。

引き継がれないもの:画像、表としての表、太字と斜体。表は行の連なりになり、二段組みは左の段から読まれます。ファイルの中で文字がそう並んでいるからです。

近い道具: PDF を Word に変換 · 画像から文字起こし · 2 つの PDF を比較 · 文字数カウント

使い方

  1. テキスト層のある PDF を選びます(スキャンではないもの)。
  2. 必要なものを入れます:ハイフンで切れた語をつなぐ、行を段落にまとめる、ヘッダーとページ番号を外す。
  3. テキストをコピーするか、.txt として保存します。

知っておくと便利

文字を取り出すのは半分の仕事

PDF が持っているのは行ではなく、座標つきの文字の断片です。文の途中で書体が変わると、一行が十数個の断片で届きます。素朴な抽出はそれを一断片一行で吐き出します。だからここではまず高さで断片を行に戻し、そのうえで整えます。同じまとめ方は 2 つの PDF を比べる道具でも動いています。そちらだけ違えば、同じファイルが違う差分を見せてしまうからです。

三つの整形、どれも黙っては行わない

ハイフンで切れた語はつなぎます。ただし次の行が小文字で始まるときだけです。そうしないと複合名がひとつの語に溶けます。行は段落にまとめますが、見出し・番号つき条項・箇条書きはそれぞれの行を保ちます。契約の条項を一段落に溶かすほうが、余分な改行を残すより悪いからです。ヘッダーとページ番号はページをまたぐ繰り返しで外します。裸の数字がページ番号と見なされるのは総ページ数以下のときだけなので、表の中の「2026」は残ります。

スキャンには別の答えを返す

PDF がスキャンなら、中に文字はありません。ページは画像です。空欄を返せば、道具を間違えたのではなく道具が壊れているように見えます。ですからページは何が起きたかを述べ、文字認識へ案内します。あちらは PDF のページも読めます。判定はわざと粗くしています。文書全体で四十文字未満なら、それは画像内の説明であってテキスト層ではありません。

よくある質問

文書はどこかにアップロードされますか。

されません。このタブの中で開かれ、そこで読み取られます。何かを読み込むこともありません。PDF リーダーはこのページの一部です。

テキストが空になるのはなぜですか。

おそらくスキャンだからです。各ページが画像で、テキスト層がありません。「画像から文字」に通してください。文字を認識し、PDF のページも受け付けます。

段の順番が混ざるのはなぜですか。

二段組みは描かれた順に保存され、たいてい左の段がまとめて先に来るからです。ここでは体裁を推測せずファイルの順に従います。推測を外すと、段そのものより文章が乱れます。

表はどうなりますか。

表は行の連なりになります。セルの順序は保たれますが、罫線の構造は失われます。表として必要なら「PDF を Excel に」をお使いください。座標から列を割り出します。

どれくらいの大きさまで扱えますか。

60 MB まで、先頭の 500 ページまでです。それ以上は待ち時間に見合わず、固まる代わりにその旨を表示します。

関連ツール