PDF の文字認識
スキャンした契約書、撮影したページ、PDF で保存された古いファクス。見た目は文書でも、振る舞いは画像です。検索できず、一行も写せず、読み上げソフトにも読むものがありません。このページは語を認識し、紙の上の同じ位置へ、見えない形で戻します。スキャンの見え方は変わらず、それ以外がすべて動きはじめます。
認識は読み取りではなく推測です。きれいな印刷面はほぼ完璧に出ますが、しわの寄ったレシートの写真はそうなりません。自動の修正はしません。数字をもっともらしく直すのは、二度と気づけない誤りだからです。
スキャンは送信しません。エンジンと言語モデルをブラウザに落とし、そこで処理します。出てくるのはあなたのスキャンに見えない文字層を重ねたもの。見た目は同じで、検索・コピー・読み上げが効くようになります。
近い道具: 画像から文字起こし · PDF をテキストに · PDF を Word に変換 · PDF 圧縮
- 無料
- ファイルは端末から出ません
- 登録不要
- ファイル数の制限なし
使い方
- スキャンした PDF を選びます。
- 文書の言語を選びます。認識の出来は、ほかの何よりここに左右されます。
- ボタンを押して待ち、検索できる PDF か、ただの文字を保存します。
知っておくと便利
「検索できる PDF」とは何か
それはあなたのスキャンに二枚目の層を重ねたものです。認識された語が、印刷された語のちょうど上に、見えないインクで置かれています。ページの見た目は同じ——同じ紙、同じ印、同じ余白の書き込み——なのに Ctrl+F で名前が見つかり、一文を写せて、読み上げソフトが読めます。画像を残し、きれいな文字に置き換えないのはそのためです。スキャンはしばしばそれ自体が証拠であり、組み直せば別のものになってしまいます。
認識は読み取りではなく推測です
きれいな印刷面はほぼ完璧に出ます。しわの寄ったレシートの写真はそうなりませんし、どの処理系でも同じです。ですから終了後に平均の確信度を示し、自動の修正はしません。数字をもっともらしく直すのは、誰にも気づけない種類の誤りだからです。頼りにする前に、特に数字を読み直してください。
よくある質問
スキャンはアップロードされますか。
されません。処理系と言語モデルをブラウザに落として、そこで動かします。ファイルは端末に残ります。
どれくらい落としますか。
二〜三メガバイトほどです(処理系と言語モデル一つ)。数字は押す前にページに出ますし、初回のあとは通信なしで動きます。
すでに文字のある PDF もかけるべきですか。
いいえ。気づいた時点でページがそう伝えます。認識は良い文字を推測に置き換えるだけです。「PDF を文字に」をお使いください。
何ページまで扱えますか。
五十ページまでです。それ以上はブラウザで数十分かかります。実際に処理した枚数はページが伝えます。
関連ツール
- 画像から文字起こし 画像を置き、写っている文字の言語を選んで、ボタンを押すだけです。スキャンやスクリーンショットならたいてい一字一句そのまま、手持ちで撮った写真ならほぼ正しく、目を通す価値があります。
- PDF をテキストに PDF からコピーすると、途中で切れた語、段の端で折れた行、四十行ごとに現れる会社名がついてきます。ここでは文字を取り出して整えます。どの整形も自分で入れる切り替えで、ファイルはこのタブから…
- PDF を Word に変換 PDF を置けば、編集できる .docx が返ってきます。何が移り何が移らないかは正直に申し上げます。語句・段落・見出しは移り、ページのレイアウトは移りません。
- PDF 圧縮 PDF を軽くする正直な方法は 2 つです。文字をそのまま残してファイルを作り直すか、書類がスキャンで、選択できる文字よりサイズが大切なときにページを画像として描き直すか。
- PDF を JPG に変換 各ページがそれぞれ 1 枚の画像になり、必要なものだけ個別に保存できます。ふつう欲しいのは 1〜2 ページで、文書全体を 1 ファイルにまとめたものではありません。
- PDF 結合 ファイルを追加し、必要な順番に並べれば 1 つの文書になります。ページはそのまま複製されるので、文字は選択でき、リンクも生きたままです。
- 画像を PDF に変換 写真を入れて順番を整えれば、1 つの PDF になります。通常の JPEG はそのまま埋め込まれるので、画質はカメラで撮ったときのままです。
- 画像を PDF に変換 画像を置けば、PDF が一つ返ってきます。書類の写真、スキャン、画面の写し、携帯で撮った紙面——ブラウザが開けるものなら、並べた順にそのまま収まります。