PDF 文字识别
扫描的合同、拍下来的书页、存成 PDF 的旧传真——它们看着像文档,用起来却是图片:搜不到、复制不了,屏幕阅读器也无从读起。这个页面把文字识别出来,再原样放回它们在页面上的位置,只是看不见。扫描件看上去毫无变化,其余的一切开始工作。
- 免费
- 文件不会离开你的设备
- 无需注册
- 不限文件数量
使用方法
- 选择扫描版 PDF。
- 选择文档的语言——识别效果取决于它,胜过其他任何设置。
- 点击按钮,等待,然后下载可检索的 PDF 或纯文本。
实用说明
可检索的 PDF 到底是什么
它就是你的扫描件加上第二层:识别出的文字,正好压在印刷的文字上面,用看不见的墨水写成。页面看起来一模一样——同样的纸、同样的印章、同样的边角批注——但 Ctrl+F 能在里面找到人名,句子可以复制,屏幕阅读器也能念出来。所以我们保留图像,而不是换成干净的文本:扫描件往往本身就是凭据,重新排版等于把它变成另一份东西。
识别是猜测,不是阅读
干净的印刷页几乎完美。皱巴巴小票的手机照片则不然,任何引擎都改变不了这一点。所以运行结束后会显示平均置信度,并且不做任何自动纠错:把一个数字「改得像模像样」,正是谁也发现不了的那类错误。在依赖这段文字之前请通读一遍——尤其是数字。
常见问题
我的扫描件会上传吗?
不会。引擎和语言模型下载到你的浏览器并在那里运行,文件留在设备上。
一共要下载多少?
大约两到三兆:引擎加一个语言模型。数字在点击之前就写在页面上,第一次之后断网也能用。
我的 PDF 本来就有文字,还要识别吗?
不用,页面发现之后也会这么说:识别只会用猜测替换掉好文字。请用「PDF 转文本」。
最多能处理多少页?
五十页。再多的话浏览器要花上几十分钟,页面也会说明实际处理了多少页。
相关工具
- 图片转文字 放进一张图片,选好文字的语言,按下按钮。扫描件或截图通常能一字不差;手持拍摄的照片大致正确,值得通读一遍。
- PDF 转文字 从 PDF 里复制,往往得到断成两半的词、在栏边被折断的行,以及每四十行就出现一次的公司名。这里把文字取出来并清理干净——每一项修整都是你自己打开的开关,而文件不会离开这个标签页。
- PDF 转 Word 拖入一个 PDF,得到可编辑的 .docx。哪些能带过来、哪些不能,我们直说:文字、段落和标题可以,页面版式不行。
- PDF 压缩 两种老实的瘦身方式:重建文件并完整保留文字;或者在文档本身就是扫描件、体积比可选文字更重要时,把页面重新渲染成图片。
- PDF 转 JPG 每一页都会变成单独的图片,可以逐个下载——通常你需要的只是一两页,而不是整份文档打包成一个文件。
- PDF 合并 添加文件,按需要排好顺序,就能得到一个文档。页面按原样复制——文字仍可选中,链接依旧可用,不会被重新渲染。
- 图片转 PDF 把照片拖进来,排好顺序,就能得到一个 PDF。普通 JPEG 会原样放入文档,画质与相机拍出来的完全一致。
- 图片转 PDF 拖入你的图片,得到一份 PDF。证件照、扫描件、屏幕截图、用手机拍下的纸页——凡是浏览器能打开的,都能按你排的顺序装进去。