PDF 文字识别

扫描的合同、拍下来的书页、存成 PDF 的旧传真——它们看着像文档,用起来却是图片:搜不到、复制不了,屏幕阅读器也无从读起。这个页面把文字识别出来,再原样放回它们在页面上的位置,只是看不见。扫描件看上去毫无变化,其余的一切开始工作。

识别是猜测,不是阅读:干净的印刷页几乎完美,手机拍的皱巴巴小票就不行。这里不会自动纠错——把数字「改得像模像样」,是你永远发现不了的错误。

扫描件不会上传:引擎和语言模型下载到你的浏览器并在本地运行。输出的是你自己的扫描件,上面加了一层看不见的文字——画面不变,但搜索、复制和屏幕阅读器都能用。

相关工具: 图片转文字 · PDF 转文字 · PDF 转 Word · PDF 压缩

使用方法

  1. 选择扫描版 PDF。
  2. 选择文档的语言——识别效果取决于它,胜过其他任何设置。
  3. 点击按钮,等待,然后下载可检索的 PDF 或纯文本。

实用说明

可检索的 PDF 到底是什么

它就是你的扫描件加上第二层:识别出的文字,正好压在印刷的文字上面,用看不见的墨水写成。页面看起来一模一样——同样的纸、同样的印章、同样的边角批注——但 Ctrl+F 能在里面找到人名,句子可以复制,屏幕阅读器也能念出来。所以我们保留图像,而不是换成干净的文本:扫描件往往本身就是凭据,重新排版等于把它变成另一份东西。

识别是猜测,不是阅读

干净的印刷页几乎完美。皱巴巴小票的手机照片则不然,任何引擎都改变不了这一点。所以运行结束后会显示平均置信度,并且不做任何自动纠错:把一个数字「改得像模像样」,正是谁也发现不了的那类错误。在依赖这段文字之前请通读一遍——尤其是数字。

常见问题

我的扫描件会上传吗?

不会。引擎和语言模型下载到你的浏览器并在那里运行,文件留在设备上。

一共要下载多少?

大约两到三兆:引擎加一个语言模型。数字在点击之前就写在页面上,第一次之后断网也能用。

我的 PDF 本来就有文字,还要识别吗?

不用,页面发现之后也会这么说:识别只会用猜测替换掉好文字。请用「PDF 转文本」。

最多能处理多少页?

五十页。再多的话浏览器要花上几十分钟,页面也会说明实际处理了多少页。

相关工具