PDF 转文字

从 PDF 里复制,往往得到断成两半的词、在栏边被折断的行,以及每四十行就出现一次的公司名。这里把文字取出来并清理干净——每一项修整都是你自己打开的开关,而文件不会离开这个标签页。

或拖放到这里

带文字层的 PDF,而不是扫描件。最大 60 MB

文件留在这台设备上:在标签页里打开,不上传任何内容。也不下载任何东西——PDF 阅读器本来就是这个页面的一部分。

不会带过来的:图片、作为表格的表格、粗体和斜体。表格会变成一行行文字,双栏排版会先读左栏——文件里的文字就是这样存放的。

相关工具: PDF 转 Word · 图片转文字 · 比较两个 PDF · 字数统计

使用方法

  1. 选择一个带文字层的 PDF,而不是扫描件。
  2. 按需打开:合并被连字符断开的词、把断行合并成段落、去掉页眉页脚和页码。
  3. 复制文字,或下载为 .txt 文件。

实用说明

取出文字只是一半的活

PDF 里存的不是行,而是带坐标的文本片段。一行常常以十几个片段到达,因为句子中间换了字体;粗糙的提取器会把它们一段一行地吐出来。所以这里先按纵向位置把片段归回成行,然后再清理。同样的归行逻辑也用在比较两个 PDF 的工具里:如果那边算法不同,同一个文件就会显示出不同的差异。

三项修整,没有一项是悄悄进行的

被连字符断开的词会接回——但只在下一行以小写字母开头时,免得把复合名称粘成一个词。行会合并成段落——但标题、编号条款和列表项各自保留一行:把合同条款熔成一段,比留下多余的换行更糟。页眉和页码按跨页重复来去除;而一个孤立的数字只有在不超过总页数时才算页码,于是表格里的「2026」得以保留。

扫描件会得到另一种回答

如果 PDF 是扫描件,里面根本没有文字——页面是图片。返回一个空白框会像是工具坏了,而不是用错了工具;所以页面会说明发生了什么,并指向文字识别,它同样能读 PDF 的页面。这个判断刻意做得粗糙:整份文档不足四十个字母,说明那是图片里的说明文字,而不是文字层。

常见问题

我的文档会被上传吗?

不会。它在这个浏览器标签页里打开并读取。也不会下载任何东西——PDF 阅读器本来就是这个页面的一部分。

为什么我的文件取出来是空的?

多半是扫描件:每页都是图片,没有文字层。请改用「图片转文字」,它能识别字母,也接受 PDF 的页面。

为什么栏目顺序乱了?

因为双栏排版是按绘制顺序保存的,通常左栏整栏先出现。这里的顺序跟随文件,而不是猜测版式——猜错会比栏目本身更把文字打乱。

表格会怎样?

表格会变成一行行文字:单元格保留顺序,但失去网格。如果需要网格,请用「PDF 转 Excel」,它会根据坐标推断出列。

能处理多大的文档?

最大 60 MB,最多前 500 页。再多,等待就不值得了,页面会直接说明,而不是卡住。

相关工具