PDF 转文字
从 PDF 里复制,往往得到断成两半的词、在栏边被折断的行,以及每四十行就出现一次的公司名。这里把文字取出来并清理干净——每一项修整都是你自己打开的开关,而文件不会离开这个标签页。
或拖放到这里
带文字层的 PDF,而不是扫描件。最大 60 MB
文件留在这台设备上:在标签页里打开,不上传任何内容。也不下载任何东西——PDF 阅读器本来就是这个页面的一部分。
不会带过来的:图片、作为表格的表格、粗体和斜体。表格会变成一行行文字,双栏排版会先读左栏——文件里的文字就是这样存放的。
相关工具: PDF 转 Word · 图片转文字 · 比较两个 PDF · 字数统计
- 免费
- 文件不会离开你的设备
- 无需注册
- 不限文件数量
使用方法
- 选择一个带文字层的 PDF,而不是扫描件。
- 按需打开:合并被连字符断开的词、把断行合并成段落、去掉页眉页脚和页码。
- 复制文字,或下载为 .txt 文件。
实用说明
取出文字只是一半的活
PDF 里存的不是行,而是带坐标的文本片段。一行常常以十几个片段到达,因为句子中间换了字体;粗糙的提取器会把它们一段一行地吐出来。所以这里先按纵向位置把片段归回成行,然后再清理。同样的归行逻辑也用在比较两个 PDF 的工具里:如果那边算法不同,同一个文件就会显示出不同的差异。
三项修整,没有一项是悄悄进行的
被连字符断开的词会接回——但只在下一行以小写字母开头时,免得把复合名称粘成一个词。行会合并成段落——但标题、编号条款和列表项各自保留一行:把合同条款熔成一段,比留下多余的换行更糟。页眉和页码按跨页重复来去除;而一个孤立的数字只有在不超过总页数时才算页码,于是表格里的「2026」得以保留。
扫描件会得到另一种回答
如果 PDF 是扫描件,里面根本没有文字——页面是图片。返回一个空白框会像是工具坏了,而不是用错了工具;所以页面会说明发生了什么,并指向文字识别,它同样能读 PDF 的页面。这个判断刻意做得粗糙:整份文档不足四十个字母,说明那是图片里的说明文字,而不是文字层。
常见问题
我的文档会被上传吗?
不会。它在这个浏览器标签页里打开并读取。也不会下载任何东西——PDF 阅读器本来就是这个页面的一部分。
为什么我的文件取出来是空的?
多半是扫描件:每页都是图片,没有文字层。请改用「图片转文字」,它能识别字母,也接受 PDF 的页面。
为什么栏目顺序乱了?
因为双栏排版是按绘制顺序保存的,通常左栏整栏先出现。这里的顺序跟随文件,而不是猜测版式——猜错会比栏目本身更把文字打乱。
表格会怎样?
表格会变成一行行文字:单元格保留顺序,但失去网格。如果需要网格,请用「PDF 转 Excel」,它会根据坐标推断出列。
能处理多大的文档?
最大 60 MB,最多前 500 页。再多,等待就不值得了,页面会直接说明,而不是卡住。
相关工具
- PDF 转 Word 拖入一个 PDF,得到可编辑的 .docx。哪些能带过来、哪些不能,我们直说:文字、段落和标题可以,页面版式不行。
- 图片转文字 放进一张图片,选好文字的语言,按下按钮。扫描件或截图通常能一字不差;手持拍摄的照片大致正确,值得通读一遍。
- 比较两个 PDF 对方把合同发回来,只说「改了一点点」。在十二页里用眼睛找这「一点点」,正是签错字的常见方式。这里两个文件都在本标签页内打开并比较——既比文字,也比页面的图像。
- PDF 转 Excel 一份对账单、一张发票、一份价目表——数字就在眼前,重新敲一遍却要花掉一个晚上。这里会找出表格、先给你看,再交给你 .xlsx 或 .csv。
- 字数统计 输入或粘贴文本,统计结果立即更新:词数、字符数、句子数、段落数以及预计阅读时间。
- PDF 编辑器 把 PDF 放进来,每一页都会显示为缩略图。挪动、旋转、丢掉不需要的,然后把文档重新装好。整个过程都在你自己的设备上。
- 图片转 PDF 把照片拖进来,排好顺序,就能得到一个 PDF。普通 JPEG 会原样放入文档,画质与相机拍出来的完全一致。
- 图片转 PDF 拖入你的图片,得到一份 PDF。证件照、扫描件、屏幕截图、用手机拍下的纸页——凡是浏览器能打开的,都能按你排的顺序装进去。