PDF를 텍스트로

PDF에서 복사하면 반토막 난 낱말, 단 끝에서 끊긴 줄, 마흔 줄마다 되풀이되는 회사 이름이 함께 따라옵니다. 여기서는 글자를 꺼내 정리합니다. 손질은 모두 직접 켜는 스위치이고, 파일은 이 탭을 벗어나지 않습니다.

또는 여기에 놓기

텍스트 층이 있는 PDF — 스캔본 말고. 60 MB 이내

파일은 이 기기에 남습니다. 탭 안에서 열리고 아무것도 올라가지 않습니다. 내려받는 것도 없습니다. PDF 판독기는 이미 이 페이지의 일부입니다.

넘어가지 않는 것: 그림, 표로서의 표, 굵게와 기울임. 표는 텍스트 줄이 되고, 2단 편집은 왼쪽 단부터 읽힙니다. 파일 안에 글자가 그렇게 담겨 있기 때문입니다.

가까운 도구: PDF를 Word로 · 그림에서 글자 추출 · PDF 두 개 비교 · 글자수 세기

사용 방법

  1. 텍스트 층이 있는 PDF를 고르세요. 스캔본은 안 됩니다.
  2. 필요한 것을 켜세요: 하이픈으로 끊긴 낱말 잇기, 줄을 문단으로 잇기, 머리글과 쪽 번호 없애기.
  3. 텍스트를 복사하거나 .txt 파일로 내려받으세요.

알아두면 좋은 점

글자를 꺼내는 것은 절반의 일

PDF가 담고 있는 것은 줄이 아니라 좌표가 붙은 글자 조각입니다. 문장 도중에 글꼴이 바뀌면 한 줄이 열댓 조각으로 도착하고, 어설픈 추출기는 그것을 한 조각씩 한 줄로 뱉습니다. 그래서 여기서는 먼저 높이로 조각을 줄로 되돌리고, 그다음에 다듬습니다. 같은 묶음 방식이 두 PDF를 비교하는 도구에서도 돕니다. 거기서만 다르게 돌면 같은 파일이 다른 차이를 보여 주기 때문입니다.

세 가지 손질, 어느 것도 말없이 하지 않는다

하이픈으로 끊긴 낱말은 잇습니다. 다만 다음 줄이 소문자로 시작할 때만입니다. 그러지 않으면 합성 이름이 한 낱말로 붙어 버립니다. 줄은 문단으로 잇지만, 제목과 번호가 붙은 조항, 목록 항목은 제 줄을 지킵니다. 계약 조항을 한 문단으로 녹이는 편이 여분의 줄바꿈을 남기는 것보다 나쁘기 때문입니다. 머리글과 쪽 번호는 쪽을 넘나드는 반복으로 걸러 냅니다. 홀로 선 숫자는 전체 쪽수를 넘지 않을 때만 쪽 번호로 봅니다. 그래서 표 안의 「2026」은 살아남습니다.

스캔본에는 다른 답을 준다

PDF가 스캔본이면 그 안에 글자는 아예 없습니다. 쪽이 그림입니다. 빈 칸을 돌려주면 잘못된 도구가 아니라 고장 난 도구처럼 보입니다. 그래서 페이지는 무슨 일이 있었는지 말하고, PDF 쪽도 읽는 글자 인식으로 안내합니다. 판정은 일부러 거칠게 잡았습니다. 문서 전체에서 마흔 자가 안 되면 그것은 그림 속 설명이지 텍스트 층이 아닙니다.

자주 묻는 질문

제 문서가 어딘가로 올라가나요?

아닙니다. 이 브라우저 탭 안에서 열리고 거기서 읽힙니다. 내려받는 것도 없습니다. PDF 판독기는 이미 이 페이지의 일부입니다.

제 파일은 왜 텍스트가 비어 있나요?

대개 스캔본이기 때문입니다. 각 쪽이 그림이고 텍스트 층이 없습니다. 「그림에서 글자」로 넘겨 보세요. 글자를 인식하며 PDF 쪽도 받습니다.

단이 뒤섞이는 이유는 무엇인가요?

2단 편집은 그려진 순서대로 저장되고, 보통 왼쪽 단이 통째로 먼저 오기 때문입니다. 여기서는 편집을 추측하지 않고 파일 순서를 따릅니다. 잘못 추측하면 단 자체보다 글이 더 헝클어집니다.

표는 어떻게 되나요?

표는 텍스트 줄이 됩니다. 칸의 순서는 남지만 격자는 사라집니다. 격자가 필요하면 「PDF를 Excel로」를 쓰세요. 좌표에서 열을 찾아냅니다.

얼마나 큰 문서까지 되나요?

60 MB, 앞의 500쪽까지입니다. 그 이상은 기다릴 만하지 않아서, 멈추는 대신 그렇게 알려 줍니다.

관련 도구