PDF 문자 인식

스캔한 계약서, 사진으로 찍은 쪽, PDF로 저장된 오래된 팩스. 문서처럼 보이지만 그림처럼 굽니다. 검색이 안 되고, 한 줄도 복사할 수 없고, 화면 낭독기도 읽을 것이 없습니다. 이 페이지는 낱말을 인식해 종이 위 원래 자리로, 보이지 않게 되돌려 놓습니다. 스캔의 겉모습은 그대로이고, 나머지가 전부 작동하기 시작합니다.

인식은 읽기가 아니라 추측입니다. 깨끗한 인쇄면은 거의 완벽하게 나오지만 구겨진 영수증 사진은 그렇지 않습니다. 자동 교정은 하지 않습니다. 숫자를 그럴듯하게 고치는 것은 끝내 알아채지 못할 잘못이니까요.

스캔은 업로드되지 않습니다. 엔진과 언어 모델을 브라우저로 내려받아 거기서 처리합니다. 결과는 원래 스캔 위에 보이지 않는 글자 층을 얹은 것입니다. 그림은 그대로지만 검색·복사·화면 낭독기가 작동합니다.

가까운 도구: 그림에서 글자 추출 · PDF를 텍스트로 · PDF를 Word로 · PDF 압축

사용 방법

  1. 스캔한 PDF를 고릅니다.
  2. 문서의 언어를 고릅니다. 인식 품질은 다른 무엇보다 여기에 달려 있습니다.
  3. 버튼을 누르고 기다린 뒤, 검색되는 PDF나 일반 텍스트를 내려받습니다.

알아두면 좋은 점

검색되는 PDF란 무엇인가

당신의 스캔에 두 번째 층을 얹은 것입니다. 인식된 낱말이 인쇄된 낱말 바로 위에, 보이지 않는 잉크로 놓입니다. 쪽은 똑같아 보입니다 — 같은 종이, 같은 도장, 여백의 같은 메모 — 그런데 Ctrl+F로 이름이 찾아지고, 문장을 복사할 수 있고, 화면 낭독기가 읽습니다. 그래서 그림을 지우고 깔끔한 글로 바꾸지 않습니다. 스캔은 흔히 그 자체가 증거이고, 다시 조판하면 다른 문서가 되어 버리니까요.

인식은 읽기가 아니라 추측

깨끗한 인쇄면은 거의 완벽하게 나옵니다. 구겨진 영수증 사진은 그렇지 않고, 어떤 엔진도 이를 바꾸지 못합니다. 그래서 작업이 끝나면 평균 확신도를 보여 주고, 무엇도 자동으로 고치지 않습니다. 숫자를 그럴듯하게 고치는 것은 아무도 잡아내지 못하는 종류의 잘못이기 때문입니다. 믿고 쓰기 전에 읽어 보세요. 특히 숫자를요.

자주 묻는 질문

스캔이 업로드되나요?

아닙니다. 엔진과 언어 모델을 브라우저로 내려받아 거기서 돌립니다. 파일은 기기에 남습니다.

얼마나 내려받나요?

2~3메가바이트 정도입니다. 엔진과 언어 모델 하나. 숫자는 누르기 전에 표시되고, 첫 실행 뒤에는 네트워크 없이 동작합니다.

이미 텍스트가 있는 PDF도 돌려야 하나요?

아닙니다. 알아채면 페이지가 그렇게 알려 줍니다. 인식은 좋은 글자를 추측으로 바꿀 뿐입니다. 「PDF를 텍스트로」를 쓰세요.

몇 쪽까지 되나요?

쉰 쪽까지입니다. 그보다 많으면 브라우저가 수십 분을 씁니다. 실제로 처리한 쪽수는 페이지가 알려 줍니다.

관련 도구