OCR de PDF

Um contrato digitalizado, uma página fotografada, um fax antigo salvo em PDF — parecem documentos e se comportam como imagens: não dá para pesquisar, não dá para copiar uma linha, e um leitor de tela não tem o que ler. Esta página reconhece as palavras e as devolve exatamente onde estão na folha, de forma invisível. O scan continua igual; todo o resto passa a funcionar.

Reconhecer é adivinhar, não ler: uma página impressa limpa sai quase perfeita; a foto de um cupom amassado, não. Nada é corrigido automaticamente — uma correção plausível num número é o erro que você nunca pega.

A digitalização não é enviada: o motor e o modelo do idioma são baixados para o seu navegador e trabalham ali. Sai o seu próprio scan com uma camada de texto invisível por cima — a imagem é a mesma, mas busca, cópia e leitores de tela funcionam.

Por perto: Imagem para texto · PDF para texto · PDF para Word · Comprimir PDF

Como usar

  1. Escolha o PDF digitalizado.
  2. Indique o idioma do documento — o reconhecimento depende disso mais do que de qualquer outra coisa.
  3. Clique, espere e baixe o PDF pesquisável ou o texto puro.

Bom saber

O que é de fato um PDF pesquisável

É o seu scan com uma segunda camada: as palavras reconhecidas, postas exatamente sobre as impressas e desenhadas com tinta invisível. A página parece idêntica — mesmo papel, mesmos carimbos, mesma anotação na margem — mas o Ctrl+F encontra um nome, uma frase pode ser copiada e um leitor de tela consegue ler. Por isso a imagem é mantida em vez de trocada por texto limpo: um scan muitas vezes é o próprio documento, e rediagramá-lo seria transformá-lo em outro.

Reconhecer é adivinhar, não ler

Uma página impressa limpa sai quase perfeita. A foto de um cupom amassado, não, e nenhum motor muda isso. Por isso a confiança média aparece ao final e nada é corrigido sozinho: uma correção plausível num dígito é justamente o erro que ninguém pega. Leia o texto antes de confiar nele — sobretudo os números.

Perguntas frequentes

Meu scan é enviado?

Não. O motor e o modelo do idioma são baixados para o seu navegador e rodam ali; o arquivo fica no aparelho.

Quanto é baixado?

Cerca de dois a três megabytes: o motor mais um modelo de idioma. O número aparece antes do clique e, depois da primeira vez, tudo funciona sem rede.

Meu PDF já tem texto — devo rodar isso?

Não, e a página avisa quando percebe: o reconhecimento trocaria texto bom por um palpite. Use «PDF para texto».

Quantas páginas ele aguenta?

Até cinquenta. Além disso um navegador levaria dezenas de minutos, e a página informa quantas foram feitas.

Ferramentas relacionadas