PDF para texto

Copiar de um PDF traz palavras cortadas ao meio, linhas quebradas na borda da coluna e um nome de empresa se repetindo a cada quarenta linhas. Aqui o texto é extraído e limpo — cada conserto é um interruptor que você mesmo liga, e o arquivo não sai desta aba.

ou solte-os aqui

Um PDF com camada de texto — não um escaneamento. Até 60 MB

O arquivo fica neste aparelho: é aberto dentro da aba e nada é enviado. Também nada é baixado — o leitor de PDF já faz parte desta página.

O que não vai junto: imagens, tabelas como tabelas, negrito e itálico. Uma tabela vira linhas de texto, e um layout de duas colunas é lido primeiro pela coluna esquerda — é assim que o texto está guardado.

Por perto: PDF para Word · Imagem para texto · Comparar dois PDFs · Contador de palavras

Como usar

  1. Escolha um PDF com camada de texto — não um escaneamento.
  2. Ligue o que precisar: juntar palavras hifenizadas, juntar linhas em parágrafos, remover cabeçalhos e números de página.
  3. Copie o texto ou baixe como arquivo .txt.

Bom saber

Tirar o texto é metade do trabalho

Um PDF não guarda linhas: guarda pedaços de texto com coordenadas. Uma linha muitas vezes chega em uma dúzia de pedaços porque a fonte mudou no meio da frase, e um extrator ingênuo devolve um por linha. Por isso os pedaços são primeiro agrupados de volta em linhas pela altura e só então limpos. O mesmo agrupamento roda na ferramenta que compara dois PDFs: se lá funcionasse diferente, o mesmo arquivo mostraria diferenças diferentes.

Três consertos, e nenhum acontece em silêncio

Palavras hifenizadas são unidas — mas só quando a linha seguinte começa em minúscula, para não colar um nome composto numa palavra só. Linhas são unidas em parágrafos — mas títulos, cláusulas numeradas e itens de lista mantêm suas linhas: fundir as cláusulas de um contrato é pior do que deixar quebras de linha sobrando. Cabeçalhos e números de página saem pela repetição entre páginas, e um número solto só conta como número de página se não for maior que o total de páginas — assim o ano 2026 numa tabela sobrevive.

Um escaneamento recebe outra resposta

Se o PDF é um escaneamento, não há texto ali — as páginas são imagens. Devolver uma caixa vazia pareceria ferramenta quebrada, e não ferramenta errada; então a página diz o que houve e aponta para o reconhecimento de texto, que também lê páginas de PDF. A verificação é propositalmente grosseira: menos de quarenta letras no documento inteiro são legendas dentro de imagens, não uma camada de texto.

Perguntas frequentes

Meu documento é enviado para algum lugar?

Não. Ele é aberto dentro desta aba do navegador e lido ali. Também nada é baixado — o leitor de PDF já faz parte desta página.

Por que o texto saiu vazio?

Provavelmente é um escaneamento: uma imagem de cada página, sem camada de texto. Passe por «Imagem para texto» — essa ferramenta reconhece as letras e também aceita páginas de PDF.

Por que as colunas ficaram embaralhadas?

Porque um layout de duas colunas é guardado como foi desenhado, e a coluna esquerda costuma vir inteira primeiro. A ordem aqui segue o arquivo em vez de adivinhar o layout: adivinhar errado embaralha mais que as próprias colunas.

O que acontece com as tabelas?

Uma tabela vira linhas de texto: as células mantêm a ordem mas perdem a grade. Se precisar da grade, use «PDF para Excel» — lá as colunas são deduzidas das coordenadas.

Que tamanho de documento ele aceita?

Até 60 MB e as primeiras 500 páginas. Além disso a espera deixa de valer a pena, e a página avisa em vez de travar.

Ferramentas relacionadas