PDF a texto

Copiar de un PDF deja palabras cortadas por la mitad, líneas rotas al borde de la columna y un nombre de empresa repitiéndose cada cuarenta líneas. Aquí el texto se extrae y se limpia: cada arreglo es un interruptor que enciendes tú, y el archivo no sale de esta pestaña.

o suéltalos aquí

Un PDF con capa de texto, no un escaneo. Hasta 60 MB

El archivo se queda en este dispositivo: se abre dentro de la pestaña y no se sube nada. Tampoco se descarga nada: el lector de PDF ya forma parte de esta página.

Lo que no se traslada: imágenes, tablas como tablas, negrita y cursiva. Una tabla se vuelve filas de texto, y una maquetación a dos columnas se lee primero la izquierda: así está guardado el texto en el archivo.

Cerca: PDF a Word · Imagen a texto · Comparar dos PDF · Contador de palabras

Cómo usarlo

  1. Elige un PDF que tenga capa de texto, no un escaneo.
  2. Activa lo que necesites: unir palabras partidas, unir líneas en párrafos, quitar encabezados y números de página.
  3. Copia el texto o descárgalo como archivo .txt.

Lo que conviene saber

Sacar el texto es la mitad del trabajo

Un PDF no guarda líneas: guarda trozos de texto con coordenadas. Una línea llega a menudo en una docena de trozos porque la fuente cambió a mitad de frase, y un extractor ingenuo los devuelve uno por línea. Por eso los trozos se agrupan primero en líneas por su posición vertical y solo después se limpian. La misma agrupación corre en la herramienta que compara dos PDF: si allí funcionara distinto, el mismo archivo mostraría diferencias distintas.

Tres arreglos, y ninguno ocurre en silencio

Las palabras con guion se unen, pero solo si la línea siguiente empieza en minúscula, para no pegar un nombre compuesto en una sola palabra. Las líneas se unen en párrafos, pero los títulos, las cláusulas numeradas y los elementos de lista conservan su línea: fundir las cláusulas de un contrato es peor que dejar saltos de línea de más. Los encabezados y números de página se quitan por repetición entre páginas, y un número solo cuenta como número de página si no supera el total de páginas, de modo que el año 2026 en una tabla sobrevive.

El escaneo recibe otra respuesta

Si el PDF es un escaneo, no hay texto dentro: las páginas son imágenes. Devolver un cuadro vacío parecería una herramienta rota en vez de la herramienta equivocada, así que la página cuenta lo ocurrido y remite al reconocimiento de texto, que también lee páginas de PDF. La comprobación es deliberadamente tosca: menos de cuarenta letras en todo el documento significa rótulos dentro de imágenes, no capa de texto.

Preguntas frecuentes

¿Se sube mi documento a algún sitio?

No. Se abre dentro de esta pestaña y se lee ahí. Tampoco se descarga nada: el lector de PDF ya forma parte de esta página.

¿Por qué el texto sale vacío?

Lo más probable es que sea un escaneo: una imagen de cada página sin capa de texto. Pásalo por «Imagen a texto», esa herramienta reconoce las letras y también acepta páginas de PDF.

¿Por qué se mezclan las columnas?

Porque una maquetación a dos columnas se guarda tal como se dibujó, y la columna izquierda suele venir entera primero. Aquí el orden sigue al archivo en vez de adivinar la maquetación: adivinar mal revuelve el texto más que las propias columnas.

¿Qué pasa con las tablas?

Una tabla se vuelve filas de texto: las celdas conservan el orden pero pierden la cuadrícula. Si necesitas la cuadrícula, usa «PDF a Excel», que deduce las columnas a partir de las coordenadas.

¿Qué tamaño de documento admite?

Hasta 60 MB y las primeras 500 páginas. Más allá, la espera deja de merecer la pena, y la página lo dice en vez de quedarse colgada.

Herramientas relacionadas