PDF in testo

Copiare da un PDF ti dà parole tagliate a metà, righe interrotte al bordo della colonna e il nome di un'azienda che si ripete ogni quaranta righe. Qui il testo viene estratto e ripulito: ogni correzione è un interruttore che accendi tu, e il file non lascia mai questa scheda.

oppure trascinali qui

Un PDF con livello di testo — non una scansione. Fino a 60 MB

Il file resta su questo dispositivo: viene aperto dentro la scheda e non viene caricato nulla. E non si scarica nulla — il lettore PDF fa già parte di questa pagina.

Che cosa non passa: le immagini, le tabelle come tabelle, il grassetto e il corsivo. Una tabella diventa righe di testo, e un impaginato su due colonne si legge prima dalla colonna di sinistra — è così che il testo è conservato nel file.

Qui vicino: Da PDF a Word · Immagine in testo · Confrontare due PDF · Contatore di parole

Come si usa

  1. Scegli un PDF che abbia uno strato di testo, non una scansione.
  2. Accendi quello che ti serve: ricongiungere le parole spezzate, unire le righe in paragrafi, togliere intestazioni e numeri di pagina.
  3. Copia il testo oppure scaricalo come file .txt.

Da sapere

Ottenere il testo è metà del lavoro

Un PDF non memorizza righe: memorizza pezzi di testo con delle coordinate. Una riga arriva spesso come una dozzina di pezzi perché il carattere è cambiato a metà frase, e un estrattore ingenuo li restituisce uno per riga. Perciò i pezzi vengono prima raggruppati di nuovo in righe secondo la loro posizione verticale, e solo dopo ripuliti. Lo stesso raggruppamento gira nello strumento che confronta due PDF: se lì funzionasse diversamente, lo stesso file mostrerebbe differenze diverse.

Tre correzioni, e nessuna avviene in silenzio

Le parole spezzate vengono ricongiunte, ma solo quando la riga successiva comincia con una lettera minuscola, così un nome composto non viene incollato in una parola sola. Le righe vengono unite in paragrafi, ma titoli, clausole numerate e voci di elenco tengono la loro riga, perché fondere insieme le clausole di un contratto è peggio che lasciare qualche a capo di troppo. Intestazioni e numeri di pagina vengono tolti perché si ripetono da una pagina all'altra, e un numero da solo conta come numero di pagina solo se non è maggiore del totale delle pagine, così l'anno 2026 dentro una tabella sopravvive.

Una scansione riceve un'altra risposta

Se il PDF è una scansione, dentro non c’è testo del tutto: le pagine sono immagini. Restituire un riquadro vuoto sembrerebbe uno strumento rotto invece dello strumento sbagliato, quindi la pagina dice cosa è successo e indirizza al riconoscimento del testo, che legge anche le pagine PDF. Quel controllo è volutamente grossolano: meno di quaranta lettere in tutto il documento significa didascalie dentro le immagini, non uno strato di testo.

Domande frequenti

Il mio documento viene caricato da qualche parte?

No. Viene aperto dentro questa scheda del browser e letto lì. Non si scarica nemmeno nulla: il lettore PDF fa già parte di questa pagina.

Perché per il mio file il testo è vuoto?

Molto probabilmente è una scansione: un'immagine di ogni pagina, senza strato di testo. Passalo invece per «Immagine in testo» — quello strumento riconosce le lettere e accetta anche le pagine PDF.

Perché le colonne sono mescolate?

Perché un impaginato a due colonne è memorizzato nel file così com'è stato disegnato, e di solito la colonna di sinistra arriva per intera per prima. Qui l'ordine segue il file invece di tirare a indovinare l'impaginazione: indovinare male scombina il testo più di quanto facciano le colonne.

Cosa succede alle tabelle?

Una tabella diventa righe di testo: le celle mantengono il loro ordine ma perdono la griglia. Se ti serve la griglia, usa «PDF in Excel», che ricava le colonne dalle coordinate.

Quanto può essere grande il documento?

Fino a 60 MB e le prime 500 pagine. Oltre, l'attesa smette di valerne la pena, e la pagina lo dice invece di bloccarsi.

Strumenti correlati