OCR per PDF

Un contratto scansionato, una pagina fotografata, un vecchio fax salvato in PDF: sembrano tutti documenti e si comportano come immagini. Non si possono cercare, non si può copiare una riga, e uno screen reader non ha nulla da leggere ad alta voce. Questa pagina riconosce le parole e le rimette dove stanno sulla pagina, in modo invisibile. La scansione resta identica; tutto il resto comincia a funzionare.

Il riconoscimento è una supposizione, non una lettura: una pagina stampata pulita esce quasi perfetta, la foto di uno scontrino spiegazzato no. Nulla viene corretto in automatico — una correzione verosimile su una cifra è l’errore che non prenderesti mai.

La scansione non viene caricata: il motore e il modello della lingua si scaricano nel tuo browser e lavorano lì. Esce la tua stessa scansione con sopra un livello di testo invisibile — l’immagine resta identica, ma ricerca, copia e lettori di schermo funzionano.

Nelle vicinanze: Immagine in testo · PDF in testo · Da PDF a Word · Comprimere un PDF

Come si usa

  1. Scegli il PDF scansionato.
  2. Indica la lingua del documento: il riconoscimento dipende da questo più che da qualsiasi altra cosa.
  3. Premi il pulsante, aspetta e scarica il PDF cercabile oppure il testo semplice.

Da sapere

Cos'è davvero un PDF cercabile

È la tua scansione con un secondo strato: le parole riconosciute, collocate esattamente sopra quelle stampate e disegnate con inchiostro invisibile. La pagina appare identica — stessa carta, stessi timbri, stessa scrittura a mano nel margine — ma Ctrl+F ci trova un nome, una frase si può copiare e uno screen reader può leggerla ad alta voce. Ecco perché l'immagine viene conservata invece di essere sostituita da testo pulito: una scansione è spesso un documento probatorio, e reimpaginarla la trasformerebbe in qualcos'altro.

Il riconoscimento è un'ipotesi, non una lettura

Una pagina stampata e pulita esce quasi perfetta. La foto di uno scontrino spiegazzato no, e nessun motore cambia questo. Perciò dopo la conversione viene mostrata la confidenza media e non viene corretto nulla in automatico: una correzione plausibile su una cifra è il tipo di errore che non becca mai nessuno. Leggi il testo prima di fidartene, soprattutto i numeri.

Domande frequenti

La mia scansione viene caricata?

No. Il motore e il modello linguistico vengono scaricati nel tuo browser e girano lì; il file resta sul dispositivo.

Quanto viene scaricato?

Circa due o tre megabyte: il motore più un modello linguistico. È scritto sulla pagina prima che tu prema il pulsante, e dopo la prima esecuzione tutto funziona offline.

Il mio PDF ha già il testo: devo passarlo di qui?

No, e la pagina lo dice quando se ne accorge: il riconoscimento sostituirebbe testo buono con un'ipotesi. Usa invece «PDF in testo».

Quante pagine regge?

Fino a cinquanta. Oltre, un browser ci metterebbe decine di minuti, e la pagina dice quante ne ha elaborate.

Strumenti correlati