OCR de PDF

Un contrat scanné, une page photographiée, un vieux fax enregistré en PDF : cela ressemble à des documents et se comporte comme des images. Rien ne se cherche, rien ne se copie, et un lecteur d’écran n’a rien à lire. Cette page reconnaît les mots et les replace exactement là où ils sont sur la feuille, de façon invisible. Le scan a la même allure ; tout le reste se met à fonctionner.

La reconnaissance est une supposition, pas une lecture : une page imprimée nette sort presque parfaite, la photo d’un ticket froissé non. Rien n’est corrigé automatiquement — une correction plausible sur un chiffre est une erreur qu’on ne rattrape jamais.

Le scan n’est pas envoyé : le moteur et le modèle de langue sont téléchargés dans votre navigateur et y travaillent. Il en sort votre scan avec une couche de texte invisible par-dessus — l’image ne change pas, mais la recherche, la copie et les lecteurs d’écran fonctionnent.

À côté : Image en texte · PDF en texte · PDF en Word · Compresser PDF

Comment faire

  1. Choisissez le PDF scanné.
  2. Indiquez la langue du document : la reconnaissance en dépend plus que de tout le reste.
  3. Cliquez, patientez, puis téléchargez le PDF cherchable ou le texte brut.

Bon à savoir

Ce qu’est vraiment un PDF cherchable

C’est votre scan doublé d’une seconde couche : les mots reconnus, posés exactement sur les mots imprimés et tracés à l’encre invisible. La page paraît identique — même papier, mêmes tampons, même annotation en marge — mais Ctrl+F y trouve un nom, une phrase se copie, un lecteur d’écran la lit. Voilà pourquoi l’image est conservée plutôt que remplacée par du texte propre : un scan est souvent le document lui-même, et le remettre en page en ferait un autre.

La reconnaissance devine, elle ne lit pas

Une page imprimée nette sort presque parfaite. La photo d’un ticket froissé, non, et aucun moteur n’y changera rien. La confiance moyenne est donc affichée après coup, et rien n’est corrigé automatiquement : une correction plausible sur un chiffre est exactement l’erreur que personne ne rattrape. Relisez le texte avant de vous y fier, surtout les nombres.

Questions fréquentes

Mon scan est-il envoyé ?

Non. Le moteur et le modèle de langue sont téléchargés dans votre navigateur et y travaillent ; le fichier reste sur l’appareil.

Quel volume est téléchargé ?

Deux à trois mégaoctets : le moteur et un modèle de langue. Le chiffre est indiqué avant le clic, et après le premier lancement tout marche hors ligne.

Mon PDF a déjà du texte, faut-il le passer ici ?

Non, et la page le signale quand elle le détecte : la reconnaissance remplacerait du bon texte par une supposition. Utilisez « PDF en texte ».

Combien de pages au maximum ?

Cinquante. Au-delà, un navigateur passerait des dizaines de minutes, et la page dit combien ont été traitées.

Outils similaires