PDF-OCR

Ein gescannter Vertrag, eine abfotografierte Seite, ein altes Fax als PDF — sie sehen aus wie Dokumente und verhalten sich wie Bilder: nicht durchsuchbar, nichts kopierbar, und ein Screenreader hat nichts vorzulesen. Diese Seite erkennt die Wörter und legt sie genau dorthin zurück, wo sie stehen — unsichtbar. Der Scan sieht gleich aus; alles andere fängt an zu funktionieren.

Erkennung ist Raten, nicht Lesen: Eine saubere Druckseite kommt fast perfekt heraus, das Handyfoto eines zerknitterten Bons nicht. Es wird nichts automatisch korrigiert — eine plausible Korrektur an einer Zahl ist ein Fehler, den man nie bemerkt.

Der Scan wird nicht hochgeladen: Engine und Sprachmodell werden in Ihren Browser geladen und arbeiten dort. Heraus kommt Ihr Scan mit einer unsichtbaren Textebene darüber — das Bild bleibt gleich, aber Suche, Kopieren und Screenreader funktionieren.

In der Nähe: Bild zu Text · PDF in Text · PDF in Word · PDF komprimieren

So geht es

  1. Gescanntes PDF wählen.
  2. Sprache des Dokuments angeben — davon hängt die Erkennung mehr ab als von allem anderen.
  3. Knopf drücken, warten und das durchsuchbare PDF oder den reinen Text herunterladen.

Gut zu wissen

Was ein durchsuchbares PDF wirklich ist

Es ist Ihr Scan mit einer zweiten Ebene: die erkannten Wörter, genau über den gedruckten platziert und mit unsichtbarer Tinte gezeichnet. Die Seite sieht identisch aus — dasselbe Papier, dieselben Stempel, dieselbe Notiz am Rand — aber Strg+F findet darin einen Namen, ein Satz lässt sich kopieren, ein Screenreader kann ihn vorlesen. Deshalb bleibt das Bild erhalten, statt durch sauberen Text ersetzt zu werden: Ein Scan ist oft das Dokument selbst, und ihn neu zu setzen hieße, ein anderes daraus zu machen.

Erkennung ist Raten, nicht Lesen

Eine saubere Druckseite kommt fast perfekt heraus. Das Handyfoto eines zerknitterten Bons nicht, und keine Engine ändert das. Deshalb wird die mittlere Sicherheit nach dem Lauf angezeigt und nichts automatisch korrigiert: Eine plausible Korrektur an einer Ziffer ist genau der Fehler, den niemand bemerkt. Lesen Sie den Text, bevor Sie sich darauf verlassen — besonders die Zahlen.

Häufige Fragen

Wird mein Scan hochgeladen?

Nein. Engine und Sprachmodell werden in Ihren Browser geladen und laufen dort; die Datei bleibt auf dem Gerät.

Wie viel wird geladen?

Etwa zwei bis drei Megabyte: Engine plus ein Sprachmodell. Die Zahl steht vor dem Klick da, und nach dem ersten Lauf funktioniert alles offline.

Mein PDF hat schon Text — soll ich das trotzdem laufen lassen?

Nein, und die Seite sagt es, sobald sie es merkt: Die Erkennung ersetzte guten Text durch eine Vermutung. Nehmen Sie «PDF in Text».

Wie viele Seiten schafft es?

Bis zu fünfzig. Darüber hinaus bräuchte ein Browser Dutzende Minuten, und die Seite nennt, wie viele erledigt wurden.

Ähnliche Tools