PDF in Text

Beim Kopieren aus einem PDF bekommt man halbierte Wörter, am Spaltenrand umgebrochene Zeilen und einen Firmennamen, der alle vierzig Zeilen wiederkehrt. Hier wird der Text herausgeholt und aufgeräumt — jede Korrektur ist ein Schalter, den Sie selbst umlegen, und die Datei verlässt diesen Tab nicht.

oder hier ablegen

Ein PDF mit Textebene — kein Scan. Bis 60 MB

Die Datei bleibt auf diesem Gerät: Sie wird im Tab geöffnet, nichts wird hochgeladen. Geladen wird auch nichts — der PDF-Leser gehört bereits zu dieser Seite.

Was nicht mitkommt: Bilder, Tabellen als Tabellen, Fett und Kursiv. Eine Tabelle wird zu Textzeilen, und ein zweispaltiges Layout wird zuerst links gelesen — so liegt der Text in der Datei.

In der Nähe: PDF in Word · Bild zu Text · Zwei PDFs vergleichen · Wörter zählen

So geht es

  1. Wählen Sie ein PDF mit Textebene — keinen Scan.
  2. Schalten Sie ein, was Sie brauchen: getrennte Wörter verbinden, Zeilen zu Absätzen, Kopfzeilen und Seitenzahlen entfernen.
  3. Kopieren Sie den Text oder laden Sie ihn als .txt herunter.

Gut zu wissen

Den Text zu holen ist die halbe Arbeit

Ein PDF speichert keine Zeilen, sondern Textstücke mit Koordinaten. Eine Zeile kommt oft in einem Dutzend Stücken an, weil sich mitten im Satz die Schrift änderte, und ein naiver Extraktor gibt sie einzeln aus. Deshalb werden die Stücke zuerst über ihre Höhe wieder zu Zeilen gruppiert und erst dann gesäubert. Dieselbe Gruppierung läuft im Werkzeug zum Vergleich zweier PDFs: liefe sie dort anders, zeigte dieselbe Datei andere Unterschiede.

Drei Korrekturen, und keine passiert stillschweigend

Getrennte Wörter werden verbunden — aber nur, wenn die nächste Zeile klein beginnt, damit ein zusammengesetzter Name nicht verschmilzt. Zeilen werden zu Absätzen verbunden — Überschriften, nummerierte Klauseln und Listenpunkte behalten jedoch ihre Zeile: die Klauseln eines Vertrags zu verschmelzen ist schlimmer als überzählige Umbrüche. Kopfzeilen und Seitenzahlen fallen über die Wiederholung zwischen Seiten weg, und eine nackte Zahl gilt nur dann als Seitenzahl, wenn sie nicht größer als die Seitenanzahl ist — das Jahr 2026 in einer Tabelle überlebt.

Ein Scan bekommt eine andere Antwort

Ist das PDF ein Scan, steht darin gar kein Text — die Seiten sind Bilder. Ein leeres Feld sähe nach kaputtem Werkzeug aus statt nach dem falschen; die Seite sagt deshalb, was los ist, und verweist auf die Texterkennung, die auch PDF-Seiten liest. Die Prüfung ist bewusst grob: unter vierzig Buchstaben im ganzen Dokument sind Bildunterschriften in Grafiken, keine Textebene.

Häufige Fragen

Wird mein Dokument irgendwohin hochgeladen?

Nein. Es wird in diesem Browser-Tab geöffnet und dort gelesen. Geladen wird auch nichts — der PDF-Leser gehört bereits zu dieser Seite.

Warum bleibt der Text bei meiner Datei leer?

Höchstwahrscheinlich ist es ein Scan: ein Bild jeder Seite ohne Textebene. Schicken Sie ihn durch «Bild zu Text» — das Werkzeug erkennt die Buchstaben und nimmt auch PDF-Seiten.

Warum sind die Spalten durcheinander?

Weil ein zweispaltiges Layout so gespeichert ist, wie es gezeichnet wurde, und die linke Spalte meist am Stück zuerst kommt. Die Reihenfolge folgt hier der Datei, statt das Layout zu raten — falsch geraten bringt mehr Durcheinander als die Spalten selbst.

Was passiert mit Tabellen?

Eine Tabelle wird zu Textzeilen: Die Zellen behalten ihre Reihenfolge, verlieren aber das Raster. Brauchen Sie das Raster, nehmen Sie «PDF in Excel» — dort werden die Spalten aus den Koordinaten erschlossen.

Wie groß darf das Dokument sein?

Bis 60 MB und die ersten 500 Seiten. Darüber lohnt das Warten nicht mehr, und die Seite sagt das, statt einzufrieren.

Ähnliche Tools