PDF-zu-Text-Konverter

Nächster: Überprüfung

Der schnellste Weg, den Text aus einem PDF zu holen. Dieses Tool liest die bereits im PDF gespeicherte Textebene, Seite für Seite, und liefert Ihnen reinen Text, den Sie kopieren oder als .txt-Datei speichern können. Alles läuft in Ihrem Browser, Ihr Dokument wird also nie hochgeladen. Eines vorweg: Es liest den Text, der bereits in der Datei steckt. Ein gescanntes oder abfotografiertes Dokument (ein Bild ohne Textebene) kommt daher leer heraus. Verwenden Sie dafür stattdessen ein OCR-Tool.

So extrahieren Sie Text aus einem PDF

  1. 1

    PDF hochladen

    Ziehen Sie es hinein oder klicken Sie zum Auswählen. Die Datei bleibt auf Ihrem Gerät und wird nie an einen Server gesendet.

  2. 2

    Text extrahieren

    Das Tool liest die Textebene jeder Seite und fügt sie zusammen, mit einer Markierung vor jeder Seite.

  3. 3

    Ergebnis prüfen

    Der extrahierte Text erscheint in einem Feld, Seite für Seite, bereit zur Kontrolle.

  4. 4

    Kopieren oder herunterladen

    Kopieren Sie ihn in die Zwischenablage oder speichern Sie ihn als .txt-Datei zur Weiterverwendung.

Was dieses Tool liest und was nicht

PDF-Typ Ergebnis
Exportiert aus Word, Google Docs, einem Browser oder einem Design-Tool Vollständiger Text, sauber und lückenlos
Ein digitales PDF mit echter Textebene Text Seite für Seite extrahiert
Ein Scan oder Foto als PDF gespeichert (nur Bild) Leer oder fast leer: es gibt keinen Text zu lesen
Ein passwortgeschütztes PDF Nicht lesbar, bis Sie es zuerst entsperren

Kein OCR hier: das richtige Tool für Scans

Dieser Extraktor führt kein OCR (optische Zeichenerkennung) aus. Er kopiert den Text, der bereits im PDF steckt, er liest keine Pixel. Wenn Ihre Datei ein Scan ist und nichts zurückkommt, schicken Sie sie zuerst durch ein OCR-Tool, das das Bild in eine echte Textebene verwandelt, die Sie danach extrahieren können.

Wie der Text aufgebaut ist

Jede Seite wird durch eine Markierung --- Page N --- getrennt, damit Sie sehen, wo eine Seite endet und die nächste beginnt. Der Text wird in der Reihenfolge ausgelesen, in der er im PDF gespeichert ist. Die meisten Dokumente lesen sich natürlich; einige wenige mit ungewöhnlichen mehrspaltigen Layouts können die Spalten verschachteln, weil das Tool der im PDF gespeicherten Reihenfolge folgt, statt einen Lesepfad zu erraten.

Häufige Anwendungen

  • Ein KI-Modell füttern. Sprachmodelle verarbeiten reinen Text, keine PDFs. Vorher zu extrahieren macht alles schneller und berechenbarer.
  • Zitieren und suchen. Kopieren Sie eine Passage, ohne mit der Auswahl im PDF-Viewer zu kämpfen.
  • Inhalte wiederverwenden. Übertragen Sie Text in ein Dokument, eine E-Mail oder eine Notiz, ohne ihn neu zu tippen.

Häufig gestellte Fragen

Nein. Es liest die eingebettete Textebene, und ein Scan ist nur ein Bild ohne Textebene, kommt also leer zurück. Nutzen Sie für gescannte oder abfotografierte Dokumente ein OCR-Tool und extrahieren Sie danach den Text.

Nein. Die Extraktion läuft vollständig in Ihrem Browser, auf Ihrem eigenen Gerät. Das PDF wird nie an einen Server gesendet und nichts wird gespeichert.

Einige PDFs, vor allem mehrspaltige Layouts, speichern ihren Text in einer anderen Reihenfolge, als Sie ihn lesen. Das Tool folgt der im PDF gespeicherten Reihenfolge, daher können sich Spalten verschachteln. Aus Textverarbeitungen exportierte Dokumente kommen fast immer korrekt heraus.

Nicht solange sie gesperrt sind. Entfernen Sie das Passwort zuerst mit einem PDF-Entsperr-Tool und extrahieren Sie dann den Text.

Verwandte Tools

Tool in anderen Sprachen verfügbar