PDF-Tabelle in CSV

PDF-Tabelle in CSV

Textbasierte PDF auswählen

Wandeln Sie einfache, textbasierte PDF-Tabellen in CSV- oder TSV-Dateien um, ohne die PDF an einen Server zu senden. Der Browser gruppiert Textfragmente nach ihrer sichtbaren Position, sucht wiederkehrende Spalten und versucht, Fließtext auszuschließen. Prüfen Sie jede erkannte Tabelle vor dem Download: Der konservative Detektor arbeitet nach bestem Bemühen, kann komplexe Layouts aber nicht garantiert in perfekte Zeilen und Spalten übertragen.

So extrahieren Sie eine PDF-Tabelle als CSV

  1. 1

    Textbasierte PDF auswählen

    Wählen Sie eine PDF mit höchstens 20 MiB und 150 Seiten. Reine Bildscans müssen zuerst per OCR in durchsuchbaren Text umgewandelt werden.

  2. 2

    Tabellen im Browser erkennen lassen

    Der Detektor verwendet sichtbare Textkoordinaten einschließlich Seitendrehung und CropBox und sucht wiederkehrende Zeilen- und Spaltenpositionen.

  3. 3

    Ergebnis und Format prüfen

    Wählen Sie die gewünschten Tabellen und kontrollieren Sie deren Zeilen. Legen Sie Komma, Semikolon oder Tabulator sowie UTF-8-Markierung und Formelschutz fest.

  4. 4

    Jede Tabelle herunterladen

    Jede ausgewählte Tabelle wird lokal als eigene CSV- oder TSV-Datei gespeichert. Tabellen werden nicht über Seiten hinweg verbunden.

Was der Detektor erkennen kann

PDF-Dateien speichern Tabellen normalerweise nicht als Raster mit benannten Zellen, sondern als Textfragmente an Koordinaten. Dieses Werkzeug gruppiert Fragmente auf derselben sichtbaren Linie, verbindet nahe beieinanderliegende Teile und behält Spaltenpositionen, die sich über mehrere Zeilen wiederholen. Es kann mehrere regelmäßige Tabellen auf einer Seite trennen und einspaltigen Fließtext verwerfen, wenn das Muster eindeutig ist.

Seitendrehung und eine verschobene CropBox fließen in die sichtbaren Koordinaten ein. Bei überwiegend rechtsläufig gesetzten Zeilen folgt die Spaltenreihenfolge der Richtung aus der PDF-Textebene. Verbundene oder umgebrochene Zellen, Schmucklayouts und gemischte Schreibrichtungen können trotzdem Nacharbeit erfordern.

PDF-Layout Wahrscheinliches Ergebnis Das sollten Sie prüfen
Sauberer Export mit wiederkehrenden Spalten Meist der beste Fall Überschriften, Dezimalzeichen und leere Zellen
Fehlender Wert in einer regelmäßigen Zeile Leere Zelle in der abgeleiteten Spalte Ob die richtige Spalte leer blieb
Verbundene oder umgebrochene Zelle Text kann geteilt, verschoben oder verbunden werden Vorschau mit der PDF vergleichen
Mehrere regelmäßige Tabellen auf einer Seite Können getrennt erkannt werden Nur benötigte Tabellen auswählen
Gescannte Bildseite Keine Tabelle erkannt Zuerst OCR ausführen

Zusätzlich zu 20 MiB und 150 Seiten gelten Schutzgrenzen für Textfragmente und Zeichen. Eine stark fragmentierte PDF kann deshalb früher stoppen.

CSV, TSV und Tabellensicherheit

Komma- und Semikolonausgaben verwenden das gewählte Trennzeichen; Tabulatorausgaben werden als TSV gespeichert. Datensätze enden mit CRLF. Felder mit dem aktiven Trennzeichen, Anführungszeichen, Wagenrücklauf oder Zeilenumbruch werden in doppelte Anführungszeichen gesetzt; enthaltene Anführungszeichen werden verdoppelt. Das entspricht den in RFC 4180 beschriebenen Regeln, angepasst an das gewählte Trennzeichen.

Der Formelschutz ist standardmäßig aktiv. Beginnt eine Zelle nach Leerraum mit =, +, - oder @, einschließlich unterstützter vollbreiter Varianten, wird ein Apostroph vorangestellt. Tabellenprogramme behandeln den Inhalt dadurch eher als Text, der Zellenwert ändert sich aber. Ohne Schutz bleibt der extrahierte Text unverändert; formelähnliche Inhalte aus nicht vertrauenswürdigen PDFs können beim Öffnen jedoch gefährlich sein. OWASP erläutert CSV Injection und warum keine Maßnahme in allen Tabellenprogrammen und nach erneutem Speichern universell wirkt.

Eine optionale UTF-8-Markierung hilft manchen Programmen bei nichtlateinischer Schrift. Prüfen Sie die Datei vor Buchhaltung, Berichten oder automatisierten Importen.

Privater Zustand zwischen den Schritten

PDF, erkannte Tabellen und Einstellungen bleiben in diesem Browser. Sie liegen bis zu 30 Minuten in einem begrenzten lokalen Speicher, damit die drei Schritte erhalten bleiben; auch die Downloads entstehen lokal. Das Werkzeug lädt nichts hoch. Ein Neustart löscht den aktuellen Auftrag, und der Browser kann lokale Daten aufgrund seiner Speicherregeln oder im Privatmodus früher entfernen.

Häufig gestellte Fragen

Nein. Lesen, Erkennen und Erstellen von CSV oder TSV geschehen im Browser. Der aktuelle Auftrag bleibt höchstens 30 Minuten im begrenzten lokalen Speicher und jeder Download ist lokal.

Nicht ohne Vorbereitung. Ein reiner Bildscan hat keine PDF-Textebene, deren Positionen der Detektor auswerten könnte. Führen Sie zuerst OCR aus und verwenden Sie danach die textbasierte PDF.

Sie können Komma, Semikolon oder Tabulator wählen. Datensätze verwenden CRLF; Felder mit dem gewählten Trennzeichen, Anführungszeichen, Wagenrücklauf oder Zeilenumbruch werden umschlossen und enthaltene Anführungszeichen verdoppelt. Tabulator ergibt .tsv.

Er stellt Zellen, die nach Leerraum wie Formeln mit =, +, - oder @ beginnen, ein Apostroph voran. Das ist standardmäßig aktiv und verändert diese Werte. Schalten Sie es nur aus, wenn der Rohtext wichtiger ist und Sie der PDF vertrauen.

Die Erkennung beruht auf Textpositionen, nicht auf echten Zellen. Umbruch, verbundene Zellen, ungewöhnliche Abstände und gemischte Richtungen können Werte verschieben. Trotz normalisierter Drehung und CropBox sollten Sie jede Vorschau vergleichen.

Mehrere regelmäßige Tabellen auf einer Seite können getrennt erkannt werden. Jede Auswahl wird als eigene Datei geladen. Eine auf der nächsten Seite fortgesetzte Tabelle wird nicht verbunden.

Verwandte Tools