PDF-Tabelle in CSV
Textbasierte PDF auswählen
Wandeln Sie einfache, textbasierte PDF-Tabellen in CSV- oder TSV-Dateien um, ohne die PDF an einen Server zu senden. Der Browser gruppiert Textfragmente nach ihrer sichtbaren Position, sucht wiederkehrende Spalten und versucht, Fließtext auszuschließen. Prüfen Sie jede erkannte Tabelle vor dem Download: Der konservative Detektor arbeitet nach bestem Bemühen, kann komplexe Layouts aber nicht garantiert in perfekte Zeilen und Spalten übertragen.
So extrahieren Sie eine PDF-Tabelle als CSV
-
1
Textbasierte PDF auswählen
Wählen Sie eine PDF mit höchstens 20 MiB und 150 Seiten. Reine Bildscans müssen zuerst per OCR in durchsuchbaren Text umgewandelt werden.
-
2
Tabellen im Browser erkennen lassen
Der Detektor verwendet sichtbare Textkoordinaten einschließlich Seitendrehung und CropBox und sucht wiederkehrende Zeilen- und Spaltenpositionen.
-
3
Ergebnis und Format prüfen
Wählen Sie die gewünschten Tabellen und kontrollieren Sie deren Zeilen. Legen Sie Komma, Semikolon oder Tabulator sowie UTF-8-Markierung und Formelschutz fest.
-
4
Jede Tabelle herunterladen
Jede ausgewählte Tabelle wird lokal als eigene CSV- oder TSV-Datei gespeichert. Tabellen werden nicht über Seiten hinweg verbunden.
Was der Detektor erkennen kann
PDF-Dateien speichern Tabellen normalerweise nicht als Raster mit benannten Zellen, sondern als Textfragmente an Koordinaten. Dieses Werkzeug gruppiert Fragmente auf derselben sichtbaren Linie, verbindet nahe beieinanderliegende Teile und behält Spaltenpositionen, die sich über mehrere Zeilen wiederholen. Es kann mehrere regelmäßige Tabellen auf einer Seite trennen und einspaltigen Fließtext verwerfen, wenn das Muster eindeutig ist.
Seitendrehung und eine verschobene CropBox fließen in die sichtbaren Koordinaten ein. Bei überwiegend rechtsläufig gesetzten Zeilen folgt die Spaltenreihenfolge der Richtung aus der PDF-Textebene. Verbundene oder umgebrochene Zellen, Schmucklayouts und gemischte Schreibrichtungen können trotzdem Nacharbeit erfordern.
| PDF-Layout | Wahrscheinliches Ergebnis | Das sollten Sie prüfen |
|---|---|---|
| Sauberer Export mit wiederkehrenden Spalten | Meist der beste Fall | Überschriften, Dezimalzeichen und leere Zellen |
| Fehlender Wert in einer regelmäßigen Zeile | Leere Zelle in der abgeleiteten Spalte | Ob die richtige Spalte leer blieb |
| Verbundene oder umgebrochene Zelle | Text kann geteilt, verschoben oder verbunden werden | Vorschau mit der PDF vergleichen |
| Mehrere regelmäßige Tabellen auf einer Seite | Können getrennt erkannt werden | Nur benötigte Tabellen auswählen |
| Gescannte Bildseite | Keine Tabelle erkannt | Zuerst OCR ausführen |
Zusätzlich zu 20 MiB und 150 Seiten gelten Schutzgrenzen für Textfragmente und Zeichen. Eine stark fragmentierte PDF kann deshalb früher stoppen.
CSV, TSV und Tabellensicherheit
Komma- und Semikolonausgaben verwenden das gewählte Trennzeichen; Tabulatorausgaben werden als TSV gespeichert. Datensätze enden mit CRLF. Felder mit dem aktiven Trennzeichen, Anführungszeichen, Wagenrücklauf oder Zeilenumbruch werden in doppelte Anführungszeichen gesetzt; enthaltene Anführungszeichen werden verdoppelt. Das entspricht den in RFC 4180 beschriebenen Regeln, angepasst an das gewählte Trennzeichen.
Der Formelschutz ist standardmäßig aktiv. Beginnt eine Zelle nach Leerraum mit =, +, - oder @, einschließlich unterstützter vollbreiter Varianten, wird ein Apostroph vorangestellt. Tabellenprogramme behandeln den Inhalt dadurch eher als Text, der Zellenwert ändert sich aber. Ohne Schutz bleibt der extrahierte Text unverändert; formelähnliche Inhalte aus nicht vertrauenswürdigen PDFs können beim Öffnen jedoch gefährlich sein. OWASP erläutert CSV Injection und warum keine Maßnahme in allen Tabellenprogrammen und nach erneutem Speichern universell wirkt.
Eine optionale UTF-8-Markierung hilft manchen Programmen bei nichtlateinischer Schrift. Prüfen Sie die Datei vor Buchhaltung, Berichten oder automatisierten Importen.
Privater Zustand zwischen den Schritten
PDF, erkannte Tabellen und Einstellungen bleiben in diesem Browser. Sie liegen bis zu 30 Minuten in einem begrenzten lokalen Speicher, damit die drei Schritte erhalten bleiben; auch die Downloads entstehen lokal. Das Werkzeug lädt nichts hoch. Ein Neustart löscht den aktuellen Auftrag, und der Browser kann lokale Daten aufgrund seiner Speicherregeln oder im Privatmodus früher entfernen.
Häufig gestellte Fragen
Nein. Lesen, Erkennen und Erstellen von CSV oder TSV geschehen im Browser. Der aktuelle Auftrag bleibt höchstens 30 Minuten im begrenzten lokalen Speicher und jeder Download ist lokal.
Nicht ohne Vorbereitung. Ein reiner Bildscan hat keine PDF-Textebene, deren Positionen der Detektor auswerten könnte. Führen Sie zuerst OCR aus und verwenden Sie danach die textbasierte PDF.
Sie können Komma, Semikolon oder Tabulator wählen. Datensätze verwenden CRLF; Felder mit dem gewählten Trennzeichen, Anführungszeichen, Wagenrücklauf oder Zeilenumbruch werden umschlossen und enthaltene Anführungszeichen verdoppelt. Tabulator ergibt .tsv.
Er stellt Zellen, die nach Leerraum wie Formeln mit =, +, - oder @ beginnen, ein Apostroph voran. Das ist standardmäßig aktiv und verändert diese Werte. Schalten Sie es nur aus, wenn der Rohtext wichtiger ist und Sie der PDF vertrauen.
Die Erkennung beruht auf Textpositionen, nicht auf echten Zellen. Umbruch, verbundene Zellen, ungewöhnliche Abstände und gemischte Richtungen können Werte verschieben. Trotz normalisierter Drehung und CropBox sollten Sie jede Vorschau vergleichen.
Mehrere regelmäßige Tabellen auf einer Seite können getrennt erkannt werden. Jede Auswahl wird als eigene Datei geladen. Eine auf der nächsten Seite fortgesetzte Tabelle wird nicht verbunden.
Verwandte Tools
PDFs zusammenführen
Führen Sie mehrere PDFs zu einem Dokument zusammen, ordnen Sie Dateien und Seiten per Drag-and-drop und laden Sie das Ergebnis sofort herunter.
PDF-zu-PNG-Konverter
Rendern Sie PDF-Seiten als PNG-Dateien mit scharfem Text, Transparenzunterstützung und frei gewählter DPI. Ideal für Dokumentation und Vorschaubilder.
JPG in PDF umwandeln
Fassen Sie JPG-Bilder zu einer PDF-Datei zusammen und steuern Sie Seitenformat, Ausrichtung und Ränder für Verträge, Belege und Portfolios.
PDF in Excel umwandeln
Erkenne regelmäßige Tabellen in textbasierten PDFs und lade lokale XLSX-, CSV- oder TSV-Dateien herunter. Prüfe jede Tabelle. Limit: 20 MiB und 150 Seiten.
Leere Seiten zu PDF hinzufügen
Füge 1 bis 50 leere Seiten in ein bestehendes PDF ein. Wähle A4, Letter, Legal, A3 oder A5, Hoch- oder Querformat und die Position am Anfang, Ende oder vor oder nach einer Seitennummer.
Seiten aus PDF entfernen
Löschen Sie ausgewählte Seiten oder Seitenbereiche aus einer PDF. Geben Sie Nummern wie 2, 5-7 ein, lassen Sie mindestens eine Seite übrig und laden Sie eine gekürzte PDF herunter.