PDF-zu-HTML-Konverter

In HTML umwandeln
Weiter

Dieser Konverter liest den Text Ihres PDFs und verpackt ihn in eine saubere, minimale HTML-Datei: eine <section> pro Seite, eine <h2>-Seitenüberschrift und <p>-Absätze. Er läuft vollständig in Ihrem Browser mit PDF.js, sodass die Datei niemals hochgeladen wird. Das Ergebnis ist schlichtes HTML, nur Text, das Sie öffnen, bearbeiten oder in ein CMS einfügen und anschließend mit Ihrem eigenen CSS gestalten können. Es ist dafür gedacht, den Text eines PDFs ins Web zu bringen, nicht eine gestaltete Seite nachzubilden.

So konvertieren Sie PDF zu HTML

  1. 1

    PDF auswählen

    Ziehen Sie ein textbasiertes PDF in das Feld oder klicken Sie, um es auszuwählen. Alles bleibt in Ihrem Browser.

  2. 2

    In HTML umwandeln

    PDF.js liest jede Seite und extrahiert deren Text, wobei Zeilen zu Absätzen gruppiert werden.

  3. 3

    HTML prüfen

    Das erzeugte Markup erscheint in einem Vorschaufeld, damit Sie das Ergebnis kontrollieren können.

  4. 4

    Datei herunterladen

    Speichern Sie eine einzige `.html`-Datei mit einem Abschnitt pro Seite, bereit zum Bearbeiten oder Umgestalten.

So sieht die Ausgabe aus

Der Konverter erzeugt eine gültige HTML5-Datei mit einer minimalen Struktur:

Element Woher es stammt
<!DOCTYPE html>-Grundgerüst Eine standardmäßige HTML5-Hülle mit UTF-8-Zeichensatz
<title> Der Dateiname Ihres PDFs
<section data-page> Ein Block pro PDF-Seite
<h2>Seite N</h2> Eine Überschrift, die den Beginn jeder Seite markiert
<p> Textzeilen, nach vertikalem Abstand zu Absätzen gruppiert

Was er nicht tut

Dies ist ein Werkzeug zur Textextraktion, keine Layout-Engine. Bewusst enthält die Ausgabe nicht:

  • Bilder, Logos oder Abbildungen aus dem PDF.
  • Tabellen, Aufzählungslisten oder nummerierte Listen als HTML-<table>/<ul>/<ol>.
  • Ursprüngliche Schriften, Farben, Spalten oder Positionierung.
  • Kein CSS und keine Inline-Formatierung.

Sie erhalten die Wörter in Lesereihenfolge, in semantische Absätze verpackt, und sonst nichts. Fügen Sie danach Ihr eigenes CSS hinzu.

Beste Ergebnisse

  • Verwenden Sie ein textbasiertes PDF (eines, in dem Sie in einem Reader Text markieren können). Gescannte oder reine Bild-PDFs enthalten keine Textebene, es gibt hier keine OCR und die Ausgabe bleibt für solche Seiten leer.
  • Lassen Sie die Datei durch prettier --parser html oder einen Formatierer laufen, um die Leerzeichen aufzuräumen, bevor Sie sie committen.
  • Sie übertragen sie nach WordPress? Fügen Sie das HTML in den Code-/HTML-Block ein, nicht in den visuellen Editor, der es neu umbrechen würde.

Kein Layout-Werkzeug

Erwarten Sie nicht, dass das HTML wie das PDF aussieht. Das Web ist fließend, eine PDF-Seite ist fest. Nutzen Sie dieses Werkzeug, wenn Sie den Inhalt im Web haben möchten, und gestalten Sie ihn dann mit dem CSS Ihrer eigenen Website neu.

Häufig gestellte Fragen

Nein. Das Werkzeug extrahiert den Text und setzt ihn in einfache Absätze. Schriften, Farben, Spalten und Positionierung werden nicht nachgebildet. Gestalten Sie die Ausgabe mit Ihrem eigenen CSS.

Nein. Es wird nur der Text extrahiert. Bilder, Logos und Abbildungen werden nicht ins HTML übernommen.

Nur wenn das PDF eine echte Textebene besitzt. Gescannte oder abfotografierte Seiten sind Bilder ohne markierbaren Text, und es gibt hier keine OCR, daher liefern solche Seiten keinen Text.

Nein. Die gesamte Umwandlung läuft mit PDF.js in Ihrem Browser. Das PDF verlässt Ihr Gerät niemals, daher ist es für vertrauliche Dokumente sicher.

Verwandte Tools

Tool in anderen Sprachen verfügbar