Zeichenkodierung-Konverter für Textdateien

Wenn ein Text café als café oder naïve als naïve anzeigt, sind die Zeichen in Ordnung: Die Kodierung wird nur falsch gelesen. Fügen Sie den Text ein, sagen Sie dem Konverter, mit welcher Kodierung er ihn lesen und in welche er ihn schreiben soll, und er kodiert sauber zwischen UTF-8, UTF-16, ISO-8859-1 (Latin-1), Windows-1252 und weiteren gängigen Codepages um. Kopieren Sie das korrigierte Ergebnis direkt in Ihren Editor, Ihre Tabelle oder Ihre Datenbank.

So wandeln Sie die Textkodierung um

  1. 1

    Text einfügen

    Jeder Text, der verstümmelt aussieht oder für ein anderes Programm neu kodiert werden muss.

  2. 2

    Erkennung prüfen

    Ein Hinweis zeigt über dem Feld die wahrscheinliche aktuelle Kodierung an.

  3. 3

    Quellkodierung wählen

    Stellen Sie „Von“ darauf ein, wie die Bytes gelesen werden sollen: UTF-8, Windows-1252, ISO-8859-1, SJIS und mehr.

  4. 4

    Zielkodierung wählen

    UTF-8 ist der moderne Standard; UTF-16, Big5 oder GB2312 stehen bereit, wenn ein bestimmtes Programm sie braucht.

  5. 5

    Umwandeln und kopieren

    Der Text wird neu kodiert und ein Klick kopiert das Ergebnis in die Zwischenablage.

Woher Kodierungskonflikte kommen

Quelle Wahrscheinliche Kodierung
Excel „Speichern als CSV“ unter Windows Windows-1252
Alte Windows-Anwendung Windows-1252
Altes Unix-Werkzeug ISO-8859-1 (Latin-1)
Moderner macOS-/Linux-Editor UTF-8
Japanischer Windows-Text Shift-JIS (SJIS)
Vereinfachtes Chinesisch unter Windows GB2312
Traditionelles Chinesisch (Taiwan/Hongkong) Big5

Die klassischen Symptome

  • café erscheint als café, wenn UTF-8-Bytes als Latin-1 gelesen werden. Setzen Sie „Von“ auf UTF-8, um die Bytes wieder korrekt zu deuten.
  • ñ wird aus demselben Grund zu ñ.
  • Doppeltes Mojibake wie café bedeutet, dass der Text nach der ersten Fehldeutung erneut gespeichert wurde und die falsche Deutung ein zweites Mal kodiert wurde.
  • Ein führendes  ist eine UTF-8-Bytereihenfolge-Markierung, die als drei Latin-1-Zeichen gelesen wurde.

Sobald Sie das Symptom erkennen, ist der Weg meist klar: Lesen Sie den Text als das, was er wirklich ist (Latin-1, Windows-1252 oder was zutrifft), und schreiben Sie ihn als UTF-8 zurück.

Bytereihenfolge-Markierungen (BOM)

Dieser Konverter fügt eine Bytereihenfolge-Markierung nicht bewusst hinzu und entfernt sie nicht: Das Verhalten richtet sich nach der Zielkodierung. UTF-8-Ausgabe hat keine BOM. Einfache UTF-16-Ausgabe beginnt mit einer BOM und ist big-endian, während UTF-16BE und UTF-16LE die Bytes ohne BOM schreiben. Wählen Sie UTF-8, sofern ein bestimmtes Programm nicht UTF-16 verlangt.

Wenn ein Zeichen keine Entsprechung hat

Manche Bytes haben in der gewählten Quellkodierung keine Bedeutung, und manche Zeichen lassen sich in der Zielkodierung nicht darstellen. Dann ersetzt die Umwandlung sie durch eine Markierung, statt abzubrechen. Am wichtigsten ist die richtige Quellkodierung: Eine reine ASCII-Zeichenkette ist in jeder Kodierung gültig, ein Konflikt zeigt sich daher meist erst bei akzentuierten oder nicht lateinischen Zeichen.

Häufig gestellte Fragen

Die Listen „Von“ und „Nach“ bieten beide UTF-8, UTF-16, UTF-16BE, UTF-16LE, ISO-8859-1, ISO-8859-15, Windows-1252, ASCII, EUC-JP, SJIS (Shift-JIS), GB2312 und Big5. Sie können von jeder in jede andere umwandeln.

Für Web, Datenbanken und nahezu jede moderne Verarbeitung: ja. Ausnahmen sind alte Windows-Programme, die nur Windows-1252 lesen, einige ältere Mainframe-Werkzeuge und bestimmte japanische Software, die Shift-JIS erwartet.

Es ist eine Schätzung anhand des Bytemusters, ausgewählt aus UTF-8, UTF-16, ISO-8859-1, Windows-1252 und ASCII. Bei kurzem oder reinem ASCII-Text kann sie falsch liegen; behandeln Sie sie als Hinweis und stellen Sie die Kodierung „Von“ selbst ein, wenn Sie es besser wissen.

Der Text wird zur Umwandlung an unseren Server gesendet und nach der Rückgabe der Antwort nicht gespeichert. Für vertrauliches Material ist ein Offline-Editor mit integriertem Kodierungskonverter vorzuziehen.

Verwandte Tools

Tool in anderen Sprachen verfügbar