Mojibake-Reparatur
Dieser private Vergleich ist nicht mehr verfügbar
Vollständiges einseitiges Werkzeug öffnenFalsch dargestellten Text einfügen
Füge Text wie café oder eine japanische Zeichenfolge ein, die nach einer falschen Zeichenkodierung unlesbar wurde. Das Original bleibt im Eingabefeld unverändert.
Höchstens 50.000 Zeichen. Dieses Werkzeug vergleicht nur eingefügten Unicode-Text. Es untersucht oder repariert keine Dateien, Bytefolgen, Datenbanken oder HTTP-Header.
Mojibake bezeichnet lesbare Daten, die als falsche Zeichen erscheinen, weil die Bytes mit einem unpassenden Zeichensatz dekodiert wurden. Ein bekanntes Beispiel ist café: café wurde als UTF-8 kodiert, seine Bytes aber als Latin-1 oder Windows-1252 gelesen. Füge den sichtbaren Text ein, um streng umkehrbare Reparaturhypothesen zu vergleichen. Das Werkzeug lässt das Original unverändert, kennzeichnet jeden Kandidaten als Hypothese und führt den Vergleich lokal in deinem Browser aus.
So vergleichst du eine Mojibake-Reparaturhypothese
-
1
Sichtbaren Text einfügen
Verwende den Text genau so, wie du ihn erhalten hast. Das Werkzeug lädt keine Quelldatei hoch und untersucht sie nicht.
-
2
Vergleich ausdrücklich starten
Lass den Browser Annahmen für Latin-1- und Windows-1252-Bytes mit einem strengen UTF-8-Decoder prüfen.
-
3
Vergleichen, nicht voraussetzen
Lies das unveränderte Original neben jedem umkehrbaren Kandidaten und wähle nur dann, wenn der Kontext dafür spricht.
-
4
Klartext übernehmen
Kopiere, lade oder drucke eine ausgewählte Hypothese, ohne den Originaltext zu überschreiben.
Was eine Mojibake-Reparatur klären kann und was nicht
Eine Zeichenkodierung ordnet Zeichen Bytes zu und wandelt sie wieder zurück. UTF-8 stellt é mit den beiden Bytes C3 A9 dar. Werden diese Bytes als Windows-1252 oder ISO-8859-1 dekodiert, kann daraus sichtbar é werden. Eine sinnvolle Reparaturhypothese kehrt genau diesen Fehler um: Die sichtbaren Zeichen werden als Werte einer älteren Bytekodierung behandelt, diese Bytes streng als UTF-8 dekodiert und anschließend wird geprüft, ob die UTF-8-Kodierung des Kandidaten wieder genau dieselben Bytes ergibt.
Diese Rücklaufprüfung verwirft unvollständige und fehlerhafte UTF-8-Folgen. Sie verwirft auch Kandidaten mit dem Ersatzzeichen �, denn die durch dieses Zeichen dargestellte Information ist bereits verloren. Ein gültiger Rücklauf spricht für eine Hypothese, beweist aber weder, welche Kodierung das Quellsystem verwendete, noch, was die verfassende Person gemeint hat.
| Sichtbarer Text | Geprüfte Hypothese | Möglicher Kandidat | Was zu prüfen ist |
|---|---|---|---|
café |
UTF-8-Bytes als Latin-1 gelesen | café |
Schreibweise mit der Quelle vergleichen |
It’s |
UTF-8-Bytes als Windows-1252 gelesen | It’s |
Satzzeichen und Schreibstil prüfen |
æååã |
UTF-8-Bytes als Latin-1 gelesen | 文字化け |
Japanischen Text mit einer verlässlichen Kopie vergleichen |
café |
Zwei aufeinanderfolgende Kodierungsfehler | café |
Beide abgesicherten Durchläufe prüfen |
Warum japanischer Text Kontext braucht
Der japanische Ausdruck 文字化け bezeichnet falsch dargestellte Zeichen. Japanischer UTF-8-Text kann zu einer langen Mischung aus lateinischen Buchstaben, Symbolen und steuerzeichenähnlichen Zeichen werden, wenn seine Bytes mit einer falschen älteren Zuordnung dekodiert werden. Die Umkehrbarkeit hilft bei der Beurteilung, doch ein kurzer Name oder ein einzelnes Zeichen kann weiterhin mehrdeutig sein. Vergleiche den Kandidaten mit dem ursprünglichen Dokument, dem Datenbankexport, der absendenden Person oder einer anderen maßgeblichen Kopie.
Grenzen und sicherere Wiederherstellung
Dieses Werkzeug erhält Unicode-Text, den der Browser bereits dekodiert hat. Es kann keine zuvor verworfenen Bytes wiederherstellen, die Kodierung einer Binärdatei nicht ermitteln, keine Datenbankspalte reparieren und keinen HTTP-Header Content-Type ändern. Falls kein Kandidat erscheint, behalte das Original. Beschaffe möglichst die tatsächlichen Quellbytes, erstelle eine Sicherung, ermittle die angegebene und die wirkliche Kodierung und dekodiere dann einmalig mit einem Werkzeug für Dateien oder Bytefolgen. Speichere beschädigten Text niemals wiederholt über die einzige Quellkopie.
Häufig gestellte Fragen
Nein. Er bedeutet nur, dass eine bestimmte Annahme zu älteren Bytes als gültiges UTF-8 dekodiert werden konnte und den exakten Byte-Rücklauf bestanden hat. Mehrere Annahmen können denselben oder unterschiedlichen lesbaren Text liefern. Kontext und eine maßgebliche Quelle bleiben erforderlich.
Die sichtbaren Zeichen stellen möglicherweise keine als ISO-8859-1 oder Windows-1252 fehlgelesenen UTF-8-Bytes dar, die Folge kann unvollständig sein oder ein Ersatzzeichen hat bereits Informationen entfernt. Behalte das Original und untersuche die tatsächlichen Bytes sowie die Kodierungsmetadaten.
Nein. Sie vergleicht nur eingefügten Unicode-Text. Sie liest keine Dateien, erkennt keine Dateikodierung, verbindet sich nicht mit einer Datenbank, schreibt keine gespeicherten Werte um und repariert keine Server-Header. Sichere die Quelle, bevor du einen bytegenauen Konvertierungsablauf verwendest.
Nein. Vergleich, Auswahl, Kopieren, TXT-Erstellung und Druckvorbereitung finden in deinem Browser statt. Der Ablaufmodus kann einen geprüften Datensatz bis zu 30 Minuten in diesem Browser-Tab halten und fügt nur eine undurchsichtige Auftrags-ID in die URL ein.
Verwandte Tools
Fantasy-Namensgenerator
Erzeuge Fantasy-Charakternamen nach Volk, Klasse und Gender-Stil für D&D-Kampagnen, Worldbuilding, Romane und NPC-Listen.
Zufallswort-Generator
Generiere zufällige englische Wortlisten. Wähle Alltag, Natur, Kreativ oder Technik, stelle Länge und Anzahl ein und kopiere das Ergebnis.
Akronym-Generator
Generiere Akronyme aus einer Phrase, einem Projektnamen oder einem Thema. Wähle Länge und Tonalität und finde aussprechbare Namen, die im Gedächtnis bleiben.
Englischer -ly-Adverbien-Hervorheber
Füge englischen Text ein, um Wörter mit der Endung -ly zu markieren, inklusive Gesamtzahl und eindeutiger Treffer. Prüfe Fehlertreffer und nicht auf -ly endende Adverbien manuell.
Bibliographie-Generator
Generieren Sie korrekt formatierte Bibliografieeinträge in APA 7, MLA 9, Chicago 17 und Harvard. Bücher, Zeitschriften, Websites, Filme und mehr.
Wortmischer
Mischen Sie die Buchstaben jedes Wortes und behalten Sie den ersten und letzten Buchstaben bei. Ideal für Rätsel, Spiele und Leseübungen.