Unicode-Suche

Füge ein mysteriöses Zeichen ein, den seltsamen Leerraum, den dein Benutzer eingefügt hat, eine Glyphe aus einer Schriftvorschau, ein Emoji, das deinen Regex bricht, und die Suche gibt seinen Unicode-Codepunkt (U+XXXX) und die rohen UTF-8-Bytes in Hexadezimal zurück, eine Zeile pro Zeichen.

So identifizierst du ein Unicode-Zeichen

  1. 1

    Füge das Zeichen ein

    Du kannst ein Glyph oder eine ganze Zeichenkette einfügen, jedes Zeichen wird der Reihe nach analysiert.

  2. 2

    Lies den Codepunkt

    Erhalte die kanonische U+ Notation in Großbuchstaben, mit Nullen aufgefüllt auf mindestens vier Hexadezimalziffern.

  3. 3

    Untersuche die UTF-8-Bytes

    Sieh dir die 1–4 Byte lange Sequenz an, die das Zeichen auf der Festplatte oder im Netzwerk einnimmt.

  4. 4

    Kopiere die Ergebnisse

    Die Ausgabe ist eine Tabelle im CSV-Format (Zeichen, Codepunkt, UTF-8-Bytes), die du markieren und in eine Tabellenkalkulation oder einen Fehlerbericht einfügen kannst.

Typische Detektivarbeit, die du mit einer Suche durchführen kannst

Die meisten Unicode-Fehler sehen auf dem Bildschirm identisch aus. Der einzige Weg, um einen regulären Leerraum von einem nicht trennbaren Leerraum oder einen geschweiften Apostroph von einem Prime zu unterscheiden, besteht darin, den Codepunkt zu inspizieren.

Häufige Probleme, die die Suche löst

Sieht aus wie Ist tatsächlich Codepunkt
Leerraum Nicht trennbarer Leerraum U+00A0
Leerraum Schmaler nicht trennbarer Leerraum U+202F
(nichts) Nullbreitenraum U+200B
(nichts) Nullbreitenverbinder U+200D
Apostroph Rechter einfacher Anführungszeichen U+2019
Apostroph Prime (Fuß/Minuten) U+2032
Bindestrich Gedankenstrich U+2013
Bindestrich Nicht trennbarer Bindestrich U+2011

UTF-8-Byte-Anordnung auf einen Blick

  • 1 Byte, ASCII, U+0000 bis U+007F (0xxxxxxx)
  • 2 Bytes, Lateinische Ergänzung, Arabisch, Hebräisch (110xxxxx 10xxxxxx)
  • 3 Bytes, CJK, die meisten Symbole (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 Bytes, Emoji, seltene Schriften (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Wenn deine Datenbankspalte eine feste Byte-Länge hat, benötigt ein 4-Byte-Emoji vier Slots, auch wenn es als ein Glyph gerendert wird, eine häufige Quelle für Truncationsfehler.

Häufig gestellte Fragen

In der Regel BOM-Markierungen (U+FEFF) am Anfang der Datei oder verstreute Nullbreitenverbinder von einem Textverarbeitungsprogramm. Füge eines in die Suche ein und es wird dir sofort sagen, was es ist, dann kannst du sie mit einer einfachen Suchen-und-Ersetzen-Funktion entfernen.

Ja. Die Suche iteriert Zeichen für Zeichen, sodass ein ganzes Wort eine Zeile pro Zeichen mit seinem Codepunkt und den UTF-8-Bytes erzeugt.

Ein Codepunkt ist die abstrakte Identität eines Zeichens, U+00E9 ist immer “é”, egal wo du es speicherst. UTF-8 ist eine von mehreren Kodierungen, die einen Codepunkt in Bytes umwandeln; dasselbe “é” ist die zwei Bytes C3 A9 in UTF-8, aber das einzelne Byte E9 in Latin-1.

Ja. Die Suche wird auf unserem Server berechnet: Die eingefügten Zeichen werden übermittelt, analysiert und ihr Codepunkt sowie ihre UTF-8-Bytes werden sofort zurückgegeben. Den übermittelten Text speichern wir nicht.

Verwandte Tools

Tool in anderen Sprachen verfügbar