N-Gramm-Extraktor
Ein N-Gramm ist eine zusammenhängende Folge von n Wörtern in einem Text. Dieser Extraktor wandelt Ihren Text in Kleinbuchstaben um, zerlegt ihn an jedem Leerzeichen und jedem Satzzeichen in Wörter und zählt anschließend jedes N-Gramm der von Ihnen gewählten Länge (1 bis 8). Das Ergebnis ist eine CSV-Häufigkeitstabelle, sortiert von der häufigsten zur seltensten Wortfolge: genau die Tabelle, auf der Keyword-Dichte-Prüfungen im SEO, die Glättung von Sprachmodellen und die Plagiatserkennung aufbauen.
So extrahieren Sie N-Gramme
-
1
Text einfügen
Fügen Sie einen Artikel, ein Transkript oder einen Produkttext ein. Für vernünftige Eingaben gibt es keine Längenbeschränkung.
-
2
n wählen
Unigramme (1), Bigramme (2), Trigramme (3) und bis zu 8. Pro Durchlauf eine Länge.
-
3
Extrahieren
Der Text wird in Kleinbuchstaben umgewandelt und in Wörter zerlegt; Satzzeichen gelten als Trennzeichen und entfallen.
-
4
Häufigkeitstabelle lesen
Jedes N-Gramm erscheint mit der Anzahl seiner Vorkommen, sortiert nach Häufigkeit.
-
5
CSV kopieren
Die Ausgabe ist kommagetrennt (N-gram,Count) und lässt sich direkt in eine Tabellenkalkulation einfügen.
Was Ihnen jede N-Gramm-Länge verrät
| N | Name | Anwendungsfall |
|---|---|---|
| 1 | Unigramm | Keyword-Dichte, Themenzuordnung |
| 2 | Bigramm | Wortfolgen (“search intent”, “page speed”), Kollokationen |
| 3 | Trigramm | Long-Tail-Phrasen, Merkmalserkennung |
| 4+ | Viergramm und länger | Erkennung doppelter Inhalte, Plagiatshinweise |
Wie das Tool Ihren Text zerlegt
- Alles wird kleingeschrieben, damit “The” und “the” in derselben Zeile landen.
- Ein Wort ist jede zusammenhängende Folge aus Buchstaben, Ziffern oder Apostrophen. Jedes andere Zeichen (Satzzeichen, Symbole, Zeilenumbrüche) gilt als Trennzeichen und wird verworfen.
- Satzgrenzen bleiben nicht erhalten. Das letzte Wort eines Satzes und das erste Wort des nächsten können trotzdem ein N-Gramm bilden. Betrachten Sie satzübergreifende Paare deshalb mit Vorsicht und analysieren Sie notfalls Satz für Satz oder Absatz für Absatz.
- Stoppwörter bleiben erhalten. Es wird nichts für Sie herausgefiltert: Wenn Sie nur semantische Wortfolgen wollen, löschen Sie diese Zeilen anschließend aus der CSV-Datei.
- Wörter werden anhand von Leerzeichen und Satzzeichen erkannt. Das Deutsche trennt Wörter durch Leerzeichen, das Tool funktioniert also sofort. Beachten Sie allerdings die deutsche Zusammenschreibung: Was im Englischen ein Bigramm ist (“search intent”), ist im Deutschen oft ein einziges Wort (“Suchintention”), weshalb Unigramme hier mehr aussagen. Chinesisch, Japanisch und Thai setzen dagegen keine Leerzeichen zwischen die Wörter: Ein ganzer Satz kommt als ein einziges Wort an und muss vorher segmentiert werden (jieba, MeCab, ein Thai-Wortsegmentierer).
Wann Sie Stoppwörter entfernen sollten
Stoppwörter sind hochfrequente Funktionswörter, im Englischen “the”, “a”, “of”, “and”, im Deutschen “der”, “die”, “und”, “von”. Behält man sie, füllt sich die Bigramm-Liste mit Ballast wie “of the” und “von der”. Dieser Extraktor behält sie, löschen Sie die entsprechenden Zeilen also aus dem Export, wenn Sie semantische Wortfolgen suchen. Behalten Sie sie, wenn Sie Stil, Autorschaftszuordnung oder Sprachmodelle untersuchen, bei denen gerade die Funktionswörter das Signal tragen.
SEO-Anwendungsfall
Für einen Artikel, der auf “nginx config generator” abzielt, prüfen Sie:
- Ob Ihr Ziel-Bigramm und -Trigramm in den Top 20 auftauchen. Steht “nginx config” auf Rang 40, verwenden Sie den Begriff vermutlich zu selten.
- Ob Sie keine Keywords stopfen. Steht der Begriff mit großem Abstand auf Rang 1, liest sich der Text wie Spam.
- Ob semantische Nachbarn vorhanden sind. Verwandte Bigramme wie “server block”, “proxy pass” und “ssl certificate” signalisieren Suchmaschinen, dass das Thema wirklich abgedeckt ist.
Nutzung in NLP und Wissenschaft
- Sprachmodelle nutzen N-Gramm-Häufigkeiten für Glättung und Backoff (Kneser-Ney, Good-Turing).
- Autorschaftsstudien vergleichen Trigramm-Verteilungen zwischen möglichen Autoren.
- Die Bewertung maschineller Übersetzung (BLEU) misst die N-Gramm-Überlappung zwischen Maschinenübersetzung und Referenzübersetzung.
Häufig gestellte Fragen
Alles von einem Tweet (wo N-Gramme kaum aussagekräftig sind) bis zu einem Buchkapitel. Für statistisch belastbare Bigramme brauchen Sie mehr als 1.000 Wörter, für Trigramme mehr als 10.000. Darunter sind die Ranglisten verrauscht.
Hier nicht. Der Text wird vor dem Zählen immer in Kleinbuchstaben umgewandelt, sodass “The” und “the” (ebenso “Apple” und “apple”) in einer Zeile zusammenfallen statt sich aufzuteilen. Einen Modus mit Groß-/Kleinschreibung gibt es nicht: Wenn Sie Eigennamen oder Code getrennt halten müssen, markieren Sie sie vor dem Einfügen im Text.
Sie wirken als Worttrenner und tauchen nie innerhalb eines N-Gramms auf. Sie unterbrechen jedoch nicht das Zählfenster: Das letzte Wort eines Satzes und das erste Wort des nächsten werden weiterhin als ein Bigramm gezählt. Wenn Sie strikte Satzgrenzen brauchen, verarbeiten Sie Sätze oder Absätze einzeln.
Nur wenn Sie den Text vorher segmentieren. Wörter werden als Folgen von Buchstaben und Ziffern zwischen Trennzeichen erkannt, und diese Sprachen schreiben ohne Leerzeichen zwischen den Wörtern, sodass ein ganzer Satz als ein einziges Wort ankommt. Lassen Sie den Text zuerst durch einen Segmentierer laufen (jieba, MeCab, ein Thai-Wortsegmentierer), sodass die Wörter durch Leerzeichen getrennt sind, und fügen Sie erst dann das Ergebnis ein. Deutsch und andere Sprachen mit Leerzeichen funktionieren direkt.
Das Tool wendet keine an, Sie filtern also nach dem Export. Die gängigste englische Liste ist das NLTK-Set mit 179 Wörtern, das die meisten SEO-Tools verwenden. Snowball, SpaCy und scikit-learn liefern leicht abweichende Listen. Für Deutsch nehmen Sie die deutsche Stoppwortliste aus NLTK oder spaCy.
Verwandte Tools
Benutzernamen-Generator
Erstelle Benutzernamen-Ideen aus einem Startwort, optional mit Zahlen und Trennzeichen. Praktisch für neue Konten, Gamer-Tags und Zweitprofile.
Firmennamen-Generator
Generiere Ideen für Firmennamen aus deiner Branche oder einem Stichwort. Kombiniert geschäftliche Vor- und Nachsilben zu 5 bis 40 Vorschlägen zum Aussortieren.
Kleiner-gleich-Zeichen
Kopiere das Zeichen ≤ und verwandte mathematische Vergleichszeichen. Enthält Unicode, HTML-Entitäten und LaTeX-Auszeichnung für Tabellenkalkulationen, wissenschaftliche Arbeiten und Webseiten.
Pfeilsymbole zum Kopieren
Kopiere gängige Unicode-Pfeile mit einem Klick: gerade, doppelte, diagonale, hakenförmige, kreisförmige und dreieckige Pfeile für Dokumente, Chats und Designs.
Glitch-Text-Generator
Erstelle Zalgo-artigen Glitch-Text mit kombinierenden Unicode-Zeichen. Wähle die Intensität, prüfe Varianten und kopiere beschädigt wirkenden Text für Profile, Memes oder Horror-Posts.
Städtenamen-Generator
Generiere fiktive Namen für Städte, Kleinstädte, Dörfer und Hauptstädte für Worldbuilding, Karten, Spiele, Geschichten und Testdaten, mit kurzen Notizen zu jedem Ergebnis.
Tool in anderen Sprachen verfügbar
- Extracteur de n-grammes [FR]
- N-그램 추출기 [KO]
- مستخرج N-gram [AR]
- Trình trích xuất N-gram [VI]
- Ekstraktor N-gram [ID]
- N-gram-extractor [NL]
- N-gram-extraktor [SV]
- Ekstraktor n-gramów [PL]
- เครื่องมือแยก N-gram [TH]
- N-gram 抽出ツール [JA]
- Extractor de n-gramas [ES]
- Extrator de n-gramas [PT]
- N-gram Extractor [EN]
- Estrattore di n-grammi [IT]
- Экстрактор N-грамм [RU]
- N-gram Çıkarıcı [TR]
- N-gram 提取器 [ZH]