N-Gramm (auch N-Gram geschrieben) ist eine Folge von n aufeinanderfolgenden Elementen aus einem Text — typischerweise Wörter, Zeichen oder Tokens. Die Zerlegung eines Satzes in N-Gramme ist eine der ältesten und einfachsten Techniken der maschinellen Textverarbeitung und die Grundlage klassischer Sprachmodelle.
Arten von N-Grammen
Der Name ergibt sich aus der Länge n der Folge:
- Unigramm (n=1): einzelne Wörter, z.B. „der", „Hund"
- Bigramm (n=2): Zweierfolgen, z.B. „der Hund"
- Trigramm (n=3): Dreierfolgen, z.B. „der Hund bellt"
Neben Wort-N-Grammen gibt es auch Zeichen-N-Gramme, die etwa zur Sprachidentifikation oder bei fehlertoleranter Suche eingesetzt werden.
N-Gramm-Modelle
Ein N-Gramm-Modell schätzt die Wahrscheinlichkeit des nächsten Wortes aus den letzten n-1 Wörtern (Markov-Annahme). Diese Modelle waren vor den neuronalen Ansätzen der Standard für Textvorhersage und Autovervollständigung. Ihre Grenzen: Bei größerem n werden die Daten dünn (Sparsity), und längere Kontexte bleiben unberücksichtigt — moderne Sprachmodelle lösen das mit Tokenisierung und Aufmerksamkeitsmechanismen.
Anwendungen
- Sprachmodellierung und Autovervollständigung
- Textklassifikation und Spam-Erkennung
- SEO-Analyse von Wortkombinationen
- Plagiats- und Ähnlichkeitserkennung
Verwandte Grundlagen: Bag of Words, TF-IDF, Wortvektor, Word2Vec.