N-Gramm (auch N-Gram geschrieben) ist eine Folge von n aufeinanderfolgenden Elementen aus einem Text — typischerweise Wörter, Zeichen oder Tokens. Die Zerlegung eines Satzes in N-Gramme ist eine der ältesten und einfachsten Techniken der maschinellen Textverarbeitung und die Grundlage klassischer Sprachmodelle.

Arten von N-Grammen

Der Name ergibt sich aus der Länge n der Folge:

  • Unigramm (n=1): einzelne Wörter, z.B. „der", „Hund"
  • Bigramm (n=2): Zweierfolgen, z.B. „der Hund"
  • Trigramm (n=3): Dreierfolgen, z.B. „der Hund bellt"

Neben Wort-N-Grammen gibt es auch Zeichen-N-Gramme, die etwa zur Sprachidentifikation oder bei fehlertoleranter Suche eingesetzt werden.

N-Gramm-Modelle

Ein N-Gramm-Modell schätzt die Wahrscheinlichkeit des nächsten Wortes aus den letzten n-1 Wörtern (Markov-Annahme). Diese Modelle waren vor den neuronalen Ansätzen der Standard für Textvorhersage und Autovervollständigung. Ihre Grenzen: Bei größerem n werden die Daten dünn (Sparsity), und längere Kontexte bleiben unberücksichtigt — moderne Sprachmodelle lösen das mit Tokenisierung und Aufmerksamkeitsmechanismen.

Anwendungen

  • Sprachmodellierung und Autovervollständigung
  • Textklassifikation und Spam-Erkennung
  • SEO-Analyse von Wortkombinationen
  • Plagiats- und Ähnlichkeitserkennung

Verwandte Grundlagen: Bag of Words, TF-IDF, Wortvektor, Word2Vec.