Stemmung (englisch stemming) ist ein Verfahren der Textnormalisierung, das verschiedene Wortformen auf einen gemeinsamen Wortstamm zurückführt. Dazu werden Endungen regelbasiert abgeschnitten: „laufen", „lief", „läuft" werden beispielsweise auf den Stamm „lauf" reduziert. Ziel ist, dass zusammengehörige Wortformen bei der Suche oder Analyse als gleich behandelt werden.

Wie funktioniert Stemming?

Der bekannteste Algorithmus ist der Porter-Stemmer, den Martin Porter 1979/1980 für die englische Sprache entwickelte. Er wendet eine Folge von Ersetzungs- und Abschneideregeln an, die nach bestimmten Kriterien nur auf passende Wortenden wirken. Daraus entstand die Stemmer-Sprache Snowball, in der Porter später verbesserte Stemmer für mehrere Sprachen formulierte. Weitere Beispiele sind der Lancaster-Stemmer oder der deutsche Snowball-Stemmer.

Stemming ist ein rein mechanisches Verfahren: Es arbeitet ohne Wörterbuch und ohne Grammatikwissen. Der entstehende Stamm ist nicht immer ein echtes Wort („running" wird zu „run", „studies" zu „studi"), reicht aber für den Vergleich von Wortformen meist aus.

Stemmung im Textverarbeitungsprozess

Nach der Tokenisierung und der Entfernung von Stoppwörtern ist die Stemmung ein typischer Schritt der Vorverarbeitung. Sie wird zum Beispiel beim Aufbau eines Bag of Words eingesetzt, damit „Haus", „Häuser" und „Häusern" in derselben Spalte der Dokument-Matrix landen. Auch für n-Gramm-Modelle werden Wortformen häufig vorher gestemmt, um die Datenmenge zu verkleinern.

Stemmung im Vergleich zur Lemmatisierung

Die Lemmatisierung arbeitet präziser: Sie führt eine Wortform mit Wörterbuch und Wortart-Erkennung auf die Grundform zurück („lief" → „laufen", „besser" → „gut"). Stemming ist dagegen schneller und einfacher, dafür ungenauer und kann Wörter verschiedener Bedeutung auf denselben Stamm werfen („bank" als Geldinstitut und Ufer). Die Wahl hängt vom Anwendungsfall ab: Für schnelle Volltextsuche genügt oft Stemming, für semantische Analysen ist Lemmatisierung besser geeignet.

Verwandte Grundlagen: Lemmatisierung, Stoppwort, Tokenisierung, Token.