Text Mining bezeichnet computergestützte Verfahren, um aus großen Mengen unstrukturierter Texte automatisch Muster, Themen und Zusammenhänge zu extrahieren. Es ist die Text-Variante des Data Mining: Statt strukturierter Datenbanken werden Dokumente, Mails, Rezensionen oder Social-Media-Beiträge analysiert.

Die Text-Mining-Pipeline

Typischerweise läuft Text Mining in mehreren Schritten ab: Zuerst wird der Text durch Tokenisierung in einzelne Einheiten zerlegt, Stoppwörter werden entfernt und Wortformen per Stemming oder Lemmatisierung normalisiert. Danach entsteht eine Dokumentenrepräsentation, etwa als Bag of Words oder TF-IDF-Vektor. Auf dieser Basis laufen die eigentlichen Analyseverfahren: Textklassifikation, Clustering, Topic Modeling oder Information Extraction.

Anwendungen

  • Suchmaschinen und Information Retrieval
  • Spam- und Phishing-Erkennung
  • Analyse von Kundenrezensionen und Social Media (siehe Sentiment Analysis)
  • Automatische Zusammenfassungen und Dokumenten-Management

Text Mining arbeitet eng mit der Datenbereinigung zusammen und bildet eine klassische Grundlage des maschinellen Lernens. Moderne Transformer-Modelle und Large Language Models ergänzen die klassischen Verfahren inzwischen um kontextverstehende Ansätze.

Verwandte Grundlagen: Korpus, Sentiment Analysis.