Ein Korpus (Plural: Korpora) ist eine elektronisch gespeicherte, systematisch zusammengestellte Sammlung von Texten, die für linguistische Analysen oder das Training von NLP-Modellen genutzt wird. Korpora bilden die empirische Grundlage der Korpuslinguistik und vieler Verfahren des Text Mining.

Bekannte Korpora

  • Brown Corpus: eine Million Wörter amerikanischen Englischs, zusammengestellt in den 1960er-Jahren
  • British National Corpus (BNC): rund 100 Millionen Wörter britischen Englischs aus Schrift und gesprochener Sprache
  • Deutsche Korpora wie das DWDS-Kernkorpus

Arten und Verwendung

Korpora können annotiert sein: Zusätzlich zum Rohtext enthalten sie Markierungen wie Wortarten (POS-Tags), Lemmata oder Syntaxbäume. Parallele Korpora enthalten Übersetzungen desselben Textes in mehreren Sprachen und dienen dem Training von Übersetzungssystemen. In der Tokenisierung und bei Verfahren wie TF-IDF wird der Korpus als Referenzmenge für Häufigkeiten und Dokumentfrequenzen benötigt.

Korpora sind auch die Trainingsdaten für Sprachmodelle und viele Ansätze des maschinellen Lernens. Beim Aufbau zählen Ausgewogenheit, Größe und Annotation zu den wichtigsten Qualitätsmerkmalen — ein verzerrter Korpus führt zu verzerrten Modellen.

Verwandte Grundlagen: Text Mining, Sentiment Analysis, Stoppwort, Stemmung, Lemmatisierung, N-Gramm, Wortvektor.