Datenqualität beschreibt, wie gut Daten für ihren jeweiligen Verwendungszweck geeignet sind. Sie ist die Voraussetzung für verlässliche Analysen, Berichte, maschinelles Lernen und automatisierte Entscheidungen – schlechte Daten erzeugen schlechte Ergebnisse, egal wie gut die Algorithmen sind.

Dimensionen der Datenqualität

Klassisch etabliert sind sechs Dimensionen (DAMA-DMBOK, ISO 8000):

  • Vollständigkeit: Sind alle benötigten Felder und Datensätze vorhanden?
  • Korrektheit / Genauigkeit: Entsprechen die Werte der Realität?
  • Konsistenz: Widersprechen sich Datenbestände nicht (etwa verschiedene Schreibweisen derselben Kundin)?
  • Aktualität: Spiegeln die Daten den aktuellen Stand wider?
  • Eindeutigkeit: Gibt es keine Duplikate oder Mehrdeutigkeiten?
  • Validität: Erfüllen die Werte die definierten Formate und Regeln?

Warum ist Datenqualität wichtig?

Laut Gartner kosten schlechte Daten Unternehmen im Schnitt rund 12,9 Millionen US-Dollar pro Jahr – durch Fehlentscheidungen, manuelle Korrekturen und verpasste Chancen. Fehlerhafte Stammdaten, doppelte Kundeneinträge oder falsche Messwerte pflanzen sich durch Datenintegration, Data Pipelines und Data Mining bis in die Entscheidungsebene fort.

Messung und Verbesserung

  • Data Profiling: Bestandsaufnahme der Ist-Qualität: fehlende Werte, Verteilungen, Anomalien.
  • Qualitätsregeln und Scorecards: Automatisierte Prüfungen (z. B. Pflichtfelder, Formatchecks) liefern messbare Kennzahlen je Dimension.
  • Frameworks: Das Data Quality Assessment Framework (DQAF) und Total Data Quality Management (TDQM) definieren zyklische Verbesserungsprozesse.
  • Bereinigung: Deduplizierung, Standardisierung und Korrektur direkt an der Quelle oder während der Verarbeitung.

Ein sauberes Datenmodell wie die Datenbank-Normalisierung verhindert Redundanzen und erleichtert konsistente Daten. Die organisatorische Absicherung übernimmt Data Governance, denn Qualitätsregeln müssen definiert, verantwortet und durchgesetzt werden. Auch Big Data-Projekte stehen und fallen mit der Qualität ihrer Datenbasis.

Verwandte Grundlagen: Data Governance, Datenintegration, Data Mining, Datenbank-Normalisierung, Big Data.