Modellkompression bezeichnet Techniken, mit denen künstliche neuronale Netze und große Sprachmodelle (LLMs) so verkleinert werden, dass sie weniger Speicher, Rechenleistung und Energie benötigen — bei möglichst geringem Qualitätsverlust. Ziel ist es, Deep-Learning-Modelle auch auf Geräten mit begrenzten Ressourcen wie Smartphones, eingebetteten Systemen oder Edge-Geräten ausführen zu können.

Warum ist Modellkompression nötig?

Moderne KI-Modelle werden immer größer: Ein großes Sprachmodell mit 70 Milliarden Parametern benötigt in voller Präzision rund 140 Gigabyte Speicher. Ohne Kompression wären solche Modelle nur auf teuren Server-Clustern mit spezieller Hardware nutzbar. Kompression senkt die Kosten für Inferenz und macht Modelle schneller — wichtig für Inferenz in Echtzeitanwendungen.

Die wichtigsten Techniken

  • Quantisierung: Gewichte werden mit weniger Bits gespeichert (z. B. 32-Bit auf 8-Bit oder 4-Bit). Das reduziert die Modellgröße drastisch. Details: Quantisierung.
  • Pruning: Unwichtige Gewichte oder Neuronen werden entfernt, das Netz wird ausgedünnt. Details: Pruning.
  • Knowledge Distillation: Ein großes Lehrer-Modell gibt sein Wissen an ein kleineres Schüler-Modell weiter, das die Aufgabe mit weniger Parametern lernt.

Quantisierung und Pruning werden häufig kombiniert und erreichen zusammen Kompressionsfaktoren von 10 bis 20. Auch die Architektur selbst kann kompakter sein: Training von vornherein kleinerer Modelle, Faktorisierung von Matrizen oder spezialisierte effiziente Architekturen sind weitere Ansätze.

Praxis

  • Kompression senkt Latenz und Energieverbrauch bei jeder einzelnen Anfrage.
  • Der Qualitätsverlust wird mit Benchmarks auf Validierungsdaten gemessen.
  • Frameworks wie TensorFlow Lite, ONNX Runtime oder llama.cpp unterstützen komprimierte Modelle nativ.

Verwandte Grundlagen: KI-Modell, Künstliche Intelligenz.