Die Batch Size legt fest, wie viele Trainingsbeispiele auf einmal verarbeitet werden, bevor das Modell seine Gewichte aktualisiert. Sie ist einer der wichtigsten Hyperparameter beim Training neuronaler Netze.

Die drei Varianten

  • Full Batch: Der gesamte Datensatz wird in einem Durchgang verarbeitet. Präzise, aber langsam und oft nicht in den Speicher passend.
  • Mini-Batch (Standard): Eine feste Zahl von Beispielen (typisch 16, 32, 64 oder 128). Guter Kompromiss aus Geschwindigkeit und Stabilität — das übliche Vorgehen beim Gradient Descent.
  • Stochastic Gradient Descent (SGD): Batch Size 1 — jedes einzelne Beispiel löst ein Update aus. Schnell, aber sehr verrauscht.

Auswirkungen der Größe

Kleine Batches aktualisieren die Gewichte häufiger und führen zu mehr Rauschen, das aus lokalen Minima hinaushelfen kann — sie erlauben oft eine höhere Learning Rate. Große Batches nutzen die GPU effizienter, können aber zu schlechterer Generalisierung führen. Der Speicher (VRAM) setzt die Obergrenze.

Zusammenhang mit Epochen

Eine Epoche besteht aus so vielen Batches, wie der Datensatz geteilt durch die Batch Size ergibt. Bei 1000 Beispielen und Batch Size 100 sind das 10 Updates pro Epoche.

Verwandte Grundlagen: Training, Dataset, Backpropagation.