Neuronale Netze verständlich erklärt

Neuronale Netze sind Rechenmodelle, die grob an Gehirn-Strukturen angelehnt sind. Sie bestehen aus Schichten von „Neuronen", die Eingaben gewichten, summieren und durch Aktivierungsfunktionen leiten.

Der Aufbau

Eingabeschicht -> versteckte Schichten -> Ausgabeschicht

Jedes Neuron:
  z = w1*x1 + w2*x2 + ... + bias
  Ausgabe = Aktivierung(z)   # z.B. ReLU, Sigmoid

Wie lernen Netze?

Beim Training werden die Gewichte w schrittweise angepasst: Der Fehler zwischen Vorhersage und Wahrheit wird berechnet (Loss), und Backpropagation verteilt die Korrektur rückwärts durch alle Schichten. Der Optimierer (z.B. Adam) aktualisiert die Gewichte.

Deep Learning

Viele versteckte Schichten = „tiefes" Netz. Tiefe Netze erkennen hierarchische Muster: Kanten → Formen → Objekte. Sie brauchen viel Daten und Rechenleistung (GPUs). Transformer – die Basis von ChatGPT – sind eine spezielle Architektur mit Aufmerksamkeits-Mechanismen.

Weiterlesen: LLMs verstehen · Maschinelles Lernen · CPU vs. GPU