Eine versteckte Schicht (englisch hidden layer) ist eine Neuronen-Ebene zwischen Eingabe- und Ausgabeschicht eines neuronalen Netzes. Ihre Aktivierungen sind von außen nicht direkt beobachtbar — sie entstehen erst durch die Berechnung des Netzes. Ein Netz mit mindestens einer versteckten Schicht heißt mehrschichtig (Multi-Layer-Perceptron); erst diese Schichten ermöglichen es, nichtlinear separierbare Probleme zu lösen.

Aufbau und Funktion

Jede versteckte Schicht erhält die Ausgaben der vorherigen Schicht, gewichtet sie mit den Verbindungsgewichten, addiert einen Bias und leitet das Ergebnis durch eine Aktivierungsfunktion. Die Ausgabe einer Schicht ist damit die Eingabe der nächsten — beim Forward-Pass wandert das Signal Schicht für Schicht bis zur Ausgabeschicht.

Warum „versteckt"?

„Versteckt" bedeutet nicht, dass die Schicht geheim ist, sondern dass ihre internen Repräsentationen nicht durch die Trainingsdaten vorgegeben werden. Das Netz lernt selbst, welche Merkmale es in diesen Schichten abbildet. In frühen Schichten entstehen oft einfache Muster (Kanten, Formen), in tieferen Schichten zunehmend abstrakte Merkmale — diese Hierarchie ist ein Kernprinzip des Deep Learning.

Universeller Approximator

Der Satz von Cybenko (1989) und ähnliche Ergebnisse von Hornik zeigen: Ein Netz mit einer einzigen versteckten Schicht und geeigneter nichtlinearer Aktivierung kann jede stetige Funktion auf einem kompakten Bereich beliebig genau annähern. Die praktische Grenze liegt nicht in der Existenz, sondern im Lernen: Die Parameter müssen per Backpropagation aus Daten gefunden werden, und die benötigte Breite der Schicht kann exponentiell wachsen. Mehr Schichten (Tiefe) sind in der Praxis oft effizienter als eine extrem breite Schicht.

Praxis

  • Anzahl und Breite: Es gibt keine Faustformel — zu wenige Neuronen führen zu Unteranpassung, zu viele zu Überanpassung (Bias-Varianz-Dilemma).
  • Dropout: Schaltet beim Training zufällig Neuronen versteckter Schichten ab und wirkt so als Regularisierung.
  • Versteckte Schichten in LLMs: Auch Transformer besitzen versteckte Ebenen (Feed-Forward-Blöcke zwischen den Aufmerksamkeitsebenen).

Verwandte Grundlagen: Künstliches Neuron, Multi-Layer-Perceptron, Gewichte im neuronalen Netz.