Transformer-Architektur

Transformer (seit 2017, „Attention Is All You Need") sind die Grundlage moderner Sprachmodelle. Ihr Kern ist der Aufmerksamkeits-Mechanismus: Das Modell gewichtet beim Verarbeiten jedes Tokens die Relevanz aller anderen Tokens im Kontext.

Wie funktioniert Aufmerksamkeit?

Eingabe: "Der Hund lief zur Tür, weil ___ hungrig war."

Das Modell erkennt: "Hund" (maskulin) -> "er" (nicht "sie")
Jedes Token erhält Query, Key, Value-Vektoren;
die Ähnlichkeit (Query·Key) bestimmt das Gewicht.

Die Bausteine

Tokenisierung: Text wird in Token zerlegt (Wörter/Wortteile). Embeddings: Token werden zu Zahlenvektoren. Selbstaufmerksamkeit: Beziehungen zwischen allen Tokens. Feed-Forward-Schichten: Nichtlineare Verarbeitung. Positional Encoding: Reihenfolge-Information.

Von GPT zu Agenten

GPT-Modelle sind Decoder-only-Transformer: Sie sagen Token für Token das nächste voraus. Fine-Tuning und Reinforcement Learning (RLHF) machen sie nützlich und hilfreich. Zusammen mit Werkzeugen und Schleifen entstehen daraus KI-Agenten.

Weiterlesen: LLMs verstehen · Neuronale Netze · Agenten-Workflows