Transformer

Aus Zweites Gehirn, dem persönlichen Wiki
Transformer
TypKonzept
QuellenQuelle - Neuronale Netze programmieren mit Python
Quelle - Recherche - Bildverarbeitung heute 2026
Erstellt2026-09-27
Aktualisiert2026-09-27
Tagsneuronale-netze, deep-learning, sprachverarbeitung, llm

Eine Netzarchitektur (Vaswani et al., „Attention Is All You Need“, 2017), die eine ganze Folge von Tokens gleichzeitig verarbeitet und mit Self-Attention berechnet, wie stark jedes Token auf jedes andere achten soll. Sie ist parallelisierbar, erfasst weite Zusammenhänge und ist die Grundlage der grossen Sprachmodelle.

Grundidee

Ein Transformer ist im Kern ein Nächstes-Token-Schätzer: Er bekommt einen Text (Prompt), gibt für jedes mögliche nächste Token eine Wahrscheinlichkeit aus, hängt eines an und wiederholt das, bis ein Ende-Token kommt (Quelle - Neuronale Netze programmieren mit Python, S. 217–218). Beispiel: „Ein Ritter befindet sich zur Rettung der Prinzessin“ → „auf“ (23 %) → „dem“ (33 %) → … „Weg zur Drachenhöhle.“

Rekurrente Netze (RNN, LSTM) lesen Text Wort für Wort, meist nur in eine Richtung, und verlieren bei langen Texten den Zusammenhang. Transformer sehen die ganze Folge auf einmal und lassen sich deshalb stark parallel trainieren (S. 216).

Bausteine

  • Tokens: Wörter, Wortteile oder Satzzeichen, dazu Start- und Ende-Token. Beispiel eines Tokenizers: „Neuronale“ → neu, ##rona, ##le (S. 219, 262).
  • Embedding: Jedes Token wird ein Vektor, ein Punkt im Bedeutungsraum. Ähnliche Wörter liegen nahe beieinander. GPT-3 verwendet über 12 000 Dimensionen (S. 219).
  • Positionskodierung: Weil alle Tokens gleichzeitig kommen, muss die Position mitgegeben werden, sonst sind „Der Fuchs jagt den Wolf“ und „Der Wolf jagt den Fuchs“ gleich. Einfaches Nummerieren taugt nicht. Vaswani verwendet Sinus- und Kosinuswellen verschiedener Frequenz (Konstante L = 10 000), die zum Embedding addiert werden (S. 219–222).
  • Self-Attention: Für jedes Token werden ein Query- („wonach suche ich?“), ein Key- („was bin ich?“) und ein Value-Vektor („was trage ich bei?“) gelernt. Daraus ergibt sich, wie stark ein Wort auf die anderen achtet. Beispiel: In „Das Tier wagte sich nicht über das Feld, denn es war zu müde“ bezieht sich „es“ auf das Tier, bei „zu breit“ auf das Feld (S. 223–224).
  • Multi-Head Attention: Mehrere Attention-Berechnungen parallel, jede kann auf etwas anderes achten (Grammatik, Bedeutung).
  • Encoder und Decoder: Der Encoder erzeugt eine kontextbezogene Darstellung der Eingabe. Der Decoder erzeugt die Ausgabe autoregressiv Token für Token. Mit maskierter Self-Attention sieht er nur schon erzeugte Tokens, mit Encoder-Decoder-Attention schaut er auf die Eingabe (z.B. den zu übersetzenden Satz) (S. 223–225).
  • Ausgabe: Softmax über alle Tokens. Eine Temperatur steuert, ob immer das wahrscheinlichste Token gewählt wird (0) oder zufällig unter den wahrscheinlichen („Kreativität“) (S. 225).

Training und Nutzung

Trainiert wird wie jedes Netz mit Backpropagation, aber mit sehr viel mehr Text und Rechenleistung (S. 226). Das Buch nutzt vortrainierte Transformer über Hugging Face: Sentiment-Analyse (BERT-Modelle), Zusammenfassung (BART), Bildbeschreibung (BLIP). Das ist Transfer Learning wie beim Faltungsnetz (S. 259–264, 426–428).

Das Buch rechnet Transformer zur generativen KI und CNN zur diskriminativen KI (S. 199, 230).

Einordnung (Claude)

Die Beschreibung mit Encoder und Decoder folgt dem Originalpaper von 2017. Die heutigen grossen Sprachmodelle (GPT-Reihe, Llama, auch Claude) sind in der Regel reine Decoder ohne separaten Encoder, BERT dagegen ist ein reiner Encoder. Der Vision Transformer überträgt dieselbe Architektur auf Bilder, indem er Bildausschnitte als Tokens behandelt (Quelle - Recherche - Bildverarbeitung heute 2026, siehe Mustererkennung). Die Temperatur ist in vielen Programmierschnittstellen nicht auf 0 bis 1 beschränkt. Diese Angaben sind Allgemeinwissen und nicht eigens recherchiert. Für dieses Wiki ist der Transformer die Technik hinter dem LLM Wiki: Das Modell, das Seiten zusammenfasst und verlinkt, ist ein solcher Nächstes-Token-Schätzer.

Verwandt