Verstärkendes Lernen

Aus Zweites Gehirn, dem persönlichen Wiki
Verstärkendes Lernen
TypKonzept
QuellenQuelle - Neuronale Netze programmieren mit Python
Erstellt2026-09-27
Aktualisiert2026-09-27
Tagsmaschinelles-lernen, reinforcement-learning, algorithmus

Beim verstärkenden Lernen (Reinforcement Learning) handelt ein Agent in einer Umgebung und bekommt für seine Aktionen Belohnungen oder Strafen. Ohne vorgegebene richtige Antworten lernt er eine Strategie, die die künftige Gesamtbelohnung maximiert. Das bekannteste Verfahren ist Q-Learning, bei grossen Zustandsräumen mit einem neuronalen Netz (Deep Q-Network).

Grundbegriffe

Agent, Umgebung, Zustand s, Aktion a, Belohnung r. Der Agent kennt die Umgebung am Anfang nicht und erkundet sie schrittweise. Er wählt Aktionen so, dass die künftige Gesamtbelohnung gross wird. Spätere Belohnungen werden mit einem Diskontierungsfaktor γ (zwischen 0 und 1) abgewertet, weil sie unsicherer sind (Quelle - Neuronale Netze programmieren mit Python, S. 374–375).

Q-Learning

Von Chris Watkins (1989). Q(s, a) schätzt den künftigen Ertrag, wenn der Agent im Zustand s die Aktion a wählt und danach optimal weiterhandelt. Nach jedem Schritt wird die Schätzung nachgeführt (Temporal Difference Learning, S. 375–376):

Q(s, a) ← Q(s, a) + α · [r + γ · maxₐ′ Q(s′, a′) − Q(s, a)]

mit Lernrate α, erhaltener Belohnung r und dem besten geschätzten Wert im Folgezustand s′. Das Buch nennt die Formel Bellman-Gleichung.

Erkunden oder ausnutzen? Am Anfang weiss der Agent nichts und sollte viel ausprobieren (Exploration), später das Gelernte nutzen (Exploitation). Die ε-greedy-Strategie wählt mit Wahrscheinlichkeit ε eine zufällige Aktion, sonst die mit dem höchsten Q-Wert, und senkt ε mit der Zeit (S. 376–377, 382).

Beispiel: Roboter im Labyrinth

5×5-Gitter, Start unten links, Ausgang oben rechts, drei Hindernisse. Belohnung −1 pro Schritt (gegen zielloses Herumirren), −10 an Wand oder Hindernis, +100 am Ausgang (S. 377–383).

  • Tabellarisches Q-Learning speichert Q für jedes Paar (Zustand, Aktion). Das geht nur bei kleinen Zustandsräumen.
  • Deep Q-Network (DQN): Ein neuronales Netz (25 Eingänge für die Position als One-hot-Vektor, zwei versteckte Schichten mit 24 ReLU-Neuronen, 4 Ausgänge für die Q-Werte der vier Richtungen) schätzt die Q-Werte. Erfahrungen werden in einem Replay Memory gesammelt und in zufälligen Stichproben trainiert, das macht das Lernen stabiler.

DeepMind brachte so einem Netz das Spielen von Atari-Spielen bei (Mnih et al. 2013, S. 45, 355). AlphaGo schlug 2016 den Go-Profi Lee Sedol, AlphaZero lernte 2017 Schach, Go und Shogi nur aus den Spielregeln (S. 304).

Einordnung (Claude)

Die Buchzusammenfassung erwähnt, dass „Lernen durch Belohnung“ aus der Psychologie stammt (Konditionierung). Der Diskontierungsfaktor ist dieselbe Idee wie die Abzinsung künftiger Zahlungen in der Investitionsrechnung der BWL. Verstärkendes Lernen spielt auch bei heutigen Sprachmodellen eine Rolle: Nach dem Vortraining werden sie mit menschlichen Bewertungen feinabgestimmt (Reinforcement Learning from Human Feedback). Das ist Allgemeinwissen und nicht eigens recherchiert. Das Buchbeispiel trainiert nur 10 Episoden, ein gefundener optimaler Pfad ist damit eher Glück als Regel.

Verwandt