Maschinelles Lernen

Aus Zweites Gehirn, dem persönlichen Wiki
Maschinelles Lernen
TypKonzept
QuellenQuelle - Neuronale Netze programmieren mit Python
Erstellt2026-09-27
Aktualisiert2026-09-27
Tagsmaschinelles-lernen, künstliche-intelligenz, klassifikation

Maschinelles Lernen (Machine Learning, ML) ist das Teilgebiet der künstlichen Intelligenz, in dem Systeme Muster aus Beispielen lernen und auf unbekannte Fälle verallgemeinern, statt fest programmierte Regeln zu befolgen. Man unterscheidet überwachtes, unüberwachtes, teilüberwachtes und verstärkendes Lernen. Neuronale Netze sind eine Methodenfamilie darin, Deep Learning deren tiefe Variante.

Einordnung

Die „Begriffszwiebel“ des Buchs: Künstliche Intelligenz ⊃ Maschinelles Lernen ⊃ künstliche neuronale Netze ⊃ Deep Learning (Quelle - Neuronale Netze programmieren mit Python, S. 37).

  • KI simuliert Verhalten, das Menschen als intelligent deuten. Der Turing-Test (1950) prüft, ob ein Mensch Antworten einer Maschine von denen eines Menschen unterscheiden kann. Er gilt heute als unzureichend, weil Sprachmodelle ihn bestehen können, ohne zu „verstehen“ (S. 38–39). Schwache KI löst konkrete Aufgaben, starke KI soll menschliches Denken insgesamt erreichen.
  • Der Begriff Machine Learning stammt von Arthur Samuel (1959). ML ist induktives Lernen: Aus Beispielen entsteht ein Modell, eine vereinfachte Darstellung der Wirklichkeit (S. 41).

Lernarten

Lernart Aufgabe Anwendungen Beispiele für Verfahren
Überwacht (supervised) Beispiele mit bekannter Antwort (Label) Klassifikation, Regression, Zeitreihenprognose Entscheidungsbaum, Naive Bayes, nächster Nachbar, lineare Regression, SVM, neuronale Netze
Unüberwacht (unsupervised) nur Eingaben, Struktur selbst finden Clustering, Assoziationsregeln, Kompression k-means, hierarchisches Clustering, PCA, SOM, Hopfield-Netz
Teilüberwacht (semi-supervised) wenige Labels, viele unbeschriftete Daten Clustern und Labels auf ganze Cluster übertragen –
Verstärkend (reinforcement) Agent handelt und erhält Belohnungen Steuerung, Spiele, Robotik Q-Learning → Verstärkendes Lernen

(S. 42, 355–384)

  • Regression: Vorhersage eines Zahlenwerts, z.B. Weinqualität aus dem Wetter. Die Gerade wird so gelegt, dass die Summe der quadrierten Abstände minimal ist, dieselbe Fehlerfunktion wie bei Adaline und Backpropagation (S. 357–359). Bei Zeitreihen gleitet ein Fenster über die Vergangenheitswerte, bei kausalen Prognosen dienen Einflussgrössen (Wochentag, Wetter, Fussball-WM) als Eingaben.
  • Clustering findet Gruppen, benennen und deuten muss sie ein Mensch (S. 361).
  • Assoziationsregeln finden Muster wie „wer Käse und Wurst kauft, kauft auch Brot“ (Warenkorbanalyse, S. 362).

Selbstorganisierende Karte (SOM)

Teuvo Kohonen (1982) bildet hochdimensionale Eingaben auf ein Gitter von Knoten ab, so dass ähnliche Eingaben auf benachbarte Knoten fallen (topologieerhaltend, wie Körperkarten in der Hirnrinde) (S. 269, 301, 362–373):

  1. Gewichtsvektoren der Knoten zufällig setzen.
  2. Zufälliges Beispiel wählen, den Knoten mit dem kleinsten euklidischen Abstand suchen (Best Matching Unit, BMU).
  3. BMU und seine Nachbarn ein Stück in Richtung des Beispiels ziehen. Lernrate und Nachbarschaftsradius schrumpfen mit der Zeit.

Das ist Wettbewerbslernen (competitive learning) ohne Fehlerkorrektur. Im Buchbeispiel sammeln sich die Gewichte einer 4×4-Karte bei den vier XOR-Eingabepunkten.

Einordnung (Claude)

Das SOM-Beispiel „lernt“ nicht die XOR-Funktion, sondern findet nur die vier Eingabepunkte als Cluster. Die Ausgabe gibt den nächstgelegenen Gewichtsvektor zurück, keinen XOR-Wert. Im Code wird die Nachbarschaft zudem über den Abstand der Gewichtsvektoren bestimmt statt über den Abstand auf dem Kartengitter, wie es die Theorie beschreibt.

Güte eines Klassifikators

Die Konfusionsmatrix stellt vorhergesagte und tatsächliche Klasse gegenüber: richtig positiv (TP), falsch positiv (FP), falsch negativ (FN), richtig negativ (TN). Daraus (S. 385–386):

  • Genauigkeit im Sinne der Quelle (üblicher: Präzision) = TP / (TP + FP)
  • Sensitivität = TP / (TP + FN)
  • Spezifität = TN / (TN + FP)

Buchbeispiel Stoppschild-Erkenner: TP 9, FP 3, FN 6, TN 9 ergibt Präzision 0,75, Sensitivität 0,6, Spezifität 0,75 (nachgerechnet).

Die ROC-Kurve trägt für verschiedene Schwellenwerte die Sensitivität gegen 1 − Spezifität auf. Je näher an der linken oberen Ecke, desto besser. Die Diagonale entspricht Münzwurf. Die Fläche darunter (AUROC) vergleicht Modelle (S. 386–389). Entstanden ist die Methode laut Quelle 1941 in der US-Radartechnik nach Pearl Harbor.

k-nächste Nachbarn

Der einfachste Klassifikator im Anhang: Ein neues Objekt bekommt die Klasse, die unter seinen k nächsten bekannten Nachbarn am häufigsten ist. Mit k = 3 kann das Ergebnis anders ausfallen als mit k = 5, die Wahl von k ist ein Hyperparameter (S. 460–464). Achtung: „kNN“ steht auch für künstliche neuronale Netze.

Einordnung (Claude)

Vieles hier stand schon 2004 in der Mustererkennung (nächster Nachbar, Clusteranalyse, Bayes, überwacht vs. unüberwacht), damals unter dem Dach der Bildverarbeitung. Die Konfusionsmatrix kennt man aus der Medizin und aus der Biometrie: Sensitivität und Spezifität entsprechen der Falschrückweisung und Falschakzeptanz bei der Zugriffskontrolle. Ob ein Schwellenwert eher auf Sensitivität oder auf Spezifität zielt, ist eine Geschäftsentscheidung über Fehlerkosten, wie beim Bayes-Klassifikator.

Verwandt