| Typ | Konzept |
|---|---|
| Quellen | Quelle - Neuronale Netze programmieren mit Python |
| Erstellt | 2026-09-27 |
| Aktualisiert | 2026-09-27 |
| Tags | maschinelles-lernen, künstliche-intelligenz, klassifikation |
Maschinelles Lernen (Machine Learning, ML) ist das Teilgebiet der künstlichen Intelligenz, in dem Systeme Muster aus Beispielen lernen und auf unbekannte Fälle verallgemeinern, statt fest programmierte Regeln zu befolgen. Man unterscheidet überwachtes, unüberwachtes, teilüberwachtes und verstärkendes Lernen. Neuronale Netze sind eine Methodenfamilie darin, Deep Learning deren tiefe Variante.
Einordnung
Die „Begriffszwiebel“ des Buchs: Künstliche Intelligenz ⊃ Maschinelles Lernen ⊃ künstliche neuronale Netze ⊃ Deep Learning (Quelle - Neuronale Netze programmieren mit Python, S. 37).
- KI simuliert Verhalten, das Menschen als intelligent deuten. Der Turing-Test (1950) prüft, ob ein Mensch Antworten einer Maschine von denen eines Menschen unterscheiden kann. Er gilt heute als unzureichend, weil Sprachmodelle ihn bestehen können, ohne zu „verstehen“ (S. 38–39). Schwache KI löst konkrete Aufgaben, starke KI soll menschliches Denken insgesamt erreichen.
- Der Begriff Machine Learning stammt von Arthur Samuel (1959). ML ist induktives Lernen: Aus Beispielen entsteht ein Modell, eine vereinfachte Darstellung der Wirklichkeit (S. 41).
Lernarten
| Lernart | Aufgabe | Anwendungen | Beispiele für Verfahren |
|---|---|---|---|
| Überwacht (supervised) | Beispiele mit bekannter Antwort (Label) | Klassifikation, Regression, Zeitreihenprognose | Entscheidungsbaum, Naive Bayes, nächster Nachbar, lineare Regression, SVM, neuronale Netze |
| Unüberwacht (unsupervised) | nur Eingaben, Struktur selbst finden | Clustering, Assoziationsregeln, Kompression | k-means, hierarchisches Clustering, PCA, SOM, Hopfield-Netz |
| Teilüberwacht (semi-supervised) | wenige Labels, viele unbeschriftete Daten | Clustern und Labels auf ganze Cluster übertragen | – |
| Verstärkend (reinforcement) | Agent handelt und erhält Belohnungen | Steuerung, Spiele, Robotik | Q-Learning → Verstärkendes Lernen |
(S. 42, 355–384)
- Regression: Vorhersage eines Zahlenwerts, z.B. Weinqualität aus dem Wetter. Die Gerade wird so gelegt, dass die Summe der quadrierten Abstände minimal ist, dieselbe Fehlerfunktion wie bei Adaline und Backpropagation (S. 357–359). Bei Zeitreihen gleitet ein Fenster über die Vergangenheitswerte, bei kausalen Prognosen dienen Einflussgrössen (Wochentag, Wetter, Fussball-WM) als Eingaben.
- Clustering findet Gruppen, benennen und deuten muss sie ein Mensch (S. 361).
- Assoziationsregeln finden Muster wie „wer Käse und Wurst kauft, kauft auch Brot“ (Warenkorbanalyse, S. 362).
Selbstorganisierende Karte (SOM)
Teuvo Kohonen (1982) bildet hochdimensionale Eingaben auf ein Gitter von Knoten ab, so dass ähnliche Eingaben auf benachbarte Knoten fallen (topologieerhaltend, wie Körperkarten in der Hirnrinde) (S. 269, 301, 362–373):
- Gewichtsvektoren der Knoten zufällig setzen.
- Zufälliges Beispiel wählen, den Knoten mit dem kleinsten euklidischen Abstand suchen (Best Matching Unit, BMU).
- BMU und seine Nachbarn ein Stück in Richtung des Beispiels ziehen. Lernrate und Nachbarschaftsradius schrumpfen mit der Zeit.
Das ist Wettbewerbslernen (competitive learning) ohne Fehlerkorrektur. Im Buchbeispiel sammeln sich die Gewichte einer 4×4-Karte bei den vier XOR-Eingabepunkten.
Das SOM-Beispiel „lernt“ nicht die XOR-Funktion, sondern findet nur die vier Eingabepunkte als Cluster. Die Ausgabe gibt den nächstgelegenen Gewichtsvektor zurück, keinen XOR-Wert. Im Code wird die Nachbarschaft zudem über den Abstand der Gewichtsvektoren bestimmt statt über den Abstand auf dem Kartengitter, wie es die Theorie beschreibt.
Güte eines Klassifikators
Die Konfusionsmatrix stellt vorhergesagte und tatsächliche Klasse gegenüber: richtig positiv (TP), falsch positiv (FP), falsch negativ (FN), richtig negativ (TN). Daraus (S. 385–386):
- Genauigkeit im Sinne der Quelle (üblicher: Präzision) = TP / (TP + FP)
- Sensitivität = TP / (TP + FN)
- Spezifität = TN / (TN + FP)
Buchbeispiel Stoppschild-Erkenner: TP 9, FP 3, FN 6, TN 9 ergibt Präzision 0,75, Sensitivität 0,6, Spezifität 0,75 (nachgerechnet).
Die ROC-Kurve trägt für verschiedene Schwellenwerte die Sensitivität gegen 1 − Spezifität auf. Je näher an der linken oberen Ecke, desto besser. Die Diagonale entspricht Münzwurf. Die Fläche darunter (AUROC) vergleicht Modelle (S. 386–389). Entstanden ist die Methode laut Quelle 1941 in der US-Radartechnik nach Pearl Harbor.
k-nächste Nachbarn
Der einfachste Klassifikator im Anhang: Ein neues Objekt bekommt die Klasse, die unter seinen k nächsten bekannten Nachbarn am häufigsten ist. Mit k = 3 kann das Ergebnis anders ausfallen als mit k = 5, die Wahl von k ist ein Hyperparameter (S. 460–464). Achtung: „kNN“ steht auch für künstliche neuronale Netze.
Vieles hier stand schon 2004 in der Mustererkennung (nächster Nachbar, Clusteranalyse, Bayes, überwacht vs. unüberwacht), damals unter dem Dach der Bildverarbeitung. Die Konfusionsmatrix kennt man aus der Medizin und aus der Biometrie: Sensitivität und Spezifität entsprechen der Falschrückweisung und Falschakzeptanz bei der Zugriffskontrolle. Ob ein Schwellenwert eher auf Sensitivität oder auf Spezifität zielt, ist eine Geschäftsentscheidung über Fehlerkosten, wie beim Bayes-Klassifikator.
Verwandt
- Künstliches neuronales Netz – die wichtigste Methodenfamilie
- Mustererkennung – dieselben Grundideen, Stand 2004
- Verstärkendes Lernen – die dritte Lernart im Detail
- Feature Engineering – Daten für ML vorbereiten
- Überanpassung – Trainings-, Validierungs- und Testdaten
- KI-Ethik – Bias und Erklärbarkeit
- Wissensrepräsentation damals und heute – symbolische vs. lernende KI
