| Typ | Konzept |
|---|---|
| Quellen | Quelle - Neuronale Netze programmieren mit Python Quelle - Neuronale Netze selbst programmieren |
| Erstellt | 2026-09-27 |
| Aktualisiert | 2026-09-27 |
| Tags | neuronale-netze, maschinelles-lernen, klassifikation, geschichte |
Das älteste lernfähige Neuronenmodell (Frank Rosenblatt, Ende der 1950er-Jahre): gewichtete Summe der Eingänge plus Stufenfunktion. Es lernt jede linear trennbare Aufgabe sicher, scheitert aber an XOR. Seine Weiterentwicklung Adaline lernt am ungestuften Signal mit der Delta-Regel, mehrere Perzeptronen in Schichten (MLP) lösen XOR.
Aufbau
Das Perzeptron ist ein Linearer Klassifikator mit Stufenfunktion. Seine Knoten heissen deshalb Linear Threshold Unit (LTU) (Quelle - Neuronale Netze programmieren mit Python, S. 84). Die fünf Bausteine (S. 85–97):
- Eingabevektor x = (x₁, …, xₙ)
- Gewichtsvektor w, als Zeilenvektor wᵀ geschrieben
- Gewichtete Summe = Skalarprodukt wᵀ·x = Σ wᵢ·xᵢ (in NumPy
np.dot(w, x)) - Stufenfunktion mit Schwelle θ: 1, wenn die Summe ≥ θ, sonst 0 (Heaviside-Funktion bei θ = 0)
- Ausgabe ŷ
Bias-Trick: Man zieht die Schwelle auf die linke Seite und schreibt sie als Gewicht w₀ = −θ mit einem immer aktiven Eingang x₀ = 1 (Bias-Neuron). Dann genügt die Heaviside-Funktion bei 0, und die Schwelle wird wie jedes andere Gewicht gelernt (S. 96, 109).
Beispiel Personalplanung (S. 74–99): Frau Äppel braucht jeden Tag mindestens einen von zwei Mitarbeitern im Laden. Das ist ein logisches ODER. Mit w = (−1, 1, 1) liefert das Perzeptron für alle vier Fälle das richtige Ergebnis. Für „Loch vor dem Roboter nur, wenn beide Sensoren dunkel melden“ (UND) passt w = (−2, 1, 1) (S. 100–103).
Perzeptron-Lernregel
Gelernt werden nur die Gewichte (S. 107–110):
- w_neu = w_alt + Δw mit Δw = (y − ŷ) · x
- Weil y und ŷ nur 0 oder 1 sind, ist der Fehler −1, 0 oder +1. Stimmt die Ausgabe, ändert sich nichts. Ist sie zu klein, werden die Gewichte der aktiven Eingänge erhöht, ist sie zu gross, gesenkt.
- Jeder Lernschritt verschiebt die Trenngerade (allgemein Hyperebene). Im Buchbeispiel findet das Perzeptron nach 9 Schritten eine Lösung für ODER (S. 117–119).
Das Konvergenztheorem von Rosenblatt sagt: Für jeden linear trennbaren Datensatz findet die Lernregel in endlich vielen Schritten eine Lösung. Ist der Datensatz nicht linear trennbar, hört der Algorithmus nie auf, man muss die Iterationen begrenzen (S. 111, 116, 481). Das Buch programmiert das Perzeptron auch als scikit-learn-kompatiblen Estimator mit den Methoden fit (lernen) und predict (auswerten) und zeigt die fertige Klasse sklearn.linear_model.Perceptron (S. 120–129).
Adaline und Delta-Regel
Das Perzeptron „vergisst“ bei nicht trennbaren Daten immer wieder, was es gelernt hat. Adaline (ADAptive LInear NEuron) von Bernard Widrow und Marcian Hoff (1960) behebt das (S. 129–140):
- Der Fehler wird vor der Stufenfunktion gemessen, am kontinuierlichen Net-Input s: y − s statt y − ŷ.
- Neu ist eine Lernrate η: Δw = η · (y − s) · x (Widrow-Hoff- oder Delta-Regel).
- Dahinter steht die Minimierung des quadratischen Fehlers (Least Mean Square, LMS). Damit ist Adaline der einfachste Fall des Gradientenabstiegs und die Vorstufe der Backpropagation.
- Adaline findet auch bei überlappenden Klassen eine stabile, möglichst gute Trenngerade (S. 287).
Ursprünglich sagte Adaline das nächste Bit auf Telefonleitungen voraus, Madaline filterte Echos (S. 287).
Mehrschichtiges Perzeptron (MLP) und XOR
Soll genau ein Mitarbeiter im Laden sein, ist das XOR. Keine einzelne Gerade trennt (0,1) und (1,0) von (0,0) und (1,1) (S. 143–145; siehe Boolesche Algebra). Die Lösung: zwei Perzeptronen lernen ODER und NICHT-UND, ein drittes verknüpft ihre Ausgaben mit UND (S. 146–149). Mit sigmoiden Neuronen funktionieren die Gewichte −10/20/20 (ODER), 30/−20/−20 (NAND) und −30/20/20 (UND) (S. 161, nachgerechnet).
In Matrixform wird die Auswertung einer Schicht zu net = W · x (numpy.dot(W, x)), dasselbe wie X = W·I in Künstliches neuronales Netz (S. 151–152).
Diese Seite belegt die frühere, unbelegte Einordnung in Linearer Klassifikator (Rosenblatt, Minsky/Papert). Das Jahr des Perzeptrons ist in der Quelle selbst uneinheitlich: 1957 (Erfindung, S. 84), 1958 (Artikel, S. 287), 1959 (Konvergenztheorem, S. 481). Rosenblatts bekannter Artikel „The Perceptron“ erschien 1958. Der Abschnitt zeigt auch, warum Minsky und Papert 1969 so viel Wirkung hatten: Das Problem war nicht XOR an sich, sondern dass es für mehrschichtige Netze noch kein Lernverfahren gab. Das kam erst mit der Backpropagation (siehe Geschichte der neuronalen Netze).
Verwandt
- Linearer Klassifikator – dieselbe Idee ohne Stufenfunktion, bei Rashid hergeleitet
- Künstliches neuronales Netz – viele Perzeptronen in Schichten
- Backpropagation – Lernverfahren für das mehrschichtige Perzeptron
- Gradientenverfahren – die Delta-Regel ist ein Gradientenabstieg
- Boolesche Algebra – UND, ODER, XOR als Lernaufgaben
- Geschichte der neuronalen Netze – Perzeptron, Adaline und KI-Winter
