| Typ | Konzept |
|---|---|
| Quellen | Quelle - Neuronale Netze programmieren mit Python |
| Erstellt | 2026-09-27 |
| Aktualisiert | 2026-09-27 |
| Tags | maschinelles-lernen, daten, datenaufbereitung, prozess |
Feature Engineering ist die Aufbereitung von Rohdaten zu einer Tabelle mit Zahlen, mit der ein Lernverfahren arbeiten kann: Merkmale kodieren, skalieren, extrahieren, kombinieren und auswählen. Es ist der aufwendigste Teil jedes Machine-Learning-Projekts und steht im Prozessmodell CRISP-DM in der Phase Datenvorbereitung.
Der Prozess: CRISP-DM
Der Cross Industry Standard Process for Data Mining (Ende der 1990er-Jahre) hat sechs Phasen, die im Kreis laufen und immer wieder zurückspringen (Quelle - Neuronale Netze programmieren mit Python, S. 309–313):
- Geschäftsverständnis: Ziele, Erfolgskriterien, Datenquellen, Kosten-Nutzen, Risiken. Hier gehören auch Ethik und Recht hin (siehe KI-Ethik).
- Datenverständnis: Daten sammeln und ihre Qualität prüfen, noch ohne sie zu verändern.
- Datenvorbereitung: auswählen, bereinigen, kombinieren → ML-bereiter Datensatz.
- Modellierung: Verfahren wählen, Parameter bestimmen.
- Evaluation: Erfüllt das Modell die Geschäftsziele (nicht nur die Genauigkeit)?
- Einsatz: in Betrieb nehmen, beobachten, Abschlussbericht.
Beispiel des Buchs: Ein Online-Verlag will vorhersagen, welche Artikel viele Klicks bekommen. Schon die Klickzahlen müssen mühsam aus Webserver-Logdateien geholt werden.
Ein ML-bereiter Datensatz ist eine einzige Tabelle: jede Zeile ein Beispiel (Sample), jede Spalte ein Merkmal (Feature) (S. 325). Relationale Datenbanken müssen dafür „verflacht“ werden (S. 339). Andrew Ng: „Applied Machine Learning is basically feature engineering.“ Data Scientists sagen oft, 80 % ihrer Zeit gehe in die Datenaufbereitung (S. 324–325).
Merkmale kodieren
- Kategorisch, nominal (Haarfarbe, ohne Reihenfolge) → One-Hot-Encoding: je ein 0/1-Wert pro Kategorie. Nachteil: Die Dimension wächst (S. 328–329).
- Kategorisch, ordinal (Schulnoten) → Label Encoding: Nummerieren. Achtung:
LabelEncodersortiert alphabetisch und zerstört die Reihenfolge (Fehler im Buch, S. 327–328). - Numerisch:
- Binning: in Klassen einteilen (Altersgruppen), mit gleicher Breite, nach Quantilen (gleich viele Werte pro Klasse) oder logarithmisch bei Werten über mehrere Grössenordnungen (S. 331–334).
- Skalieren: Neuronale Netze reagieren stark auf den Wertebereich, Entscheidungsbäume nicht. Min-Max-Skalierung auf 0 bis 1 (empfindlich für Ausreisser, Abhilfe: Perzentilgrenzen) oder Standardisierung auf Mittelwert 0 und Varianz 1 (S. 334–335).
- Zeit: Tageszeit in Perioden einteilen (frühmorgens, morgens, mittags …) oder den Abstand zu Ereignissen verwenden (Zahltag, Weihnachten) (S. 335–336).
- Ort: Adressen in Koordinaten umwandeln (Geocoding, z.B. mit
geopy). Zwei Kartenzahlungen weit auseinander innerhalb einer Stunde deuten auf Betrug (S. 336–337).
Merkmale extrahieren
- Text: säubern, Stoppwörter entfernen, auf den Wortstamm kürzen (Stemming), in Tokens zerlegen. Dann Bag-of-Words (Wortzählungen) oder TF-IDF: Termhäufigkeit mal log(Anzahl Dokumente / Dokumente mit dem Wort). Häufige Allerweltswörter werden abgewertet, seltene, bedeutungstragende aufgewertet (S. 340–345).
- Bilder: Faltungsnetze extrahieren die Merkmale selbst (siehe Faltungsnetz). Wichtig ist genügend Material, notfalls durch Datenaugmentation (S. 345–346, siehe Überanpassung).
Fluch der Dimensionalität
Die nötige Datenmenge wächst exponentiell mit der Zahl der Merkmale, im hochdimensionalen Raum liegen alle Punkte weit auseinander, und die Intuition aus zwei oder drei Dimensionen versagt (S. 347). Zwei Auswege:
- Transformation (Merkmale kombinieren): wissensbasiert, z.B. Body-Mass-Index aus Gewicht und Grösse oder Vegetationsindex NDVI aus Rot und nahem Infrarot, oder automatisch mit der Hauptkomponentenanalyse (PCA): ein neues Koordinatensystem aus unkorrelierten Richtungen, von denen man nur die wichtigsten behält (S. 347–351).
- Auswahl: Filtermethoden bewerten jedes Merkmal einzeln statistisch (z.B. Chi-Quadrat-Test), Wrapper-Methoden probieren Kombinationen mit einem Modell aus (z.B. rekursive Merkmalselimination) (S. 352–353). Beim Iris-Datensatz bleiben so die Blütenblatt-Masse übrig.
Vieles davon kennt man aus der Bildverarbeitung von 2004 unter dem Namen Merkmalsextraktion und Merkmalsauswahl (siehe Mustererkennung: „ein gutes Merkmal hat grossen Mittelwertabstand bei kleiner Streuung“). Datenverflachung ist die Umkehrung der Normalisierung relationaler Datenbanken. TF-IDF ist das klassische Gewicht der Volltextsuche und bis heute der Kern vieler Suchmaschinen, auch neben der Vektorsuche in Retrieval-Augmented Generation. Die Standardisierung (Mittelwert 0, Varianz 1) ist die z-Transformation aus der Statistik.
Verwandt
- Maschinelles Lernen – wofür die Daten aufbereitet werden
- Merkmalsextraktion – Merkmale in der Bildverarbeitung
- Mustererkennung – Merkmalsraum und Merkmalsauswahl
- KI-Ethik – Bias steckt oft schon in den Daten
- Überanpassung – zu viele Merkmale, zu wenige Daten
- Transformer – Tokenisierung und Embeddings statt Bag-of-Words
- Marktforschung – Datenerhebung und Gütekriterien in der BWL
