Merkmalsextraktion

Aus Zweites Gehirn, dem persönlichen Wiki
Merkmalsextraktion
TypKonzept
QuellenQuelle - Bildverarbeitung Zusammenfassung
Quelle - Recherche - Bildverarbeitung heute 2026
Erstellt2026-09-24
Aktualisiert2026-09-26
Tagsbildverarbeitung, merkmale, repräsentation

Beschreibt segmentierte Objekte durch charakteristische Zahlenwerte (Merkmale, Deskriptoren) und Datenstrukturen. Das reduziert die Datenmenge stark und ist die Grundlage für die Klassifikation.

Vom Segment zum Objekt

  • Etikettierung (Labeling): Jede Zusammenhangskomponente eines Binärbildes (abhängig von N4 oder N8) bekommt eine Marke → Label-Bild.
  • Kontur: Die Randpixel genügen für die geometrische Beschreibung (Quelle - Bildverarbeitung Zusammenfassung).

Repräsentation von Konturen und Regionen

  • Kettencode (chain code): Startpunkt plus die Richtungen zum jeweils nächsten Randpixel (N = 4, 8, 16, 24). Die Gestaltungsnummer ist eine davon unabhängige, reihenfolgeinvariante Zahl.
  • Polygonapproximation: Konturabschnitte werden durch Geraden ersetzt (Split-and-Merge oder Suche nach dem längsten Segment).
  • Fourierdeskriptoren: Die Kontur wird als komplexe Folge x + jy aufgefasst, ihre Fourierkoeffizienten beschreiben die Form. Translation, Rotation und Skalierung wirken sich bekannt aus (auf Phase oder Betrag) → Fourier-Transformation.
  • Quadtree: Eine Region wird so lange in vier Teile geteilt, bis jeder Teil einheitlich ist; daraus entsteht eine Baumstruktur.
  • Skelettierung (Thinning): Flächen werden auf 1 Pixel breite Mittellinien reduziert. Die drei Kriterien: Zusammenhang erhalten, Endpunkte erhalten, nur Konturpixel löschen. Zu löschende Pixel werden erst vorgemerkt und dann gemeinsam gelöscht, damit alle Pixel gleich behandelt werden (Isotropie). Algorithmen: 3×3-Masken, Zhang/Suen, Mittelachse.

Geometrische Merkmale und Deskriptoren

Merkmal Bedeutung
Fläche F Zahl der Objektpixel (nulltes Moment)
Schwerpunkt erste Momente; die zweiten Momente liefern die Trägheitsachse und damit die Orientierung
Umfang U Länge der Kontur (cracks) oder des Pixelrands; eine allgemein exakte Formel gibt es nicht
Kompaktheit / Formfaktor U²/(4πF), bei einem Kreis = 1
Durchmesser, Projektion grösste Ausdehnung bzw. „Schatten“ auf eine Gerade
Elongation Breite/Durchmesser, klein = langgestreckt
Eulerzahl E = C − H (Komponenten minus Löcher), invariant gegenüber Rotation, Skalierung, Scherung
Momente (p+q)-ter Ordnung bezogen auf den Schwerpunkt; invariant gegenüber Translation (und normiert gegenüber Rotation und Skalierung)
Textur Rauhigkeit, Kontrast, Entropie → Bildsegmentierung
Einordnung (Claude)

Die Quelle nennt Momente pauschal „invariant gegenüber Translation, Rotation und Umskalierung“. Zentrale Momente sind aber nur translationsinvariant. Für Rotations- und Skalierungsinvarianz braucht es normierte bzw. abgeleitete Momente (z.B. die Hu-Momente).

Die Auswahl geeigneter Merkmale entscheidet über den Erfolg der Klassifikation → Mustererkennung.

Aus den Abbildungen der Quelle

  • Polygonapproximation, Suche nach dem längsten Segment (S. 68): Die Gerade von A aus wird so weit verlängert, wie alle Konturpunkte höchstens d von ihr abweichen.
  • Fourierdeskriptoren (S. 68): a(k) = (1/N)·Σᵣ f(r)·e^(−j2πkr/N) mit f(r) = x(r) + j·y(r). Das Diagramm zeigt, dass verschiedene Objekte unterschiedliche Betragsspektren |a(k)| haben, die schnell abfallen. Wenige Koeffizienten genügen.
  • Momente (S. 69–70): m_pq = Σᵣ Σₛ f(r,s)·(r − r_s)ᵖ·(s − s_s)^q um den Schwerpunkt (r_s, s_s).
  • Einfache Deskriptoren (S. 69): Fläche F, Umfang U, Kompaktheit K = U²/(4π·F) (Kreis ≈ 1), Eulerzahl E = C − H (Komponenten minus Löcher). Beispiele: „A“ E = 1 − 1 = 0, „B“ E = 1 − 2 = −1, „C“ E = 1 − 0 = 1.
  • Quadtree (S. 70): Ein 4×4-Bild wird rekursiv in Viertel geteilt, bis jedes Blatt einheitlich weiss (w) oder schwarz (s) ist.
  • Skelettierung mit 3×3-Masken (S. 70–71, 140): Für jedes Kriterium gibt es Beispielmasken (Zusammenhang, Endpunkt, Konturpixel). Algorithmus:
    1. Alle Konturpixel markieren.
    2. Jedes Konturpixel mit 9 Grundmasken prüfen, gedreht und gespiegelt ergibt das 72 Varianten. Passt keine Maske, wird das Pixel zum Löschen vorgemerkt.
    3. Vorgemerkte Pixel löschen und neue Konturpixel suchen.
    4. Wiederholen, bis keine neuen Konturpixel entstehen. Die verbleibenden Pixel sind das Skelett.
Aktueller Stand (2026)

Seit etwa 2012 lernen tiefe neuronale Netze (CNNs, Vision Transformer) die Merkmale meist selbst aus Beispielbildern, statt dass sie von Hand definiert werden. Details in Mustererkennung (Quelle - Recherche - Bildverarbeitung heute 2026).

Verwandt