Wissensbasierte Bildanalyse

Aus Zweites Gehirn, dem persönlichen Wiki
Wissensbasierte Bildanalyse
TypKonzept
QuellenQuelle - Bildverarbeitung Zusammenfassung
Erstellt2026-09-24
Aktualisiert2026-09-26
Tagsbildverarbeitung, bildanalyse, wissensrepräsentation, künstliche-intelligenz

Bildverstehen durch Abgleich von Bilddaten mit explizit gespeichertem Modellwissen, z.B. in semantischen Netzen, Frames, Grammatiken oder Produktionsregeln. Ausgeführt wird der Abgleich mit Suchstrategien und Systemarchitekturen wie dem Blackboard.

Ziel und Modelle

Bildanalyse (computer vision) leitet aus Bilddaten eine Bild- oder Szenenbeschreibung ab: Bestandteile, Eigenschaften, Beziehungen und Deutung. Verstehen setzt Wissen voraus, und dieses steckt in Modellen (Quelle - Bildverarbeitung Zusammenfassung):

  • Szenen- und Objektmodelle (topologisch, geometrisch, physikalisch, semantisch), Beleuchtungsmodelle, Sensormodelle
  • strukturell (Teile und ihre Beziehungen) vs. attributiv (nur globale Eigenschaften)
  • hierarchisch: Spezialisierung („ist eine Art von“) und Bestandteile („besteht aus“)
  • spezifisch vs. generisch vs. parametrisch

Darstellungsebenen: ikonisch (Bildmatrix, Low-Level-Verfahren) → symbolisch (Primitivobjekte, High-Level-Verfahren). Modell und Bild werden auf symbolischer Ebene verglichen, indem Korrespondenzen zwischen Modell- und Bildprimitiven gesucht werden.

Systemstruktur

Zentrale Designregel: Wissen von der Ablaufsteuerung trennen (explizit statt implizit). Nur dann lassen sich Wissen und Strategie unabhängig voneinander ändern.

  • Langzeitwissen: allgemeingültig, statisch, unabhängig vom einzelnen Bild
  • Kurzzeitwissen: bezogen auf das aktuelle Bild, dynamisch

Strategien: datengetrieben (bottom-up), modellgetrieben (top-down), Hypothesen bilden und testen (beides kombiniert).

Architekturen: interaktiv bzw. halbautomatisch, hierarchisch (Kette von Modulen), heterarchisch (Netz von Modulen), datenbankorientiert (zentrale Datenbasis), Blackboard (Wissensquellen als Spezialisten, die nur über eine gemeinsame Tafel kommunizieren, mit einer Steuereinheit als „Diskussionsleiter“).

Wissensrepräsentation

  • Formale Grammatiken: Ersetzungsregeln zerlegen komplexe Objekte in Teile. Theorie dazu: Formale Sprache, Chomsky-Hierarchie.
  • Graphen: Knoten sind Objekte, Kanten Relationen; gerichtet, markiert oder attributiert (quantitative Attribute).
  • Frames: Prototyp mit Slots. Die Relationen a_kind_of (Klasse → Oberklasse) und is_a (Element → Klasse) ermöglichen Vererbung.
  • Produktionssysteme: Regeln aus Bedingungs- und Aktionsteil, dazu Datenbasis und Steuerung.
  • Semantische Netze: Knoten mit komplexer Struktur, Kanten wie „ist-Teil-von“, „ist-benachbart-zu“. Unterschieden werden Konzept (Prototyp) und Instanz (konkretes Element).

Wissensnutzung: Suche

Die Analyse wird als Suche in einem Baum von Zuständen aufgefasst:

  • uninformiert: Tiefensuche, Breitensuche
  • bewertet: Bergsteigen (hill climbing), Strahlensuche (beam search, nur die w besten Knoten)
  • optimaler Pfad: vollständige Suche, Branch and Bound, dynamische Programmierung, A*
  • Syntaxanalyse (Parsing): top-down oder bottom-up, mit Backtracking; Grundlage sind Ableitungsbäume und Kellerautomaten → Kontextfreie Sprache
  • Graph-Matching: (Untergraph-)Isomorphismus
  • Relaxation: Unverträgliche Deutungen werden iterativ ausgeschlossen, diskret oder kontinuierlich (Plausibilitäten).

Beispielsysteme aus der Quelle: BPI (Produktionssystem mit Blackboard, FIM Ettlingen) und ERNEST (semantisches Netz, Universität Erlangen-Nürnberg; Expansion und Instantiierung wechseln sich ab).

Lernen und Bildfolgen

  • Adaptive Bildanalyse: Das System passt sich selbst an: beobachten → bewerten → Verhalten ändern. Automatischer Wissenserwerb heisst Lernen, wer nur Parameter anpasst, betreibt Parameterlernen.
  • Räumliche Bildfolgen (3D): Korrespondierende Punkte in zwei Bildern werden gesucht (Epipolargeometrie hilft), die 3D-Position folgt durch Triangulation.
  • Zeitliche Bildfolgen (Bewegung): Differenzbild, optischer Fluss, Verschiebungsvektorfelder, Blendenproblem (Mehrdeutigkeit). Vorwissen hilft, z.B. starre Körper, begrenzte Geschwindigkeit und Trägheit.
  • Anwendungen von 3D-Bildern: Tomographie, Vermessung, Inspektion, Robot Vision, 3D-Kino, Holographie, virtuelle Chirurgie.

Bezug zum Zweiten Gehirn

Einordnung (Claude)

Die Konzepte aus diesem Kapitel tauchen im LLM Wiki wieder auf, nur mit einem Sprachmodell statt mit Handregeln:

  • Trennung von Wissen und Steuerung: Das Wiki (wiki/) ist das Wissen, CLAUDE.md die Ablaufsteuerung.
  • Langzeit- vs. Kurzzeitwissen: Das Wiki ist das Langzeitwissen, der Kontext einer Session das Kurzzeitwissen.
  • Semantisches Netz: Wiki-Seiten sind Knoten, [[Links]] sind Kanten. Die „Verwandt“-Abschnitte benennen die Relation.
  • Blackboard: Ein gemeinsamer Speicher, über den Spezialisten kommunizieren, entspricht einem Vault, den Mensch und LLM gemeinsam bearbeiten.

Der Unterschied: 2004 musste das Wissen formal (Frames, Regeln) codiert werden. Heute genügt Fliesstext, weil das LLM ihn deuten kann (Zweites Gehirn, Memex).

Aus den Abbildungen der Quelle

  • Modell-Bild-Vergleich (S. 90): Modellprimitive und Bildprimitive werden über eine Suche einander zugeordnet. Es wird nicht mit dem Bild selbst verglichen, sondern mit seiner symbolischen Darstellung.
  • Systemarchitekturen (S. 92–94):
    Typ Aufbau
    interaktiv Benutzerschnittstelle steuert das System (halbautomatisch, wenn nur zu Beginn eingegriffen wird)
    hierarchisch Kette PM1 → PM2 → … → PMn
    heterarchisch Netz, jedes Modul spricht mit jedem
    datenbankorientiert alle Module kommunizieren nur über eine Datenbasis
    Blackboard Wissensquellen PM1…PMn plus globale Tafel plus Kontrollmodul (Diskussionsleiter)
  • Grammatik-Beispiel (S. 94): Vₜ = {a, b} (a = kleines Quadrat, b = hohes Rechteck), Vₙ = {Z, C}, Regeln r₁: Z → aCb, r₂: C → bCa, r₃: C → ab. Das ergibt r₁r₃: aabb, r₁r₂r₃: ababab, r₁r₂r₂r₃: abbabaab. Jedem Satz entspricht ein grafisches Muster.
  • Syntaxanalyse (S. 100): Die Tabelle zeigt einen Top-down-Parse von abbabaab mit Backtracking: Nach r₁ wird zuerst r₃ probiert, bei einer Sackgasse geht es zurück und mit r₂ weiter, bis die Zeichenkette vollständig abgeleitet ist. Der Bottom-up-Baum reduziert umgekehrt von den Terminalen zum Startsymbol.
  • Graphen (S. 95): Ein Haus als markierter Graph (Knoten Dach, Wand, Wand, Fundament) und als attributierter Graph mit Attributen wie Breite w und Höhe h (Dach w=5, h=2; Wände w=1, h=3) und Kantenattribut Abstand d=3.
  • Frames (S. 96): Viereck ← ako Parallelogramm ← ako Rechteck (Slots Länge, Breite, Orientierung, Position) ← is_a Objekt 13 (l = 32, b = 16, φ = 45°, Position 384,256). Konzepte vererben ihre Slots an Instanzen.
  • Produktionsregeln (S. 96): P₁: Linie, Linie (rechtwinklig) → Winkel; P₂: Winkel, Linie (U-förmig) → U-Struktur; P₃: U-Struktur, Linie (rechteckförmig) → Rechteck.
  • Semantisches Netz (S. 97): Rechteck Teil-von vier Linien, jede Linie eine Spezialisierung von „Linie“, und benachbarte Linien im Winkel +90° zu.
  • Suchstrategien (S. 97–99): Aus einem Stadtgraphen A–Z wird ein Suchbaum. Die Beispiele zeigen die Knotenreihenfolge der Tiefen- und Breitensuche sowie Bergsteigen und Strahlensuche mit Kostenwerten an den Knoten.
  • ERNEST (S. 103, 105): Die Architektur besteht aus Vorverarbeitung, Warteschlange, Hypothesen, Blackboard und Verarbeitungsmodulen (K, W, R). Im Suchbaum speichert jeder Knoten den vollständigen Analysezustand. Die Bildfolge „Expansion und Instantiierung“ (a)–(o) zeigt, wie das Instanzennetz schrittweise zum Modellnetz wächst.
  • Adaptive Bildanalyse (S. 106): Regelkreis Bild → Vorverarbeitung → strukturelle Bildanalyse → Ergebnis → Bewertung gegen die Zielvorstellung → Adaptionsstrategie → zurück in die Analyse.
  • Stereo (S. 107–108): Projektion eines Raumpunkts P durch das Zentrum C auf die Bildebene. Triangulation: p = c₁ + s₁·e₁ = c₂ + s₂·e₂. Aus den Kamerapositionen cᵢ und den Strahlrichtungen eᵢ ergibt sich P als Schnittpunkt.
  • Bewegung (S. 108–110): Verschiebungsvektorfelder für Translation, Rotation, Zoom. Beim differentiellen Ansatz gilt Δx = Δg/g′ₓ, die Verschiebung folgt also aus Grauwertdifferenz und örtlicher Steigung.

Verwandt