Bildcodierung

Aus Zweites Gehirn, dem persönlichen Wiki
Bildcodierung
TypKonzept
QuellenQuelle - Bildverarbeitung Zusammenfassung
Quelle - Recherche - Bildverarbeitung heute 2026
Erstellt2026-09-24
Aktualisiert2026-09-25
Tagsbildverarbeitung, kompression, informationstheorie, jpeg, mpeg

Kompression von Bildern und Videos, indem Redundanz (verlustfrei) und Irrelevanz (verlustbehaftet) entfernt werden. Grundlage ist die Informationstheorie, Anwendungen sind Fax, JPEG und MPEG.

Ziel

Bilder sollen mit möglichst wenig Speicher schnell übertragen werden, ohne die Botschaft an den Empfänger zu verändern. Die Kommunikationskette dafür: Quelle → Codierer → Kanal → Decodierer → Senke (Quelle - Bildverarbeitung Zusammenfassung).

  • Redundanz steckt im Code und im Bildinhalt (Pixel sind korreliert).
  • Irrelevanz ist das, was der Empfänger nicht wahrnimmt: Das Auge reagiert stärker auf Helligkeit als auf Farbe und unterscheidet nur wenige Graustufen.
  • Die Genauigkeit wird objektiv (Abweichung) oder subjektiv (mit Versuchspersonen) bewertet.

Informationstheorie

  • Informationsgehalt: H(sᵢ) = log₂(1/P(sᵢ)) bit. Je seltener ein Zeichen, desto mehr Information trägt es.
  • Entropie: H = Σ P(sᵢ)·log₂(1/P(sᵢ)) bit/Zeichen, die Untergrenze für die mittlere Codelänge.
  • Redundanz: R = L − H (mittlere Codelänge minus Entropie).
  • Quellencodierungssatz: Ein optimaler Code verringert die Datenmenge, ohne Information zu verlieren.

Verlustfreie Verfahren

  • Huffman-Code: Häufige Zeichen bekommen kurze Codewörter. Er ist präfixfrei (kein Codewort ist Anfang eines anderen) und kommt nahe an die Entropie heran. Das gleiche Prinzip steckt schon im Morsecode.
  • Lauflängencodierung (RLE): Wiederholungen werden als (Anzahl, Wert) gespeichert, z.B. in PCX und beim Fax.
  • Bitebenencodierung: Zerlegung in binäre Bitebenen, danach RLE.
  • Prädiktive Codierung: Aus den Nachbarn wird ein Schätzwert berechnet, übertragen wird nur der Fehler (dessen Entropie niedriger ist).

Verlustbehaftete Verfahren

  • Prädiktiv mit Quantisierung: Deltamodulation (1 bit pro Fehler), DPCM, ADPCM (adaptiv).
  • Transformationscodierung: Das Bild wird als Summe von Basisbildern dargestellt, übertragen werden nur die Koeffizienten. Die Transformation dekorreliert und macht Irrelevanz gezielt steuerbar.
    • DCT (diskrete Cosinus-Transformation): reell, symmetrischer Kern, Standard für die Kompression
    • DFT/FFT → Fourier-Transformation
    • Walsh-Hadamard: Basisbilder nur aus ±1, es genügen Additionen
    • Karhunen-Loève (KLT): Eigenvektoren der Kovarianzmatrix, optimal dekorrelierend (entspricht der Hauptkomponentenanalyse)
  • Hybridcodierung: Transformation kombiniert mit direkter Codierung. Adaptiv: Die Quantisierung wird je Bildbereich an den Inhalt angepasst.

Standards

  • Fax: eindimensional mit dem modifizierten Huffman-Code (Lauflängen, Weiss kürzer als Schwarz, Makeup-Code für Ketten über 63 Pixel), zweidimensional mit dem modifizierten READ-Code (Vergleich mit der Vorzeile, Modi vertical, horizontal und pass).
  • JPEG (Einzelbilder): Wertebereich anpassen → Farbdifferenzcodierung (YCC) → 8×8-Blöcke → DCT → Quantisierung (steuert den Kompressionsfaktor) → Zickzack-Abtastung → Lauflängencodierung → Huffman. Ergebnis: ca. 10 % der Grösse bei kaum sichtbarem Verlust. Gut für weiche Verläufe, schlecht für technische Zeichnungen und harte Kanten. Es gibt sequentielle, progressive, hierarchische und (selten genutzt) verlustfreie Modi.
  • MPEG (Video): baut auf JPEG auf. I-Bilder sind eigenständig JPEG-codiert, P-Bilder werden aus dem vorherigen Bild vorhergesagt, B-Bilder bidirektional interpoliert. Bewegungskompensation arbeitet mit 16×16-Makroblöcken. Die Kompression reicht bis 0,5 %, bei ca. 150 KB/s (CD). Der Codierer muss viel mehr leisten als der Decodierer. H.261 ist der verwandte Bildtelefon-Standard (p × 64 kbit/s, ISDN).

Aktueller Stand (2026)

Überholt

Der Stand der Quelle ist 2004 und beschreibt im Kern JPEG und MPEG-1/2.

Videocodecs (Quelle - Recherche - Bildverarbeitung heute 2026):

  • Nach MPEG-2 folgten H.264/AVC (2003), H.265/HEVC (2013) und H.266/VVC (fertig am 6.7.2020, etwa 50 % weniger Bitrate als HEVC bei gleicher Qualität, aber wenig verbreitet).
  • AV1 (Alliance for Open Media, 2018) ist lizenzfrei. Dahinter stehen u.a. Google, Netflix, Amazon, Apple, Microsoft und Mozilla. AV1 ist heute im Streaming breit im Einsatz.

Bildformate:

  • AVIF beruht auf AV1 und wird 2026 von allen grossen Browsern nativ unterstützt (über 95 % globale Abdeckung).
  • JPEG XL (ISO/IEC 18181, 2022) ist lizenzfrei und kann bestehende JPEGs verlustfrei umverpacken. Safari unterstützt es seit Version 17. Chrome hatte es 2022/23 entfernt. Laut Fachblogs ist es seit Chrome 145 (Februar 2026) wieder enthalten, aber nur hinter einem Schalter.
Einordnung (Claude)

Alle diese Verfahren folgen denselben Prinzipien wie die Quelle: Prädiktion, Transformation (DCT-Varianten), Quantisierung und Entropiecodierung. Sie sind nur deutlich effizienter.

Aus den Abbildungen der Quelle

  • Kommunikationskette (S. 56): Quelle → Codierer → Kanal → Decodierer → Senke. Informationsgehalt H(sᵢ) = log₂(1/P(sᵢ)) bit.
  • Prädiktive Codierung (S. 58–59): Schätzwert ŵ(r) = Σᵢ aᵢ·w(r−i). Übertragen wird nur e(r) = ŵ(r) − w(r). Codierer und Decodierer enthalten denselben Prädiktor. Bei DPCM sitzt ein Quantisierer im Codierer, und der Prädiktor arbeitet mit den rekonstruierten Werten, damit Codierer und Decodierer synchron bleiben.
  • Basisbilder (S. 60): Jede 2×2-Matrix [a b; c d] ist eine Summe a₀₀·[1 1; 1 1] + a₀₁·[1 −1; 1 −1] + a₁₀·[1 1; −1 −1] + a₁₁·[1 −1; −1 1]. Übertragen werden nur die Koeffizienten aᵢⱼ, die Basisbilder kennen Quelle und Senke.
  • DCT (S. 62): C(k,l) = Σᵣ Σₛ 4·f(r,s)·cos((2r+1)kπ/2N₁)·cos((2s+1)lπ/2N₂). Die Basisbilder sind reine Kosinusfunktionen, die Kerne sind symmetrisch und zeilen- und spaltenweise separierbar.
  • KLT (S. 63): Transformationsmatrix aus den Eigenvektoren der Kovarianzmatrix, geordnet nach Eigenwerten. Danach sind die Komponenten unkorreliert (diagonale Kovarianzmatrix). Das ist optimal, aber bildabhängig.
  • JPEG-Kette (S. 64): Quellcodierung = Irrelevanzreduktion (8×8-Blockbildung → DCT → Quantisierung mit Gewichtsfaktoren) und Entropiecodierung = Redundanzreduktion (Zickzack-Abtastung → Lauflängencodierung RLC → Huffman VLC).
  • MPEG-Reihenfolge (S. 66): Die Originalbilder werden als I P B B P B B I … codiert. Weil B-Bilder das folgende I- oder P-Bild brauchen, sortiert der Codierer um: Die Übertragungsreihenfolge ist I P B B I B B …

Huffman-Beispiel (Prüfungsaufgabe 51, S. 150): Wahrscheinlichkeiten A 0.15, B 0.15, C 0.16, D 0.30, E 0.04, F 0.20.

  • Zusammenfassen der jeweils zwei kleinsten: E + B = G (0.19), A + C = H (0.31), G + F = I (0.39), D + H = J (0.61), I + J = K (1.0).
  • Codes: D = 01, F = 10, C = 000, A = 001, B = 110, E = 111.
Einordnung (Claude)

Nachgerechnet ist die mittlere Codewortlänge 0.16·3 + 0.15·3 + 0.30·2 + 0.20·2 + 0.15·3 + 0.04·3 = 2.50 bit. Die Entropie beträgt H = −Σ pᵢ·log₂ pᵢ ≈ 2.42 bit. Der Huffman-Code liegt also nur ca. 0.08 bit über dem theoretischen Minimum. Ein fester 3-Bit-Code bräuchte 3 bit.

Verwandt