A/B-Test

Aus Zweites Gehirn, dem persönlichen Wiki
A/B-Test
TypKonzept
QuellenQuelle - Praxisbuch Usability und UX
Quelle - Recherche - Usability und UX heute 2026
Erstellt2026-09-27
Aktualisiert2026-09-27
Tagsab-test, experiment, statistik, signifikanz, konversion, optimierung

Zwei Varianten, die sich in genau einem Merkmal unterscheiden, werden im Livebetrieb gleichzeitig zufällig verteilten Nutzern gezeigt; gemessen wird, welche ein vorher festgelegtes Ziel besser erreicht. Liefert Fakten statt Bauchgefühl, braucht aber viele Nutzer, eine Hypothese und saubere Statistik.

Dateiname

Die Seite heisst im Wiki „A/B-Test“; der Dateiname lautet A-B-Test.md, weil „/“ in Dateinamen nicht erlaubt ist. Links im Wiki verwenden [[A-B-Test|A/B-Test]].

Prinzip

Die Besucher werden aufgeteilt (daher auch Split-Test): Ein Teil sieht Variante A, der andere B. Nach einer Weile setzt man die bessere für alle um (Quelle - Praxisbuch Usability und UX, S. 219). Einsetzbar für Websites, Landing Pages, Apps, Suchmaschinenwerbung, Banner und E-Mails.

Erfunden in heutiger Form von Greg Linden bei Amazon in den 1990ern: Er testete gegen den Willen seines Chefs Kaufempfehlungen im Warenkorb, die den Umsatz so steigerten, dass sie sofort eingeführt wurden. Amazon hat sich seitdem in kleinen, getesteten Schritten verändert statt in grossen Relaunches (S. 221–222).

Was sich testen lässt – und was nicht

  • Ja: Texte (Überschriften, Button-Beschriftung), Anordnung, Bilder. Die Varianten müssen sich deutlich, aber nur in einem Merkmal unterscheiden.
  • Nein: ästhetische Streitfragen (Schriftart), Relaunches mit vielen Änderungen – man wüsste nicht, welche Änderung wirkt (S. 221).

Vorgehen

  1. Hypothese statt „Ach, das testen wir einfach“: Beobachtung (zu wenige Newsletter-Anmeldungen) → Vermutung (Button übersehen) → konkrete Hypothese (zu unauffällig gestaltet). Manche Hypothesen prüft man schneller anders, etwa die Scrolltiefe per Web-Analytics (S. 222–223).
  2. Ziel festlegen, bevor der Test startet: Konversionsrate, Umsatz, Verweildauer oder Bearbeitungszeit. Nicht den kleinsten Schritt messen (Klicks auf die Kategorieseite), sondern das, was zählt (Verkäufe).
  3. Störvariablen ausschliessen: Zufallsschwankungen, Wochenende und Ferien, Wetter und Nachrichten. Beide Varianten gleichzeitig, Teilnehmer zufällig zuteilen (S. 224).
  4. Signifikanz ausrechnen, nie aufs Gefühl verlassen.
  5. Aus dem Ergebnis lernen, warum eine Variante besser ist.

Statistik

Signifikanz sagt, ob ein Unterschied Zufall sein könnte. Beispiel: 10 von 100 Käufern bei A und 11 von 100 bei B sind „10 % mehr“, aber so zufällig wie 54-mal Zahl bei 100 Münzwürfen (S. 225).

Je kleiner der erwartete Unterschied, desto mehr Besucher. Stark vereinfachte Beispielwerte aus Tabelle 21.1:

Besucher/Tag Konversion A → B Laufzeit
100 3 % → 3,5 % 57 Tage
1 000 3 % → 3,5 % 6 Tage
100 3 % → 4 % 16 Tage
100 3 % → 6 % 3 Tage

Bis zu 90 % der Tests bei Testanbietern erreichen keine Signifikanz; man liest nur von den Erfolgen (S. 220). Kleine Sites testen deshalb grosse Unterschiede. Eine ungleiche Aufteilung (90:10) verlängert die Laufzeit. Nach Erreichen der Signifikanz darf man abbrechen, wenn schnelle Verbesserung das Ziel ist; bei teurer Umsetzung lieber länger laufen lassen (S. 227).

Vertiefung: Jeff Sauro, „Quantifying the User Experience“, und measuringu.com. Grundlagen: Wahrscheinlichkeitsrechnung.

Grenzen

  • Korrelation ist nicht Kausalität: Wer den Schirm aufspannt, bevor es regnet, hat den Wetterbericht gehört (S. 227).
  • Lokales Maximum: A/B-Tests optimieren eng an der bestehenden Lösung und erklimmen den nächsten Hügel, nicht den höchsten Berg. Für grundsätzlich neue Ansätze braucht es Design Thinking (S. 229).
  • Effekte lassen nach: Gewöhnung, Sättigung oder die Konkurrenz zieht nach.
Einordnung (Claude)

Das lokale Maximum ist dasselbe Problem wie beim Gradientenverfahren: Kleine Schritte bergauf bleiben auf dem nächsten Gipfel stecken. Die Abhilfe ist in beiden Fällen ähnlich, grössere Sprünge oder mehrere Startpunkte.

Alternativen

  • Multivariater Test: mehrere Merkmale gleichzeitig, mit Wechselwirkungen; braucht noch mehr Nutzer.
  • Usability-Test: liefert das Warum, qualitativ.
  • Usability-Review: schnell bei wenig Nutzern.

Werkzeuge 2017: Excel, WordPress-Plugins, Google Content Experiments bzw. Optimize, Piwik (S. 228).

Veraltet seit der Quelle

Google Optimize (samt Optimize 360 und GA4-Integration) wurde am 30. September 2023 eingestellt; Piwik heisst seit Januar 2018 Matomo (Quelle - Recherche - Usability und UX heute 2026).

Verwandt