| Typ | Konzept |
|---|---|
| Quellen | Quelle - Praxisbuch Usability und UX |
| Erstellt | 2026-09-27 |
| Aktualisiert | 2026-09-27 |
| Tags | usability-test, thinking-aloud, eyetracking, remote-test, guerilla-test, sus, methode |
Testpersonen aus der Zielgruppe erledigen typische Aufgaben mit der Anwendung, während man sie beobachtet und befragt. Die vielseitigste und wichtigste UX-Methode: mit jedem Produkt und in jeder Phase anwendbar, und schon fünf Personen finden die meisten Probleme.
Grundprinzip
Anwendung oder Prototyp bereitstellen, Fragen und Aufgaben überlegen, Leitfaden schreiben, passende Testpersonen rekrutieren, beobachten, auswerten, Verbesserungen ableiten (Quelle - Praxisbuch Usability und UX, S. 179). Die Autoren sind nach eigener Aussage noch nie ohne neue, relevante Erkenntnisse aus einem Test gekommen (S. 80).
Unterscheidungen: Labor oder Feld; moderiert oder unmoderiert; persönlich oder remote. Die meisten Tests laufen moderiert im Labor (S. 180).
Labor und Techniken
- Usability-Labor: Testraum und Beobachtungsraum, Einwegspiegel oder Videoübertragung. Kamera aufs Gesicht, Bildschirmaufzeichnung oder Dokumentenkamera für Smartphones. Wichtiger als Technik ist ein guter Interviewer (S. 181–182).
- Thinking aloud (lautes Denken): Die Person spricht ihre Gedanken aus. Erfasst spontane Eindrücke, die man später vergessen hätte, und überzeugt Entwickler, weil die Aussagen für sich stehen. Ausnahme: Sprachassistenten, dort nur nachträglich (S. 182–183).
- Eyetracking: misst Fixationen; Auswertung als Heatmap oder Gazeplot. Nur mit klarer Fragestellung und Erfahrung (S. 183–185).
- Weitere Messungen: Hautleitwiderstand (Erregung), Klicktracking.
Quantitative Werte
- Erfolgsrate (Success Rate), Zeit pro Aufgabe (Time on Task), Fehlerrate.
- Standardfragebögen: SUS (System Usability Scale, 0–100), UEQ (User Experience Questionnaire, fünf Dimensionen), VisAWI (visuelle Ästhetik, vier Dimensionen). Vor allem zum Vergleich von Varianten und für Benchmarks (S. 185).
- Diese Werte sind bei kleinen Stichproben nicht repräsentativ.
Ablauf
- Ziele und Hypothesen festlegen; nicht zu viele Fragen.
- Studienkonzept: allgemeine Aufgaben (erkunden: „Suchen Sie ein Wochenende in einer Metropole“) und spezifische (eindeutig: „Eintrittspreis für zwei Erwachsene“). Realistisch formulieren, ohne versteckte Hinweise (S. 187–188).
- Interviewleitfaden: Einführung (lautes Denken, Einverständnis, Incentive) → Aufwärmfragen → freie Exploration → Aufgaben → Nachbefragung.
- Stichprobe: siehe unten.
- Rekrutierung nach Kriterien und Screener; keine „Dauertester“ und keine Personen aus der Branche (S. 190–191).
- Pretest am Vortag: Technik, Länge, Formulierungen.
- Durchführung: Interviewer gehört nicht zum Entwicklungsteam, es gibt kein Richtig oder Falsch, keine persönlichen Infos preisgeben. Viel notieren.
- Ergebnis-Workshop: Probleme sammeln und nach Schweregrad ordnen (siehe unten). In agilen Projekten ersetzt er den Bericht.
- Bericht: Management Summary, Hintergrund, Methode, Ergebnisse nach Schwere mit Screenshots und Lösungsvorschlägen, auch Positives; höchstens etwa 40 Befunde. Highlight-Videos überzeugen („It's propaganda, not a documentary“, David Travis) (S. 194–195).
Wie viele Testpersonen?
| Personen | mind. gefundene Probleme | durchschnittlich |
|---|---|---|
| 5 | 55 % | 85,55 % |
| 10 | 82 % | 94,69 % |
| 15 | 90 % | 97,05 % |
| 20 | 95 % | 98,4 % |
Tabelle 17.1 nach Sarodnik & Brau 2011 (S. 189). Faustregel: fünf Personen für einen qualitativen Test, vier bis fünf je stark unterschiedlicher Nutzergruppe; für quantitative Fragen oder Eyetracking etwa das Vierfache, also 20–30 je Gruppe.
Mehrere kleine Runden (z. B. je drei Personen) finden mehr als ein grosser Test mit acht, weil nach jeder Verbesserung neue Probleme sichtbar werden (Rapid User Testing, S. 198). Das passt zu Jakob Nielsens Discount Usability seit 1989: nur das Nötigste dokumentieren, fünf Nutzer pro Runde (S. 208).
Schweregrade
Nach Häufigkeit, Auswirkung und Hartnäckigkeit (S. 193):
- kritisch: Aufgabe nicht lösbar → sofort beheben
- schwer: viele frustriert, manche brechen ab
- geringfügig: verärgert, aber lösbar
Varianten
- Remote-Usability-Test (RUT): Testperson bleibt zuhause. Asynchron (aRUT): unmoderiert per Software mit Panel, Klickpfaden und Kennzahlen; 3–5 Aufgaben, 15–30 Minuten, gut für grosse Stichproben, Variantenvergleiche und enge Zeitpläne, findet aber weniger Probleme. Synchron (sRUT): moderiert per Screen-Sharing, mit Nachfragen, technisch anspruchsvoller. Mobil per Mirroring des Smartphones, das allerdings an den PC bindet (Kap. 18).
- Guerilla-Test: bewusst Regeln brechen, vor allem die Rekrutierung aus der Zielgruppe. In Café, Büroflur („Hallway Test“) oder beim Usability-Testessen; 5–15 Minuten, klare Fragestellung, ein Kaffee statt Honorar. Nicht für weitreichende Entscheidungen oder sehr spezielle Zielgruppen wie Senioren (Kap. 19).
- Wizard of Oz: Ein Mensch spielt das noch fehlende System, etwa einen Sprachassistenten (S. 81).
- Papierprototyp-Test: siehe Prototyping.
Wann?
So früh wie möglich und immer wieder: vom ersten Papierprototyp bis zum laufenden Betrieb. Ein Usability-Review durch Experten ersetzt den Test mit Nutzern nicht.
Verwandt
- Softwaretest – technischer Test vs. Test der Bedienbarkeit
- Usability-Review – Expertensicht als Ergänzung
- A/B-Test – quantitativ im Livebetrieb, ohne das Warum
- Persona – Testpersonen passend rekrutieren
- Nutzerzentrierte Entwicklung – Evaluationsphase
