Ein Usability-Test ist ein Prüfverfahren, bei dem echte Nutzer echte Aufgaben an einer Website oder einem Prototyp erledigen, während jemand beobachtet und mitschreibt. Ausgewertet wird das Verhalten: Was jemand über ein Formular sagt, weicht regelmäßig davon ab, wie er es ausfüllt. Ein Test liefert deshalb konkrete Stellen: die Schaltfläche, an der vier von fünf Leuten vorbeiscrollen, oder das Wort im Menü, das keiner versteht.
- Usability-Test
Prüfverfahren, bei dem echte Nutzer echte Aufgaben an einer Oberfläche erledigen, während jemand beobachtet und mitschreibt.
Beispiel: „Im Usability-Test hat keine der fünf Testpersonen den Ersatzteilkatalog auf Anhieb gefunden.“Auch: Usability Testing oder User Testing. Beide meinen dasselbe Verfahren, wobei „User Testing“ in die falsche Richtung weist: Auf dem Prüfstand steht die Oberfläche.
Gegenbegriff: die heuristische Evaluation. Sie kommt ohne Nutzer aus, weil dort Fachleute gegen anerkannte Gestaltungsregeln prüfen.
Der Test steht und fällt mit den Aufgaben
Jede Sitzung dreht sich um eine Handvoll Aufgaben, die eine echte Absicht abbilden: einen Termin buchen oder eine Rechnung herunterladen. Formuliert wird immer das Ziel, nie der Klickweg. Sobald in der Aufgabe steht, wo etwas zu finden ist, prüft der Test nur noch, ob jemand einer Anleitung folgen kann.
Während des Bearbeitens ist das laute Denken verbreitet: Die Testperson spricht aus, was sie sucht und was sie erwartet. Aus den Sitzungen lassen sich zusätzlich Kennzahlen ziehen, etwa wie viele Aufgaben zum Abschluss kommen. Die Zahlen ordnen ein, die Begründung steckt in den Beobachtungen.
Woher die Faustregel von fünf Testpersonen kommt
Jakob Nielsen und Thomas Landauer haben 1993 ein Modell dafür vorgelegt, wie viele Usability-Probleme eine Testreihe aufdeckt. Es unterstellt, dass jede Testperson im Schnitt denselben Anteil der vorhandenen Probleme findet, im Mittel der untersuchten Projekte rund 31 Prozent. Weil sich die Funde überlappen, flacht der Zugewinn schnell ab: Nach dieser Rechnung sind bei fünf Personen etwa 85 Prozent der Probleme aufgefallen.
Das ist ein Modellwert mit Annahmen, keine feste Regel. Er gilt für eine Nutzergruppe mit vergleichbaren Aufgaben und behandelt alle Probleme als gleich gut auffindbar. Wer zwei getrennte Zielgruppen bedient, etwa Einkäufer und Techniker, braucht für jede eine eigene Runde. Wir empfehlen ohnehin mehrere kleine Runden, weil die zweite Runde die Wirkung der Änderungen gleich mitprüft.
Was vor der ersten Sitzung festgelegt wird
Vor dem Termin steht fest, wer teilnimmt und woran geprüft wird. Die Teilnehmer sollten der späteren Nutzergruppe ähneln, und jede Sitzung braucht eine Einwilligung zur Aufzeichnung. Ohne Mitschnitt hängt die Auswertung am Gedächtnis der Beobachter.
Zwei Entscheidungen prägen danach den Aufwand: ob während der Sitzung eine Testleitung dabei ist und ob alle im selben Raum sitzen. Aus diesen beiden Achsen ergeben sich die gängigen Spielarten des Verfahrens, die im Aufwand und in der Art der Ergebnisse weit auseinanderliegen.