Definition
Eine evaluative Methode, bei der repräsentative Nutzer realistische Aufgaben mit einem Dienst oder einer Oberfläche ausführen, während Beobachter Effektivität (Aufgabenerfolg), Effizienz (Zeit‑ und Arbeitsaufwand) und Zufriedenheit messen, um Usability‑Probleme zu identifizieren und Gestaltung zu verbessern.

Prinzip

Prinzip
Die direkte Beobachtung repräsentativer Nutzer bei Aufgaben deckt funktionale und Interaktionsprobleme auf, die Spezifikationen und Expertenprüfungen übersehen können; Leistungsmetriken lenken die Priorisierung von Korrekturen nach Häufigkeit und Schwere der Fehlerfälle.

Demonstration

Demonstration
Illustratives Szenario: In einem moderierten Test werden fünf öffentliche Bibliotheksnutzer gebeten, einen Aufsatz im Katalog zu finden und herunterzuladen. Beobachter notieren Aufgabenabschluss, Schritte, Fehler und Zeit; wiederkehrende Navigationsfehler an einem Formularfeld führen zu dessen Vereinfachung und einem Nachtest.

Fehlanwendung

Fehlanwendung
Unrepräsentative Teilnehmende (Mitarbeitende oder Bequemlichkeitsstichproben) oder anekdotische Notizen aus einer einzigen Sitzung heranzuziehen, um allgemeine Usability‑Aussagen zu treffen, ist ein semantischer Fehler: Die Validität beruht auf Repräsentativität, realistischen Aufgaben und systematischen Metriken, nicht auf Einzeleindrücken.

Konsequenz

Konsequenz
Richtig durchgeführt liefert Usability‑Testing umsetzbare, priorisierte Erkenntnisse, die Benutzerfehler reduzieren und Interface‑Änderungen begründen; es erfordert Aufwand für Rekrutierung, Szenariendesign und Analyse und kann Zielkonflikte zwischen Entdeckbarkeit, Effizienz und Funktionsumfang aufzeigen.

Umkehrung

Umkehrung
Für großflächige Verhaltensmuster können passive Analytics oder A/B‑Tests geeigneter sein, da sie Häufigkeit und Größenordnung über Populationen messen; Usability‑Tests sind besonders geeignet, um zu diagnostizieren, warum konkrete Aufgaben scheitern.

Abgrenzung

Abgrenzung
Eindeutig innerhalb: aufgabenbasierte, moderierte oder unmoderierte Sitzungen mit repräsentativen Nutzern und aufgezeichneten Metriken. Grenzfall: heuristische Expertenbewertung ohne Nutzer. Eindeutig außerhalb: rein quantitative Analytics ohne qualitative Aufgabebeobachtung.

Semantische Spannung

Semantische Spannung
Tiefe Einsicht ↔ Beweisskala — moderierte Usability‑Tests liefern tiefe diagnostische Einsichten bei wenigen Teilnehmenden, während großskalige Analysen statistische Abdeckung bieten; beide sind komplementär und müssen je nach Ziel kombiniert werden.

Synthese

Synthese
Usability‑Testing wandelt beobachtetes Nutzerverhalten in priorisierte Designmaßnahmen um: es tauscht Reichweite gegen diagnostische Tiefe und ist die Methode der Wahl, wenn das Ziel ist, konkrete Interaktionsfehler zu verstehen und zu beheben.