Définition
Méthode évaluative dans laquelle des utilisateurs représentatifs effectuent des tâches réalistes sur un service ou une interface pendant que des observateurs mesurent l’efficacité (réussite des tâches), l’efficience (temps et effort) et la satisfaction afin d’identifier les problèmes d’utilisabilité et d’alimenter les améliorations de conception.
Principe
Principe
L’observation directe d’utilisateurs représentatifs réalisant des tâches révèle des problèmes fonctionnels et d’interaction que les spécifications ou les revues d’experts peuvent manquer ; les métriques de performance orientent la priorisation des corrections selon la fréquence et la gravité des défaillances.
Démonstration
Démonstration
Scénario illustratif : lors d’un test modéré, cinq usagers d’une bibliothèque publique doivent localiser et télécharger un article depuis le catalogue. Les observateurs consignent l’achèvement des tâches, les étapes, les erreurs et les durées ; des échecs de navigation récurrents sur un champ de formulaire conduisent les concepteurs à le simplifier et à re‑tester.
Mauvaise application
Mauvaise application
Employer des participants non représentatifs (personnel ou échantillons de convenance) ou des notes anecdotiques issues d’une seule session pour prétendre à des caractéristiques d’utilisabilité générales est une erreur sémantique : la validité dépend de la représentativité, de tâches réalistes et de métriques systématiques, pas d’impressions isolées.
Conséquence
Conséquence
Un test d’utilisabilité correctement réalisé produit des enseignements actionnables et priorisés qui réduisent les erreurs des utilisateurs et guident des modifications d’interface ; il exige des moyens pour le recrutement, la conception des scénarios et l’analyse et peut mettre en lumière des arbitrages entre découvrabilité, efficience et richesse fonctionnelle.
Inversion
Inversion
Pour mesurer des tendances comportementales à grande échelle, des analyses passives ou des tests A/B peuvent être plus appropriés pour évaluer la fréquence et l’ampleur des problèmes ; les tests d’utilisabilité excellent pour diagnostiquer pourquoi des tâches échouent plutôt que pour mesurer l’incidence agrégée.
Limite
Limite
Dans la définition : sessions modulées ou non, centrées sur des tâches, avec utilisateurs représentatifs et métriques enregistrées. Cas limite : évaluation heuristique d’experts sans utilisateurs. Hors définition : analyses purement quantitatives dépourvues d’observation qualitative au niveau des tâches.
Tension sémantique
Tension sémantique
Profondeur d’Insight ↔ Échelle de Preuve — les tests modérés offrent des diagnostics approfondis à partir de peu de participants, tandis que l’analytique à grande échelle apporte une couverture statistique ; les deux se complètent et doivent être équilibrés selon les objectifs.
Synthèse
Synthèse
Le test d’utilisabilité transforme le comportement observé des utilisateurs en actions de conception priorisées : il sacrifie l’étendue pour la profondeur diagnostique, et sert surtout à comprendre et corriger des échecs d’interaction concrets plutôt qu’à estimer des taux populationnels.