Définition
Méthode évaluative dans laquelle des utilisateurs représentatifs effectuent des tâches réalistes sur un service ou une interface pendant que des observateurs mesurent l’efficacité (réussite des tâches), l’efficience (temps et effort) et la satisfaction afin d’identifier les problèmes d’utilisabilité et d’alimenter les améliorations de conception.

Principe

Principe
L’observation directe d’utilisateurs représentatifs réalisant des tâches révèle des problèmes fonctionnels et d’interaction que les spécifications ou les revues d’experts peuvent manquer ; les métriques de performance orientent la priorisation des corrections selon la fréquence et la gravité des défaillances.

Démonstration

Démonstration
Scénario illustratif : lors d’un test modéré, cinq usagers d’une bibliothèque publique doivent localiser et télécharger un article depuis le catalogue. Les observateurs consignent l’achèvement des tâches, les étapes, les erreurs et les durées ; des échecs de navigation récurrents sur un champ de formulaire conduisent les concepteurs à le simplifier et à re‑tester.

Mauvaise application

Mauvaise application
Employer des participants non représentatifs (personnel ou échantillons de convenance) ou des notes anecdotiques issues d’une seule session pour prétendre à des caractéristiques d’utilisabilité générales est une erreur sémantique : la validité dépend de la représentativité, de tâches réalistes et de métriques systématiques, pas d’impressions isolées.

Conséquence

Conséquence
Un test d’utilisabilité correctement réalisé produit des enseignements actionnables et priorisés qui réduisent les erreurs des utilisateurs et guident des modifications d’interface ; il exige des moyens pour le recrutement, la conception des scénarios et l’analyse et peut mettre en lumière des arbitrages entre découvrabilité, efficience et richesse fonctionnelle.

Inversion

Inversion
Pour mesurer des tendances comportementales à grande échelle, des analyses passives ou des tests A/B peuvent être plus appropriés pour évaluer la fréquence et l’ampleur des problèmes ; les tests d’utilisabilité excellent pour diagnostiquer pourquoi des tâches échouent plutôt que pour mesurer l’incidence agrégée.

Limite

Limite
Dans la définition : sessions modulées ou non, centrées sur des tâches, avec utilisateurs représentatifs et métriques enregistrées. Cas limite : évaluation heuristique d’experts sans utilisateurs. Hors définition : analyses purement quantitatives dépourvues d’observation qualitative au niveau des tâches.

Tension sémantique

Tension sémantique
Profondeur d’Insight ↔ Échelle de Preuve — les tests modérés offrent des diagnostics approfondis à partir de peu de participants, tandis que l’analytique à grande échelle apporte une couverture statistique ; les deux se complètent et doivent être équilibrés selon les objectifs.

Synthèse

Synthèse
Le test d’utilisabilité transforme le comportement observé des utilisateurs en actions de conception priorisées : il sacrifie l’étendue pour la profondeur diagnostique, et sert surtout à comprendre et corriger des échecs d’interaction concrets plutôt qu’à estimer des taux populationnels.