Definición
Un método evaluativo en el que usuarios representativos realizan tareas realistas con un servicio o interfaz mientras observadores registran medidas de eficacia (éxito de la tarea), eficiencia (tiempo y esfuerzo) y satisfacción para identificar problemas de usabilidad e informar mejoras de diseño.
Principio
Principio
La observación directa de usuarios representativos realizando tareas revela problemas funcionales e interaccionales que las especificaciones o revisiones de expertos pueden pasar por alto; las métricas de desempeño orientan la priorización de correcciones por frecuencia y gravedad de los modos de fallo.
Demostración
Demostración
Escenario ilustrativo: en una prueba moderada, cinco usuarios de biblioteca pública deben localizar y descargar un artículo desde el catálogo. Observadores registran finalización de la tarea, pasos realizados, errores y tiempo; fallos de navegación recurrentes en un campo llevan a los diseñadores a simplificarlo y volver a probar.
Aplicación incorrecta
Aplicación incorrecta
Usar participantes no representativos (personal o muestras de conveniencia) o notas anecdóticas de una sola sesión para afirmar características generales de usabilidad es un error semántico: la validez depende de la representatividad de participantes, tareas realistas y métricas sistemáticas, no de impresiones aisladas.
Consecuencia
Consecuencia
Realizadas correctamente, las pruebas de usabilidad producen hallazgos accionables y priorizados que reducen errores de usuario y guían cambios de interfaz; requieren inversión en reclutamiento, diseño de escenarios y análisis y pueden revelar compensaciones entre descubribilidad, eficiencia y riqueza funcional.
Inversión
Inversión
Para patrones de comportamiento a gran escala, los analytics pasivos o pruebas A/B pueden ser más adecuados para medir frecuencia y magnitud de problemas; las pruebas de usabilidad son más potentes para diagnosticar por qué fallan tareas específicas que para medir incidencias agregadas.
Límite
Límite
Claramente dentro: sesiones basadas en tareas, moderadas o no, con usuarios representativos y métricas registradas. Caso límite: evaluación heurística de expertos sin usuarios. Claramente fuera: análisis puramente cuantitativos sin observación cualitativa de tareas.
Tensión semántica
Tensión semántica
Profundidad de Insight ↔ Escala de Evidencia — las pruebas moderadas proporcionan diagnóstico profundo con pocos participantes, mientras que la analítica a gran escala aporta cobertura estadística; ambos son complementarios y deben equilibrarse según objetivos.
Síntesis
Síntesis
La prueba de usabilidad convierte el comportamiento observado en acciones de diseño priorizadas: sacrifica amplitud por profundidad diagnóstica y es la técnica adecuada cuando se pretende entender y arreglar fallos concretos de interacción.