Definición
Un marco experimental de evaluación en recuperación de información en el que una colección fija de documentos, un conjunto de necesidades de información (consultas) y juicios humanos de relevancia se usan como entradas estandarizadas para comparar sistemas o algoritmos de búsqueda en condiciones controladas.
Principio
Principio
Mantener constante la colección documental y los juicios de relevancia aísla las diferencias debidas al sistema o algoritmo, permitiendo comparaciones cuantitativas y repetibles de la efectividad de recuperación.
Demostración
Demostración
Escenario ilustrativo → Situación: Un investigador reúne un corpus estático de 10 000 documentos y 50 consultas representativas. Reconocimiento: Reconoce que cambiar solo el algoritmo preserva la comparabilidad. Acción: Ejecuta dos algoritmos sobre el mismo corpus y mide la precisión de las listas ordenadas con los juicios existentes. Consecuencia: Las diferencias medidas pueden atribuirse al comportamiento algorítmico y no a variaciones de colección o criterios.
Aplicación incorrecta
Aplicación incorrecta
Tratar los resultados de Cranfield como medidas directas de satisfacción de usuarios reales: dado que el paradigma fija colección y consultas, las conclusiones solo se generalizan a colecciones y formulaciones de tareas similares, no a la búsqueda web abierta ni a comportamientos interactivos.
Consecuencia
Consecuencia
Proporciona un medio reproducible para evaluar y comparar algoritmos de recuperación, orientar ajustes del sistema y desarrollar métricas; pero depender únicamente de él puede conducir a optimizaciones que exploten idiosincrasias del conjunto de prueba en lugar de las necesidades reales de usuarios.
Inversión
Inversión
Cuando la pregunta de investigación trata sobre recuperación interactiva, usabilidad, cambios longitudinales de contenido o colecciones web heterogéneas, las suposiciones del laboratorio (documentos y juicios fijos) dejan de aplicarse y se requieren métodos alternativos o complementarios (estudios con usuarios, pruebas A/B, seguimiento longitudinal).
Límite
Límite
Claramente dentro: experimentos a nivel de sistema usando un corpus estático, consultas predefinidas y juicios de relevancia acordados. Caso límite: una colección curada pero en evolución con actualizaciones de juicios. Claramente fuera: pruebas A/B en vivo con usuarios, estudios cualitativos de usabilidad o evaluaciones sobre contenidos web en cambio continuo.
Tensión semántica
Tensión semántica
Reproducibilidad controlada en laboratorio frente a validez ecológica en campo: un control estricto aumenta la validez interna pero reduce la certeza de predicción para entornos abiertos dirigidos por usuarios.
Síntesis
Síntesis
El paradigma Cranfield es una herramienta metodológica para aislar efectos algorítmicos; ofrece alta validez interna para afirmaciones comparativas, pero debe complementarse con métodos de campo o centrados en el usuario para establecer la validez externa.