Définition
Un cadre d’évaluation expérimentale en recherche d’information où une collection de documents fixe, un ensemble de besoins d’information (requêtes) et des jugements d’utilité réalisés par des évaluateurs servent d’entrées standardisées pour comparer des systèmes ou algorithmes de recherche dans des conditions contrôlées.
Principe
Principe
En maintenant constantes la collection documentaire et les jugements de pertinence, on isole les différences liées au système ou à l’algorithme, ce qui permet des comparaisons quantitatives répétables de l’efficacité de recherche.
Démonstration
Démonstration
Scénario illustratif → Situation : Un chercheur constitue un corpus statique de 10 000 documents et 50 requêtes représentatives. Reconnaissance : Il reconnaît que ne modifier que l’algorithme de recherche préserve la comparabilité. Action : Il exécute deux algorithmes sur le même corpus et mesure la précision des résultats classés à l’aide des jugements existants. Conséquence : Les différences mesurées peuvent être attribuées au comportement algorithmique plutôt qu’à la variation des collections ou critères.
Mauvaise application
Mauvaise application
Considérer les résultats de Cranfield comme des mesures directes de la satisfaction des utilisateurs réels : puisque le paradigme fixe la collection et les requêtes, les conclusions ne se généralisent qu’à des collections et formulations de tâches similaires, pas à la recherche web ouverte ou aux comportements interactifs des utilisateurs.
Conséquence
Conséquence
Fournit un moyen reproductible d’évaluer et de comparer des algorithmes de recherche, d’orienter l’ajustement des systèmes et de développer des métriques d’évaluation ; mais s’y fier exclusivement peut conduire à optimiser des caractéristiques propres au jeu de test plutôt qu’aux besoins des utilisateurs.
Inversion
Inversion
Quand la question porte sur la recherche interactive, l’utilisabilité, l’évolution longitudinale du contenu ou des collections web hétérogènes, les hypothèses de laboratoire (documents et jugements fixes) ne s’appliquent plus et des méthodes complémentaires (études utilisateur, tests A/B, suivi longitudinal) sont nécessaires.
Limite
Limite
Clairement à l’intérieur : expériences au niveau système utilisant un corpus statique, des requêtes prédéfinies et des jugements de pertinence partagés. Cas limite : une collection sélectionnée mais évolutive avec mises à jour des jugements. Clairement à l’extérieur : tests A/B en direct avec des utilisateurs, études qualitatives d’utilisabilité ou évaluations sur des contenus web en changement continu.
Tension sémantique
Tension sémantique
Reproductibilité expérimentale contrôlée versus validité écologique sur le terrain : un contrôle expérimental strict augmente la validité interne mais réduit la certitude que les résultats prédisent la performance en environnement utilisateur ouvert.
Synthèse
Synthèse
Le paradigme de Cranfield est un outil méthodologique pour isoler les effets algorithmiques ; il offre une forte validité interne pour les affirmations comparatives mais doit être compensé par des méthodes de terrain ou centrées sur l’utilisateur pour établir la validité externe.