Définition
Technique automatisée qui récupère systématiquement des ressources publiées sur le Web (pages HTML, fichiers liés et flux lisibles par machine) en suivant la structure des liens, des sitemaps ou des manifestes de moissonnage pour alimenter l’indexation, la découverte ou la capture de matériaux scientifiques et patrimoniaux.
Principe
Principe
L’exploration est opportuniste : un agent automatisé effectue des requêtes HTTP en suivant les liens découverts ou des cibles énumérées, soumis aux réponses du serveur, à la dynamique des changements et aux contraintes d’accès ; la couverture dépend donc de la topologie des liens, de la stratégie de découverte et de l’accessibilité des ressources, et non d’une garantie d’exhaustivité.
Démonstration
Démonstration
Scénario illustratif : un travail de moissonnage démarre à partir du sitemap publié d’un établissement, suit les liens des collections, télécharge les pages HTML et les PDF joints, enregistre les en‑têtes HTTP et les horodatages, et produit un journal de crawl qu’un indexeur utilise ensuite pour la recherche et l’ingestion d’archives.
Mauvaise application
Mauvaise application
Prétendre qu’un crawl fournit un corpus autoritatif et complet (par exemple, croire que toutes les versions et ressources non liées seront capturées) confond récupération opportuniste et accès exhaustif ; les contenus dynamiques, scriptés ou protégés par paywall peuvent rester introuvables ou incomplets.
Conséquence
Conséquence
L’exploration peut procurer une large couverture et capturer la structure des liens et les métadonnées HTTP ; elle consomme toutefois de la bande passante, peut enregistrer des états transitoires, générer des représentations dupliquées ou incohérentes et être limitée par des contrôles d’accès ou des politiques serveur.
Inversion
Inversion
Lorsqu’il existe des points d’accès structurés et autorisés (APIs, exports sous licence, flux éditeurs), ils fournissent souvent des métadonnées et contenus plus complets, stables ou licenciés que l’exploration ; inversement, l’exploration reste nécessaire pour les ressources sans export programmatique ou API publique.
Limite
Limite
Dans la définition : moissonnages automatisés programmés qui suivent liens/sitemaps pour collecter des ressources publiques web. Cas limite : crawls ciblés utilisant graines de requête et critères de sélection étroits. Hors définition : navigation manuelle et téléchargements individuels ou transferts négociés via protocoles convenus.
Tension sémantique
Tension sémantique
Couverture ↔ Respect des Contraintes Fournisseur — les crawlers visent la découverte maximale mais doivent équilibrer exhaustivité et politesse (limites de fréquence, directives robots) ainsi que le respect des politiques d’accès, ce qui peut réduire la couverture.
Synthèse
Synthèse
L’exploration Web est une stratégie de découverte et de capture opportuniste : efficace pour une couverture large quand il n’existe pas d’export programmatique, mais fondamentalement limitée par la découvrabilité, la dynamique du contenu et les contraintes d’accès.