Definición
Técnica automatizada que recupera sistemáticamente recursos publicados en la web (páginas HTML, archivos enlazados y feeds legibles por máquina) siguiendo estructuras de enlaces, sitemaps o manifiestos de recolección para apoyar indexación, descubrimiento o captura de materiales académicos y culturales.

Principio

Principio
El rastreo opera de forma oportunista: un agente automatizado realiza peticiones HTTP siguiendo enlaces descubiertos o objetivos enumerados, sujeto a las respuestas del servidor, la dinámica de cambios y las restricciones de acceso; la cobertura depende de la topología de enlaces, la estrategia de descubrimiento y la accesibilidad de recursos, no garantiza exhaustividad.

Demostración

Demostración
Escenario ilustrativo: un trabajo de recolección comienza en el sitemap publicado de una institución, sigue enlaces de colecciones, descarga HTML y PDFs asociados, registra cabeceras HTTP y marcas temporales, y produce un registro de rastreo que luego un indexador incorpora para búsqueda e ingesta en archivo.

Aplicación incorrecta

Aplicación incorrecta
Asumir que un rastreo produce un corpus autoritativo y completo (por ejemplo, creer que se capturan todas las versiones y recursos no enlazados) confunde la recuperación oportunista con el acceso exhaustivo; contenidos dinámicos, con scripts o en paywall pueden quedar sin descubrir o incompletos.

Consecuencia

Consecuencia
El rastreo puede ofrecer amplia cobertura y capturar la estructura de enlaces y metadatos HTTP; también consume ancho de banda, puede recuperar estados transitorios, generar duplicados o representaciones inconsistentes y verse restringido por controles de acceso o políticas de servidor.

Inversión

Inversión
Cuando existen puntos de acceso estructurados y autorizados (APIs, exportes con licencia, feeds de editor), estos suelen proporcionar metadatos y contenidos más completos, estables o licenciados que el rastreo; aun así, el rastreo sigue siendo necesario para recursos sin exportes programáticos.

Límite

Límite
Claramente dentro: recolecciones automáticas programadas que siguen enlaces/sitemaps para colectar recursos web públicos. Caso límite: rastreos focalizados usando semillas de consulta y criterios estrechos. Claramente fuera: navegación manual y descargas individuales o transferencias negociadas por protocolos acordados.

Tensión semántica

Tensión semántica
Cobertura ↔ Respeto a las Restricciones del Proveedor — los rastreadores buscan máxima detección pero deben equilibrar exhaustividad con cortesía (límites de frecuencia, directivas robots) y respeto a políticas de acceso, lo que puede reducir la cobertura.

Síntesis

Síntesis
El rastreo web es una estrategia de descubrimiento y captura oportunista: eficaz para cobertura amplia cuando no existen exportes programáticos, pero intrínsecamente limitada por la descubribilidad, la dinámica del contenido y las restricciones de acceso.