 ##  [Rastreo Web](/es/node/72200) 

 Definición

Técnica automatizada que recupera sistemáticamente recursos publicados en la web (páginas HTML, archivos enlazados y feeds legibles por máquina) siguiendo estructuras de enlaces, sitemaps o manifiestos de recolección para apoyar indexación, descubrimiento o captura de materiales académicos y culturales.

 

 

 

 

 

 





## Principio

Principio

El rastreo opera de forma oportunista: un agente automatizado realiza peticiones HTTP siguiendo enlaces descubiertos o objetivos enumerados, sujeto a las respuestas del servidor, la dinámica de cambios y las restricciones de acceso; la cobertura depende de la topología de enlaces, la estrategia de descubrimiento y la accesibilidad de recursos, no garantiza exhaustividad.

 

 

 

 

 





## Demostración

Demostración

Escenario ilustrativo: un trabajo de recolección comienza en el sitemap publicado de una institución, sigue enlaces de colecciones, descarga HTML y PDFs asociados, registra cabeceras HTTP y marcas temporales, y produce un registro de rastreo que luego un indexador incorpora para búsqueda e ingesta en archivo.

 

 

 

 

## Aplicación incorrecta

Aplicación incorrecta

Asumir que un rastreo produce un corpus autoritativo y completo (por ejemplo, creer que se capturan todas las versiones y recursos no enlazados) confunde la recuperación oportunista con el acceso exhaustivo; contenidos dinámicos, con scripts o en paywall pueden quedar sin descubrir o incompletos.

 

 

 

 

 





## Consecuencia

Consecuencia

El rastreo puede ofrecer amplia cobertura y capturar la estructura de enlaces y metadatos HTTP; también consume ancho de banda, puede recuperar estados transitorios, generar duplicados o representaciones inconsistentes y verse restringido por controles de acceso o políticas de servidor.

 

 

 

 

## Inversión

Inversión

Cuando existen puntos de acceso estructurados y autorizados (APIs, exportes con licencia, feeds de editor), estos suelen proporcionar metadatos y contenidos más completos, estables o licenciados que el rastreo; aun así, el rastreo sigue siendo necesario para recursos sin exportes programáticos.

 

 

 

 

 





## Límite

Límite

Claramente dentro: recolecciones automáticas programadas que siguen enlaces/sitemaps para colectar recursos web públicos. Caso límite: rastreos focalizados usando semillas de consulta y criterios estrechos. Claramente fuera: navegación manual y descargas individuales o transferencias negociadas por protocolos acordados.

 

 

 

 

 





## Tensión semántica

Tensión semántica

Cobertura ↔ Respeto a las Restricciones del Proveedor — los rastreadores buscan máxima detección pero deben equilibrar exhaustividad con cortesía (límites de frecuencia, directivas robots) y respeto a políticas de acceso, lo que puede reducir la cobertura.

 

 

 

 

 





## Síntesis

Síntesis

El rastreo web es una estrategia de descubrimiento y captura oportunista: eficaz para cobertura amplia cuando no existen exportes programáticos, pero intrínsecamente limitada por la descubribilidad, la dinámica del contenido y las restricciones de acceso.