R-CLO
CloudScraper
Rastrea un sitio web objetivo y escanea con regex cada página encontrada en busca de referencias a recursos de S3, Azure Blob o DigitalOcean Spaces.
Sitio oficialVolver al catálogo
RESUMEN
CloudScraper (github.com/jordanpotti/CloudScraper) es una herramienta de reconocimiento en Python con un enfoque distinto al de los brute-forcers por permutación de palabras clave: en lugar de adivinar nombres de buckets, rastrea las propias páginas del sitio web objetivo y escanea con regex el código fuente crudo de la página — no solo los enlaces HTML ya parseados — en busca de referencias a recursos de storage cloud como buckets S3 (`s3.amazonaws.com`), Azure Blob Storage (`windows.net`) y DigitalOcean Spaces.
Como compara contra el código fuente crudo y no solo contra etiquetas `<a href>`, detecta URLs de storage que están ocultas en JavaScript inline, blobs JSON o comentarios — lugares donde el propio código front-end del objetivo referencia un bucket que un crawler basado solo en enlaces pasaría por alto. Soporta profundidad de rastreo configurable, procesos worker concurrentes y escanear una lista de objetivos en una sola ejecución.
CASOS DE USO
Casos de uso en un engagement
- 01
Descubrir buckets de storage cloud referenciados dentro del HTML, scripts inline o JavaScript empaquetado de un objetivo.
- 02
Complementar herramientas de permutación de palabras clave (cloud_enum, CloudBrute) con un ángulo de descubrimiento basado en evidencia y dirigido por el sitio.
- 03
Escanear en lote una lista de dominios objetivo desde un archivo de alcance provisto por el cliente en una sola pasada.
- 04
Ajustar la profundidad de rastreo y el número de procesos para equilibrar cobertura contra tiempo de escaneo en sitios grandes.
PRIMEROS PASOS
Durante el reconocimiento centrado en web, para encontrar enlaces a storage cloud que el propio sitio del objetivo filtra en HTML, scripts inline o bundles de JavaScript.
- Clona el repositorio e instala las dependencias (`requests`, `beautifulsoup4`, `termcolor`, `rfc3987`) con pip.
- Confirma que el sitio objetivo está en alcance, ya que esta herramienta rastrea activamente y descarga cada página a la que puede llegar.
- Ejecuta contra una única URL con `-u`, o pasa un archivo de objetivos con `-l` para un escaneo en lote.
- Ajusta `-d` (profundidad de rastreo) y `-p` (procesos paralelos) según el tamaño del sitio objetivo.
- Revisa los enlaces de storage cloud marcados y verifica por separado la accesibilidad real del bucket/contenedor.
python3 CloudScraper.py -u https://www.target.com -d 5 -p 4 -vANTES DE USARLA
Qué revisar antes de lanzarla
Este es un spider web activo, no una fuente OSINT pasiva — rastrear un sitio completo puede generar un volumen alto de tráfico y activar límites de tasa o reglas de WAF.
Rastrea solo dominios y páginas dentro del alcance autorizado del engagement; un spider seguirá los enlaces a donde lleven a menos que se acote.
Una coincidencia de regex para una URL de storage es una pista, no un hallazgo — confirma que el recurso realmente existe y es accesible antes de reportarlo.