Saltar al contenido
OPS // KITitspentest.sh

R-CLO

CloudScraper

Rastrea un sitio web objetivo y escanea con regex cada página encontrada en busca de referencias a recursos de S3, Azure Blob o DigitalOcean Spaces.

Sitio oficialVolver al catálogo

RESUMEN

CloudScraper (github.com/jordanpotti/CloudScraper) es una herramienta de reconocimiento en Python con un enfoque distinto al de los brute-forcers por permutación de palabras clave: en lugar de adivinar nombres de buckets, rastrea las propias páginas del sitio web objetivo y escanea con regex el código fuente crudo de la página — no solo los enlaces HTML ya parseados — en busca de referencias a recursos de storage cloud como buckets S3 (`s3.amazonaws.com`), Azure Blob Storage (`windows.net`) y DigitalOcean Spaces.

Como compara contra el código fuente crudo y no solo contra etiquetas `<a href>`, detecta URLs de storage que están ocultas en JavaScript inline, blobs JSON o comentarios — lugares donde el propio código front-end del objetivo referencia un bucket que un crawler basado solo en enlaces pasaría por alto. Soporta profundidad de rastreo configurable, procesos worker concurrentes y escanear una lista de objetivos en una sola ejecución.

CASOS DE USO

Casos de uso en un engagement

  • 01

    Descubrir buckets de storage cloud referenciados dentro del HTML, scripts inline o JavaScript empaquetado de un objetivo.

  • 02

    Complementar herramientas de permutación de palabras clave (cloud_enum, CloudBrute) con un ángulo de descubrimiento basado en evidencia y dirigido por el sitio.

  • 03

    Escanear en lote una lista de dominios objetivo desde un archivo de alcance provisto por el cliente en una sola pasada.

  • 04

    Ajustar la profundidad de rastreo y el número de procesos para equilibrar cobertura contra tiempo de escaneo en sitios grandes.

PRIMEROS PASOS

Durante el reconocimiento centrado en web, para encontrar enlaces a storage cloud que el propio sitio del objetivo filtra en HTML, scripts inline o bundles de JavaScript.

  1. Clona el repositorio e instala las dependencias (`requests`, `beautifulsoup4`, `termcolor`, `rfc3987`) con pip.
  2. Confirma que el sitio objetivo está en alcance, ya que esta herramienta rastrea activamente y descarga cada página a la que puede llegar.
  3. Ejecuta contra una única URL con `-u`, o pasa un archivo de objetivos con `-l` para un escaneo en lote.
  4. Ajusta `-d` (profundidad de rastreo) y `-p` (procesos paralelos) según el tamaño del sitio objetivo.
  5. Revisa los enlaces de storage cloud marcados y verifica por separado la accesibilidad real del bucket/contenedor.
python3 — bash
python3 CloudScraper.py -u https://www.target.com -d 5 -p 4 -v

ANTES DE USARLA

Qué revisar antes de lanzarla

Este es un spider web activo, no una fuente OSINT pasiva — rastrear un sitio completo puede generar un volumen alto de tráfico y activar límites de tasa o reglas de WAF.

Rastrea solo dominios y páginas dentro del alcance autorizado del engagement; un spider seguirá los enlaces a donde lleven a menos que se acote.

Una coincidencia de regex para una URL de storage es una pista, no un hallazgo — confirma que el recurso realmente existe y es accesible antes de reportarlo.

SIGUE EXPLORANDO

Ver toda la fase →