Índice de rastreadores de IA

¿Qué es CCBot?

CCBot es el rastreador de Common Crawl para entrenar IA. Construye el repositorio abierto y gratuito de datos de rastreo de Common Crawl, una fuente habitual de conjuntos de entrenamiento.

En resumen

OperadorCommon Crawl
FinalidadEntrenamiento de IA
User agent CCBot/2.0 (https://commoncrawl.org/faq/)
Respeta robots.txtSí, según el operador
Rangos de IP publicados https://index.commoncrawl.org/ccbot.json
Cómo verificarlo DNS inverso hacia *.crawl.commoncrawl.org con confirmación directa (solo IPv4), o la lista de IP.
Documentación oficial https://commoncrawl.org/ccbot

¿Conviene bloquear CCBot?

Recoge páginas para entrenar modelos, no para responder preguntas en tiempo real. Bloquearlo deja tu contenido futuro fuera de los datos de entrenamiento de ese operador, pero no te saca de las respuestas de búsqueda con IA, que alimentan otros rastreadores. Bloquéalo si no quieres que tu contenido entre en conjuntos de entrenamiento; permítelo si quieres que los modelos futuros conozcan tu marca.

Respeta Crawl-delay. Bloquearlo solo frena los rastreos futuros, no los archivos ya publicados. Common Crawl avisa de que hay CCBots falsos, así que verifícalo.

Cómo bloquear o permitir CCBot en robots.txt

Bloquearlo en toda la web:

User-agent: CCBot
Disallow: /

Permitirlo en toda la web:

User-agent: CCBot
Allow: /

Las reglas se asignan por el token de la línea User-agent. Prueba el resultado con el probador de robots.txt antes de publicarlo.

Comprueba tu propia web

El comprobador de rastreadores de IA te dice qué rastreadores de IA deja pasar tu robots.txt, y el analizador de logs muestra con qué frecuencia te visita cada uno. Para el contexto, mira qué son los rastreadores de IA y el índice completo de rastreadores de IA.

FAQ

Preguntas sobre CCBot

CCBot es el rastreador de Common Crawl para entrenar IA. Construye el repositorio abierto y gratuito de datos de rastreo de Common Crawl, una fuente habitual de conjuntos de entrenamiento.
Sí. Common Crawl dice que CCBot sigue las reglas de robots.txt, así que una regla Disallow para su token lo frena.
Añade «User-agent: CCBot» seguido de «Disallow: /» a tu robots.txt. Respeta Crawl-delay. Bloquearlo solo frena los rastreos futuros, no los archivos ya publicados. Common Crawl avisa de que hay CCBots falsos, así que verifícalo.

Empieza hoy a medir tu marca en los buscadores con IA

Controla cómo citan tu marca los motores de IA, sigue tus posiciones y compárate con la competencia, todo en una sola plataforma.