Los rastreadores de IA son bots automáticos que las empresas de IA envían a descargar páginas web, ya sea para reunir datos con los que entrenar sus modelos, para construir el índice de búsqueda que citan sus asistentes o para leer una página concreta cuando un usuario pregunta por ella. Cada uno se identifica con un user agent que puedes permitir o bloquear en el robots.txt.
Saber cuál es cuál importa, porque la misma línea del robots.txt puede dejarte fuera de un modelo futuro o fuera de las respuestas que un asistente da hoy.
Cómo funcionan los rastreadores de IA
Técnicamente, se comportan como los rastreadores de los buscadores: piden una URL, leen el HTML y siguen enlaces. Lo que cambia es qué pasa después con la página. Las empresas de IA tienen rastreadores con tres funciones distintas:
- Rastreadores de entrenamiento: recogen páginas públicas que pueden servir para entrenar modelos futuros. Su efecto es lento: tu contenido solo influye en lo que sabe un modelo cuando se entrena uno nuevo con él.
- Rastreadores de búsqueda: construyen el índice en el que busca el asistente cuando responde con resultados web. Este rastreo decide si tus páginas pueden recuperarse y citarse.
- Agentes a petición del usuario: descargan una página en el momento, durante una conversación, cuando alguien pide al asistente que lea o compruebe algo.
Algunas empresas publican además tokens de robots.txt sin rastreador propio. Aprovechan un rastreo que ya existe y solo le indican a la empresa si puede usar tu contenido en sus productos de IA.
Los principales user agents de rastreadores de IA
| Token de user agent | Empresa | Función |
|---|---|---|
GPTBot | OpenAI | Entrenamiento |
OAI-SearchBot | OpenAI | Índice de ChatGPT search |
ChatGPT-User | OpenAI | Visitas a petición del usuario |
ClaudeBot | Anthropic | Entrenamiento |
Claude-SearchBot | Anthropic | Índice de búsqueda |
Claude-User | Anthropic | Visitas a petición del usuario |
PerplexityBot | Perplexity | Índice de búsqueda |
Perplexity-User | Perplexity | Visitas a petición del usuario |
Google-Extended | Solo token: controla el uso en modelos Gemini | |
CCBot | Common Crawl | Dataset abierto usado para entrenar |
Cada empresa documenta su propia lista, y cambia: consulta los rastreadores de OpenAI y los rastreadores comunes de Google. Ten en cuenta que los AI Overviews y el modo IA de Google usan el rastreo normal de Googlebot, no Google-Extended, así que bloquear Google-Extended no te saca de ellos.
Por qué importan los rastreadores de IA a las marcas
Un motor de IA solo puede citar lo que puede leer. Si su rastreador de búsqueda está bloqueado, por el robots.txt o por una regla del cortafuegos, tus páginas no pueden recuperarse para sus respuestas y el motor describirá tu marca con páginas ajenas: webs de reseñas, foros, comparativas de la competencia. Tus fichas de producto, tus precios y tu documentación dejan de ser la fuente.
Los rastreadores de entrenamiento trabajan a más largo plazo. Lo que un modelo sabe de tu marca sin buscar viene de aquello con lo que se entrenó, hasta su fecha de corte. Bloquear el entrenamiento es una decisión legítima, sobre todo para los medios, pero es un intercambio, no un ajuste de privacidad gratuito.
Cómo controlar los rastreadores de IA en el robots.txt
Una política habitual es seguir visible en la búsqueda con IA sin participar en el entrenamiento: permitir los rastreadores de búsqueda y los que visitan a petición del usuario, y bloquear los de entrenamiento.
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: /
Dos reglas deciden cómo lo leen los rastreadores. Un rastreador con grupo propio sigue solo ese
grupo e ignora las reglas de User-agent: *, así que repite ahí todo lo que también
deba respetar. Dentro de un grupo, gana la ruta coincidente más larga. Antes de publicar un
cambio, pega el archivo editado en el probador de robots.txt
gratuito y prueba las URL importantes con cada bot.
Cómo comprobar qué rastreadores de IA llegan a tu web
- Comprueba el acceso. El comprobador de rastreadores de IA lee tu robots.txt como lo hace cada rastreador, pide la página con los user agents de los principales para detectar bloqueos del cortafuegos o la CDN, y avisa de las directivas noindex o nosnippet.
- Comprueba las visitas reales. El analizador de logs lee tu log de acceso en el navegador y muestra qué rastreadores de IA han venido, qué páginas han leído y dónde han recibido errores.
- Comprueba el resultado. El acceso es el punto de partida, no el objetivo. Mencoro sigue cómo te mencionan ChatGPT, Perplexity, Google AI Overview y el modo IA de Google frente a tu competencia, para que veas si abrir la puerta cambia las respuestas.
Errores frecuentes
- Un solo interruptor para todos los bots de IA. Las opciones de CDN que bloquean los «bots de IA» con un clic suelen frenar también a los rastreadores de búsqueda y a los agentes de usuario, y eso te saca de las respuestas.
- Bloquear GPTBot para salir de ChatGPT search. ChatGPT search depende de OAI-SearchBot. GPTBot es para el entrenamiento.
- Bloquear Google-Extended para salir de los AI Overviews. No funciona así. Para
limitar cómo muestra Google una página en sus funciones de IA, usa directivas de fragmento como
nosnippet. - Fiarte del user agent. Cualquiera puede decir que es GPTBot. Para una auditoría rigurosa, contrasta las peticiones con los rangos de IP que publica cada empresa.
- Esconder el contenido tras JavaScript. No des por hecho que todos los rastreadores de IA renderizan las páginas como Googlebot. Servir el contenido principal en el HTML es la opción segura.
Para cada rastreador de IA con su user agent, sus rangos de IP y su comportamiento con robots.txt, mira el índice de rastreadores de IA.
Términos relacionados del glosario
- GPTBot: el rastreador de entrenamiento de OpenAI, en detalle.
- llms.txt: un mapa seleccionado de tus páginas clave para los modelos de IA.
- Generación aumentada por recuperación (RAG): cómo usan los motores las páginas que recogen los rastreadores de búsqueda para escribir sus respuestas.
- Visibilidad en IA: con qué frecuencia y en qué tono aparece tu marca en las respuestas de IA.
Alvaro Peña de Luna