¿Qué son los rastreadores de IA? Definición, user agents y cómo controlarlos

Los rastreadores de IA son los bots con los que las empresas de IA leen webs para entrenar modelos, indexar su buscador y responder. Cómo controlarlos.

  • Alvaro Peña de Luna Alvaro Peña de Luna
  • icono de fecha

    miércoles, 30 de sept de 2026

Los rastreadores de IA son bots automáticos que las empresas de IA envían a descargar páginas web, ya sea para reunir datos con los que entrenar sus modelos, para construir el índice de búsqueda que citan sus asistentes o para leer una página concreta cuando un usuario pregunta por ella. Cada uno se identifica con un user agent que puedes permitir o bloquear en el robots.txt.

Saber cuál es cuál importa, porque la misma línea del robots.txt puede dejarte fuera de un modelo futuro o fuera de las respuestas que un asistente da hoy.

Cómo funcionan los rastreadores de IA

Técnicamente, se comportan como los rastreadores de los buscadores: piden una URL, leen el HTML y siguen enlaces. Lo que cambia es qué pasa después con la página. Las empresas de IA tienen rastreadores con tres funciones distintas:

  • Rastreadores de entrenamiento: recogen páginas públicas que pueden servir para entrenar modelos futuros. Su efecto es lento: tu contenido solo influye en lo que sabe un modelo cuando se entrena uno nuevo con él.
  • Rastreadores de búsqueda: construyen el índice en el que busca el asistente cuando responde con resultados web. Este rastreo decide si tus páginas pueden recuperarse y citarse.
  • Agentes a petición del usuario: descargan una página en el momento, durante una conversación, cuando alguien pide al asistente que lea o compruebe algo.

Algunas empresas publican además tokens de robots.txt sin rastreador propio. Aprovechan un rastreo que ya existe y solo le indican a la empresa si puede usar tu contenido en sus productos de IA.

Los principales user agents de rastreadores de IA

Token de user agent Empresa Función
GPTBot OpenAI Entrenamiento
OAI-SearchBot OpenAI Índice de ChatGPT search
ChatGPT-User OpenAI Visitas a petición del usuario
ClaudeBot Anthropic Entrenamiento
Claude-SearchBot Anthropic Índice de búsqueda
Claude-User Anthropic Visitas a petición del usuario
PerplexityBot Perplexity Índice de búsqueda
Perplexity-User Perplexity Visitas a petición del usuario
Google-Extended Google Solo token: controla el uso en modelos Gemini
CCBot Common Crawl Dataset abierto usado para entrenar

Cada empresa documenta su propia lista, y cambia: consulta los rastreadores de OpenAI y los rastreadores comunes de Google. Ten en cuenta que los AI Overviews y el modo IA de Google usan el rastreo normal de Googlebot, no Google-Extended, así que bloquear Google-Extended no te saca de ellos.

Por qué importan los rastreadores de IA a las marcas

Un motor de IA solo puede citar lo que puede leer. Si su rastreador de búsqueda está bloqueado, por el robots.txt o por una regla del cortafuegos, tus páginas no pueden recuperarse para sus respuestas y el motor describirá tu marca con páginas ajenas: webs de reseñas, foros, comparativas de la competencia. Tus fichas de producto, tus precios y tu documentación dejan de ser la fuente.

Los rastreadores de entrenamiento trabajan a más largo plazo. Lo que un modelo sabe de tu marca sin buscar viene de aquello con lo que se entrenó, hasta su fecha de corte. Bloquear el entrenamiento es una decisión legítima, sobre todo para los medios, pero es un intercambio, no un ajuste de privacidad gratuito.

Cómo controlar los rastreadores de IA en el robots.txt

Una política habitual es seguir visible en la búsqueda con IA sin participar en el entrenamiento: permitir los rastreadores de búsqueda y los que visitan a petición del usuario, y bloquear los de entrenamiento.

User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: /

Dos reglas deciden cómo lo leen los rastreadores. Un rastreador con grupo propio sigue solo ese grupo e ignora las reglas de User-agent: *, así que repite ahí todo lo que también deba respetar. Dentro de un grupo, gana la ruta coincidente más larga. Antes de publicar un cambio, pega el archivo editado en el probador de robots.txt gratuito y prueba las URL importantes con cada bot.

Cómo comprobar qué rastreadores de IA llegan a tu web

  1. Comprueba el acceso. El comprobador de rastreadores de IA lee tu robots.txt como lo hace cada rastreador, pide la página con los user agents de los principales para detectar bloqueos del cortafuegos o la CDN, y avisa de las directivas noindex o nosnippet.
  2. Comprueba las visitas reales. El analizador de logs lee tu log de acceso en el navegador y muestra qué rastreadores de IA han venido, qué páginas han leído y dónde han recibido errores.
  3. Comprueba el resultado. El acceso es el punto de partida, no el objetivo. Mencoro sigue cómo te mencionan ChatGPT, Perplexity, Google AI Overview y el modo IA de Google frente a tu competencia, para que veas si abrir la puerta cambia las respuestas.

Errores frecuentes

  • Un solo interruptor para todos los bots de IA. Las opciones de CDN que bloquean los «bots de IA» con un clic suelen frenar también a los rastreadores de búsqueda y a los agentes de usuario, y eso te saca de las respuestas.
  • Bloquear GPTBot para salir de ChatGPT search. ChatGPT search depende de OAI-SearchBot. GPTBot es para el entrenamiento.
  • Bloquear Google-Extended para salir de los AI Overviews. No funciona así. Para limitar cómo muestra Google una página en sus funciones de IA, usa directivas de fragmento como nosnippet.
  • Fiarte del user agent. Cualquiera puede decir que es GPTBot. Para una auditoría rigurosa, contrasta las peticiones con los rangos de IP que publica cada empresa.
  • Esconder el contenido tras JavaScript. No des por hecho que todos los rastreadores de IA renderizan las páginas como Googlebot. Servir el contenido principal en el HTML es la opción segura.

Para cada rastreador de IA con su user agent, sus rangos de IP y su comportamiento con robots.txt, mira el índice de rastreadores de IA.

Términos relacionados del glosario

  • GPTBot: el rastreador de entrenamiento de OpenAI, en detalle.
  • llms.txt: un mapa seleccionado de tus páginas clave para los modelos de IA.
  • Generación aumentada por recuperación (RAG): cómo usan los motores las páginas que recogen los rastreadores de búsqueda para escribir sus respuestas.
  • Visibilidad en IA: con qué frecuencia y en qué tono aparece tu marca en las respuestas de IA.

FAQ

Preguntas frecuentes

Un rastreador de entrenamiento, como GPTBot o ClaudeBot, recoge páginas que pueden usarse para entrenar modelos futuros. Uno de búsqueda, como OAI-SearchBot o PerplexityBot, construye el índice en el que busca el asistente cuando responde con resultados web. Bloquear el primero deja tu contenido fuera del entrenamiento; bloquear el segundo deja tus páginas fuera de las respuestas.
No del todo. Bloquear los rastreadores de búsqueda y los que visitan a petición del usuario impide que esos motores lean y citen tus páginas, pero pueden seguir nombrando tu marca por lo que el modelo aprendió en su entrenamiento o por otras webs que hablan de ti. Pierdes el control de la fuente, no la mención.
Las principales empresas de IA documentan cómo leen el robots.txt sus rastreadores, pero es un estándar voluntario y cualquiera puede falsear un user agent. Si necesitas imponer un bloqueo, hazlo en el cortafuegos o la CDN y comprueba las peticiones con los rangos de IP que publica cada empresa.
Busca sus user agents en los logs de acceso de tu servidor. El analizador de logs gratuito de Mencoro lee el archivo en tu navegador y agrupa cada bot según su función, con sus peticiones, las páginas que lee y los errores que recibe.

Empieza hoy a medir tu marca en los buscadores con IA

Controla cómo citan tu marca los motores de IA, sigue tus posiciones y compárate con la competencia, todo en una sola plataforma.