Herramienta gratuita
Comprobador de rastreadores de IA: ¿pueden ChatGPT, Claude y Perplexity leer tu web?
Comprueba en segundos si 16 rastreadores de IA pueden leer una página, desde las reglas de tu robots.txt hasta cómo les responde tu servidor.
Qué revisa este comprobador de rastreadores de IA
Un motor de IA solo puede recomendar lo que puede leer. Este comprobador de rastreadores de IA mira los cuatro sitios donde una web puede dejar fuera a los rastreadores de IA, muchas veces sin que nadie se dé cuenta:
- robots.txt. Las reglas de cada rastreador se aplican como las lee el propio rastreador: gana el grupo de user agent más específico y decide la regla de ruta más larga.
- Tu servidor y tu CDN. Pedimos la página con el user agent de cada rastreador principal y comparamos la respuesta con la de un navegador normal. Los firewalls que bloquean “bots de IA” con un clic aparecen aquí como un 403.
- Directivas de la página. Una meta robots o una cabecera X-Robots-Tag con noindex o nosnippet deja la página fuera de las funciones de búsqueda, AI Overviews incluidos.
- llms.txt. Si la web publica uno. Es opcional, y nuestro generador de llms.txt prepara un borrador a partir de tu sitemap.
Los rastreadores de IA que revisamos
| Rastreador | Empresa | Para qué |
|---|---|---|
GPTBot | OpenAI | Entrenar modelos |
OAI-SearchBot | OpenAI | Índice de búsqueda con IA |
ChatGPT-User | OpenAI | Visitas cuando un usuario pregunta |
ClaudeBot | Anthropic | Entrenar modelos |
Claude-SearchBot | Anthropic | Índice de búsqueda con IA |
Claude-User | Anthropic | Visitas cuando un usuario pregunta |
PerplexityBot | Perplexity | Índice de búsqueda con IA |
Perplexity-User | Perplexity | Visitas cuando un usuario pregunta |
Googlebot | Índice de búsqueda con IA | |
Google-Extended | Token de exclusión, sin rastreador propio | |
Bingbot | Microsoft | Índice de búsqueda con IA |
Applebot-Extended | Apple | Token de exclusión, sin rastreador propio |
meta-externalagent | Meta | Entrenar modelos |
Amazonbot | Amazon | Índice de búsqueda con IA |
CCBot | Common Crawl | Entrenar modelos |
Bytespider | ByteDance | Entrenar modelos |
La diferencia que importa es entre entrenamiento y búsqueda. Bloquear un rastreador de entrenamiento deja tu contenido fuera de los modelos futuros; bloquear uno de búsqueda te saca de las respuestas que ese motor da hoy.
Cómo permitir o bloquear rastreadores de IA en robots.txt
Para seguir visible en la búsqueda con IA sin participar en el entrenamiento de modelos, permite los rastreadores de búsqueda y los que actúan a petición del usuario, y bloquea los de entrenamiento:
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: / Dos cosas a tener en cuenta. El robots.txt es una petición, no un candado, así que revisa también la configuración de tu CDN, que es donde suelen estar los bloqueos accidentales. Y cada cambio aquí cambia exposición al entrenamiento por visibilidad: decide rastreador a rastreador, no con una regla global. Para ver cuáles te visitan de verdad, y con qué frecuencia, arrastra tu log de acceso al analizador de logs . Para probar una regla antes de publicarla, pega tu fichero editado en el probador de robots.txt y prueba cualquier URL con él.
Por qué importa el acceso de los rastreadores para la visibilidad en IA
El acceso de los rastreadores es el suelo, no el objetivo. Una web que los motores de IA pueden leer puede quedarse igualmente fuera de las respuestas, y la única forma de saberlo es medir. Mencoro sigue cómo te mencionan ChatGPT, Perplexity y las funciones de IA de Google , junto a tus competidores, para que veas si abrir la puerta cambia de verdad la respuesta.
Preguntas frecuentes
Comprobador de rastreadores de IA: preguntas frecuentes
Más herramientas gratis
Empieza hoy a medir tu marca en los buscadores con IA
Controla cómo citan tu marca los motores de IA, sigue tus posiciones y compárate con la competencia, todo en una sola plataforma.