Herramienta gratuita

Comprobador de rastreadores de IA: ¿pueden ChatGPT, Claude y Perplexity leer tu web?

Comprueba en segundos si 16 rastreadores de IA pueden leer una página, desde las reglas de tu robots.txt hasta cómo les responde tu servidor.

Qué revisa este comprobador de rastreadores de IA

Un motor de IA solo puede recomendar lo que puede leer. Este comprobador de rastreadores de IA mira los cuatro sitios donde una web puede dejar fuera a los rastreadores de IA, muchas veces sin que nadie se dé cuenta:

  1. robots.txt. Las reglas de cada rastreador se aplican como las lee el propio rastreador: gana el grupo de user agent más específico y decide la regla de ruta más larga.
  2. Tu servidor y tu CDN. Pedimos la página con el user agent de cada rastreador principal y comparamos la respuesta con la de un navegador normal. Los firewalls que bloquean “bots de IA” con un clic aparecen aquí como un 403.
  3. Directivas de la página. Una meta robots o una cabecera X-Robots-Tag con noindex o nosnippet deja la página fuera de las funciones de búsqueda, AI Overviews incluidos.
  4. llms.txt. Si la web publica uno. Es opcional, y nuestro generador de llms.txt prepara un borrador a partir de tu sitemap.

Los rastreadores de IA que revisamos

Rastreador Empresa Para qué
GPTBot OpenAI Entrenar modelos
OAI-SearchBot OpenAI Índice de búsqueda con IA
ChatGPT-User OpenAI Visitas cuando un usuario pregunta
ClaudeBot Anthropic Entrenar modelos
Claude-SearchBot Anthropic Índice de búsqueda con IA
Claude-User Anthropic Visitas cuando un usuario pregunta
PerplexityBot Perplexity Índice de búsqueda con IA
Perplexity-User Perplexity Visitas cuando un usuario pregunta
Googlebot Google Índice de búsqueda con IA
Google-Extended Google Token de exclusión, sin rastreador propio
Bingbot Microsoft Índice de búsqueda con IA
Applebot-Extended Apple Token de exclusión, sin rastreador propio
meta-externalagent Meta Entrenar modelos
Amazonbot Amazon Índice de búsqueda con IA
CCBot Common Crawl Entrenar modelos
Bytespider ByteDance Entrenar modelos

La diferencia que importa es entre entrenamiento y búsqueda. Bloquear un rastreador de entrenamiento deja tu contenido fuera de los modelos futuros; bloquear uno de búsqueda te saca de las respuestas que ese motor da hoy.

Cómo permitir o bloquear rastreadores de IA en robots.txt

Para seguir visible en la búsqueda con IA sin participar en el entrenamiento de modelos, permite los rastreadores de búsqueda y los que actúan a petición del usuario, y bloquea los de entrenamiento:

User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
Disallow: /

Dos cosas a tener en cuenta. El robots.txt es una petición, no un candado, así que revisa también la configuración de tu CDN, que es donde suelen estar los bloqueos accidentales. Y cada cambio aquí cambia exposición al entrenamiento por visibilidad: decide rastreador a rastreador, no con una regla global. Para ver cuáles te visitan de verdad, y con qué frecuencia, arrastra tu log de acceso al analizador de logs . Para probar una regla antes de publicarla, pega tu fichero editado en el probador de robots.txt y prueba cualquier URL con él.

Por qué importa el acceso de los rastreadores para la visibilidad en IA

El acceso de los rastreadores es el suelo, no el objetivo. Una web que los motores de IA pueden leer puede quedarse igualmente fuera de las respuestas, y la única forma de saberlo es medir. Mencoro sigue cómo te mencionan ChatGPT, Perplexity y las funciones de IA de Google , junto a tus competidores, para que veas si abrir la puerta cambia de verdad la respuesta.

Preguntas frecuentes

Comprobador de rastreadores de IA: preguntas frecuentes

Escribe tu dominio arriba. La herramienta lee tu robots.txt y aplica las reglas de cada rastreador de IA como lo hace el propio rastreador, y después pide la página con el user agent de los principales para ver si tu servidor o tu firewall les responde distinto que a un navegador normal.
Depende de lo que quieras. GPTBot recoge datos para entrenar los modelos de OpenAI; OAI-SearchBot construye el índice que cita la búsqueda de ChatGPT. Bloquear GPTBot deja tu contenido fuera del entrenamiento sin sacarte de la búsqueda de ChatGPT, siempre que OAI-SearchBot siga permitido.
No. Google-Extended controla si tu contenido se usa para entrenar y fundamentar los modelos Gemini. Los AI Overviews y el AI Mode usan el rastreo normal de Googlebot, así que para quedarte fuera hace falta una directiva de fragmentos como nosnippet, no Google-Extended.
Los firewalls y CDN como Cloudflare pueden bloquear bots de IA por user agent, diga lo que diga el robots.txt. Si la herramienta muestra un 403 para un rastreador que tu robots.txt permite, el bloqueo está en la configuración de tu servidor o CDN. En Googlebot y Bingbot, un 403 también puede significar que tu firewall bloquea impostores, y eso está bien.

Más herramientas gratis

Ver todas las herramientas →

Empieza hoy a medir tu marca en los buscadores con IA

Controla cómo citan tu marca los motores de IA, sigue tus posiciones y compárate con la competencia, todo en una sola plataforma.