Herramienta gratuita

Probador de robots.txt: ¿pueden Google y los bots de IA rastrear esta URL?

Prueba cualquier URL con tu robots.txt publicado o con una versión editada, para Googlebot, Bingbot y los rastreadores de IA, y mira la regla exacta que la permite o la bloquea.

User agents

Déjalo vacío para probar el fichero publicado. Pega o edita una versión para ver qué haría un cambio antes de publicarlo.

Qué hace este probador de robots.txt

Este probador de robots.txt (robots.txt tester) lee el robots.txt de la web que escribas y lo aplica como lo hacen los rastreadores, según el RFC 9309, el estándar que documenta Google:

  • Permitido o bloqueado: para cada user agent que elijas, si puede rastrear la URL, con sus parámetros incluidos.
  • La regla que decide: la línea Allow o Disallow que decide, su número de línea y el grupo al que pertenece, para que sepas exactamente qué cambiar.
  • Validación: las líneas que los rastreadores saltan o leen mal, como reglas antes de cualquier User-agent, directivas Noindex o Crawl-delay que Google ignora, dos puntos que faltan y ficheros de más de 500 KiB.
  • Prueba antes de publicar: tras una prueba con el fichero publicado, este se carga en el cuadro de texto. Edítalo y vuelve a probar para ver el efecto de un cambio sin tocar tu web.

Errores habituales en el robots.txt

  • Un grupo para un bot que olvida las reglas generales. Un rastreador con grupo propio ignora por completo el grupo *, así que las reglas que quieras que siga hay que repetirlas en el suyo.
  • Bloquear el CSS y el JavaScript. Google renderiza las páginas; si no puede cargar sus recursos, puede no ver el contenido.
  • Usar Disallow para desindexar. Una página bloqueada puede seguir en el índice. Usa noindex en una página que se pueda rastrear.
  • Un error de servidor en el robots.txt. Si /robots.txt responde 5xx, Google deja de rastrear toda la web hasta que se recupera.
  • Bloquear sin querer los rastreadores de búsqueda con IA. Un Disallow para todos los bots, o una regla del firewall, puede sacarte de las respuestas de ChatGPT y Perplexity.

El robots.txt y los rastreadores de IA

Las empresas de IA usan varios rastreadores con funciones distintas. GPTBot, ClaudeBot y CCBot recogen datos de entrenamiento. OAI-SearchBot, Claude-SearchBot y PerplexityBot crean los índices en los que buscan sus asistentes. ChatGPT-User y Perplexity-User cargan una página cuando un usuario pregunta por ella. Google-Extended y Applebot-Extended son interruptores sin rastreador propio: le dicen a Google y a Apple si pueden usar tu contenido para sus modelos de IA. Bloquea el entrenamiento si quieres, pero deja pasar a los rastreadores de búsqueda si quieres aparecer en las respuestas de IA. Tus logs del servidor te dicen cuáles vienen de verdad. Nuestro comprobador de rastreadores de IA los prueba todos a la vez, también cómo responde tu servidor a cada uno, y el generador de llms.txt da a los que dejas pasar un mapa de tus páginas clave.

Ser rastreable es el primer paso. Si después los motores de IA te recomiendan es lo que mide Mencoro , cada día en ChatGPT, Perplexity y los AI Overviews y el AI Mode de Google.

Preguntas frecuentes

Probador de robots.txt: preguntas frecuentes

Escribe la URL que quieres comprobar y elige los user agents. La herramienta lee tu robots.txt publicado, aplica las mismas reglas que documenta Google y te dice, para cada rastreador, si la URL está permitida o bloqueada y qué línea del fichero lo decide. Pega una versión editada en el cuadro de texto para ver qué haría un cambio antes de publicarlo.
Google retiró el probador de robots.txt de Search Console a finales de 2023 y lo cambió por un informe de robots.txt que enseña el fichero que ha descargado y sus errores, pero no prueba una URL contra él. Esta herramienta cubre ese hueco y añade los rastreadores de IA.
Sigue el grupo de su propio user agent, o el grupo * si no tiene uno; no combina los dos. Dentro del grupo gana la regla coincidente más larga, y si un Allow y un Disallow de la misma longitud coinciden, gana Allow. El * equivale a cualquier secuencia de caracteres y el $ marca el final de la URL.
No. El robots.txt controla el rastreo, no la indexación: una página bloqueada puede seguir indexada sin su contenido si otras webs la enlazan. Para sacar una página de los resultados, deja que Google la rastree y añade una etiqueta meta robots noindex o una cabecera X-Robots-Tag. Las líneas Noindex dentro del robots.txt se ignoran.
Depende de lo que busques. Bloquear rastreadores de entrenamiento como GPTBot o CCBot deja tu contenido fuera de futuros entrenamientos. Bloquear los de búsqueda y los que visitan a petición del usuario, como OAI-SearchBot, PerplexityBot o ChatGPT-User, también te deja fuera de las respuestas de esos asistentes, lo que suele costar visibilidad. Muchas webs bloquean el entrenamiento y permiten la búsqueda.

Más herramientas gratis

Ver todas las herramientas →

Empieza hoy a medir tu marca en los buscadores con IA

Controla cómo citan tu marca los motores de IA, sigue tus posiciones y compárate con la competencia, todo en una sola plataforma.