Herramienta gratuita
Probador de robots.txt: ¿pueden Google y los bots de IA rastrear esta URL?
Prueba cualquier URL con tu robots.txt publicado o con una versión editada, para Googlebot, Bingbot y los rastreadores de IA, y mira la regla exacta que la permite o la bloquea.
Qué hace este probador de robots.txt
Este probador de robots.txt (robots.txt tester) lee el robots.txt de la web que escribas y lo aplica como lo hacen los rastreadores, según el RFC 9309, el estándar que documenta Google:
- Permitido o bloqueado: para cada user agent que elijas, si puede rastrear la URL, con sus parámetros incluidos.
- La regla que decide: la línea Allow o Disallow que decide, su número de línea y el grupo al que pertenece, para que sepas exactamente qué cambiar.
- Validación: las líneas que los rastreadores saltan o leen mal, como reglas antes de cualquier User-agent, directivas Noindex o Crawl-delay que Google ignora, dos puntos que faltan y ficheros de más de 500 KiB.
- Prueba antes de publicar: tras una prueba con el fichero publicado, este se carga en el cuadro de texto. Edítalo y vuelve a probar para ver el efecto de un cambio sin tocar tu web.
Errores habituales en el robots.txt
- Un grupo para un bot que olvida las reglas generales. Un rastreador con grupo propio ignora por completo el grupo *, así que las reglas que quieras que siga hay que repetirlas en el suyo.
- Bloquear el CSS y el JavaScript. Google renderiza las páginas; si no puede cargar sus recursos, puede no ver el contenido.
- Usar Disallow para desindexar. Una página bloqueada puede seguir en el índice. Usa noindex en una página que se pueda rastrear.
- Un error de servidor en el robots.txt. Si /robots.txt responde 5xx, Google deja de rastrear toda la web hasta que se recupera.
- Bloquear sin querer los rastreadores de búsqueda con IA. Un Disallow para todos los bots, o una regla del firewall, puede sacarte de las respuestas de ChatGPT y Perplexity.
El robots.txt y los rastreadores de IA
Las empresas de IA usan varios rastreadores con funciones distintas. GPTBot, ClaudeBot y CCBot recogen datos de entrenamiento. OAI-SearchBot, Claude-SearchBot y PerplexityBot crean los índices en los que buscan sus asistentes. ChatGPT-User y Perplexity-User cargan una página cuando un usuario pregunta por ella. Google-Extended y Applebot-Extended son interruptores sin rastreador propio: le dicen a Google y a Apple si pueden usar tu contenido para sus modelos de IA. Bloquea el entrenamiento si quieres, pero deja pasar a los rastreadores de búsqueda si quieres aparecer en las respuestas de IA. Tus logs del servidor te dicen cuáles vienen de verdad. Nuestro comprobador de rastreadores de IA los prueba todos a la vez, también cómo responde tu servidor a cada uno, y el generador de llms.txt da a los que dejas pasar un mapa de tus páginas clave.
Ser rastreable es el primer paso. Si después los motores de IA te recomiendan es lo que mide Mencoro , cada día en ChatGPT, Perplexity y los AI Overviews y el AI Mode de Google.
Preguntas frecuentes
Probador de robots.txt: preguntas frecuentes
Más herramientas gratis
Empieza hoy a medir tu marca en los buscadores con IA
Controla cómo citan tu marca los motores de IA, sigue tus posiciones y compárate con la competencia, todo en una sola plataforma.