GPTBot es el rastreador web de OpenAI que recoge páginas públicas que pueden usarse para entrenar sus modelos de IA generativa. Se identifica con el token de user agent GPTBot, lee el robots.txt y es distinto de OAI-SearchBot, el rastreador que está detrás de ChatGPT search.
Esa separación es lo único que debes recordar de GPTBot: decide qué pueden aprender de tu web los futuros modelos de OpenAI, no si ChatGPT puede citarte hoy.
Cómo funciona GPTBot
GPTBot pide páginas públicas como cualquier rastreador, lee su contenido y sigue los enlaces. Su
user agent completo contiene GPTBot y un enlace a openai.com/gptbot, y
OpenAI publica los rangos de IP que usan sus rastreadores, así que puedes distinguir una visita
real de una suplantación. OpenAI documentó GPTBot en agosto de 2023, y su descripción actual
está en la página de rastreadores de OpenAI.
Lo que recoge GPTBot no aparece en ChatGPT al día siguiente. Puede pasar a formar parte de los datos de entrenamiento de un modelo futuro, que solo lo refleja cuando ese modelo se entrena y se publica, y solo hasta su fecha de corte.
GPTBot frente a OAI-SearchBot y ChatGPT-User
OpenAI tiene tres user agents, y cada uno se puede permitir o bloquear por separado en el robots.txt:
| User agent | Qué hace | Si lo bloqueas |
|---|---|---|
GPTBot | Recoge contenido que puede usarse para entrenar los modelos de OpenAI | Tu contenido nuevo queda fuera de los datos de entrenamiento futuros |
OAI-SearchBot | Construye el índice con el que ChatGPT search encuentra y cita páginas | Tus páginas dejan de recuperarse y citarse en las respuestas de ChatGPT search |
ChatGPT-User | Descarga una página cuando un usuario pide a ChatGPT que la lea o la compruebe | ChatGPT no puede abrir tus páginas cuando un usuario se lo pide |
Otras empresas de IA siguen una división parecida, que la entrada sobre rastreadores de IA repasa empresa por empresa.
¿Deberías bloquear GPTBot?
Es una decisión de negocio, no técnica. Los medios cuyo producto es el contenido suelen bloquear GPTBot para dejarlo fuera del entrenamiento. Las marcas que quieren que los modelos de IA sepan quiénes son, qué venden y cómo se comparan suelen permitirlo, porque los datos de entrenamiento son parte de lo que usa un modelo cuando responde sin buscar.
Decidas lo que decidas sobre GPTBot, el rastreador que afecta hoy a tu visibilidad en las respuestas de ChatGPT es OAI-SearchBot. Bloquear GPTBot y permitir OAI-SearchBot es una política habitual y coherente.
Cómo bloquear o permitir GPTBot en el robots.txt
Para bloquear el entrenamiento sin dejar de aparecer en ChatGPT search:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
Allow: / Para que GPTBot solo lea una sección, por ejemplo tu blog:
User-agent: GPTBot
Allow: /blog/
Disallow: /
El segundo ejemplo funciona porque gana la regla coincidente más larga: /blog/ es más
larga que /, así que las URL del blog quedan permitidas y el resto bloqueado. Ten
en cuenta que, en cuanto GPTBot tiene su propio grupo, ignora tus reglas de User-agent: *, y que una web sin grupo para GPTBot y con un Disallow: / general también bloquea a
GPTBot. Prueba el archivo editado en el probador de robots.txt gratuito antes de publicarlo.
Cómo comprobar si GPTBot visita tu web
- Acceso: el comprobador de rastreadores de IA aplica tu robots.txt a GPTBot, OAI-SearchBot y ChatGPT-User y pide tu página con sus user agents, así que un bloqueo del cortafuegos o de la CDN aparece como un 403.
- Visitas: el analizador de logs lee tu log de acceso en el navegador y muestra con qué frecuencia viene cada rastreador de OpenAI, qué páginas lee y dónde recibe errores.
- Autenticidad: compara las IP de las peticiones sospechosas con los rangos que publica OpenAI. Una petición que dice ser GPTBot desde una IP que no está en la lista no es de OpenAI.
Errores frecuentes
- Bloquear GPTBot para salir de ChatGPT search. No funciona. La búsqueda depende de OAI-SearchBot.
- Bloquear todos los bots de OpenAI de golpe. Una regla de la CDN contra los «bots de IA» suele atrapar también a OAI-SearchBot y ChatGPT-User, y eso saca tus páginas de las fuentes de ChatGPT.
- Esperar efectos inmediatos. Permitir GPTBot no cambia las respuestas de hoy, y bloquearlo no borra lo que los modelos ya aprendieron.
Cómo medir el efecto en las respuestas de ChatGPT
Las reglas para rastreadores solo importan si cambian lo que ChatGPT dice de ti. Mencoro pregunta tus prompts a ChatGPT con la búsqueda web activada y guarda tanto el texto de la respuesta como las fuentes que devuelve, incluidas las páginas que recuperó su búsqueda. El seguimiento de posiciones en ChatGPT muestra con qué frecuencia te nombra, en qué posición y si tus propias páginas están entre las fuentes, frente a tu competencia. Para una muestra puntual, prueba el comprobador de posiciones en ChatGPT gratuito.
Para cada rastreador de IA con su user agent, sus rangos de IP y su comportamiento con robots.txt, mira el índice de rastreadores de IA.
Términos relacionados del glosario
- Rastreadores de IA: todos los bots de IA, agrupados según para qué recogen.
- Fecha de corte del conocimiento: la fecha en la que terminan los datos de entrenamiento de un modelo.
- Tráfico referido de IA: las visitas de quienes hacen clic en los enlaces de las respuestas de IA.
- llms.txt: un mapa seleccionado de tus páginas clave para los modelos de IA.
Alvaro Peña de Luna