La fecha de corte del conocimiento (knowledge cutoff) es la fecha a partir de la cual un modelo de lenguaje grande no tiene información en sus datos de entrenamiento: todo lo que se publicó o cambió después le resulta desconocido, salvo que lo recupere de la web o de otra fuente en el momento de responder.
Para una marca, la fecha de corte explica una frustración conocida: una respuesta de IA que describe tus precios antiguos, ignora tu producto nuevo o no sabe que existes.
Por qué los modelos de lenguaje tienen fecha de corte
Un modelo de lenguaje grande aprende de una instantánea de textos recopilados hasta una fecha. Entrenar y probar el modelo lleva después meses, así que la fecha de corte suele ser anterior a la de lanzamiento, y el modelo se sigue usando mucho tiempo después. Los proveedores suelen indicar la fecha de corte en su documentación.
Hay dos detalles que se pasan por alto con facilidad:
- Los últimos meses están poco cubiertos. Cuando se toma la instantánea, se ha escrito menos sobre lo más reciente, así que el modelo tiende a saber menos del periodo justo anterior a su fecha de corte.
- Los modelos no son fiables sobre su propia fecha de corte. Preguntarle a un chatbot por ella no es una forma segura de averiguarla.
Fecha de corte frente a búsqueda web
Los buscadores con IA sortean la fecha de corte con la generación aumentada por recuperación: buscan en la web y dan los resultados al modelo, y así pueden responder sobre hechos recientes. Pero la memoria congelada no desaparece. Sigue presente en cada respuesta y toma el control siempre que el motor no busca. En ChatGPT, por ejemplo, es el modelo quien decide si una pregunta necesita una búsqueda web. Cuando no busca, responde con sus datos de entrenamiento, y la respuesta describe tu marca tal como era antes de la fecha de corte.
Qué supone la fecha de corte para tu marca
- Si lanzaste tu marca después de la fecha de corte, eres invisible en las respuestas de memoria. Tu única vía de entrada a las respuestas de IA, por ahora, es la recuperación, que depende de que se encuentren tus páginas y tu cobertura.
- Si has cambiado de nombre, de precios o de productos, la memoria del modelo está desfasada. Las respuestas pueden mezclar datos antiguos y nuevos, o repetir los antiguos en forma de alucinaciones.
- Si eres una marca consolidada, los datos de entrenamiento te dan asociaciones por defecto con tu categoría. Perder terreno en la cobertura actual se nota primero en las respuestas con grounding, mucho antes de que lo refleje un modelo nuevo.
Por eso la cobertura reciente cuenta dos veces. Hoy, las reseñas, comparativas, noticias y páginas actualizadas son lo que recuperan y citan los motores con búsqueda. Mañana, esa misma cobertura forma parte del texto con el que se entrenan los modelos futuros.
Cómo trabajar con la fecha de corte
- Mantén los datos clave al día y en texto plano en tu web: precios, productos, sedes y qué ha cambiado.
- Anuncia los cambios donde se vayan a encontrar. Una página rastreable en tu web más cobertura en fuentes de terceros que ya posicionan en tu categoría.
- Actualiza las páginas antiguas de terceros. Directorios, comparativas y reseñas con datos desfasados alimentan tanto la recuperación como los entrenamientos futuros.
- Redirige y explica los nombres antiguos. Si has cambiado el nombre de un producto, dilo en la página que lo sustituye.
- Sigue siendo rastreable. Revisa tus reglas con el probador de robots.txt para que los rastreadores de búsqueda y de IA lleguen a las páginas con los datos nuevos.
Errores habituales
- Dar por hecho que un motor con búsqueda siempre busca. A menudo responde de memoria.
- Esperar cambios inmediatos. Un cambio en tu web llega a las respuestas con grounding solo cuando se rastrea y se recupera, y a las respuestas de memoria solo con un modelo nuevo.
- Actualizar solo tu web. El modelo aprendió sobre ti sobre todo de lo que escribieron otros.
Cómo te ayuda Mencoro a ver el efecto de la fecha de corte
Mencoro pregunta a ChatGPT con la búsqueda web activada, pero es el modelo quien decide si busca: cuando responde con lo que ya sabe, la respuesta no trae fuentes, y las menciones de su texto se cuentan igualmente. Leer esas respuestas junto a las que sí traen fuentes te muestra qué descripciones de tu marca salen de la memoria y cuáles de páginas recuperadas hoy. Mencoro guarda 16 meses de historial, así que puedes ver cuándo empieza a aparecer un producto o un precio nuevo en las respuestas de ChatGPT, Perplexity, Google AI Overview y Google AI Mode. Tienes el método en cómo funciona Mencoro, y el seguimiento de posiciones en ChatGPT y la función de visibilidad en IA lo muestran en la práctica.
Términos relacionados del glosario
- Modelo de lenguaje grande (LLM): el tipo de modelo que tiene fecha de corte.
- Grounding: cómo vinculan los motores sus respuestas a fuentes actuales.
- Alucinaciones de la IA: afirmaciones falsas, a menudo causadas por un conocimiento desactualizado.
- Generación aumentada por recuperación (RAG): la técnica que lleva documentos recientes a una respuesta.
Alvaro Peña de Luna