Un modelo de lenguaje grande (LLM) es un modelo de IA entrenado con enormes cantidades de texto para predecir el siguiente fragmento de texto a partir de todo lo anterior, lo que le permite entender preguntas y redactar respuestas fluidas. Los LLM son el motor de ChatGPT, Perplexity, los AI Overviews de Google y el modo IA de Google.
Para quien trabaja en marketing o SEO, el LLM es el nuevo redactor que se interpone entre tu marca y tu cliente. En lugar de una lista de diez enlaces, el usuario lee una sola respuesta, y es el modelo quien decide qué marcas aparecen, en qué orden y con qué tono.
Cómo funciona un modelo de lenguaje grande
No necesitas las matemáticas para trabajar con LLM, pero cuatro ideas explican casi todo su comportamiento:
- Tokens. El texto se divide en tokens, que son palabras enteras o trozos de palabras. El modelo lee y escribe tokens, no páginas.
- Entrenamiento. Durante el preentrenamiento, el modelo lee un corpus enorme de páginas web públicas, libros, código y otros textos, y ajusta miles de millones de números internos (sus parámetros) para predecir mejor el siguiente token. Las fases posteriores, que incluyen valoraciones de revisores humanos, le enseñan a seguir instrucciones y a responder de forma útil.
- Generación. Cuando haces una pregunta, el modelo escribe la respuesta token a token, eligiendo cada uno entre varias opciones probables. Por eso la misma pregunta puede dar respuestas distintas.
- Arquitectura. La mayoría de los LLM actuales usan la arquitectura transformer, que presentaron investigadores de Google en 2017 y que permite al modelo ponderar cómo se relaciona cada palabra de un pasaje con todas las demás.
Lo de «grande» se refiere tanto al número de parámetros como a la cantidad de texto de entrenamiento. La escala es lo que ha convertido la predicción del siguiente token en modelos capaces de resumir, comparar y recomendar.
Lo que un LLM sabe y lo que busca
Cuando un LLM responde dentro de un buscador con IA, se apoya en dos tipos de conocimiento:
- Lo que aprendió en el entrenamiento. Esa memoria está congelada en su fecha de corte del conocimiento. Determina las asociaciones por defecto del modelo: qué marcas vincula a una categoría y cómo las describe.
- Lo que recupera en el momento de responder. Muchos motores buscan primero en la web y pasan los resultados al modelo, una técnica llamada generación aumentada por recuperación. De ahí salen las fuentes citadas.
La diferencia importa para tu estrategia. Los datos de entrenamiento cambian despacio y no puedes verlos. La recuperación ocurre cada vez que alguien pregunta y depende de qué páginas están disponibles, se pueden rastrear y resultan relevantes hoy.
Por qué importan los LLM para la visibilidad de tu marca
En la búsqueda clásica, tu página posiciona o no posiciona. En una respuesta de un LLM, a tu marca le pueden pasar varias cosas a la vez: que la recomienden, que la incluyan en una lista de alternativas, que la comparen de forma desfavorable, que la mencionen sin enlace, que la enlacen sin nombrarla o que la dejen fuera. Además, el modelo describe tu producto con sus propias palabras, que pueden alejarse de cómo lo describes tú y, a veces, convertirse en auténticas alucinaciones.
Como la generación es probabilística, no hay una posición fija que comprobar una vez. Tu visibilidad es una tasa: con qué frecuencia, y cómo de bien, te nombra el modelo en muchas ejecuciones de las preguntas que hacen tus clientes.
Cómo hacer que los LLM describan mejor tu marca
- Di claramente qué eres. Explica tu categoría, tu producto y tu público con frases sencillas en tu propia web, no solo con eslóganes.
- Mantén los datos coherentes. Nombres, precios, funciones y ubicaciones deben coincidir en tu web, tus perfiles, los directorios y la prensa.
- Consigue cobertura de terceros. Los modelos aprenden, y recuperan, lo que dicen de ti las reseñas, las comparativas y los artículos, no solo lo que dices tú.
- Deja entrar a los rastreadores de IA. Un rastreador bloqueado no puede recopilar ni recuperar tus páginas. El comprobador de rastreadores de IA gratuito te dice cuáles permite tu web.
- Mide las respuestas. Haz las preguntas que hacen tus clientes, en los motores que usan, y sigue los resultados en el tiempo.
Errores habituales
- Fiarse de una sola respuesta. Una conversación es una muestra de un resultado variable. Repite la pregunta antes de sacar conclusiones.
- Tratar el LLM como un índice de búsqueda. El modelo no guarda tus páginas para ordenarlas. Redacta una respuesta, unas veces de memoria y otras a partir de fuentes recuperadas.
- Pensar que todos los motores son iguales. ChatGPT, Perplexity y Google usan modelos, sistemas de recuperación e instrucciones distintos, así que tu marca puede ir bien en uno y no aparecer en otro.
Cómo sigue Mencoro lo que dicen los LLM de tu marca
Mencoro hace a ChatGPT, Perplexity, Google AI Overview y Google AI Mode los prompts que eliges, en los países que eliges, y guarda el texto de cada respuesta y las fuentes que devuelve. Como las respuestas de un LLM varían, cada comprobación puede hacer de 1 a 3 pasadas de la misma pregunta para suavizar el ruido. Después, un modelo de lenguaje localiza cada marca nombrada en la respuesta y clasifica cada mención por tipo y tono, y cada mención se contrasta con el texto visible. El resultado son tu Coverage, tu Favorability y tu Share of voice por motor, que se explican paso a paso en cómo funciona Mencoro. Consulta la función de monitorización de marca en IA o saca una muestra rápida con el comprobador de visibilidad en IA gratuito.
Términos relacionados del glosario
- Generación aumentada por recuperación (RAG): cómo añaden los motores de IA fuentes recientes a lo que el modelo ya sabe.
- Fecha de corte del conocimiento: la fecha en la que terminan los datos de entrenamiento de un modelo.
- Alucinaciones de la IA: cuando un modelo afirma algo falso como si fuera un hecho.
- Visibilidad en IA: con qué frecuencia y cómo aparece tu marca en las respuestas de IA.
Alvaro Peña de Luna