La fragmentación de contenido (content chunking) consiste en dividir un documento en pasajes más pequeños y autónomos (fragmentos) para que un sistema de recuperación pueda indexar, encontrar y citar cada uno por separado. En la búsqueda con IA, el término también describe escribir páginas cuyas secciones sigan teniendo sentido cuando un motor extrae un único pasaje de la página.
Importa porque los motores de IA casi nunca leen tu página de arriba abajo. Leen los pasajes que encajaron con la pregunta.
Cómo funciona la fragmentación de contenido
La mayoría de motores de IA que responden con fuentes web usan alguna forma de generación aumentada por recuperación. De forma simplificada, el proceso es este:
- Dividir. Cada documento se corta en fragmentos: por encabezados, por párrafos o por una longitud fija, a veces con cierto solapamiento entre fragmentos vecinos.
- Representar. Cada fragmento se convierte en un embedding vectorial, una representación numérica de su significado, y se guarda en un índice.
- Recuperar. Cuando llega una pregunta, el sistema la compara con los fragmentos guardados y elige los más cercanos, a menudo combinando la búsqueda por palabras clave y un paso de reordenación.
- Generar. El modelo redacta su respuesta a partir de los fragmentos recuperados y puede citar las páginas de las que salen.
Los motores no publican cómo dividen el texto, y cada uno lo hace de una manera. Lo que sí controlas es lo bien que tu contenido aguanta que lo partan.
Por qué importa la fragmentación a las marcas
Cada fragmento se evalúa por sí solo. Si un dato clave depende del párrafo anterior, o se refiere a tu producto como «este» o «este plan», el pasaje recuperado puede llevar el dato sin tu nombre, o no encajar con la pregunta. El motor acaba citando a otro que lo dice claramente.
Las páginas en las que cada sección responde a una pregunta, nombra su tema y da el dato al principio ofrecen a los sistemas de recuperación pasajes que encajan limpiamente y se pueden citar sin reescribirlos.
Cómo escribir contenido fácil de fragmentar
- Una idea por sección. Usa un encabezado que nombre la pregunta que responde la sección.
- La respuesta, primero. Pon la respuesta directa en la primera frase y el detalle después.
- Repite el sujeto. Vuelve a nombrar la marca, el producto o el concepto en lugar de usar pronombres que apuntan a una sección anterior.
- Los datos, en texto. Precios, especificaciones y comparativas en imágenes, o en pestañas que solo cargan con JavaScript, pueden no llegar nunca al índice.
- Tablas y listas para los datos estructurados. Mantienen juntos en un mismo pasaje los valores relacionados.
Un ejemplo hipotético de antes y después, en una sección de precios:
- Antes: «Cuesta menos que los otros dos y lo incluye de serie».
- Después: «Acme Pro cuesta 29 € al mes, menos que Beta y Gamma, e incluye inicio de sesión único (SSO) de serie».
La segunda versión responde por sí sola a «cuánto cuesta Acme Pro» y a «si Acme Pro incluye SSO», corte el motor la página por donde la corte.
Errores frecuentes
- Dividir páginas en lugar de estructurarlas. Muchas páginas pobres pierden contexto y enlaces internos. Una página larga con secciones claras ya se convierte en muchos fragmentos.
- Llenar la página de FAQ. Decenas de preguntas de una línea añaden ruido, no respuestas recuperables.
- Escribir solo para máquinas. Repetir el nombre de la marca en cada frase se lee mal. Nombra el sujeto una vez por sección, donde está el dato.
- Dar por hecho un tamaño fijo de fragmento. Optimizar para un número de tokens que has leído en algún sitio no tiene sentido: las secciones claras funcionan haga lo que haga el divisor.
Cómo ver si se citan tus pasajes
No puedes ver qué fragmento recuperó un motor, pero sí el resultado: si tus páginas están entre las fuentes y si se nombra tu marca. Mencoro guarda el texto de cada respuesta de IA y las fuentes que devuelve en ChatGPT, Perplexity, Google AI Overview y el modo IA de Google. Un enlace cuenta como tuyo cuando apunta a uno de tus dominios, y su posición de enlace es su lugar en la lista de fuentes. La página de metodología explica cada métrica, y el seguimiento de visibilidad en IA muestra cómo se mueven después de reescribir una página. Para una comprobación rápida en Google, el comprobador de AI Overviews gratuito te dice si un AI Overview te cita.
Términos relacionados del glosario
- Generación aumentada por recuperación (RAG): el proceso que recupera fragmentos y escribe respuestas con ellos.
- Embeddings vectoriales: la forma numérica que toma cada fragmento en el índice.
- Búsqueda semántica: encontrar fragmentos para una pregunta por su significado.
- Citas en IA: las fuentes que enlaza una respuesta de IA.
Alvaro Peña de Luna