Mejores estrategias de segmentación para RAG en 2026: una guía de selección práctica
TL;DR
No hay una estrategia de fragmentación RAG universalmente mejor. El método correcto depende de la estructura del documento, el tipo de pregunta, el comportamiento de la incrustación, la reordenación y el contexto que necesita el generador.
La fragmentación de secciones consciente de la estructura es el mejor valor por defecto para una documentación bien formada. Preserva los encabezados y las unidades semánticas, al tiempo que evita el costo de un divisor impulsado por un modelo.
La fragmentación de tokens recursivos es la línea base más fuerte. Es simple, determinista y útil para medir si un método más complejo justifica su costo de ingestión adicional.
La recuperación padre-hijo funciona mejor cuando la coincidencia precisa y el contexto de respuesta amplio están en conflicto. Recupera un pequeño hijo, luego devuelve su padre más grande al modelo.
La fragmentación a nivel de página vale la pena probarla para PDFs orientados a páginas. El benchmark de NVIDIA de 2025 encontró que es la más fuerte en promedio en sus conjuntos de datos probados, pero los resultados aún variaron según el corpus y la consulta.
Evalúa la recuperación y la calidad de las respuestas juntas. Una estrategia que eleva el recuerdo vectorial aún puede dañar las respuestas al agregar contexto repetido o irrelevante.
Qué hace que una estrategia de fragmentación sea “mejor” para RAG
La mejor estrategia devuelve la unidad de evidencia más pequeña que responde a la consulta mientras preserva suficiente contexto circundante para interpretarla. La fragmentación ocurre después de la adquisición y limpieza, pero antes de la incrustación y el índice. Nstproxy Crawl puede suministrar Markdown normalizado u otras salidas seleccionadas de sitios autorizados; no elige cómo deben fragmentarse esos documentos.
Un límite de fragmento cambia cuatro cosas a la vez: lo que se incrusta, lo que una consulta puede recuperar, cuánto texto no relacionado llega al reordenador, y qué contexto ve el generador. Por eso, copiar un tamaño de fragmento de un tutorial de marco rara vez sobrevive al contacto con documentos reales.
Esta guía compara cada estrategia con los mismos campos de decisión:
Campo
Pregunta de decisión
Señal de límite
¿El método utiliza tokens, párrafos, encabezados, páginas o cambio semántico?
Mejor corpus
¿Qué estructuras documentales hacen que la señal sea confiable?
Ajuste de consulta
¿Favorece hechos exactos, explicaciones de varias oraciones o razonamiento transversal?
Recuperación de contexto
¿Puede el sistema expandirse de un golpe preciso a un padre más grande?
Costo de ingestión
¿Requiere el método análisis, incrustaciones o un LLM durante el índice?
Principal fallo
¿Qué información es más probable que se divida, duplique o entierre?
El glosario de RAG proporciona el contexto más amplio de recuperación y generación. La fragmentación es una variable de diseño dentro de ese sistema, no un interruptor de calidad por sí sola.
Comparación de estrategias
Estrategia
Señal de límite
Mejor corpus
Ajuste de consulta
Recuperación de contexto
Costo de ingestión
Principal fallo
Secciones conscientes de la estructura
Encabezados, listas, párrafos
Documentación, artículos, políticas
Preguntas explicativas
Sección padre opcional
Bajo a medio
Marcas incorrectas o faltantes
Fragmentos de tokens recursivos
Separadores ordenados más límite de tokens
Texto mixto con estructura débil
Línea base general
Superposición solo por defecto
Bajo
Cortes semánticos arbitrarios
Padre-hijo
Pequeño hijo más padre más grande
Documentos largos estructurados
Recuperación exacta con respuestas amplias
Integrado
Medio
El padre añade contexto excesivo
A nivel de página
Límite de página PDF
Informes, presentaciones, manuales
Hechos y análisis locales de página
Páginas adyacentes si se añaden
Bajo
El significado cruza páginas
Semántico
Cambios en la similitud de incrustaciones
Transcripciones y prosa densa en temas
Preguntas orientadas a temas
Expansión de ventana opcional
Alto
Inestabilidad del umbral y costo
1. Fragmentación de secciones consciente de la estructura: mejor valor por defecto
La fragmentación consciente de la estructura divide en encabezados, párrafos, listas, tablas y otros elementos del documento, luego combina pequeños elementos adyacentes hasta un presupuesto. Es el mejor valor por defecto para documentación técnica, bases de conocimiento y contenido web cuya estructura lleva significado.
La guía de canalización de datos RAG de Databricks distingue enfoques de tamaño fijo, párrafo, específicos de formato y semánticos y enfatiza que el óptimo depende de los datos y el caso de uso. La fragmentación consciente de la estructura utiliza información que el editor ya proporcionó, por lo que a menudo preserva la relación de pregunta y respuesta de una sección sin otra llamada al modelo.
Mantén la ruta del encabezado como metadato, como Producto > Autenticación > Rotación de token. Repite esa ruta en la representación incrustada cuando los párrafos cortos sean ambiguos, pero conserva el texto limpio por separado para el contexto final. Las tablas y bloques de código deben tratarse como elementos atómicos o transformarse en una representación diseñada para la recuperación.
La principal falla aparece cuando HTML es pesado en plantillas, faltan encabezados o un analizador PDF pierde el orden de lectura. Limpia el documento primero. Un pipeline de índice web reflexivo debería preservar la URL canónica, el título, la ruta del encabezado, el tiempo de actualización y el hash del contenido junto a cada fragmento.
2. Fragmentación de tokens recursiva: mejor línea base
La fragmentación recursiva intenta separadores preferidos en orden: secciones, párrafos, oraciones y luego unidades más pequeñas, hasta que cada fragmento se ajuste a un presupuesto de tokens. Es la mejor línea base porque es determinística, económica y está disponible en la mayoría de las bibliotecas RAG.
Usa tokens en lugar de caracteres cuando el modelo de incrustación impone un límite de tokens. Comienza con un tamaño moderado y una superposición modesta, luego ajusta utilizando preguntas reales. La guía de fragmentación de Azure AI Search presenta 512 tokens con un 25% de superposición como punto de partida, no como un óptimo universal. Esa distinción es importante: una FAQ de soporte, un repositorio de código fuente y un informe anual no comparten una ventana ideal.
La superposición puede preservar oraciones a través de límites, pero también duplica vectores, aumenta el almacenamiento y puede hacer que el mismo pasaje ocupe varios resultados principales. Elimina duplicados o diversifica después de la recuperación. Si se requiere una gran superposición para hacer que las respuestas sean coherentes, el divisor probablemente está ignorando una estructura útil.
3. Fragmentación padre-hijo: mejor para recuperación precisa más contexto
La fragmentación padre-hijo indexa pequeños fragmentos hijos, pero mapea cada uno a una sección padre más grande. El recuperador empareja el hijo enfocado; la aplicación envía el padre, o una región limitada alrededor del hijo, al generador. Esto también se llama recuperación de pequeño a grande.
La guía avanzada de RAG de Microsoft describe índices jerárquicos y expansión de contexto Small2Big. El patrón funciona bien cuando los usuarios piden una cláusula precisa, pero la respuesta requiere definiciones, excepciones o pasos alrededor de ella.
La recuperación padre-hijo necesita identificadores estables de documento y desplazamiento. Almacena el ID del padre, la posición del hijo, la ruta del encabezado y la versión del contenido. Después de la recuperación, fusiona padres duplicados y preserva la ubicación del hijo más relevante para que el generador no reciba la misma sección repetidamente.
La compensación es la inflación del contexto. Un hijo pequeño puede coincidir con una palabra clave mientras que su padre incluye varias subsecciones no relacionadas. Limita el límite del padre a una sección coherente, utiliza un recalentador en los hijos y compara la recuperación de todo el padre con una ventana circundante fija.
Comience a dividir RAG con documentos más limpios
Use Nstproxy Crawl para recopilar contenido estructurado y delimitado de sitios web antes de analizar, dividir, incrustar y recuperar.
4. Fragmentación a nivel de página: mejor para PDFs orientados a páginas
La fragmentación a nivel de página mantiene cada página del PDF como una unidad de recuperación. Funciona cuando los límites de página son importantes para los lectores, las tablas o gráficos son locales de la página y las citas deben referirse a un número de página. Informes, presentaciones, documentos similares a diapositivas y manuales son candidatos fuertes.
En una evaluación de 2025, el benchmark de fragmentación RAG de NVIDIA reportó la mayor precisión media de extremo a extremo para la fragmentación a nivel de página en sus conjuntos de datos probados. La misma evaluación también encontró que el óptimo variaba según el conjunto de datos y la consulta: algunos conjuntos orientados a hechos favorecían fragmentos más pequeños, mientras que las preguntas analíticas se beneficiaban de un contexto más grande o alineado con la página. La conclusión responsable es probar fragmentos de página, no declarar que las páginas son universalmente superiores.
Las páginas fallan cuando una oración, tabla o sección cruza un salto de página. La repetición de encabezados y pies de página también puede dominar la similitud. Elimine muebles repetidos, mantenga el número de página como metadato y pruebe agregar páginas adyacentes solo después de un acierto en lugar de incrustar ventanas de varias páginas por defecto.
5. Fragmentación semántica: mejor para cambios de tema sin marcado
La fragmentación semántica detecta cambios en el significado, a menudo comparando incrustaciones de oraciones o grupos vecinos. Puede ayudar con transcripciones, notas de reuniones o prosa larga donde la estructura de encabezados está ausente y los límites de tema importan más que la longitud.
Su atractivo también es su riesgo. Los resultados dependen de la segmentación de oraciones, modelo de incrustación, umbral de similitud y la ventana utilizada para suavizar cambios locales. Cambiar el modelo de incrustación puede cambiar silenciosamente los límites del corpus e invalidar evaluaciones en caché. La división semántica también añade trabajo de incrustación durante la ingestión antes de que los fragmentos finales se incrusten de nuevo.
Úselo solo después de que la línea base recursiva haya tenido un fracaso documentado, como mezclar repetidamente temas adyacentes o separar una discusión de su conclusión. Versione la configuración del divisor y retenga los desplazamientos de origen para que los fragmentos puedan ser reproducidos. Para texto conversacional ruidoso, compare los límites semánticos con los turnos de los hablantes; la señal más barata puede ser igualmente útil.
Cómo elegir según el tipo de documento y consulta
Use la estructura del documento como la primera señal de enrutamiento, luego pruebe contra el comportamiento de la consulta:
Documentación de productos: secciones conscientes de la estructura, con expansión padre-hijo para temas largos.
Artículos de soporte cortos: fragmentos de párrafo o recursivos con poco solapamiento.
Informes financieros y manuales: a nivel de página más metadatos de sección; pruebe el análisis consciente de tablas por separado.
Transcripciones: turnos de oradores o fragmentos semánticos, con códigos de tiempo retenidos.
Código fuente: límites de sintaxis-árbol o símbolos en lugar de estrategias en prosa.
Corpus empresarial mixto: ruta por tipo MIME y salida del analizador en lugar de forzar un divisor global.
Para nuevos corpus web, una tubería de recolección de datos automatizada debe volver a rastrear solo lo que permite la política, detectar cambios en el contenido y reinsertar los fragmentos afectados. Reconstruir cada vector en cada ejecución desperdicia recursos y complica la trazabilidad.
Un protocolo de evaluación que revela diferencias reales
Comience con un conjunto de preguntas muestreadas de un uso real. Incluya búsquedas exactas, preguntas explicativas, solicitudes multipartes, preguntas negativas y consultas cuya respuesta abarca un límite. Etiquete los pasajes fuente que apoyan antes de ajustar el divisor.
Mida al menos cuatro capas:
Recuerdo de recuperación: ¿algún resultado principal contenía la evidencia requerida?
Precisión contextual: ¿cuánto texto recuperado era relevante para la pregunta?
Fidelidad de la respuesta: ¿las afirmaciones de respuesta estaban respaldadas por el contexto proporcionado?
Costo operativo: ¿cuántos fragmentos, tokens de incrustación, entradas de reordenador y tokens de generación fueron necesarios?
Mantenga el modelo de incrustación, el método de recuperación, el reordenador, el aviso y el generador fijos mientras compara el fragmentado. Luego ajuste la estrategia ganadora junto con la asamblea de top-k y contexto. De lo contrario, un reordenador más fuerte puede ser confundido con un divisor más fuerte.
Inspeccione fallos, no solo promedios. Un método puede funcionar bien en general mientras pierde constantemente encabezados de tablas, excepciones o definiciones cruzadas de páginas. Esos errores afectan las decisiones del producto más que una pequeña mejora agregada.
Prepare el contenido web antes de fragmentarlo
El fragmentado no puede reparar un documento de entrada roto. La navegación, los banners de cookies, el marcado móvil duplicado, el contenido que falta renderizado por JavaScript y un orden de lectura malformado se convierten en vectores de baja calidad independientemente del divisor.
Nstproxy Crawl puede recopilar sitios autorizados con controles de página, profundidad, inclusión y exclusión y devolver formatos adecuados para el procesamiento posterior. Use Markdown cuando los encabezados y la prosa son importantes; retenga HTML cuando las tablas, atributos o el análisis estructural son importantes. La guía del agente de búsqueda de IA muestra dónde encaja esta capa de ingesta antes de la recuperación y síntesis.
Veredicto final: use la estructura primero, luego demuestre las excepciones
El fragmentado de secciones con conciencia de estructura es el mejor valor predeterminado general, mientras que el fragmentado de tokens recursivos es el estándar que todos los métodos más complejos deberían superar. Use recuperación padre-hijo cuando se necesiten coincidencias precisas con un contexto más amplio, pruebe fragmentos a nivel de página para PDF orientados a páginas y reserve la división semántica para corpus donde los cambios de tema son reales pero el marcado es débil.
El siguiente paso es etiquetar un conjunto de preguntas representativas y ejecutar la misma evaluación de recuperación y respuesta a través de dos o tres estrategias. Si las páginas de origen están incompletas o son ruidosas, solucione la adquisición con Nstproxy Crawl antes de pasar tiempo en los umbrales del divisor.
Dé a su tubería RAG documentos fuente más limpios
Use Nstproxy Crawl para producir entradas web estructuradas y limitadas con URLs retenidas y formatos seleccionables, luego evalúe estrategias de fragmentación en un corpus reproducible.
P: ¿Cuál es el mejor tamaño de fragmento para RAG?
No hay un tamaño de fragmento universalmente mejor. Comience con una ventana de tokens moderada, luego ajústelo contra consultas representativas mientras mantiene constante el modelo de incrustación, el recuperador, el reordenador y el generador.
P: ¿Cuánta superposición deben usar los fragmentos de RAG?
Use solo la superposición suficiente para preservar el significado a través de límites inevitables. La alta superposición aumenta el almacenamiento y la recuperación duplicada; los enfoques con conciencia de estructura o padre-hijo a menudo preservan el contexto de manera más eficiente.
P: ¿Es el fragmentado semántico mejor que el fragmentado de tamaño fijo?
El fragmentado semántico es mejor solo cuando sus límites temáticos mejoran lo suficiente la recuperación y la calidad de respuesta medida como para justificar el trabajo de ingesta adicional. El fragmentado de tokens fijos recursivos sigue siendo la base más reproducible.
P: ¿Deben fragmentarse los PDF por página?
El fragmentado por página es un fuerte candidato para informes orientados a páginas, manuales y presentaciones, especialmente cuando importan las citas de páginas. Funciona mal cuando oraciones clave, tablas o secciones cruzan rutinariamente los límites de las páginas.
La observabilidad de LLM debe cubrir la recuperación y las herramientas, así como las llamadas al modelo. Esta guía compara nueve plataformas según la cobertura de trazas, el flujo de trabajo de evaluación, los estándares, el despliegue y la correlación operativa.
Marcus Chen
Aug. 26th 2026
110M+ IP reales con 99.9% de acceso exitoso
Respuesta media ultrarrapida ~0.5s para tareas de alta concurrencia
Desde solo $0.1/GB
Acceso inmediato a pools premium de proxies residenciales, datacenter, IPv6 e ISP.