Лучшие стратегии разбивки для RAG в 2026 году: практическое руководство по выбору
TL;DR
Нет универсально лучшей стратегии разделения для RAG. Правильный метод зависит от структуры документа, типа вопроса, поведения встраивания, повторного рейтинга и контекста, необходимого генератору.
Разделение с учетом структуры разделов является лучшим вариантом по умолчанию для хорошо оформленной документации. Оно сохраняет заголовки и семантические единицы, избегая затрат на разбиение, основанное на модели.
Рекурсивное разделение на токены — это сильнейшая базовая линия. Это простой, детерминированный подход, полезный для оценки того, оправдывает ли более сложный метод свои дополнительные затраты на обработку.
Извлечение родитель-дочерних элементов работает лучше, когда точное соответствие и широкий контекст ответа конфликтуют. Извлеките небольшого ребенка, затем верните его более крупного родителя модели.
Разделение на уровне страниц стоит протестировать для PDF-документов, ориентированных на страницы. Бенчмарк NVIDIA 2025 года показал, что он в среднем является самым сильным по всем протестированным наборам данных, но результаты по-прежнему варьировались в зависимости от корпуса и запроса.
Оцените качество извлечения и ответов вместе. Стратегия, повышающая точность векторов, все еще может ухудшить ответы, добавив повторяющийся или неуместный контекст.
Что делает стратегию разделения «лучшей» для RAG
Лучшая стратегия возвращает наименьшую единицу доказательства, которая отвечает на запрос, сохраняя достаточно окружающего контекста для ее интерпретации. Разделение происходит после приобретения и очистки, но до встраивания и индексации. Nstproxy Crawl может предоставить нормализованный Markdown или другие выбранные выходные данные с авторизованных сайтов; он не выбирает, как эти документы должны быть разделены.
Граница раздела меняет сразу четыре вещи: что встраивается, что может извлечь запрос, сколько несоответствующего текста достигает повторного рейтингового процесса и какой контекст видит генератор. Именно поэтому копирование размера раздела из учебного пособия фреймворка редко успешно проходит через контакт с реальными документами.
Попробуйте Nstproxy - Начните бесплатный тест сегодня
Этот гид сравнивает каждую стратегию по одним и тем же полям принятия решений:
Поле
Вопрос для принятия решения
Сигнал границы
Использует ли метод токены, абзацы, заголовки, страницы или семантические изменения?
Лучший корпус
Какие структуры документа делают сигнал заслуживающим доверия?
Соответствие запроса
Предпочитает ли это точные факты, многосentence объяснения или рассуждения по пересечению?
Восстановление контекста
Может ли система расшириться от точного попадания к более крупному родителю?
Стоимость обработки
Требует ли метод парсинга, встраиваний или LLM во время индексации?
Основной сбой
Какая информация с наибольшей вероятностью будет разделена, дублирована или засыпана?
Глоссарий RAG предоставляет более широкий контекст для извлечения и генерации. Разделение — это одна переменная дизайна внутри этой системы, а не переключатель качества сам по себе.
Сравнение стратегий
Стратегия
Сигнал границы
Лучший корпус
Соответствие запроса
Восстановление контекста
Стоимость обработки
Основной сбой
Разделы с учетом структуры
Заголовки, списки, абзацы
Документация, статьи, политики
Объяснительные вопросы
Опционально родительский раздел
Низкая до средней
Плохая или отсутствующая разметка
Рекурсивные токенные части
Упорядоченные разделители плюс лимит токенов
Смешанный текст со слабой структурой
Общая базовая линия
Перекрытие только по умолчанию
Низкая
Произвольные семантические разрезы
Родитель-дочерний
Маленький ребенок плюс крупный родитель
Длинные структурированные документы
Точное извлечение с широкими ответами
Встроено
Средняя
Родитель добавляет избыточный контекст
Уровень страницы
Граница страницы PDF
Отчеты, учеты, руководства
Факты и анализ, локализованные по странице
Соседние страницы, если добавлены
Низкая
Значение пересекает страницы
Семантическое
Изменения в сходстве встраивания
Транскрипты и насыщенный темами текст
Вопросы, ориентированные на темы
Опциональное расширение окна
Высокая
Нестабильность порога и стоимость
1. Разделение с учетом структуры: лучший вариант по умолчанию
Разделение с учетом структуры происходит на основе заголовков, абзацев, списков, таблиц и других элементов документа, затем сочетает небольшие смежные элементы до установленного бюджета. Это лучший вариант по умолчанию для технической документации, баз знаний и веб-контента, структура которого имеет значение.
Руководство по RAG-каналу данных Databricks различает подходы фиксированного размера, абзацев, формата и семантики и подчеркивает, что оптимальное решение зависит от данных и конкретного случая использования. Разделение с учетом структуры использует информацию, которую издатель уже предоставил, поэтому оно часто сохраняет отношение вопрос-ответ раздела без дополнительного вызова модели.
Сохраните путь заголовка в качестве метаданных, например, Продукт > Аутентификация > Поворот токена. Повторите этот путь в встраиваемом представлении, когда короткие абзацы неоднозначны, но сохраняйте чистый текст отдельно для окончательного контекста. Таблицы и кодовые блоки следует рассматривать как атомарные элементы или преобразовывать в представление, предназначенное для извлечения.
Основной сбой возникает, когда HTML сильно зависит от шаблонов, заголовки отсутствуют или парсер PDF теряет порядок чтения. Сначала очистите документ. Продуманный web index pipeline должен сохранять канонический URL, заголовок, путь заголовка, время обновления и хэш контента вместе с каждым фрагментом.
2. Рекурсивное разбивание на токены: лучшая база
Рекурсивное разбивание пробует предпочтительные разделители в порядке — секции, абзацы, предложения, затем меньшие единицы — пока каждый фрагмент не вписывается в лимит токенов. Это лучшая база, потому что она детерминирована, недорога и доступна во многих библиотеках RAG.
Используйте токены вместо символов, когда модель внедрения накладывает ограничение на токены. Начните с умеренного размера и скромного перекрытия, затем настройте, используя реальные вопросы. Руководство по разбивке Azure AI Search предлагает 512 токенов с 25% перекрытием в качестве отправной точки, а не универсального оптимума. Это различие важно: поддержка FAQ, репозиторий исходного кода и годовой отчет не разделяют идеальное окно.
Перекрытие может сохранять предложения за границами, но также дублирует векторы, увеличивает объем хранения и может привести к тому, что один и тот же отрывок займёт несколько верхних результатов. Удаляйте дубликаты или разнообразьте после извлечения. Если требуется большое перекрытие, чтобы сделать ответы связными, разделитель, вероятно, игнорирует полезную структуру.
3. Родительское-дочернее разбивание: лучшее для точного извлечения с контекстом
Родительское-дочернее разбивание индексирует небольшие дочерние отрывки, но сопоставляет каждый из них с большим родительским разделом. Извлекатель сопоставляет сфокусированный дочерний; приложение отправляет родительский — или ограниченный регион вокруг дочернего — генератору. Это также называется извлечением малых к большим.
Руководство Microsoft по продвинутому RAG описывает иерархические индексы и расширение контекста Small2Big. Эта схема хорошо работает, когда пользователи запрашивают точное предложение, но ответ требует определений, исключений или шагов вокруг него.
Извлечение родительских и дочерних отрывков требует стабильных идентификаторов документа и смещения. Храните идентификатор родителя, позицию дочернего элемента, путь заголовка и версию контента. После извлечения объединяйте дублирующиеся родительские и сохраняйте наиболее актуальное местоположение дочернего, чтобы генератор не получал один и тот же раздел несколько раз.
Компромисс заключается в инфляции контекста. Небольшой дочерний элемент может совпадать с одним ключевым словом, тогда как его родитель включает несколько несвязанных подсекций. Ограничьте границу родителя согласованным разделом, используйте повторный ранг для дочерних элементов и сравните извлечение полного родителя с фиксированным окружающим окном.
Начните разбиение RAG с более чистыми документами
Используйте Nstproxy Crawl для сбора ограниченного, структурированного контента веб-сайта перед разбором, разбиением, встраиванием и извлечением.
4. Разделение на уровне страниц: лучше всего подходит для PDF-документов, ориентированных на страницы
Разделение на уровне страниц сохраняет каждую страницу PDF как единицу извлечения. Это работает, когда границы страниц имеют значение для читателей, таблицы или графики являются локальными для страницы, и цитаты должны ссылаться на номер страницы. Отчеты, документы, похожие на слайды, и руководства являются сильными кандидатами.
В оценке 2025 года бенчмарк разделения NVIDIA RAG сообщил о наивысшей средней точности от конца до конца для разделения на уровне страниц среди протестированных наборов данных. В той же оценке также было установлено, что оптимум варьировался в зависимости от набора данных и запроса: некоторые наборы, ориентированные на факты, предпочитали более мелкие куски, в то время как аналитические вопросы извлекали выгоду из больших или выровненных по страницам контекстов. Ответственное заключение состоит в том, чтобы тестировать страницы-кусочки, а не заявлять, что страницы универсально превосходят.
Страницы терпят неудачу, когда предложение, таблица или раздел пересекает разрыв страницы. Повторение заголовков и сносок также может доминировать в сходстве. Удалите повторяющиеся элементы, сохраните номер страницы как метаданные и тестируйте добавление соседних страниц только после попадания, а не встраивайте многостраничные окна по умолчанию.
5. Семантическое разделение: лучше всего подходит для изменений темы без разметки
Семантическое разделение обнаруживает изменения в значении, часто путем сравнения встраиваний для соседних предложений или групп. Это может помочь с транскрипциями, записями встреч или длинным текстом, в котором структура заголовков отсутствует, и границы тем важнее, чем длина.
Его привлекательность также является его риском. Результаты зависят от сегментации предложений, модели встраивания, порога сходства и окна, используемого для сглаживания местных изменений. Изменение модели встраивания может незаметно изменять границы корпуса и аннулировать кэшированные оценки. Семантическое разделение также добавляет работу по встраиванию во время ingestion перед повторным встраиванием окончательных кусочков.
Используйте его только после того, как рекурсивная база имеет задокументированную неудачу, такую как многократное смешивание соседних тем или отделение обсуждения от его заключения. Версионируйте конфигурацию разделителя и сохраняйте исходные смещения, чтобы куски можно было воспроизвести. Для шумного разговорного текста сравните семантические границы с поворотами говорящего; более дешевый сигнал может быть равноценным.
Как выбрать по типу документа и запроса
Используйте структуру документа как первый сигнал маршрутизации, затем протестируйте по поведению запроса:
Документация по продукту: разделы с учетом структуры, с расширением родитель-ребенок для длинных тем.
Короткие статьи поддержки: параграфы или рекурсивные куски с небольшим перекрытием.
Финансовые отчеты и руководства: уровень страниц плюс метаданные разделов; тестируйте парсинг с учетом таблиц отдельно.
Транскрипты: поворот говорящего или семантические части, с сохранением временных кодов.
Исходный код: границы синтаксического дерева или символов, а не стратегии прозы.
Смешанный корпоративный корпус: маршрутизируйте по типу MIME и выходным данным парсера, а не принудительно используя один глобальный разделитель.
Для свежих веб-корпусов должен быть автоматизированный конвейер сбора данных, который повторно просматривает только то, что разрешает политика, обнаруживает изменения в содержании и повторно встраивает затронутые части. Перестройка каждого вектора на каждом запуске расходует ресурсы и усложняет отслеживаемость.
Протокол оценки, который выявляет реальные различия
Начните с набора вопросов, выбранных из реального использования. Включите точные запросы, разъяснительные вопросы, многочастные запросы, отрицательные вопросы и запросы, ответы на которые пересекают границу. Обозначьте поддерживающие источники перед настройкой разделителя.
Измерьте как минимум четыре слоя:
Восприятие извлечения: содержал ли хотя бы один лучший результат необходимое доказательство?
Точность контекста: сколько извлеченного текста было актуально для вопроса?
Верность ответа: поддерживались ли заявления о ответах предоставленным контекстом?
Операционные затраты: сколько частей, токенов встраивания, вводов переоценщика и токенов генерации было необходимо?
Сохраняйте фиксированными модель встраивания, метод извлечения, переоценщик, подсказку и генератор во время сравнения нарезки. Затем настройте выигрышную стратегию совместно с top-k и сборкой контекста. В противном случае более сильный переоценщик может быть ошибочно воспринят как более сильный разделитель.
Проверяйте неудачи, а не только средние значения. Один метод может показывать хорошие результаты в целом, теряя при этом заголовки таблиц, исключения или определения на разных страницах. Эти ошибки влияют на решения по продукту больше, чем небольшое общее улучшение.
Подготовьте веб-контент перед его нарезкой
Нарезка не может исправить поврежденный входной документ. Навигация, баннеры cookie, дублирующий мобильный разметка, отсутствующий контент, отрисованный JavaScript, и неправильно оформленный порядок чтения становятся векторами низкого качества, независимо от разделителя.
Nstproxy Crawl может собирать авторизованные сайты с управлением страницами, глубиной, включениями и исключениями и возвращать форматы, подходящие для дальнейшей обработки. Используйте Markdown, когда заголовки и проза важны; сохраняйте HTML, когда важны таблицы, атрибуты или структурный анализ. Руководство по агентам AI-поиска показывает, где этот уровень потребления подходит перед извлечением и синтезом.
Окончательный вердикт: используйте структуру сначала, затем докажите исключения
Осознанная структурная нарезка с секциями является лучшим общим по умолчанию, тогда как рекурсивная нарезка токенов является стандартом, который должен побить каждый более сложный метод. Используйте извлечение родитель-дитя, когда точные попадания требуют более широкого контекста, тестируйте уровни страниц для PDF, ориентированных на страницу, и сохраняйте семантическую нарезку для корпусов, где изменения тем реальны, но разметка слаба.
Следующий шаг - обозначить репрезентативный набор вопросов и провести ту же оценку извлечения и ответов по двум или трем стратегиям. Если источники страниц неполные или шумные, исправьте приобретение с помощью Nstproxy Crawl перед тем, как тратить время на пороговые значения разделителя.
Дайте вашему RAG конвейеру более чистые исходные документы
Используйте Nstproxy Crawl для создания ограниченных, структурированных веб-входов с сохраненными URL и выбираемыми форматами, затем оценивайте стратегии нарезки по воспроизводимому корпусу.
В: Какой размер нарезки лучше всего подходит для RAG?
Нет универсального лучшего размера нарезки. Начните с умеренного окна токенов, затем настройте его по отношению к репрезентативным запросам, сохраняя модель встраивания, извлекатель, переоценщик и генератор постоянными.
В: Сколько перекрытия должно использовать концы RAG?
Используйте только столько перекрытий, сколько необходимо для сохранения смысла через неизбежные границы. Высокое перекрытие увеличивает хранение и дублирующее извлечение; подходы, учитывающие структуру или родитель-дитя, часто сохраняют контекст более эффективно.
В: Является ли семантическая нарезка лучше, чем нарезка фиксированного размера?
Семантическая нарезка лучше только тогда, когда ее тематические границы улучшают измеренные качество извлечения и ответов достаточно, чтобы оправдать дополнительные работы по потреблению. Рекурсивная нарезка фиксированных токенов остается более воспроизводимым эталоном.
В: Следует ли нарезать PDF по страницам?
Нарезка по страницам является сильным кандидатом для отчетов, инструкций и подаче документов, особенно когда важны ссылки на страницы. Она плохо работает, когда ключевые предложения, таблицы или разделы регулярно пересекают границы страниц.
Marcus Chen
Aug. 26th 2026
110M+ реальных IP с 99.9% успешных доступов
Средний отклик ~0.5с для задач высокой конкуренции
Всего от $0.1/GB
Мгновенный доступ к премиальным residential, datacenter, IPv6 и ISP пулам.