TL;DR
- 没有普遍最佳的RAG分块策略。 正确的方法取决于文档结构、问题类型、嵌入行为、重新排序以及生成器所需的上下文。
- 结构感知的章节分块是良好格式文档的最佳默认选项。 它保留标题和语义单元,同时避免模型驱动拆分器的成本。
- 递归令牌分块是最强的基线。 它简单、确定性强,并且有助于衡量更复杂的方法是否值得其额外的摄取成本。
- 父子检索在精确匹配和广泛答案上下文冲突时效果更好。 先检索小的子项,然后将其较大的父项返回给模型。
- 页面级分块适合面向页面的PDF值得测试。 NVIDIA的2025基准测试发现其在被测试数据集上平均最强,但结果仍因语料库和查询而异。
- 一起评估检索和答案质量。 一个提高向量召回的策略仍可能通过添加重复或无关的上下文而损害答案。
什么使得分块策略对RAG来说是“最佳”
最佳策略返回最小的证据单元,以回答查询,同时保留足够的周围上下文以便于理解。分块发生在获取和清理之后,但在嵌入和索引之前。Nstproxy Crawl 可以提供来自授权网站的标准化Markdown或其他选定输出;它并不选择这些文档应该如何分块。
一个分块边界同时改变四件事:嵌入的内容、查询可以检索的内容、不相关文本到达重新排名器的程度,以及生成器看到的上下文。这就是为什么从框架教程复制分块大小,通常与真实文档接触后无法存活的原因。
本指南将每个策略与相同的决策字段进行比较:
| 字段 | 决策问题 |
|---|---|
| 边界信号 | 该方法使用令牌、段落、标题、页面还是语义变化? |
| 最佳语料库 | 哪些文档结构使信号可靠? |
| 查询契合 | 它是否倾向于精确事实、多句解释或交叉推理? |
| 上下文恢复 | 系统能否从精确命中扩展到更大的父项? |
| 摄取成本 | 该方法在索引过程中是否需要解析、嵌入或LLM? |
| 主要失败 | 哪种信息最可能被分割、重复或埋没? |
RAG术语表 提供了更广泛的检索和生成上下文。分块是该系统中的一个设计变量,而不是单独的质量开关。
策略比较
| 策略 | 边界信号 | 最佳语料库 | 查询契合 | 上下文恢复 | 摄取成本 | 主要失败 |
|---|---|---|---|---|---|---|
| 结构感知章节 | 标题、列表、段落 | 文档、文章、政策 | 解释性问题 | 可选的父章节 | 低到中等 | 不良或缺少标记 |
| 递归令牌块 | 有序分隔符加令牌限制 | 结构弱的混合文本 |



