Chiến Lược Chunking Tốt Nhất cho RAG vào Năm 2026: Hướng Dẫn Lựa Chọn Thực Tế
TL;DR
Không có chiến lược phân đoạn RAG nào là tốt nhất cho tất cả. Phương pháp đúng phụ thuộc vào cấu trúc tài liệu, loại câu hỏi, hành vi nhúng, xếp hạng lại, và bối cảnh mà bộ sinh cần.
Phân đoạn theo cấu trúc là mặc định tốt nhất cho tài liệu được định dạng tốt. Nó bảo tồn tiêu đề và các đơn vị ngữ nghĩa trong khi tránh chi phí của một bộ phân chia dựa trên mô hình.
Phân đoạn theo token đệ quy là cơ sở mạnh nhất. Nó đơn giản, xác định, và hữu ích để đo lường xem phương pháp phức tạp hơn có xứng đáng với chi phí tiếp nhận bổ sung hay không.
Khôi phục cha-con hoạt động tốt hơn khi việc khớp chính xác và bối cảnh câu trả lời rộng xung đột. Khôi phục một phần nhỏ, sau đó trả lại phần lớn hơn của nó cho mô hình.
Phân đoạn theo cấp trang đáng để thử nghiệm cho các PDF theo trang. Bảng đánh giá của NVIDIA vào năm 2025 cho thấy nó mạnh nhất trong số các bộ dữ liệu đã thử nghiệm, nhưng kết quả vẫn thay đổi theo tập hợp và truy vấn.
Đánh giá chất lượng khôi phục và câu trả lời cùng nhau. Một chiến lược làm tăng độ chính xác vector vẫn có thể làm hại câu trả lời bằng cách thêm bối cảnh lặp lại hoặc không liên quan.
Điều gì làm cho một chiến lược phân đoạn “tốt nhất” cho RAG
Chiến lược tốt nhất trả về đơn vị bằng chứng nhỏ nhất trả lời truy vấn trong khi bảo tồn đủ bối cảnh xung quanh để giải thích nó. Phân đoạn xảy ra sau khi thu thập và làm sạch nhưng trước khi nhúng và lập chỉ mục. Nstproxy Crawl có thể cung cấp Markdown chuẩn hóa hoặc các đầu ra được chọn khác từ các trang web được ủy quyền; nó không chọn cách các tài liệu đó nên được phân đoạn.
Một ranh giới phân đoạn thay đổi bốn điều cùng một lúc: những gì được nhúng, những gì một truy vấn có thể khôi phục, bao nhiêu văn bản không có liên quan đến tay xếp hạng lại, và bối cảnh mà bộ sinh nhìn thấy. Đó là lý do tại sao việc sao chép kích thước phân đoạn từ hướng dẫn của khung hiếm khi sống sót qua việc tiếp xúc với các tài liệu thực tế.
Hướng dẫn này so sánh từng chiến lược với cùng các trường quyết định:
Trải nghiem Nstproxy - Bat dau dung thu mien phi ngay
Trường
Câu hỏi quyết định
Tín hiệu ranh giới
Phương pháp có sử dụng token, đoạn văn, tiêu đề, trang, hay thay đổi ngữ nghĩa không?
Tập hợp tốt nhất
Cấu trúc tài liệu nào làm cho tín hiệu đáng tin cậy?
Phù hợp truy vấn
Nó có thiên về các sự thật chính xác, các giải thích nhiều câu, hay lý luận cắt ngang không?
Khôi phục bối cảnh
Hệ thống có thể mở rộng từ một cú đánh chính xác đến một phần lớn hơn không?
Chi phí tiếp nhận
Phương pháp có yêu cầu phân tích, nhúng, hay một LLM trong quá trình lập chỉ mục không?
Thất bại chính
Thông tin nào có khả năng bị chia, trùng lặp, hoặc chôn vùi nhất?
Bảng thuật ngữ RAG cung cấp bối cảnh rộng hơn về khôi phục và sinh sản. Phân đoạn là một biến thiết kế bên trong hệ thống đó, không phải là một công tắc chất lượng.
So sánh chiến lược
Chiến lược
Tín hiệu ranh giới
Tập hợp tốt nhất
Phù hợp truy vấn
Khôi phục bối cảnh
Chi phí tiếp nhận
Thất bại chính
Phân đoạn theo cấu trúc
Tiêu đề, danh sách, đoạn văn
Tài liệu, bài viết, chính sách
Các câu hỏi giải thích
Phần cha tùy chọn
Thấp đến trung bình
Đánh dấu không tốt hoặc thiếu
Phân đoạn token đệ quy
Bộ phân tách có thứ tự cộng với giới hạn token
Văn bản hỗn hợp với cấu trúc yếu
Cơ sở chung
Chồng chéo chỉ theo mặc định
Thấp
Cắt ngữ nghĩa tùy ý
Cha-con
Phần nhỏ cộng với phần lớn hơn
Tài liệu dài có cấu trúc
Khôi phục chính xác với câu trả lời rộng
Tích hợp sẵn
Trung bình
Phần cha thêm bối cảnh dư thừa
Cấp trang
Ranh giới trang PDF
Báo cáo, hồ sơ, hướng dẫn
Các sự thật và phân tích theo trang
Các trang liền kề nếu được thêm vào
Thấp
Ý nghĩa vượt qua các trang
Ngữ nghĩa
Thay đổi sự tương đồng nhúng
Biên bản và văn bản phong phú về chủ đề
Các câu hỏi hướng tới chủ đề
Mở rộng cửa sổ tùy chọn
Cao
Sự không ổn định và chi phí ngưỡng
1. Phân đoạn theo cấu trúc: mặc định tốt nhất
Phân đoạn theo cấu trúc chia nhỏ theo tiêu đề, đoạn văn, danh sách, bảng biểu và các yếu tố tài liệu khác, sau đó kết hợp các yếu tố liền kề nhỏ đến một ngân sách. Nó là mặc định tốt nhất cho tài liệu kỹ thuật, cơ sở kiến thức, và nội dung web mà cấu trúc mang ý nghĩa.
Hướng dẫn về đường ống dữ liệu RAG Databricks phân biệt các phương pháp Có kích thước cố định, theo đoạn văn, cụ thể định dạng, và ngữ nghĩa và nhấn mạnh rằng tối ưu phụ thuộc vào dữ liệu và trường hợp sử dụng. Việc chia tách theo cấu trúc sử dụng thông tin mà nhà phát hành đã cung cấp, vì vậy nó thường duy trì mối quan hệ câu hỏi và câu trả lời của một phần mà không cần gọi mô hình khác.
Giữ đường dẫn tiêu đề như siêu dữ liệu, chẳng hạn như Product > Authentication > Token rotation. Lặp lại đường dẫn đó trong đại diện đã nhúng khi các đoạn văn ngắn không rõ ràng, nhưng giữ văn bản sạch một cách riêng biệt để có bối cảnh cuối cùng. Bảng và các khối mã nên được xem như các yếu tố nguyên tử hoặc được chuyển đổi thành một đại diện được thiết kế để khôi phục.
Sự cố chính xảy ra khi HTML chứa nhiều mẫu, thiếu tiêu đề hoặc một trình phân tích PDF mất trật tự đọc. Hãy làm sạch tài liệu trước. Một pipeline chỉ mục web suy nghĩ cẩn thận nên gìn giữ URL chuẩn, tiêu đề, đường dẫn tiêu đề, thời gian cập nhật và mã nội dung bên cạnh mỗi phần.
2. Chia token đệ quy: cơ sở tốt nhất
Chia đệ quy thử các dấu hiệu phân cách ưu tiên theo thứ tự—các phần, đoạn văn, câu, rồi các đơn vị nhỏ hơn—cho đến khi mỗi phần phù hợp với ngân sách token. Đây là cơ sở tốt nhất vì nó xác định trước, chi phí thấp và có sẵn trong hầu hết các thư viện RAG.
Sử dụng token thay vì ký tự khi mô hình nhúng áp đặt giới hạn token. Bắt đầu với kích thước vừa phải và chồng chéo khiêm tốn, sau đó điều chỉnh bằng cách sử dụng các câu hỏi thực tế. Hướng dẫn chia nhỏ AI Azure trình bày 512 token với 25% chồng chéo như một điểm khởi đầu, không phải là một tối ưu phổ quát. Sự phân biệt đó rất quan trọng: một FAQ hỗ trợ, kho mã nguồn và báo cáo hàng năm không chia sẻ một cửa sổ lý tưởng.
Chồng chéo có thể bảo tồn câu qua các ranh giới, nhưng nó cũng sao chép các vector, tăng lưu trữ và có thể khiến cùng một đoạn chiếm nhiều kết quả hàng đầu. Hãy loại bỏ bản sao hoặc đa dạng hóa sau khi lấy lại. Nếu cần chồng chéo lớn để làm cho các câu trả lời trở nên mạch lạc, phần chia có thể đang bỏ qua cấu trúc hữu ích.
3. Chia nhỏ cha-con: tốt nhất cho khôi phục chính xác cộng với ngữ cảnh
Chia nhỏ cha-con chỉ mục các đoạn nhỏ nhưng ánh xạ mỗi đoạn đến một phần cha lớn hơn. Bộ khôi phục tương ứng với trẻ con tập trung; ứng dụng gửi phần cha—hoặc một khu vực giới hạn xung quanh trẻ con—đến trình tạo. Điều này cũng được gọi là khôi phục từ nhỏ đến lớn.
Hướng dẫn RAG nâng cao của Microsoft mô tả các chỉ mục phân cấp và mở rộng ngữ cảnh Small2Big. Mô hình này hoạt động tốt khi người dùng yêu cầu một điều khoản chính xác nhưng câu trả lời yêu cầu định nghĩa, ngoại lệ hoặc các bước xung quanh nó.
Khôi phục cha-con cần các định danh tài liệu và vị trí ổn định. Lưu lại ID cha, vị trí con, đường dẫn tiêu đề và phiên bản nội dung. Sau khi lấy lại, hợp nhất các phần cha trùng lặp và bảo tồn vị trí con liên quan nhất để trình tạo không nhận cùng một phần nhiều lần.
Sự đánh đổi là lạm phát ngữ cảnh. Một trẻ con nhỏ có thể khớp với một từ khóa trong khi cha của nó bao gồm một số tiểu mục không liên quan. Hạn chế ranh giới cha đến một phần mạch lạc, sử dụng một bộ xếp hạng lại trên các phần con và so sánh khôi phục cha đầy đủ với một cửa sổ xung quanh cố định.
Bắt đầu phân đoạn RAG với tài liệu sạch hơn
Sử dụng Nstproxy Crawl để thu thập nội dung website có cấu trúc, giới hạn trước khi phân tích, phân đoạn, nhúng và truy xuất.
4. Chia theo trang: tốt nhất cho các PDF theo trang
Chia theo trang giữ mỗi trang PDF như một đơn vị thu hồi. Nó hoạt động khi ranh giới trang quan trọng với người đọc, bảng hoặc biểu đồ chỉ có trong trang, và tài liệu tham khảo cần phải chỉ số trang. Báo cáo, hồ sơ, tài liệu giống như trang chiếu và các hướng dẫn là những ứng viên mạnh mẽ.
Trong một đánh giá năm 2025, chuẩn đánh giá chia NVIDA RAG báo cáo độ chính xác trung bình tốt nhất từ đầu đến cuối cho chia theo trang trên các tập dữ liệu đã thử nghiệm. Đánh giá tương tự cũng phát hiện rằng tối ưu hóa thay đổi theo tập dữ liệu và truy vấn: một số tập dữ liệu theo sự kiện ưu tiên các phần nhỏ hơn, trong khi các câu hỏi phân tích được hưởng lợi từ ngữ cảnh lớn hơn hoặc theo trang. Kết luận có trách nhiệm là thử nghiệm các phần trang chứ không tuyên bố các trang là ưu việt một cách phổ quát.
Các trang thất bại khi một câu, bảng hoặc phần vượt qua một ngắt trang. Sự lặp lại của tiêu đề và chân trang cũng có thể chiếm ưu thế trong sự tương tự. Loại bỏ nội thất lặp lại, giữ số trang như siêu dữ liệu, và thử nghiệm việc thêm các trang liền kề chỉ sau một lần trúng thưởng thay vì nhúng các khung đa trang theo mặc định.
5. Chia theo ngữ nghĩa: tốt nhất cho sự chuyển đổi chủ đề mà không có markup
Chia theo ngữ nghĩa phát hiện sự thay đổi trong ý nghĩa, thường bằng cách so sánh các nhúng cho các câu hoặc nhóm liền kề. Nó có thể giúp trong việc tạo biên bản, ghi chú cuộc họp hoặc văn bản dài nơi cấu trúc tiêu đề không có sẵn và các ranh giới chủ đề quan trọng hơn chiều dài.
Sự hấp dẫn của nó cũng là rủi ro. Kết quả phụ thuộc vào việc phân đoạn câu, mô hình nhúng, ngưỡng độ tương tự, và cửa sổ được sử dụng để làm mịn sự thay đổi cục bộ. Thay đổi mô hình nhúng có thể âm thầm thay đổi ranh giới tập tài liệu và làm vô hiệu hóa các đánh giá đã lưu. Việc chia theo ngữ nghĩa cũng thêm công việc nhúng trong quá trình tiêu thụ trước khi các phần cuối cùng được nhúng lại.
Chỉ sử dụng nó sau khi cơ sở dữ liệu đệ quy có một sự thất bại đã được tài liệu, chẳng hạn như lặp đi lặp lại việc trộn các chủ đề liền kề hoặc tách một cuộc thảo luận khỏi kết luận của nó. Phiên bản cấu hình bộ chia và giữ lại vị trí nguồn để các phần có thể được tái tạo. Đối với văn bản hội thoại ồn ào, hãy so sánh các ranh giới ngữ nghĩa với các lượt người nói; tín hiệu rẻ hơn có thể cũng hữu ích tương đương.
Cách lựa chọn theo loại tài liệu và truy vấn
Sử dụng cấu trúc tài liệu như tín hiệu định tuyến đầu tiên, sau đó thử nghiệm chống lại hành vi truy vấn:
Tài liệu sản phẩm: các phần nhận thức cấu trúc, với sự mở rộng cha-con cho các chủ đề dài.
Các bài viết hỗ trợ ngắn: các phần hoặc các phần đệ quy với ít chồng chéo.
Báo cáo tài chính và hướng dẫn: cấp độ trang cộng với siêu dữ liệu phần; thử nghiệm phân tích có nhận thức bảng riêng biệt.
Biên bản: các đoạn đối thoại hoặc các khối ngữ nghĩa, với mã thời gian được giữ lại.
Mã nguồn: cây cú pháp hoặc ranh giới biểu tượng thay vì các chiến lược tường thuật.
Tập hợp doanh nghiệp hỗn hợp: định tuyến theo kiểu MIME và đầu ra phân tích cú pháp thay vì ép buộc một bộ tách toàn cầu.
Đối với tập hợp dữ liệu trang web mới, một quy trình thu thập dữ liệu tự động nên thu thập lại chỉ những gì chính sách cho phép, phát hiện những thay đổi nội dung và nhúng lại các khối bị ảnh hưởng. Việc tái xây dựng mọi vector trong mỗi lần chạy lãng phí tài nguyên và làm phức tạp quá trình truy tìm.
Một giao thức đánh giá tiết lộ sự khác biệt thực sự
Bắt đầu với một tập hợp câu hỏi lấy mẫu từ sử dụng thực tế. Bao gồm các tìm kiếm chính xác, câu hỏi giải thích, yêu cầu nhiều phần, câu hỏi phủ định và các truy vấn mà trong đó câu trả lời kéo dài qua một ranh giới. Ghi nhãn các đoạn văn hỗ trợ trước khi điều chỉnh bộ tách.
Đo ít nhất bốn lớp:
Tỷ lệ hồi phục: có kết quả hàng đầu nào chứa bằng chứng cần thiết không?
Độ chính xác ngữ cảnh: đã bao nhiêu văn bản thu hồi là liên quan đến câu hỏi?
Độ tin cậy của câu trả lời: có phải các tuyên bố câu trả lời được hỗ trợ bởi ngữ cảnh cung cấp không?
Chi phí vận hành: cần bao nhiêu khối, token nhúng, đầu vào xếp hạng lại và token sinh ra?
Giữ nguyên mô hình nhúng, phương pháp thu hồi, bộ xếp hạng lại, lời nhắc và trình tạo cố định trong khi so sánh việc phân khối. Sau đó, điều chỉnh chiến lược thắng cuộc cùng với top-k và lắp ghép ngữ cảnh. Nếu không, một bộ xếp hạng lại mạnh hơn có thể bị nhầm lẫn là một bộ tách mạnh hơn.
Kiểm tra các lỗi, không chỉ trung bình. Một phương pháp có thể hoạt động tốt tổng thể trong khi liên tục bị mất tiêu đề bảng, ngoại lệ, hoặc định nghĩa xuyên trang. Những lỗi đó ảnh hưởng đến quyết định sản phẩm nhiều hơn một cải thiện tổng hợp nhỏ.
Chuẩn bị nội dung web trước khi phân khối
Phân khối không thể sửa chữa một tài liệu đầu vào bị hỏng. Điều hướng, bảng cookie, mã đánh dấu di động trùng lặp, nội dung render JavaScript bị thiếu, và thứ tự đọc không đúng trở thành các vector chất lượng thấp bất kể bộ tách là gì.
Nstproxy Crawl có thể thu thập các trang web được ủy quyền với các điều khiển trang, độ sâu, bao gồm và loại trừ và trả về các định dạng phù hợp với việc xử lý hạ nguồn. Sử dụng Markdown khi tiêu đề và ngữ nghĩa quan trọng; giữ lại HTML khi bảng, thuộc tính, hoặc phân tích cấu trúc là quan trọng. Hướng dẫn đại lý tìm kiếm AI cho thấy nơi lớp tiếp nhận này phù hợp trước khi thu hồi và tổng hợp.
Kết luận cuối cùng: sử dụng cấu trúc trước, sau đó chứng minh ngoại lệ
Phân khối theo cấu trúc là mặc định tổng quát tốt nhất, trong khi phân khối theo token đệ quy là tiêu chuẩn mà mỗi phương pháp phức tạp hơn nên vượt qua. Sử dụng thu hồi cha-con khi các điểm chính xác cần ngữ cảnh rộng hơn, kiểm tra các khối cấp trang cho các tệp PDF định hướng trang, và giữ việc tách ngữ nghĩa cho các tập hợp mà sự thay đổi chủ đề là có thật nhưng mã đánh dấu còn yếu.
Bước tiếp theo là ghi nhãn một tập hợp câu hỏi đại diện và chạy cùng một đánh giá thu hồi và câu trả lời qua hai hoặc ba chiến lược. Nếu các trang nguồn không đầy đủ hoặc ồn ào, hãy sửa chữa việc thu thập với Nstproxy Crawl trước khi tốn thời gian trên ngưỡng bộ tách.
Cung cấp tài liệu nguồn sạch cho quy trình RAG của bạn
Sử dụng Nstproxy Crawl để tạo ra các đầu vào web có giới hạn, có cấu trúc với các URL được giữ lại và các định dạng có thể chọn, sau đó đánh giá các chiến lược phân khối trên một tập hợp có thể tái tạo.
Không có kích thước khối tốt nhất chung. Bắt đầu với một cửa sổ token vừa phải, sau đó điều chỉnh nó theo các truy vấn đại diện trong khi giữ nguyên mô hình nhúng, bộ thu hồi, bộ xếp hạng lại và trình tạo.
Q: RAG khối nên sử dụng bao nhiêu chồng?
Chỉ sử dụng đủ chồng để duy trì ý nghĩa qua những ranh giới không thể tránh khỏi. Chồng cao làm tăng lưu trữ và thu hồi trùng lặp; các phương pháp nhận thức cấu trúc hoặc cha-con thường bảo tồn ngữ cảnh hiệu quả hơn.
Q: Phân khối ngữ nghĩa có tốt hơn phân khối kích thước cố định không?
Phân khối ngữ nghĩa chỉ tốt hơn khi các ranh giới chủ đề của nó cải thiện đáng kể việc thu hồi và chất lượng câu trả lời để biện minh cho công việc tiếp nhận bổ sung. Phân khối theo token cố định đệ quy vẫn là cơ sở có thể tái tạo hơn.
Q: Có nên phân khối PDF theo trang không?
Phân khối theo trang là một ứng cử viên mạnh mẽ cho các báo cáo, tài liệu và hồ sơ định hướng trang, đặc biệt khi các trích dẫn trang có ý nghĩa. Nó hoạt động kém khi các câu quan trọng, bảng hoặc phần thường xuyên vượt qua các ranh giới trang.
Marcus Chen
Aug. 26th 2026
110M+ IP that voi ti le truy cap thanh cong 99.9%
Phan hoi trung binh ~0.5s cho tac vu dong thoi cao
Chi tu $0.1/GB
Truy cap ngay cac pool proxy residential, datacenter, IPv6 va ISP cao cap.