大语言模型
RAG 系统优化笔记:从检索到生成的全链路
2026/08/29#LLM#向量数据库#RAG
为什么需要 RAG
大模型的知识有截止日期,且无法覆盖私有数据。RAG(检索增强生成)通过"先检索、后生成"的方式,把外部知识注入模型上下文。
关键优化点
1. 文档分块(Chunking)
- 固定长度分块简单但会切断语义,建议按标题/段落做结构化切分;
- 相邻块保留 10%-20% 重叠,避免边界信息丢失。
2. 检索召回
- 向量检索擅长语义匹配,关键词检索(BM25)擅长精确命中,混合检索往往效果更好;
- 召回数量(top-k)要与重排序能力匹配,通常召回 50-100 条再精排。
3. 重排序(Rerank)
使用 Cross-Encoder 或专用重排模型对召回结果二次打分,是性价比最高的提升手段。
4. 提示词组织
- 明确告诉模型"只根据参考资料回答";
- 为每段资料编号,要求模型在回答中引用编号,便于溯源。
小结
RAG 优化是一个系统工程,建议先建立评测集,再逐项实验、量化对比。