AI我的 AI 学习站
← 返回笔记列表
大语言模型

RAG 系统优化笔记:从检索到生成的全链路

2026/08/29#LLM#向量数据库#RAG

为什么需要 RAG

大模型的知识有截止日期,且无法覆盖私有数据。RAG(检索增强生成)通过"先检索、后生成"的方式,把外部知识注入模型上下文。

关键优化点

1. 文档分块(Chunking)

  • 固定长度分块简单但会切断语义,建议按标题/段落做结构化切分;
  • 相邻块保留 10%-20% 重叠,避免边界信息丢失。

2. 检索召回

  • 向量检索擅长语义匹配,关键词检索(BM25)擅长精确命中,混合检索往往效果更好;
  • 召回数量(top-k)要与重排序能力匹配,通常召回 50-100 条再精排。

3. 重排序(Rerank)

使用 Cross-Encoder 或专用重排模型对召回结果二次打分,是性价比最高的提升手段。

4. 提示词组织

  • 明确告诉模型"只根据参考资料回答";
  • 为每段资料编号,要求模型在回答中引用编号,便于溯源。

小结

RAG 优化是一个系统工程,建议先建立评测集,再逐项实验、量化对比。