RAG 检索增强架构

从用户提问 → 向量检索 → 重排 → 拼接 Prompt → 生成回答,完整链路可视化。点击下方步骤或"运行全链路",看每一环在做什么。

创建时间:2026-09-09 更新时间:2026-09-11 阅读次数:1007 次
用户提问
🔢 向量化
🔍 向量检索
📊 重排
生成回答

📚 知识库文档(按相关性排序)

🧭 向量空间中的语义距离

🔴 红点 = 用户 Query 🟢 绿点 = 命中的文档 🔵 蓝点 = 未命中

✨ 拼接后的 Prompt 与大模型回答

等待运行...
运行全链路后,这里会展示 RAG 生成的回答。

🎯 面试速答:一句话讲清 RAG

Q:RAG 的完整流程是什么?
离线阶段把文档分块、向量化、存入向量库;在线阶段把用户提问向量化,在向量库中检索 Top-K 相似文档,可选重排,把检索结果拼进 Prompt 交给大模型生成答案。
Q:RAG 相比微调有什么优势?
知识更新快(改文档即可,无需重训)、成本低、可溯源(能给出引用来源)、减少幻觉。适合知识频繁变化的场景;微调适合改变模型风格和能力。
Q:如何提升 RAG 检索准确率?
① 分块策略优化(语义分块、重叠窗口);② 混合检索(向量 + BM25 关键词);③ 重排模型(Cross-Encoder 精排);④ Query 改写/扩展;⑤ 元数据过滤。
Q:RAG 常见问题有哪些?
检索不到相关内容、检索到无关内容、上下文超长被截断、多跳推理失败、答案与检索内容矛盾。对应方案:Query 改写、重排、上下文压缩、多轮检索、引用约束。