RAG 在检索与生成之间架桥,解决时效、私有数据与幻觉三难题(非零幻觉)。

工作原理

离线索引六步:摄入、清洗、元数据、Chunk、Embedding、入库。在线:Query 向量化 → 相似检索 → 上下文增强 → 生成 + 引用。

为何需要

预训练知识过期;企业数据不可外泄;生成需证据降低胡编。但仍可能检索错、引用错、模型不跟指令。

与搜索对比

找文档用搜索;读文档答问题用 RAG。很多企业双入口并存。RAG 延迟与成本更高,需评测与 ACL。

误区

RAG 消灭幻觉;Chunk 越大越好;不做混合检索与重排。

延伸思考

Embedding 模型选择看语种、领域、维度与推理成本;查询与文档应同一模型。相似度 metric 要与索引实现一致(cosine/L2/IP)。与微调对比:RAG 适合知识频繁变、需 citation;微调适合风格/格式固定、知识相对稳定。长上下文可补 RAG 但无法替代权限与溯源。生产 RAG 必做:低分拒答、引用片段展示、用户反馈回流索引。

实践小结

练习:手工走一遍索引+查询,打印 top5 chunk 与最终答案,检查 grounded。对比纯搜索入口的用户满意度假设。写一段「何时拒答」规则。

工程检查清单

检查清单:离线与在线阶段是否讲清;混合检索是否计划;拒答与引用是否设计;与搜索双入口是否评估。基础概念决定后续优化方向是否正确。

读者 takeaway

读者 takeaway:RAG 降低幻觉却不能消除;检索与权限同样关键。理解 RAG 与搜索、微调、长窗的边界,才能为业务选最省钱的组合。

学习建议