RAG 基础概念:检索、生成与工程取舍
RAG 在检索与生成之间架桥,解决时效、私有数据与幻觉三难题(非零幻觉)。
工作原理
离线索引六步:摄入、清洗、元数据、Chunk、Embedding、入库。在线:Query 向量化 → 相似检索 → 上下文增强 → 生成 + 引用。
为何需要
预训练知识过期;企业数据不可外泄;生成需证据降低胡编。但仍可能检索错、引用错、模型不跟指令。
与搜索对比
找文档用搜索;读文档答问题用 RAG。很多企业双入口并存。RAG 延迟与成本更高,需评测与 ACL。
误区
RAG 消灭幻觉;Chunk 越大越好;不做混合检索与重排。
延伸思考
Embedding 模型选择看语种、领域、维度与推理成本;查询与文档应同一模型。相似度 metric 要与索引实现一致(cosine/L2/IP)。与微调对比:RAG 适合知识频繁变、需 citation;微调适合风格/格式固定、知识相对稳定。长上下文可补 RAG 但无法替代权限与溯源。生产 RAG 必做:低分拒答、引用片段展示、用户反馈回流索引。
实践小结
练习:手工走一遍索引+查询,打印 top5 chunk 与最终答案,检查 grounded。对比纯搜索入口的用户满意度假设。写一段「何时拒答」规则。
工程检查清单
检查清单:离线与在线阶段是否讲清;混合检索是否计划;拒答与引用是否设计;与搜索双入口是否评估。基础概念决定后续优化方向是否正确。
读者 takeaway
读者 takeaway:RAG 降低幻觉却不能消除;检索与权限同样关键。理解 RAG 与搜索、微调、长窗的边界,才能为业务选最省钱的组合。
学习建议
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 Dai Wei!
评论

