GraphRAG:用图结构补充向量检索
向量 Top-K 擅长相似片段,GraphRAG 补关系推理与全局摘要类问题。
动机
Chunk 孤岛化;向量相似度不保证逻辑邻接;「整个库的趋势」类问题需社区检测与图遍历。GraphRAG 构建实体关系图,检索时走子图 + 摘要。
机制
索引期:抽取实体边、社区划分、生成社区摘要。查询期:局部向量检索 + 图扩展 + 汇总 Prompt。成本高于纯向量 RAG。
选型
适合关系密集、多跳问答、研报类全局问题。简单 FAQ 纯向量即可。可混合:向量初召 + 图 refine。
误区
一切上图;忽视构建与更新成本;图质量差于向量 baseline 未对比评测。
延伸思考
GraphRAG 索引成本包含实体抽取 LLM 调用、社区摘要生成与图存储。查询时若走全局搜索,延迟高于普通 RAG,适合离线分析型问答而非毫秒级客服。与向量混合:先用向量找种子实体,再 k-hop 扩展。更新时图边也需增量维护,否则节点过期。评测应用多跳数据集验证是否真的优于 baseline,避免为图而图。
实践小结
练习:选 5 个多跳问题,对比向量 RAG 与(若有)图扩展结果。估算构图 LLM 成本是否可接受。明确团队是否有「必须 GraphRAG」的数据特征。
工程检查清单
检查清单:是否真有多跳需求;构图成本;更新策略;与向量 baseline 对比指标。GraphRAG 是补充而非默认方案。
读者 takeaway
读者 takeaway:GraphRAG 解决关系和全局性问题,不是向量 RAG 的简单升级。用数据和成本证明需要它,否则维护图结构的投入可能高于收益。
学习建议
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 Dai Wei!
评论

