AI Agent 记忆系统:短期记忆、长期记忆与记忆演化机制
记忆让 Agent 跨轮次保持任务连贯,也是长对话失控的主要变量。
记忆分类
短期记忆通常是对话历史与当前任务状态,受上下文窗口限制。长期记忆存用户偏好、历史结论、实体关系,常用向量库或 KV/图数据库。 episodic 记「发生了什么」,semantic 记「知道什么」。
生命周期
写入:工具结果、用户确认、摘要压缩后入库。读取:按 query 检索相关记忆注入上下文。更新:冲突合并、过期淘汰、重要性打分。遗忘:主动删除敏感或过时条目。
与 RAG 的边界
RAG 面向企业知识库、强调溯源与权限;Memory 面向会话/用户态、强调个性化与任务连续。二者可共存:RAG 供事实,Memory 供交互历史。勿把整库当 Memory 无差别注入。
实践与误区
长任务定期做 rolling summary;记忆写入前脱敏。误区:无限追加历史导致偏题;不做去重重复注入矛盾信息;长期记忆无 TTL 引发隐私风险。
延伸思考
工程上可为 Memory 设计写入门槛:仅持久化用户显式确认、工具返回的结构化结论、或经摘要压缩后的高价值事实。读取侧做相关性阈值,低于阈值不注入,避免「记忆污染」带偏当前任务。对合规场景,Memory 需支持按用户删除与导出。与 RAG 联用时,企业事实走 RAG 并带 citation,会话偏好走 Memory 且带来源时间戳,模型才能区分「制度规定」与「上次聊天约定」。
实践小结
练习:为会话 Memory 设计写入 API(含 TTL 与 user_id),并写测试验证「用户删除账号后 Memory 同步清除」。对比「全历史塞上下文」与「摘要+检索 Memory」在同一多轮任务上的成功率与 token 曲线。
工程检查清单
检查清单:Memory 写入是否有用户确认或自动摘要门槛;是否支持 GDPR 删除;读取是否做相关性与 TTL 过滤;是否与 RAG citation 分工清晰;长会话是否 rolling summary;Memory 条目是否去重。未治理的 Memory 比无 Memory 更危险,容易累积矛盾事实。
读者 takeaway
读者 takeaway:记忆系统解决连续性,也引入一致性风险。写入克制、读取筛选、与 RAG 分工明确,Memory 才会放大体验而不是放大错误。

