Agent 的记忆系统:短期、长期、情景记忆怎么设计
2026/7/26 12:22:44 网站建设 项目流程

一个客服 Agent,用户第三轮说"我之前说的那个订单",Agent 完全不知道"那个订单"是什么——因为前两轮的对话已经被截断了,而且没有做情景摘要。

阅读提示

  • 适合谁看:理解了推理模式和工具调用(看完前两篇)、现在要解决"怎么让 Agent 记住上下文和历史知识"的工程师
  • 看完能做什么:设计三层记忆架构、实现记忆压缩、选择合适的检索策略
  • 不适合谁:还没理解推理和工具调用的读者(先看前两篇)

先给结论

  • **Agent 的记忆不是"把历史消息塞进上下文窗口"**——上下文窗口是短期记忆,但 Agent 还需要长期记忆(知识库)和情景记忆(历史交互摘要)
  • **记忆系统的核心矛盾是"检索精度 vs 上下文长度"**——塞太多记忆会稀释关键信息,塞太少会丢掉重要上下文
  • 记忆写入比记忆检索更难——什么时候该存、存什么格式、怎么去重和更新,这些问题比"怎么检索"更关键

01 三种记忆类型

图 1|Agent 三层记忆架构

短期记忆(上下文窗口):当前对话的完整上下文。受 token 上限限制(比如 4K / 8K / 128K)。对话结束后丢失。

长期记忆(向量库 + 知识图谱):持久化存储,支持语义检索。跨对话保留。存的是"事实"和"知识"。

情景记忆(交互摘要 + 决策记录):历史对话的压缩版本。保留关键决策点和上下文,但丢弃冗余细节。跨对话保留。存的是"经历"和"判断"。

三者的关系

  • 短期记忆满了 → 压缩成情景记忆
  • 情景记忆积累多了 → 提取关键事实存入长期记忆
  • 新对话开始 → 从长期记忆和情景记忆检索相关上下文,注入短期记忆

02 短期记忆:token 预算分配

上下文窗口是有限的。怎么在有限的 token 里最大化信息密度?

推荐的 token 预算分配

组件占比说明
System Prompt20%角色定义、行为约束、输出格式
工具描述15%注册的工具列表和参数 Schema
历史消息50%对话历史(最新的优先)
用户输入15%当前轮的用户问题

历史消息的截断策略

  • 滑动窗口:只保留最近 N 轮对话(简单但会丢失早期重要信息)
  • 重要性排序:根据消息的重要性(是否包含决策、是否被引用)选择保留
  • 摘要替换:把早期对话压缩成摘要,替换原始消息

03 长期记忆:向量检索 vs BM25 vs 混合检索

图 2|记忆检索策略对比

向量检索:用 embedding 模型把记忆和查询都转成向量,计算余弦相似度。

  • 优点:语义理解能力强,“用户投诉"能匹配到"客户不满”
  • 缺点:精确关键词匹配弱,"订单号 12345"可能匹配不到

BM25 关键词检索:基于词频-逆文档频率的统计方法。

  • 优点:精确关键词匹配强,速度快
  • 缺点:语义理解弱,“投诉"匹配不到"不满”

混合检索(推荐):向量 + BM25 加权融合。

def hybrid_retrieve(query, vector_store, bm25_index, alpha=0.7): # 向量检索 vector_results = vector_store.search(query, top_k=20) # BM25 检索 bm25_results = bm25_index.search(query, top_k=20) # 加权融合 combined = {} for r in vector_results: combined[r.id] = alpha * r.score for r in bm25_results: combined[r.id] = combined.get(r.id, 0) + (1 - alpha) * r.score return sorted(combined.items(), key=lambda x: -x[1])[:10]

04 情景记忆:压缩时机和摘要粒度

什么时候该压缩

  • token 使用超过 80%:触发压缩,把早期对话摘要化
  • 对话结束时:把整轮对话的关键信息提取出来存入情景记忆
  • 关键决策点:用户做出了重要选择(比如"就选方案 A"),立即记录

摘要的 Prompt 模板

请将以下对话压缩为结构化摘要,保留:1. 用户的核心需求和偏好2. 做出的关键决策及其原因3. 未解决的问题和待办事项4. 重要的事实信息(数字、日期、名称)丢弃:- 寒暄和无关对话- 已经被后续消息覆盖的信息- 重复的确认对话对话历史:{history}输出格式:{ "user_needs": "...", "key_decisions": [...], "open_questions": [...], "important_facts": [...]}

在我们的项目里,情景记忆的压缩比约 10:1(1000 token 的对话压缩成 100 token 的摘要),但关键决策点的保留率要保证 95% 以上


05 记忆写入:去重 / 更新 / 过期

去重:相似记忆合并。用户在第 2 轮说"我喜欢红色",第 5 轮说"我偏好红色和蓝色"——应该合并为一条"用户偏好:红色、蓝色",而不是存两条。

更新:旧信息覆盖。用户第 1 轮说"我的地址是北京",第 3 轮说"我搬到上海了"——应该更新为"用户地址:上海"。

过期:时间衰减。三个月前的对话细节可能已经不重要了,降低检索权重。

优先级:重要记忆保留。包含决策、数字、名称的记忆比一般对话更重要。


06 最小实验:三层记忆 vs 只有短期记忆

实验设计:一个客服 Agent,用户连续对话 10 轮,对比两种配置的回答质量。

只有短期记忆(滑动窗口 5 轮):

  • 第 6 轮开始,用户说"我之前说的那个订单"——Agent 不知道是哪个订单
  • 第 10 轮,用户说"按之前的方案处理"——Agent 完全不知道之前的方案

有三层记忆

  • 第 6 轮:Agent 从情景记忆检索到"用户在第 2 轮提到订单号 12345"
  • 第 10 轮:Agent 从情景记忆检索到"第 4 轮确定的方案:退款 + 补发"

效果差异:在 10 轮对话中,有三层记忆的 Agent 回答准确率约 88%,只有短期记忆的约 62%。


07 边界:什么场景不需要复杂记忆系统

单轮任务:用户问一句、Agent 答一句,不需要记忆系统。比如"翻译这段话"、“计算这个公式”。

无状态服务:每次请求独立处理,不需要跨请求记忆。比如"批量分类 100 条文本"。

上下文窗口足够大:如果模型支持 128K 上下文,且对话轮数不超过 20 轮,短期记忆就够了。


08 给读者一个能用来做决策的结论

决策帮助

  • 如果你的对话轮数 < 10 轮:短期记忆(滑动窗口)就够了,不需要复杂记忆系统
  • 如果你的对话轮数 > 10 轮:加情景记忆(压缩摘要),解决"早期对话被截断"问题
  • 如果你的Agent 需要跨对话记忆:加长期记忆(向量库),存储用户偏好和历史事实
  • 如果你只能先做一步:实现一个 token 超 80% 时自动压缩历史的机制——这一步能解决 80% 的"记忆丢失"问题

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询