一个客服 Agent,用户第三轮说"我之前说的那个订单",Agent 完全不知道"那个订单"是什么——因为前两轮的对话已经被截断了,而且没有做情景摘要。
阅读提示
- 适合谁看:理解了推理模式和工具调用(看完前两篇)、现在要解决"怎么让 Agent 记住上下文和历史知识"的工程师
- 看完能做什么:设计三层记忆架构、实现记忆压缩、选择合适的检索策略
- 不适合谁:还没理解推理和工具调用的读者(先看前两篇)
先给结论
- **Agent 的记忆不是"把历史消息塞进上下文窗口"**——上下文窗口是短期记忆,但 Agent 还需要长期记忆(知识库)和情景记忆(历史交互摘要)
- **记忆系统的核心矛盾是"检索精度 vs 上下文长度"**——塞太多记忆会稀释关键信息,塞太少会丢掉重要上下文
- 记忆写入比记忆检索更难——什么时候该存、存什么格式、怎么去重和更新,这些问题比"怎么检索"更关键
01 三种记忆类型
图 1|Agent 三层记忆架构
短期记忆(上下文窗口):当前对话的完整上下文。受 token 上限限制(比如 4K / 8K / 128K)。对话结束后丢失。
长期记忆(向量库 + 知识图谱):持久化存储,支持语义检索。跨对话保留。存的是"事实"和"知识"。
情景记忆(交互摘要 + 决策记录):历史对话的压缩版本。保留关键决策点和上下文,但丢弃冗余细节。跨对话保留。存的是"经历"和"判断"。
三者的关系:
- 短期记忆满了 → 压缩成情景记忆
- 情景记忆积累多了 → 提取关键事实存入长期记忆
- 新对话开始 → 从长期记忆和情景记忆检索相关上下文,注入短期记忆
02 短期记忆:token 预算分配
上下文窗口是有限的。怎么在有限的 token 里最大化信息密度?
推荐的 token 预算分配:
| 组件 | 占比 | 说明 |
|---|---|---|
| System Prompt | 20% | 角色定义、行为约束、输出格式 |
| 工具描述 | 15% | 注册的工具列表和参数 Schema |
| 历史消息 | 50% | 对话历史(最新的优先) |
| 用户输入 | 15% | 当前轮的用户问题 |
历史消息的截断策略:
- 滑动窗口:只保留最近 N 轮对话(简单但会丢失早期重要信息)
- 重要性排序:根据消息的重要性(是否包含决策、是否被引用)选择保留
- 摘要替换:把早期对话压缩成摘要,替换原始消息
03 长期记忆:向量检索 vs BM25 vs 混合检索
图 2|记忆检索策略对比
向量检索:用 embedding 模型把记忆和查询都转成向量,计算余弦相似度。
- 优点:语义理解能力强,“用户投诉"能匹配到"客户不满”
- 缺点:精确关键词匹配弱,"订单号 12345"可能匹配不到
BM25 关键词检索:基于词频-逆文档频率的统计方法。
- 优点:精确关键词匹配强,速度快
- 缺点:语义理解弱,“投诉"匹配不到"不满”
混合检索(推荐):向量 + BM25 加权融合。
def hybrid_retrieve(query, vector_store, bm25_index, alpha=0.7): # 向量检索 vector_results = vector_store.search(query, top_k=20) # BM25 检索 bm25_results = bm25_index.search(query, top_k=20) # 加权融合 combined = {} for r in vector_results: combined[r.id] = alpha * r.score for r in bm25_results: combined[r.id] = combined.get(r.id, 0) + (1 - alpha) * r.score return sorted(combined.items(), key=lambda x: -x[1])[:10]04 情景记忆:压缩时机和摘要粒度
什么时候该压缩:
- token 使用超过 80%:触发压缩,把早期对话摘要化
- 对话结束时:把整轮对话的关键信息提取出来存入情景记忆
- 关键决策点:用户做出了重要选择(比如"就选方案 A"),立即记录
摘要的 Prompt 模板:
请将以下对话压缩为结构化摘要,保留:1. 用户的核心需求和偏好2. 做出的关键决策及其原因3. 未解决的问题和待办事项4. 重要的事实信息(数字、日期、名称)丢弃:- 寒暄和无关对话- 已经被后续消息覆盖的信息- 重复的确认对话对话历史:{history}输出格式:{ "user_needs": "...", "key_decisions": [...], "open_questions": [...], "important_facts": [...]}在我们的项目里,情景记忆的压缩比约 10:1(1000 token 的对话压缩成 100 token 的摘要),但关键决策点的保留率要保证 95% 以上。
05 记忆写入:去重 / 更新 / 过期
去重:相似记忆合并。用户在第 2 轮说"我喜欢红色",第 5 轮说"我偏好红色和蓝色"——应该合并为一条"用户偏好:红色、蓝色",而不是存两条。
更新:旧信息覆盖。用户第 1 轮说"我的地址是北京",第 3 轮说"我搬到上海了"——应该更新为"用户地址:上海"。
过期:时间衰减。三个月前的对话细节可能已经不重要了,降低检索权重。
优先级:重要记忆保留。包含决策、数字、名称的记忆比一般对话更重要。
06 最小实验:三层记忆 vs 只有短期记忆
实验设计:一个客服 Agent,用户连续对话 10 轮,对比两种配置的回答质量。
只有短期记忆(滑动窗口 5 轮):
- 第 6 轮开始,用户说"我之前说的那个订单"——Agent 不知道是哪个订单
- 第 10 轮,用户说"按之前的方案处理"——Agent 完全不知道之前的方案
有三层记忆:
- 第 6 轮:Agent 从情景记忆检索到"用户在第 2 轮提到订单号 12345"
- 第 10 轮:Agent 从情景记忆检索到"第 4 轮确定的方案:退款 + 补发"
效果差异:在 10 轮对话中,有三层记忆的 Agent 回答准确率约 88%,只有短期记忆的约 62%。
07 边界:什么场景不需要复杂记忆系统
单轮任务:用户问一句、Agent 答一句,不需要记忆系统。比如"翻译这段话"、“计算这个公式”。
无状态服务:每次请求独立处理,不需要跨请求记忆。比如"批量分类 100 条文本"。
上下文窗口足够大:如果模型支持 128K 上下文,且对话轮数不超过 20 轮,短期记忆就够了。
08 给读者一个能用来做决策的结论
决策帮助
- 如果你的对话轮数 < 10 轮:短期记忆(滑动窗口)就够了,不需要复杂记忆系统
- 如果你的对话轮数 > 10 轮:加情景记忆(压缩摘要),解决"早期对话被截断"问题
- 如果你的Agent 需要跨对话记忆:加长期记忆(向量库),存储用户偏好和历史事实
- 如果你只能先做一步:实现一个 token 超 80% 时自动压缩历史的机制——这一步能解决 80% 的"记忆丢失"问题
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~