📖标题:Self-Designed Evaluators and Warm Memory for Long-Horizon Agents
🌐来源:arXiv, 2609.33717v1
🛎️文章简介
🔸研究问题:在没有人工标注和明确奖励信号的长周期任务中,智能体如何判断自己是否成功,从而安全地进行重试并从经验中学习?
🔸主要贡献:论文提出了SELFSUITE框架,让智能体利用公开材料自行设计一套冻结的评估套件,用于控制重试循环和标记记忆,在无标签情况下显著提升了性能。
📝重点思路
🔸自设计评估套件:智能体的基础模型作为“架构师”,仅依据世界摘要、策略文档等公开材料,自动生成包含多个评判标准(Judge)的小型评估套件。这些标准被分解为具体的检查项,并设定权重和否决机制,一旦生成即冻结,不再随部署过程改变。
🔸基于世界状态的验证:评判者不只查看对话记录,而是通过只读查询获取任务执行后的真实世界状态作为证据。这种基于结果的验证比基于过程的验证更可靠,避免了模型对自己生成内容的盲目偏好。
🔸保守的重试与择优机制:引入“保留最佳”(Keep-best)重试策略。如果第一次尝试失败且预算允许,智能体会根据评估套件的反馈进行第二次尝试。只有当第二次尝试的得分显著高于第一次时,才会替换结果,从而确保重试是低风险且有益的。
🔸带损益账本的类型化记忆:智能体将经验提炼为教训存入记忆,并为每条教训维护一个损益账本。如果某条教训被使用后任务成功则加分,失败则扣分,持续有害的教训会被淘汰,确保记忆库的质量。
🔸专家校准与热启动:模拟真实部署中专家提供的少量(10个)标注数据,可用于校准评估套件的阈值和聚合规则,或用于初始化强基线模型的记忆库,进一步微调性能。
🔎分析总结
🔸无标签表现优异:在tau2-bench基准测试中,SELFSUITE在无标签情况下的表现优于普通智能体,并与使用专家标签的方法持平;在App