☰
不是所有经验都适合存入模型权重:面向自改进GUI智能体的组件路由框架
2026/10/4 19:26:06 网站建设 项目流程

不是所有经验都适合存入模型权重:面向自改进GUI智能体的组件路由框架

arXiv:2610.01787v1,2026‑10‑01

摘要

自改进GUI智能体会将自身运行产生的轨迹经验复用,主要存在两种方案:一是对轨迹做微调,将经验写入模型权重;二是把轨迹检索后放入上下文提示。现有研究对比这两种方案得出互相矛盾的结论,本文指出矛盾根源来自经验的粒度问题:一条轨迹是多种不同属性经验单元的混合包络,整体评估结论会受内部组分占比影响。

本文提出组件路由(Component Routing),将智能体经验拆解为四类组件:定位器(locators)、过程序列(procedures)、状态事实(state facts)、经验教训(lessons);依据训练前即可统计得到的两个属性——重复出现度(recurrence)、状态条件依赖性(state‑conditionality),把每一类组件分配到「上下文提示」或者「模型权重」。在三套主干模型、两个GUI仿真环境、3个随机种子下开展对照实验。
实验发现最优分配策略:定位器、经验教训适合存入权重;过程序列、状态事实适合放在上下文。

基于两类属性拟合得到路由判定规则,在留出的主干模型家族测试集上,24组测试样例全部预测正确。两组干预实验可以人为改变组件的最优归属:提升训练样本剂量可以让过程序列向权重一侧偏移;剥离状态条件会降低上下文方案收益。采用该路由规则的效果,平均比每一套主干模型的单一最优方案高出**+3.5个百分点**,相比反向分配策略高出+7.8个百分点。

进一步揭示训练、生产者‑消费者模型差异如何改变两种复用路径收益:当相同经验写入权重后,高重复度经验在上下文里被读取触发的概率大幅下降;上下文路径收益会随信息缺口增大而提升;权重微调路径收益会随策略缺口增大而衰减。

1 引言

GUI智能体(手机/桌面端大模型代理)会把自己执行任务得到的轨迹经验用于自我迭代。行业存在两条主流路线:

  1. 微调路线:拿成功轨迹做SFT/偏好微调,把经验固化进模型权重;
  2. 检索上下文路线:维护轨迹库,运行时检索相关样本放到prompt上下文。

但是现有文献对比两种路线得到相互冲突结论:部分场景微调更好,部分场景检索上下文更好。本文发现问题根源:现有方法把整条轨迹当作不可拆分的最小经验单元,一条轨迹混杂多种属性完全不同的经验片段,实验结论取决于轨迹内部组分占比。

举一个天气APP直观示例:任务为「将罗马添加到已保存城市列表」。完整轨迹包含两类信息:①搜索框控件的页面位置(定位器,跨任务反复出现);②在预览页面点击Add按钮的操作(过程序列,高度依赖当前页面状态)。
如果直接拿整条轨迹做微调SFT:模型学会了控件位置,但是会遗忘“需要点击Add”这个状态依赖的关键步骤。
而组件路由方案:定位器存入权重,过程序列保留在上下文,二者各司其职。

核心研究问题:智能体产生的经验,哪些适合放到上下文,哪些适合写入权重?该结论是否在不同主干模型、训练条件下依然成立?

本文主要贡献

  1. 经验单元拆解评测:把轨迹拆分为4类组件,定义训练前可计算的两个统计属性;在3套主干模型、2个环境做严格配对对照,同一批经验分别送入权重/上下文。
  2. 基于重复出现度、状态条件依赖性拟合路由判定规则;在留出模型家族全部24个样例预测正确;两组干预实验验证规则有效性;组件路由相比单一方案平均提升+3.5pts。
  3. 揭示生产者‑消费者、信息缺口、策略缺口对两种经验复用路径的影响:高重复度经验写入权重后,上下文笔记触发率显著下降;上下文收益随信息缺口上升;权重微调收益随策略冲突缺口下降。

2 相关工作

2.1 经验复用两大路线:权重微调 vs 上下文检索

  • 权重微调:对智能体自身轨迹做SFT、DPO偏好优化;提取技能做蒸馏,把经验固化进参数。
  • 上下文检索:维护轨迹/技能库,运行时检索,把样本直接放入prompt,不修改权重。

现有研究经常直接对比两套完整流水线,但是输入经验集本身存在差异;很少做到保持经验内容完全不变,仅仅改变存放目的地做对照。本文组件路由固定经验素材,只改变存储目的地。

2.2 GUI智能体与轨迹经验

GUI智能体训练来源包括人类演示、智能体自生成轨迹。已有工作会提取技能卡片、事后重标记经验;观测到微调会学习界面捷径而不是语义逻辑;同一套表征在一类任务有效,另一类任务产生负面影响。大部分现有系统固定经验存储目的地,本文将经验拆分成组件,由数据统计属性自动选择存储位置。

2.3 生产者‑消费者与自改进智能体脆弱性

自改进智能体性能高度依赖经验生成方(producer)和使用方(consumer)模型之间的匹配度;记忆收益受随机种子、任务顺序影响;重复内化经验性能不升反降。
本文区分信息缺口、策略缺口两个指标,量化解释生产者消费者之间的性能变化。

3 实验设置:组件路由框架

组件路由不再把整条轨迹作为单元,而是将原始经验池EEE提取为4类组件集合DcD_cDc​,c∈{G,P,F,L}c \in \{G,P,F,L\}c∈{G,P,F,L}。

  • GGGLocators定位器:描述界面元素在屏幕的位置;键值(应用,角色,元素名)
  • PPPProcedures过程序列:任务家族内部连续动作子目标序列;键值为连续3个动作目标
  • FFFState facts状态事实:动作成功执行必须满足的前置条件;来自同一目标的成功、失败成对样本
  • LLLLessons经验教训:同一个状态下失败动作与对应成功动作的偏好配对

每一条经验项ddd包含:唯一标识key、上下文使用的文本笔记note、用于微调的训练样本sample。

两种存储目的地:

  1. 上下文路线CcC_cCc​:运行时根据当前界面状态签名做Jaccard相似度检索,将匹配项作为笔记追加到prompt;不修改模型权重。
  2. 权重路线WcW_cWc​:使用LoRA低秩适配微调;定位器、过程序列、状态事实使用监督微调SFT;经验教训使用DPO直接偏好优化。
  3. 共存Cc+WcC_c+W_cCc​+Wc​:既做微调,运行时同时追加笔记。

定义路由增益Δ(c)\Delta(c)Δ(c):同一套经验,权重路线减去上下文路线的留任任务成功率。
Δ(c)=U(Wc)−U(Cc) \Delta(c)=U(W_c)-U(C_c)Δ(c)=U(Wc​)−U(Cc​)
Δ(c)>0\Delta(c)>0Δ(c)>0:该组件更适合存入权重;Δ(c)<0\Delta(c)<0Δ(c)<0更适合放在上下文。

两个核心统计属性(训练前仅从经验池计算,无需运行模型)

  1. 重复出现度KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲r(d)\):该经验key在其他无关任务中出现的占比;越高代表跨任务频繁复用。
  2. 状态条件依赖性κ0(d)\kappa_0(d)κ0​(d):经验的可用性多大程度依赖当前界面和生成该经验的原始界面严格匹配;数值越高越强依赖特定界面状态。

组件统计特性(原始实验统计均值)
|组件|符号|平均重复度r|中位状态条件依赖性κ0\kappa_0κ0​|最优目的地|
|—|—|—|—|—|
|定位器|G|0.39|0.10|权重weights|
|过程序列|P|0.05|0.66|上下文context|
|状态事实|F|0.32|0.56|上下文context|
|经验教训|L|0.45|0.53|权重weights|

实验环境

  1. MobileGym:手机仿真GUI环境,20款APP;416任务模板;可以直接读取完整应用内部状态;
  2. AndroidWorld:真实安卓应用,通过可访问性树获取界面信息;共116个任务。

主干模型(Backbone)

  • GUI‑Owl‑8B
  • ScaleCUA‑7B
  • Qwen3‑VL‑8B
    附加Qwen3‑VL 4B /32B做生产者‑消费者对照。

评估协议

  • 全部采用确定性环境评判器,不使用LLM‑as‑judge打分;
  • 配对bootstrap重采样10000次,计算95%置信区间;
  • 每一组配置3个不同随机种子;
  • 测试集分为见过应用模板、未见过应用模板。

基线对照组

  1. Base:原始模型,不使用任何经验
  2. Whole‑trajectory SFT:整条轨迹做微调
  3. 轨迹检索:检索1条完整轨迹、检索10条步骤记录
  4. Context‑then‑distill:先上下文再蒸馏到权重
  5. All‑to‑context:全部组件送入上下文
  6. All‑to‑weights:全部组件送入权重
  7. Reverse routing:组件路由分配完全颠倒(反向分配)
  8. Self‑retry:最多重试3次任务

4 观测实验结果

4.1 组件存在明确最优存储目的地

汇总两套环境、三套模型:

  • ✅定位器G:路由增益Δ=+4.9\Delta=+4.9Δ=+4.9,适合存入权重;
  • ✅经验教训L:路由增益Δ=+1.5\Delta=+1.5Δ=+1.5,倾向权重;
  • ❌过程序列P:路由增益Δ=−4.2\Delta=-4.2Δ=−4.2,适合上下文;
  • ❌状态事实F:路由增益Δ=−4.1\Delta=-4.1Δ=−4.1,适合上下文。

共存模式(权重+笔记):定位器收益几乎不再提升;但是过程序列、状态事实即使已经微调过权重,上下文笔记仍然带来可观收益。

关键现象:不是权重一定更好,也不是上下文一定更好;取决于组件本身统计属性。

4.2 生产者‑消费者效应

  1. 上下文笔记路线:收益不强烈依赖经验生成方是谁;更强生产者产出经验,消费者拿到收益更高;跨家族模型产出经验放到上下文依然有效。
  2. 权重微调路线:只有消费者自身产生的经验微调才有正向收益;使用其他模型(尤其是其他家族)生成样本微调,性能反而下降。

权重微调学到很大一部分收益来自于对自身行为的练习practice,而不是跨模型迁移知识。

4.3 写入权重后,上下文笔记的读取触发率下降

  • 读取触发率:添加笔记前后,模型动作是否发生改变的步骤占比。
  • 现象:组件写入权重之后,笔记的读取触发率显著下降;下降幅度和该组件的重复出现度r强负相关,Spearman −0.92。
    高重复度的定位器、经验教训写入权重后,笔记几乎不再改变模型输出;而高度状态依赖的过程序列,笔记依旧有很高价值。

解释:高重复度的知识被模型权重吸收;强状态依赖的知识很难被权重完全吸收,笔记仍然不可替代。

5 路由判定规则

5.1 基于r,κ0r,\kappa_0r,κ0​的线性打分规则

s(c)=α⋅r(c)−β⋅κ0(c)−γ s(c)=\alpha\cdot r(c)-\beta\cdot \kappa_0(c)-\gammas(c)=α⋅r(c)−β⋅κ0​(c)−γ

  • KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲s(c)>0\)→ 送入权重weights
  • s(c)≤0s(c)\le0s(c)≤0→ 送入上下文context

采用留一法:每次留出一个主干模型家族做测试,在另外两个家族上拟合参数;24个留出测试单元格,全部符号预测正确(24/24)。

边界把平面划分为两个区域:

  1. 高重复度、低状态依赖 → 权重;
  2. 低重复度、高状态依赖 → 上下文。

经验教训L、状态事实F落在边界附近,同一个组件内部,高r子项走权重、低r子项走上下文,性能差异显著。

5.2 干预验证实验(人为修改属性,观测路由收益变化)

  1. 提升训练剂量(样本复制×8):过程序列P的路由增益从‑4.2提升至‑0.8,向权重一侧大幅偏移。
  2. 剥离状态条件(仅用任务文本检索,不再匹配界面状态):过程序列P上下文收益下降‑3.9pts;状态事实F上下文收益下降‑3.4pts。

证明:过程序列、状态事实从上下文获得的收益,绝大部分来自状态匹配检索能力。

5.3 冲突场景:权重陈旧,笔记是新版本

当APP界面发生版本变更:权重是旧版本知识,上下文笔记携带新版本知识。

  • 高重复度组件:模型更倾向遵循已经固化在权重的陈旧知识,忽略笔记;
  • 低重复度组件:更容易采纳上下文笔记给出的新动作。

风险:高重复度知识一旦过时,模型很难被上下文笔记纠正。

5.4 整体性能对比

实验组MobileGym平均得分相比单一最优方案增益相比反向分配增益
组件路由(ours)32.8+4.4+8.9
全部送上下文28.6‑‑
全部送权重27.9‑‑
反向分配23.9‑‑
自重试基线22.6‑‑
整条轨迹SFT21.1‑‑

AndroidWorld上同样取得一致结论。组件路由显著优于所有whole‑trajectory整条轨迹基线。

6 生产者‑消费者之间的收益迁移:信息缺口与策略缺口

定义两个关键缺口指标:

  1. 信息缺口gIg_IgI​:生产者会、消费者不会处理的任务占比;信息缺口越大,上下文笔记收益越高。
  2. 策略缺口gPg_PgP​:同一状态下生产者与消费者输出不同动作的比例;策略缺口越大,权重微调收益越低甚至负收益。

核心观测:

  1. 上下文路线收益随信息缺口上升:笔记提供消费者缺失的信息,不在乎是谁生成;
  2. 权重微调路线收益随策略缺口衰减:如果生产者和消费者策略行为不一致,微调会破坏原有模型能力;
  3. 当升级更换消费者模型:旧模型产出的笔记库仍然可以复用;但是权重LoRA适配器需要基于新消费者轨迹重新训练。

7 结论

本文提出组件路由Component Routing:不要直接把整条轨迹全部丢给权重或者全部丢给上下文;将GUI智能体经验拆分为定位器、过程序列、状态事实、经验教训。
利用训练前可统计的两个属性:重复出现度r、状态条件依赖性κ0\kappa_0κ0​,自动判定组件存储目的地。

✅最优分配:

  • 定位器、经验教训 → 模型权重LoRA微调(高重复,弱状态依赖)
  • 过程序列、状态事实 → 运行时上下文检索笔记(低重复,强状态条件依赖)

关键发现:

  1. 高重复度知识写入权重后,上下文笔记的影响力会被显著削弱;强状态依赖知识即便做过微调,上下文笔记依然不可替代。
  2. 上下文笔记可以跨模型家族迁移;权重微调高度依赖生产者‑消费者策略对齐,不同模型生成经验直接微调往往带来负面效果。
  3. 当发生软件界面版本迭代,已经内化进权重的高频知识容易变成陈旧知识,上下文笔记很难覆盖纠正。
  4. 组件路由在两套测试环境,对比全部组件单一目的地基线,平均提升+3.5个百分点。

工程启示:GUI智能体自改进,不应该一刀切选择微调或者检索上下文;优先对经验做组件拆分,根据统计属性分配存储位置;强状态依赖的操作流程尽量保留在检索上下文,不要全部压入权重。

附录要点摘要

  1. 附录A:四类组件完整定义、提取规则
    • 每个组件包含key标识、payload有效载荷、状态条件;提供样例;给出MobileGym、AndroidWorld两套环境的组件数量统计、r与κ0\kappa_0κ0​分布。
  2. 附录B:实验协议、环境划分、各个实验组配置、干预实验组
    • 数据集划分,held‑out任务实例数量;各类ablation干预臂:复制样本、移除状态匹配、打乱key对照实验;随机笔记对照组。
  3. 附录C:训练超参
    • LoRA rank=16,α=32\alpha=32α=32;epoch=3;学习率10−510^{-5}10−5;vision塔冻结;SFT用于G/P/F;DPO用于L经验教训。
  4. 附录D:路由规则拟合数学推导、留一法测试完整表格
  5. 附录E:全部完整实验数值结果,干预实验、生产者‑消费者对照数据
  6. 附录F:敏感性测试:Jaccard阈值、笔记条数、LoRA秩、经验池大小等参数扫描。
  7. 附录G:两个完整任务案例复现
    • 案例1:天气APP添加城市;展示路由分配与全部送入权重两种方案的执行轨迹对比。
    • 案例2:日历APP版本冲突;权重陈旧,上下文笔记给出正确动作。
  8. 附录H:算力统计,每个实验组GPU小时消耗、prompt token开销
  9. 附录I:所有主干模型完整系统提示词、笔记块模板

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询