一、研究背景与核心问题
背景:通用AI智能体在各领域能力日益增强,但可靠完成现实任务仍需领域特定的程序性知识和工作流程。智能体技能(Agent Skills)提供了一种无需更新模型参数即可封装专业知识的轻量级方式。
核心问题:现有技能演化方法(如EvoSkill、Trace2Skill、SkillOpt)虽能从执行轨迹中发现和改进技能,但它们没有将所学到的内容作为独立的、持续演化的知识表示来维护,导致洞见分散在优化历史中,限制了跨迭代的系统性复用。
研究动机:受Karpathy(2026)"LLM Wiki"观点启发——倡导将经验编译为持久、复利增长的知识——作者提出:智能体经验能否类似地被编译为持久知识,以支持长期技能演化?
二、核心方法:WikiSkill框架
1. 三层知识架构
| 层级 | 名称 | 功能 |
|---|---|---|
| 第一层 | 原始层(Raw Layer) | 存储不可变的原始执行轨迹(推理、工具调用、输出、答案) |
| 第二层 | Wiki层(Wiki Layer) | 将原始轨迹编译为结构化、复利增长的知识,包含模式目录、演化日志、技能影响跟踪器 |
| 第三层 | 技能层(Skill Layer) | 包含活跃的演化技能集,每个技能含SKILL.md和PURPOSE.md |
2. 演化循环的四个组件
推理智能体(Inference Agent):使用当前技能执行任务,生成执行轨迹。训练时被限制访问Wiki层(消融实验证明此限制有益)。
Wiki维护者(Wiki Maintainer):分析采样轨迹,进行根因分析,提取成功策略,更新持久wiki中的模式页面和演化日志。
技能提议者(Skill Proposer):以多轮ReAct方式自主运行,按需读取wiki和轨迹,生成原子提案(创建新技能或补丁式编辑现有技能)。
门控与回滚机制(Gating and Rollback):在验证集上评估候选技能,接受提升性能的修改,否则回滚。关键设计:无论接受与否,Wiki永不回滚,确保知识长期保留。
3. 关键创新点
持久知识积累:Wiki跨迭代持续积累,记录被拒绝的提案、反复出现的错误、成功策略,避免重复失败尝试。
知识-技能分离:将"发现有用程序性知识"与"有效执行该知识"区分开来,Wiki负责前者,技能负责后者。
审计轨迹:skill-impact.md提供客观的真实审计轨迹,记录提案元数据、diff、验证分数和接受结果。
三、实验设计与主要发现
1. 实验设置
5个基准:LiveMath(数学推理)、SealQA(网络搜索)、SpreadSheetBench(电子表格操作)、OfficeQA(长上下文文档问答)、ALFWorld(交互式具身任务)
5个模型:Qwen-3.5-4B/9B、Qwen-3.6-27B、Gemma-4-31B、Gemini-3.5-Flash
3个基线:Trace2Skill、EvoSkill、SkillOpt,以及无技能基线
3次独立运行取平均,配对bootstrap检验(p<0.05)
2. 主要发现
(1)WikiSkill持续优于现有方法
在全部5个模型上实现最高平均性能
相比最强竞争方法,平均提升3.3~12.0个百分点
改进跨领域一致,而基线方法(如EvoSkill、SkillOpt)在某些设置下会退化
(2)技能演化与模型规模扩展互补
Qwen家族内,增益随规模增加:4B(+12.3)、9B(+17.5)、27B(+23.9)
小模型+技能可超越大模型无技能:Qwen-3.5-9B+WikiSkill(47.4%)> Qwen-3.6-27B无技能(39.4%)
(3)跨模型技能迁移有效
迁移技能常优于无技能基线和自演化技能
例:Qwen-3.6-27B技能将Qwen-3.5-9B在SpreadSheet上从24.3%提升到50.5%
有效迁移也可从小模型到大模型
但存在负迁移:模型特定变通方法可能限制更强模型
(4)持久Wiki至关重要(消融实验)
禁用推理智能体wiki访问、保留技能提议者访问:平均性能从48.7%→63.7%(+15.0%)
允许推理智能体训练时访问wiki:性能从63.7%降至60.9%,说明会分散技能开发
(5)技能精炼贯穿整个演化过程
初始阶段(迭代0-1)占接受更新的39%-52%
中后期持续有大量更新被接受
Wiki保留反复错误、被拒绝提案和演化历史,支持持续精炼
四、案例研究
以Qwen-3.6-27B在ALFWorld上的演化为例:
迭代0:Wiki维护者识别基本循环行为,提议者提出goal-directed-action被拒绝;skill-impact.md保留拒绝记录
迭代1:受审计轨迹启发,提议者创建break-repetition-loop被接受
迭代4:随着新循环变体出现,Wiki积累新证据,提议者进一步用新规则精炼技能
说明:持久知识从先前迭代为后续技能精炼提供信息。
五、贡献与局限
主要贡献
提出WikiSkill框架,将智能体技能与持久知识库共同演化
在5个基准和5个模型上证明WikiSkill持续优于现有方法,消融证实持久知识积累的重要性
系统研究演化技能与模型能力的交互,证明技能演化与规模扩展互补、跨模型迁移有效
局限性
采用全注入设置,未评估技能检索/触发
严格验证门控排除了中性提案
缺乏自动修剪wiki的机制
未覆盖超长时程任务(数百动作/数小时)
WikiSkill通过引入持久、复利增长的Wiki层,将智能体执行经验编译为结构化知识,使技能演化建立在累积知识而非分散的优化历史上,在多个基准和模型上持续超越现有技能演化方法,并揭示技能演化与模型规模扩展互补、跨模型迁移有效等重要规律。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
智能体技能将专业知识和工作流程打包为可复用资源,从而扩展AI智能体的能力。近期研究能够从智能体经验中自动发现此类技能,使智能体通过交互逐步适应。然而,指导技能开发的洞见通常分散在优化历史中,限制了它们在迭代之间的系统性复用。我们提出WikiSkill,一个将智能体技能与持久知识库(wiki)共同演化的框架。在高层设计上,WikiSkill将原始执行经验、累积知识和可执行技能分离,同时持续将经验整合到wiki中,后续技能更新可在此基础上构建。在多种基准和模型上,WikiSkill持续优于最先进的技能演化方法,并在大多数模型-基准设置中优于无技能基线。我们发现技能演化与模型规模扩展互补:更大的模型通常从演化技能中获益更多,而使用技能的较小模型可以超越不使用技能的显著更大模型。我们还发现,演化技能可以有效地跨模型和模型家族迁移,且由其他模型演化的技能可以优于自演化技能。最后,我们的消融研究证实,wiki中持久的知识积累对于有效的技能演化至关重要。这些结果证明了系统性积累和精炼智能体经验以开发可复用且可迁移技能的价值。
图1| WikiSkill持续优于无技能基线和现有技能演化方法。有趣的是,其优势在更强的模型上更为显著。我们报告了每个模型在使用无技能或由EvoSkill、SkillOpt和WikiSkill演化的技能时,在所评估基准上的平均准确率(详情见表1)。
1. 引言
通用AI智能体在各领域执行复杂任务的能力日益增强(Jackson等,2025;Merrill等,2026;Patwardhan等,2026;Phan等,2026)。然而,可靠地完成现实世界任务通常需要领域特定的专业知识(例如,程序性知识和工作流程)。智能体技能(Chen等,2026a;Li等,2026;Liu等,2026;Zhang等,2025)提供了一种轻量级、开放格式来捕获此类专业知识,而无需更新模型参数。其核心是将指令、脚本和其他资源打包为可复用的基于文件系统的模块(即,有组织的目录)(Anthropic,2026;Li等,2026;Xia等,2026b;Zhang等,2025)。这种设计使专业知识在兼容技能的智能体之间保持一致、可审计和可复用。它还支持渐进式披露(Jiang等,2026),即智能体在任何给定时间只加载相关内容,从而节省上下文空间。更广泛地说,技能提供了一种独立于模型参数来积累知识的自然机制。
然而,开发有效的技能仍然具有挑战性。大多数智能体技能是手动编写的,这需要预先设想智能体将需要的程序性知识和工作流程(Li等,2026;Liang等,2026;Xu和Yan,2026)。这一挑战推动了近期的工作,即通过在训练任务上执行智能体、分析成功和失败的轨迹,并基于所得经验精炼技能,来迭代地开发智能体技能(Agrawal等,2026;Alzubi等,2026;Ni等,2026;Ouyang等,2026;Yang等,2026;Yuksekgonul等,2025)。
一个关键的设计问题是如何在整个技能演化过程中保存和组织智能体所学到的内容。先前的工作以不同方式解决这个问题。EvoSkill(Alzubi等,2026)维护先前提案及其评估结果的累积历史;Trace2Skill(Ni等,2026)从执行轨迹中提取并整合经验教训到技能更新中;SkillOpt(Yang等,2026)使用被拒绝编辑的反馈和按轮次的元指导。然而,这些方法没有将所学到的内容作为独立的、不断演化的知识表示来维护。受Karpathy(2026)关于LLM Wiki的观点——即倡导将经验编译为持久、复利增长的知识——的启发,我们提出:智能体经验能否类似地被编译为持久知识,以支持长期技能演化?我们提出WikiSkill,它在原始经验和可执行程序(即技能)之间增加了一个结构化知识层。这一层允许技能开发在迭代之间建立在日益得到良好支持和整合的知识之上,而不是建立在分散于技能演化产物中的知识之上。
WikiSkill将智能体工作空间组织为三个层:原始层(Raw Layer),存储不可变的执行轨迹;Wiki层(Wiki Layer),维护结构化知识;技能层(Skill Layer),包含不断演化的程序性知识(图2)。每次迭代涉及四个组件:推理智能体(Inference Agent),使用当前技能执行 rollout;Wiki维护者(Wiki Maintainer),将轨迹整合到wiki中;技能提议者(Skill Proposer),使用wiki和轨迹提出技能更新;以及门控与回滚机制(Gating and Rollback),保留能提升验证性能的更新。虽然技能更新可以回滚,但wiki会持续存在,以便未来更新可以建立在累积知识之上。在高层设计上,这些组件形成一个持续循环,其中经验被整合为持久知识,以支持技能演化。
我们在五个基准上评估WikiSkill,涵盖数学推理(LiveMathematicianBench(He等,2026))、网络搜索(SealQA(Pham等,2026))、电子表格操作(SpreadSheetBench(Ma等,2024))、长上下文文档问答(OfficeQA(Singhvi等,2025))和交互式具身任务(ALFWorld(Shridhar等,2021)),使用来自Qwen(Qwen Team,2026a,b)、Gemma(Gemma Team,2026)和Gemini(Google DeepMind,2026)家族的五个模型。我们发现WikiSkill优于现有技能演化方法,并在大多数设置中优于无技能基线。有趣的是,技能演化与模型规模扩展互补。
在Qwen家族内,WikiSkill将4B、9B和27B模型的平均性能分别提升12.3%、17.5%和23.9%,且增益随模型规模增加。同时,演化技能可以弥补显著的模型规模差距:使用WikiSkill的Qwen-3.5-9B优于不使用技能的Qwen-3.6-27B(47.4% vs. 39.4%3)。我们进一步发现,演化技能可以有效地跨模型家族迁移,并且可以优于自演化技能。例如,在ALFWorld上,Qwen-3.5-9B使用Qwen-3.6-27B演化的技能达到70.2%,而使用自己的技能为63.4%。这些结果表明技能发现和技能执行是不同的能力。最后,我们的分析表明,持久wiki对这些增益至关重要,支持了我们的假设:跨迭代积累和精炼知识可以改善技能演化。
总之,我们的主要贡献是:
我们提出WikiSkill,一个将智能体技能与持久知识库共同演化的框架,该知识库持续从智能体经验中组织和精炼知识。
我们在五个基准和五个模型上证明,WikiSkill持续优于现有技能演化方法,消融研究证实了持久知识积累的重要性。
我们系统地研究了演化技能如何与模型能力交互,表明技能演化与模型规模扩展互补,且演化技能可以有效地跨模型迁移,有时优于自演化技能。
综上,我们希望我们的工作能激发更多关于智能体如何从经验中积累、组织和复用知识的基础研究。
2. 问题设定
图2| WikiSkill框架概览。智能体工作空间被组织为三个层:不可变执行轨迹(原始层)、在迭代间复利增长的持久知识库(Wiki层)和活跃程序性指令(技能层)。在每个演化循环中,推理智能体运行rollout(注入活跃技能但限制Wiki访问),Wiki维护者将轨迹整合到Wiki中,技能提议者(使用ReAct机制)建议更新,同时Wiki在所有迭代中保留。
3. 方法
我们提出WikiSkill,一个将智能体技能与持久知识库(wiki)共同演化的框架。围绕三层知识架构(§3.1),WikiSkill执行一个精心编排的演化循环,其中智能体运行rollout,Wiki维护者整合轨迹并更新wiki,技能提议者提出技能更新,门控机制过滤更改(§3.2)。
3.1. 三层知识架构
WikiSkill工作空间由三个不同的层组成,如图2所示并在下面描述。
原始层(raw)该层存储每次迭代中从训练示例收集的原始执行轨迹τi∈Ttrain,k。这些轨迹捕获智能体完整的逐步交互,包括推理、工具调用、工具调用输出和最终答案。在我们的设置中,Wiki维护者和技能提议者智能体可以访问这些原始轨迹以分析智能体行为。为保留原始历史,该层是不可变的。
Wiki层(wiki)该层将原始轨迹编译为结构化的、复利增长的知识,并在技能演化过程中维护。它包含一个模式目录(patterns/),其中填充了记录特定失败模式或成功策略以及可操作变通方法的单独markdown文件。关键的是,该层通过演化日志(logs.md,由Wiki维护者更新)和技能影响跟踪器(skill-impact.md,由外层循环框架在验证门控后以编程方式更新)提供跨优化迭代的长期历史意识。这些记录使Wiki维护者和技能提议者能够:(1) 观察完整的技能接受历史,以便不再提出被拒绝的干预措施;(2) 跟踪先前迭代中提出了什么以及这些提案是否成功;(3) 识别跨迭代反复出现的错误。wiki不会在迭代之间重置,而是在整个演化过程中持续积累和编译知识。
技能层(skills/)该层包含活跃的演化技能集ss,编码推理智能体可以读取的程序性知识。WikiSkill中的每个技能目录包含两个文件:SKILL.md,包含技能的完整内容;以及PURPOSE.md,将技能映射回激发其创建或修改的Wiki模式。技能层与Wiki层之间交互的详细示例在图3中说明,并在§5.3的案例研究中解释。
3.2. 演化智能体与Wiki编排
WikiSkill循环由四个组件组成。在每次迭代中,推理智能体(§3.2.1)使用skills/中的活跃技能执行任务,在raw/中产生不可变的执行轨迹。在训练rollout期间,推理智能体被限制访问Wiki层,因为我们的消融研究(§5.1)表明,在训练期间允许wiki访问会对技能开发产生负面影响。接下来,Wiki维护者(§3.2.2)分析这些原始轨迹以及现有的wiki/层,以诊断失败并提取成功策略,更新持久模式目录和演化日志。然后,技能提议者(§3.2.3)审查更新后的wiki并读取最新迭代的执行轨迹,以在skills/中生成或修改候选技能。最后,门控与回滚机制(§3.2.4)在验证集上评估候选技能,接受成功的修改或在更改导致性能下降时回滚技能集。整个演化算法在附录A的算法1中描述。
3.2.1. 推理智能体的技能提供
3.2.3. Wiki-informed技能提议者
3.2.4. 门控与回滚
4. 实验与结果
4.1. 实验设置
数据集我们在五个基准上评估,涵盖多样领域:数学推理(LiveMathematicianBench (LiveMath)(He等,2026))、网络搜索(SealQA(Pham等,2026))、电子表格操作(SpreadsheetBench (SpreadSheet)(Ma等,2024))、长上下文文档问答(OfficeQA(Singhvi等,2025))和交互式具身任务(ALFWorld(Shridhar等,2021))。数据集详情和统计见附录B。
基线我们将WikiSkill与三个代表性技能演化基线进行比较,包括Trace2Skill(Ni等,2026)、EvoSkill(Alzubi等,2026)和SkillOpt(Yang等,2026),它们都共享相同的一般循环:展开智能体、分析执行轨迹、提出技能修改、通过验证门控更改。我们还评估每个模型在不使用技能时的无技能基线。这些框架的详细描述和优化器API调用复杂性分析见附录D。我们专注于专门的技能演化框架,而非通用自动提示优化器(例如,GEPA(Agrawal等,2026)),遵循先前工作表明专门技能演化流水线始终优于通用提示优化方法(Yang等,2026)。
模型我们实验了闭源和开源权重模型来评估WikiSkill和基线。对于闭源模型,我们使用Gemini-3.5-Flash(Google DeepMind,2026)。对于开源权重模型,我们评估Qwen-3.5-4B/9B-Instruct(Qwen Team,2026a)、Qwen-3.6-27B(Qwen Team,2026b)和Gemma-4-31B-It(Gemma Team,2026),我们使用vLLM框架(Kwon等,2023)部署。
4.2. 主要结果
我们在模型和任务上评估WikiSkill,并研究演化技能是否能跨模型迁移。表1展示了跨模型和任务的主要技能演化结果,包括技能演化收益如何随模型规模变化,而表2展示了跨模型技能迁移结果。我们下面详细分析这些结果。
为了考虑变异性,我们对每种方法重复完整演化过程三次独立运行,所有报告的分数代表三个所得演化技能集的平均测试性能。性能差异的统计显著性使用配对bootstrap检验在p<0.05下评估(附录C)。注意,对于Gemini-3.5-Flash在ALFWorld上,所有演化方法都产生与无技能基线相同的性能(85.9%),因为Gemini-3.5-Flash在技能演化之前在验证集(Dval)(Dval)上达到100%分数。这也解释了为什么Gemini-3.5-Flash在跨模型迁移评估(表2)中在ALFWorld上被标记为“—”。
4.2.1. 跨模型和任务的技能演化
WikiSkill在模型和数据集上产生一致的改进如表1所示,WikiSkill在所有五个模型上实现了最高的平均性能。与每个模型最强的竞争技能演化方法相比,WikiSkill将Qwen-3.5-4B、Qwen-3.5-9B、Qwen-3.6-27B、Gemma-4-31B和Gemini-3.5-Flash的平均性能分别提升3.3、5.1、10.0、5.8和12.0个百分点。这些改进在设置中是一致的:WikiSkill在大多数模型-数据集对中优于无技能基线,并在所有模型的5个数据集平均性能上匹配或超过最强竞争方法。改进也跨越多样领域,且可能很显著。例如,WikiSkill将Gemini-3.5-Flash在LiveMath上从33.0%提升到72.6%,在SpreadSheet上从50.5%提升到76.6%,同时将Qwen-3.6-27B在ALFWorld上从52.8%提升到77.6%。相比之下,现有技能演化方法不太一致。例如,EvoSkill在LiveMath上大幅提升Qwen-9B (28.2%→58.1%),但在同一基准上降低Gemma-4-31B (33.9%→29.8%),而SkillOpt在SealQA上降低Gemini-3.5-Flash (29.4%→28.2%)。这些结果表明,WikiSkill在设置中产生更强且更可靠的改进。
技能演化的收益随模型能力增加并与模型规模扩展互补在Qwen家族内,WikiSkill的平均改进随模型规模增加,从Qwen-3.5-4B的+12.3分到Qwen-3.5-9B的+17.5分和Qwen-3.6-27B的+23.9分。这一趋势在SpreadSheet上尤为明显,WikiSkill将三个模型分别提升+6.5、+9.3和+40.9分,表明技能演化的收益可以随模型规模显著增加。同时,演化技能可以弥补显著的模型规模差异:使用WikiSkill的Qwen-3.5-9B达到47.4%平均准确率,优于不使用技能的Qwen-3.6-27B的39.4%,而使用WikiSkill的Qwen-3.5-4B达到38.5%。我们的结果表明,模型能力和演化程序性知识提供了互补的性能来源:更强的模型可以通过开发和执行更有效的技能从技能演化中获得更大价值,而有效的技能可以使较小模型超越不使用技能的显著更大模型。
技能演化的收益也因数据集而异我们的结果表明,一些数据集比其他数据集更适合技能演化。对于Qwen-3.6-27B,WikiSkill在OfficeQA上提升11.6分,在SealQA上提升14.1分,而在ALFWorld上提升24.8分,LiveMath上提升28.0分,SpreadSheet上提升40.9分。其他模型也出现类似差异。LiveMath始终从技能演化中受益,在所有五个模型上增益范围为20.6到39.6分,而ALFWorld在WikiSkill演化技能的四个模型上产生14.0到29.3分的增益(由于提前停止,排除Gemini-3.5-Flash)。相比之下,OfficeQA由于其长上下文文档检索需求而呈现独特挑战。较大的模型有效地利用演化搜索工作流程来导航长文档(例如,Qwen-3.6-27B为+11.6分,Gemini-3.5-Flash为+12.1分),而Qwen-3.5-4B难以在长上下文中执行这些多步搜索工作流程,并退回到其默认阅读行为,导致轻微退化。
4.2.2. 使用WikiSkill的跨模型技能迁移
演化技能有效地跨模型迁移,且迁移技能可以优于自演化技能表2评估了WikiSkill演化的技能在使用不同源模型开发时如何跨推理模型迁移。迁移技能经常优于无技能基线和自演化技能。例如,Qwen-3.6-27B技能将Qwen-3.5-9B在SpreadSheet上提升到50.5%,而无技能为24.3%,自演化技能为33.6%;并将Gemma-4-31B在LiveMath上提升到73.7%,而无技能为33.9%,自演化技能为56.7%。值得注意的是,有效的迁移也发生在从小模型到大模型:Qwen-3.5-4B技能将Gemma-4-31B在LiveMath上提升到73.1%,在ALFWorld上提升到66.9%。我们的结果表明,更强的源模型不一定产生更好的技能,且由一个模型经验开发的程序性知识可以跨模型规模和家族迁移。
演化技能的可迁移性取决于它们捕获的是通用程序还是模型特定的变通方法表2中的结果表明,WikiSkill可以产生跨模型迁移的通用程序性知识和可能导致负迁移的模型特定策略。LiveMath技能跨模型迁移特别好:Qwen-3.5-4B和Qwen-3.6-27B技能分别将Gemini-3.5-Flash从33.0%提升到67.5%和73.9%。相比之下,SpreadSheet表现出强烈的源-目标交互。Qwen-3.5-4B技能将Gemini-3.5-Flash性能从50.5%降低到18.1%,而Qwen-3.6-27B技能将其提升到63.4%。我们的错误分析确定了负迁移背后的两个因素。首先,Qwen-3.5-4B技能编码了低级变通方法,如单行Python命令和字符串转换规则,这帮助较小模型避免执行失败,但限制了更强模型如Gemini-3.5-Flash使用全面的端到端脚本。其次,碎片化的诊断程序引入冗余工具调用,可能在任务完成前耗尽Gemini-3.5-Flash的交互预算。
迁移技能的效用还取决于推理模型执行它们的能力我们现在转向不同推理模型如何使用由同一源模型开发的技能。在Qwen家族内,更强的模型可以从相同的程序性知识中获得更大价值。例如,Qwen-3.6-27B SpreadSheet技能将Qwen-3.5-4B、Qwen-3.5-9B和Qwen-3.6-27B相对于其无技能基线分别提升18.4%、26.2%和40.9%。OfficeQA提供了一个案例,其中模型开发的技能对另一个模型比对自己更有用:Qwen-3.5-4B技能将其自身性能从30.2%降低到28.5%,但将Qwen-3.6-27B从42.1%提升到52.9%。我们的轨迹分析表明,在长上下文设置中,较小的模型可能被冗长的文档上下文分散注意力,无法遵循详细的多步搜索指令,而是退回到其默认文档阅读行为。相比之下,更强的模型更可靠地在长上下文中执行技能指定的结构化导航程序。总之,这些结果区分了自演化通常混淆的两种能力:从经验中发现有用的程序性知识,以及在推理时有效执行该知识。
5. 分析与讨论
5.1. 持久知识在技能演化中的作用
为了理解持久知识在技能演化中的贡献,我们对演化过程中可以使用它的两个组件消融wiki访问(表3)。具体而言,使用Gemini-3.5-Flash,我们独立改变推理智能体在训练rollout期间和技能提议者在技能开发期间的wiki访问,产生四种配置。当技能提议者没有wiki访问时,我们还移除Wiki维护者,消除跨迭代的持久知识积累。我们的默认WikiSkill配置给技能提议者wiki访问,但不给推理智能体。
持久wiki知识显著改善技能演化如表3所示,当推理智能体的wiki访问被禁用时,为技能提议者提供对持久wiki的访问将平均基准性能从48.7%提升到63.7%(+15.0%),在LiveMath (51.3%到72.6%)和SpreadsheetBench (49.9%到76.6%)上有显著增益。没有跨迭代积累的持久知识,技能提议者难以解决复杂的失败模式。
推理智能体在演化期间访问wiki会降低最终技能质量当技能提议者可以访问持久wiki时,为推理智能体在训练rollout期间提供wiki访问会将平均基准性能从63.7%降低到60.9%,LiveMath上大幅下降从72.6%7到64.8%。我们假设,当推理智能体在训练rollout期间可以同时访问技能和wiki时,一些任务解决知识可能直接从wiki获得,而不是从技能获得,这可能使所得轨迹对技能开发的信息量减少。
5.2. 定性分析:技能和Wiki动态
为了更好地理解WikiSkill如何在模型和数据集上演化知识和技能,我们分析演化过程中积累的wiki模式和产生的技能(表4),以及成功技能更新在迭代中被接受的时间(附录表5)。
WikiSkill持续积累wiki模式,同时产生简洁技能表4总结了跨模型和基准的技能和wiki模式的创建与编辑,以及它们的平均长度。跨模型,Qwen模型产生更长的程序性技能(118.9-128.6行),而Gemma-4-31B和Gemini-3.5-Flash产生更紧凑的技能(分别为45.1和81.2行)。Wiki模式积累也因模型而异,平均创建6.3-8.9个模式,编辑7.0-18.4次。跨基准,SpreadSheet产生最长的技能(142.5行)和最多的wiki模式(9.8),而LiveMath产生最短的技能(84.6行)和最少的wiki模式(4.4)。总体而言,这些结果表明技能结构和wiki积累因模型和数据集而异。
技能精炼在整个演化过程中持续附录表5将接受的技能更新分为早期(迭代0-1)、中期(迭代2-4)和晚期(迭代5-7)阶段。跨模型,初始阶段占接受更新的39%−52%,中后期仍有相当比例。跨基准也类似,39%−58%的接受更新发生在初始阶段。持续精炼在SealQA上尤为明显,其中33%的接受更新发生在中期,28%发生在晚期。结合§5.1的消融,这些结果表明持久知识积累支持跨迭代的持续技能精炼。Wiki层保留反复出现的错误、被拒绝的提案和演化历史,为技能提议者提供后续更新的累积上下文。下面,我们提供一个案例研究,说明这种积累的知识如何为技能演化提供信息。
图3| ALFWorld上Wiki引导技能演化的案例研究(Qwen-3.6-27B)。持久Wiki层编译跨迭代模式、过去提案diff和接受决策的审计轨迹以及时间顺序历史。受迭代0技能提案被拒绝的启发,提议者在迭代1综合出被接受的技能更新,随后用新模式证据精炼它。文件内容为清晰起见已简化。
5.3. 案例研究:Wiki引导技能演化的剖析
为了说明Wiki层和技能层在演化过程中如何交互,我们追踪Qwen-3.6-27B在ALFWorld上的一个具体例子,如图3所示(为展示简化)。
在迭代0,Wiki维护者识别出基本循环行为(take-examine-move-loop.md),而技能提议者提出goal-directed-action,但未能在验证集上提升性能并被拒绝。关键的是,skill-impact.md保留了提案diff和拒绝结果,使后续技能更新能够考虑这一失败尝试。
受此审计轨迹启发,技能提议者在迭代1创建break-repetition-loop,带有具体动作规则(Never Return an Item to Its Origin Location),并被接受。随着新的循环变体在rollout中出现(multi-operation-loop.md),Wiki维护者在持久wiki中积累新证据。在这些累积的wiki模式和 newly stored trajectories(图中未显示)的指导下,技能提议者在迭代4进一步用新规则(Each Operation Type ONCE Per Item)精炼技能。这个例子说明了来自先前迭代的持久知识如何为后续技能精炼提供信息。
6. 相关工作
经验驱动的智能体技能演化智能体技能编码可复用的程序性知识,使LLM智能体能够利用过去经验完成未来任务(Anthropic,2026;Li等,2026;Wang等,2026;Xia等,2026b;Xu和Yan,2026;Zhang等,2025;Zhou等,2026)。近期框架使智能体能够通过从过去执行轨迹中发现和精炼程序性知识来自我改进(Agrawal等,2026;Lu等,2026;Ouyang等,2026;Xia等,2026a;Yuksekgonul等,2025)。EvoSkill(Alzubi等,2026)、Trace2Skill(Ni等,2026)和SkillOpt(Yang等,2026)等方法使用专门的智能体流水线分析任务rollout并更新模块化技能文档(Zhang等,2026a)。然而,这些方法没有将所学到的内容作为独立的、不断演化的知识表示来维护。WikiSkill引入持久Wiki层,跨迭代将经验整合为结构化知识,允许后续技能更新系统地建立在累积知识之上。
技能增强智能体与智能体自我改进除了构建高质量技能外,技能增强智能体必须在执行期间有效选择和使用相关技能(Chen等,2026a;Liu等,2026)。随着可复用技能数量的增长,近期工作探索了技能检索,以从库中为每个任务选择相关技能(Cho等,2026;Shi等,2026;Su等,2026;Ye等,2026;Zheng等,2026)。WikiSkill则专注于技能质量本身,与技能检索分开。另一条工作线优化更广泛的智能体框架,包括提示、上下文、工具、记忆和工作流程(Chen等,2026b;Lee等,2026;Lin等,2026;Lou等,2026;Zhang等,2026b)。这些方法通过分析执行轨迹和环境反馈来搜索更好的智能体配置,从而改进智能体系统。这一方向与WikiSkill互补,后者专注于演化可复用程序性技能,同时保持更广泛的智能体框架固定。
7. 结论
我们提出WikiSkill,一个将智能体技能与持久、复利增长的知识库(wiki)共同演化的框架。通过将智能体工作空间结构化为三个不同的层,WikiSkill使技能开发能够在迭代之间建立在日益得到良好支持和整合的知识之上。一个编排循环将经验整合到wiki中,从累积知识中提出技能精炼,并基于验证性能门控更改。在实证上,WikiSkill在五个基准和五个推理模型上持续优于现有技能演化方法,并在大多数模型-数据集对中优于无技能基线。除了这些总体增益外,技能演化与模型规模扩展互补:更大的模型通常从演化技能中获益更多,而使用技能的较小模型可以超越不使用技能的显著更大模型。同时,演化技能有效地跨模型和模型家族迁移,并且可以优于自演化技能。最后,我们的消融证实持久知识积累对于有效的技能演化至关重要。
局限性
WikiSkill有几个局限性,推动未来工作。首先,为了隔离技能质量并避免技能检索的混杂效应,我们的研究遵循先前工作,直接将活跃技能注入智能体提示。这种设置不评估技能检索或触发,随着可用技能数量增长,这些变得重要。其次,我们的验证门控要求每个被接受的提案提高验证分数,这排除了保持即时性能但可能在后继迭代中实现增益的中性提案。我们采用这一严格标准,遵循先前技能演化框架(Alzubi等,2026;Yang等,2026),以确保公平比较。探索更灵活的接受标准是未来工作的重要方向。第三,Wiki层跨迭代持续积累模式页面、演化日志和提案diff,但WikiSkill目前缺乏自动修剪wiki的机制。随着知识在更长的演化运行中积累,这种修剪可能变得必要。最后,虽然我们的基准套件包括长上下文文档推理(OfficeQA)和多步工具交互,但它不包括跨越数百个环境动作或多个小时的非常长时程任务。开发在单个长执行rollout内精炼程序性知识的在线技能适应方法仍然是未来工作的重要方向。