这项由Patronus AI独立完成的研究以预印本形式发布于2026年5月7日,论文编号为arXiv:2607.16204v1,分类于计算机科学人工智能领域。有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。
**研究从一个现实困境出发**
每当我们训练一个AI助手去处理复杂任务——比如帮你预订机票、排查代码错误、或者处理客服投诉——研究人员都需要给它搭建一个"练习场"。这个练习场通常由人工精心设计:什么情境下会出现什么结果,哪些工具可以调用,什么样的反馈算成功。问题在于,这些练习场是死的——它们不会随着AI变聪明而变难,也不会主动生成AI没见过的新情况。
随着AI越来越厉害,固定练习场带来的麻烦越来越明显。AI会把特定练习场的"套路"记得滚瓜烂熟,但换到真实环境里就抓瞎。更糟糕的是,当AI已经能轻松完成所有练习任务时,它就很难遇到"犯错→被纠正→进步"的机会,奖励信号变得稀少,训练效果急剧下降,研究人员管这个叫"模式崩塌"——就像一个棋手只练一种开局,遇到别的走法就不知所措。
一个自然而然的解决思路是:与其手工搭练习场,不如训练一个AI来模拟练习场本身。这类系统被称为"世界模型"——它能根据AI的动作,预测环境会怎么反应,从而生成无穷无尽的虚拟训练场景。早期的世界模型研究主要用在电子游戏和机器人领域,而Patronus AI这项研究则聚焦于文字型世界模型,也就是用语言来描述环境状态、动作和结果的那类系统。
然而,现有的文字世界模型几乎都基于传统的大语言模型(LLM)——也就是我们熟悉的GPT这类模型。Patronus AI的研究团队发现,这类模型有一个根深蒂固的结构性缺陷,会严重影响世界模型的质量。他们提出了一种截然不同的替代方案,并通过大规模实验证明了其优越性,最终让用这个新型世界模型训练出的AI助手,在完全陌生的测试环境里,性能提升幅度最高达到47%。
---
**一、传统大语言模型为何是"单行道司机"**
理解这项研究的突破,得先弄清楚传统大语言模型的一个本质局限。
传统的大语言模型生成文字的方式,就像一个只能往前走的打字机:从左到右,一个字一个字地敲,每敲一个字只能看到它前面已经打出来的内容,绝对看不到后面的字。这种方式被称为"自回归生成",它在写故事、聊天、回答问题上表现极好,但在模拟一个环境状态时会碰到大麻烦。
研究团队用一个非常直观的例子来说明这个问题。假设一个AI助手调用了一个"处理退款"的工具,工具返回的结果是一段JSON格式的数据,包含多个字段:票据编号、用户ID、退款是否成功、错误代码、处理结果……还有一个关键字段:状态,其值是"error"(出错)。
当传统大语言模型来模拟这个工具返回结果时,它从左往右生成。它先生成"退款是否成功"这个字段,因为只能看到前面的内容(工具名称和部分参数),它可能生成"成功";接着生成"错误代码",它根据"成功"这个前文生成"null(无错误)";接着生成"处理结果",它填了"已完成"。然后,它终于到达最后一个字段——状态,结果是"error"。
问题出现了:前面已经生成了"退款成功、无错误、已完成",后面却显示"error"。这个输出在逻辑上是矛盾的,但由于模型只能看到已经生成的内容,无法回头修改,这个自相矛盾的状态就这么被输出了。研究团队把这个现象叫做"前缀一致但全局不连贯"——每一小段都合理,但整体拼在一起就乱套了。
更严重的是,这类错误会污染下游的AI训练。当AI拿着这个自相矛盾的工具返回结果去学习"退款失败时我应该怎么做",它接收到的是一个充满矛盾信号的训练样本,学习效果可想而知。
---
**二、"双向扩散":从照片冲洗到语言生成**
Patronus AI提出的解决方案叫做"掩码扩散语言模型",英文缩写是MDLM(Masked Diffusion Language Model)。要理解这个名字,可以从一个熟悉的场景切入。
老式胶片相机拍完照片之后,需要在暗房里"冲洗"。刚放进显影液时,相纸上什么都看不见,随着时间推移,图像逐渐从模糊变清晰——先是大致轮廓,然后是细节,整张照片一起从朦胧浮现出来。这个过程和MDLM的工作方式非常相似。
MDLM在训练时,会把一个完整的目标文本(比如一条工具返回结果)随机"遮盖"掉一部分词,就像在相纸上故意涂抹一些区域让它变模糊。然后模型要做的任务是:看着剩余未被遮盖的内容,猜出被遮盖的词是什么。在这个过程中,模型能同时看到整段文本里所有未被遮盖的部分——包括出现在被遮盖词后面的那些字。
回到刚才的退款例子。如果用MDLM来生成这个工具结果,模型在生成"退款是否成功"、"错误代码"、"处理结果"这些字段时,就能同时看到那个已经确定的"status: error"字段。于是它心里清楚:这次调用以错误告终,所以"退款是否成功"应该是"false","错误代码"应该是某个具体的错误代号,"处理结果"应该是"需要重试"或者"联系用户"之类的表述。整个输出在逻辑上是一致的、自洽的。
这种"能同时看到文本两端信息"的能力,在技术上被称为"双向感知"。传统大语言模型只能从左往右单向感知,MDLM则能双向同时感知,这就是两者在世界模型任务上产生差异的根本原因。
MDLM还带来了另一个意想不到的好处:生成多样性。传统模型在生成时,一旦开头的几个词被确定了,后续内容的走向就被严重限制了——这被称为"前缀模式崩塌",就像一个写手起了个特定开头,就被迫沿着既有逻辑走到底。MDLM则不同,它在生成时既可以从头部填词,也可以从中间、从结尾填词,生成顺序本身就是随机的。这种额外的随机性来源,使得MDLM在多次生成时能产生真正多样化的结果,而不是总围绕着几种固定模式打转。
---
**三、构建训练数据:24万条真实轨迹的收集工程**
为了让MDLM有足够的知识来模拟各种工具调用环境,Patronus AI的团队耗费大量精力构建了一个专门的训练数据集。
这个数据集的规模非常可观:共计239,403条完整的"状态—动作轨迹",也就是AI助手完成一个任务过程中每一步的记录,包括当前状态是什么、AI做了什么、环境返回了什么结果。这些轨迹来自九个不同的开源环境,覆盖了软件工程(代码修复与生成)、深度研究(自动文献搜索与整合)、客户服务(模拟客服对话)、通用工具调用(调用各类API完成任务)等截然不同的领域。
为了确保数据的多样性,研究团队让12个不同的前沿AI模型来生成这些轨迹,包括Qwen系列、GPT系列、Claude系列、Gemini、DeepSeek等主流模型。每个模型都有自己独特的"思维方式"和表达风格,混合在一起后,数据集里就包含了各种各样的推理路径、工具调用模式和错误恢复行为。
数据处理环节同样颇费心思。研究团队专门对轨迹长度进行了多样化处理。对于超长的对话历史,他们采用"中间截断"策略:保留开头的任务描述和最后的若干轮对话,把中间部分替换成一个占位符,告诉模型"这里有若干字符被截断了"。这样一来,模型就学会了如何在只看到部分历史的情况下做出预测——这在实际部署中非常重要,因为真实的对话历史往往会超过模型的处理上限。
更有创意的是"环境状态接地"环节。研究团队用Claude模型对每条轨迹进行分析,生成一段"事后诸葛亮式的指导说明":如果我们早就知道最终结果,那么预测这个结果需要哪些关键的环境信息?这些信息被整理成结构化的说明,包括数据库当前状态、任务奖励结构、相关工具的使用规范等,然后附加到训练数据里。为了防止模型过度依赖这些说明,大约20%的训练数据保持了"无说明"的原始状态。
---
**四、世界模型的五要素框架**
在技术层面,研究团队对"文字世界模型"给出了一个精确的数学定义,但其核心思想可以用更直白的语言来描述。
一个好的世界模型,需要处理五类信息。第一类是初始环境状态,也就是这次任务开始时,这个虚拟世界长什么样——数据库里有哪些记录、文件系统里有哪些文件、用户账户处于什么状态。第二类是任务上下文,包括用户的目标是什么、过去几轮对话说了什么。第三类是工具规范,这次可以调用哪些工具、每个工具需要什么参数、会返回什么格式的数据。第四类是领域规则,这个环境里有哪些不成文的限制和约定,比如退款只能在特定条件下处理。第五类是"导向指令",这是这项研究特别强调的一个要素,指的是对世界模型行为的高层次指导,比如"模拟一个工具调用失败的场景"或者"生成一个需要多步骤才能解决的复杂问题"。
这五类信息共同决定了世界模型应该生成什么样的下一个状态。传统方法往往只处理前三类,而研究团队明确把"可导向性"作为设计目标——世界模型应该能够按照指定方向产生特定类型的场景,这样研究人员就能根据AI的当前水平,按需生成合适难度的训练场景。
这五要素框架的另一个重要设计是:初始环境状态由模型在内部追踪,而不直接输出。这避免了每次预测都要重新描述整个世界的冗余,模型只需要输出"这一步之后,世界有什么变化"即可。
---
**五、比拼结果:小身材,大能耐**
研究团队设计了一套严格的评测体系,把MDLM和传统大语言模型在世界模型任务上做了全面比较。
评测分为三个维度。第一个维度是"生成质量":模型生成的下一个状态,和真实的下一个状态有多像?研究团队使用了BLEU分数(衡量词语重叠程度)、ROUGE分数(衡量最长公共子序列)和MAUVE分数(衡量整体文本分布的相似性)三个指标。其中MAUVE分数最为关键,因为它衡量的不是逐字的相似度,而是生成结果和真实结果在"语义空间"里的整体接近程度。第二个维度是"生成多样性":同样的输入,多次生成的结果有多不同?使用Self-BLEU(越低越多样)和Distinct-N(越高越多样)来衡量。第三个维度是"下游训练效果":用这个世界模型生成的训练数据训练出的AI,在真实环境里表现如何?
参与比较的模型阵容相当豪华。传统大语言模型一侧包括Qwen3.5-27B、GPT-OSS-20B、GLM-4.7-Flash、Nemotron-3-Nano-30B-A3B(包含30B参数的混合专家模型)和Qwen3.5-35B-A3B(35B参数的混合专家模型)。MDLM一侧包括WeDLM-8B、SDAR-8B、SDAR-30B-A3B和LLaDA-2.1-mini。所有模型都在同一份训练数据上进行了微调。
零样本测试(不给任何示例、直接让模型生成)的结果显示,MDLM在MAUVE分数上就已经普遍优于传统大语言模型。在API调用返回结果的预测任务上,最大的MDLM的零样本MAUVE分数是0.697,而表现最好的传统大语言模型只有0.532——差距相当可观。分析发现,传统大语言模型在零样本场景下倾向于生成冗长的输出,而API返回结果通常是简洁的JSON格式,这种风格上的不匹配直接导致了分布差异。
给传统大语言模型提供三个参考示例之后(即"三样本提示"),差距有所收窄,部分传统模型在某些测试集上能接近甚至超过零样本的MDLM。但关键一步来了——当所有模型都经过微调后,MDLM全面碾压传统大语言模型。
最引人注目的数字是这个:参数量只有8B的SDAR模型,在核心测试数据集上的MAUVE分数达到了0.982,而参数量是其四倍多、达到35B的Qwen3.5-35B-A3B只有0.932。换句话说,一个小得多的MDLM,在世界模型这个任务上,打败了比它大四倍的传统大语言模型。
多样性的比较结果同样支持MDLM的优势。在Self-BLEU指标上(数值越低代表生成结果越多样),SDAR-8B得到0.601,而最好的传统大语言模型是0.659;在Distinct-N指标上,SDAR-8B是0.385,传统模型只有0.228到0.321。这印证了之前的理论预测:MDLM的随机去噪过程确实带来了更丰富的生成多样性。
---
**六、真正的考验:在陌生环境里训练AI**
评测世界模型的生成质量只是第一步,更重要的问题是:用这个世界模型训练出来的AI,到底能不能在真实场景里有更好的表现?
研究团队选择了三个完全没有出现在训练数据中的测试环境。第一个是ScienceWorld,一个文字型科学实验环境,AI需要在十个相互连通的房间里导航,拿取物品,完成各种科学实验(比如测量水的沸点、观察生物生长)。第二个是ALFWorld,一个家庭场景文字游戏环境,AI需要在厨房、卧室等房间里完成捡起物品、把东西放到特定位置、清洁物品等任务。第三个是AppWorld,一个模拟手机应用生态的环境,AI需要调用Venmo、Spotify、邮件、日历等应用的API来完成用户交代的任务。
这三个环境覆盖了截然不同的工具体系和任务类型,而且完全是"零样本转移"——AI在训练时从未见过这三个环境的任何数据。研究团队分别测试了参数量从1.2B到7B不等的三个AI助手:LFM2.5-1.2B(Liquid AI开发)、Qwen3-4B(阿里巴巴开发)和Mistral-7B-v0.3(Mistral AI开发)。
训练方案分为四种:完全不训练(直接测试基础模型)、只用监督学习微调(用专家示例教模型)、监督学习加上用传统大语言模型(Qwen3.5-27B)生成的世界模型轨迹做强化学习、监督学习加上用SDAR-8B生成的世界模型轨迹做强化学习。
结果呈现出几个清晰的规律。在ALFWorld任务上,LFM2.5-1.2B基础模型的成功率只有5.7%,经过监督学习微调后提升到42.9%,用传统大语言模型世界模型做强化学习后达到48.6%,而用SDAR世界模型做强化学习后跃升至53.6%——相比最初的5.7%,绝对提升幅度为47.9个百分点。对于Mistral-7B来说,这个数字更令人印象深刻:在ScienceWorld上,从基础的3.3%一路提升至48.4%,足足提高了45.1个百分点。
在所有9对"模型—环境"组合中,用SDAR世界模型训练的结果,无一例外地优于用传统大语言模型世界模型训练的结果。两种世界模型之间平均相差5.3个百分点。鉴于这两个世界模型用的是完全相同的训练数据,这个差距只能归因于MDLM本身更高的生成质量和多样性。
---
**七、人类专家说了什么**
除了自动化评测,研究团队还邀请了四位来自业界的独立专家对MDLM生成的世界模型输出进行了人工评估。这四位专家均拥有两年以上的LLM代理系统开发经验,通过Upwork平台招募,并经过了一个预筛选任务的考核才正式参与评估。
评估的维度有三个。第一是"真实性",即生成的API响应看起来是否像真实的API响应。第二是"结果正确性",即模型预测的结果类型和关键事实是否正确。第三是"训练效用",即这个输出对于训练AI助手来说是否有价值——专家被要求从AI学习者的角度思考:"如果我是一个AI,看到这个工具输出,我能从中学到正确的行为模式吗?"
四位专家独立打分,使用1到5分的李克特量表。评估结果相当不错:真实性平均分4.75,结果正确性4.25,训练效用4.50。更值得注意的是,四位专家之间的一致性非常高——Krippendorff's alpha(一种衡量评分者一致性的指标,1.0代表完全一致,0代表随机)在三个维度上分别达到了0.932、0.891和0.901,都远高于0.8这个通常被认为是"高度一致"的门槛。
专家们还指出了一些值得称道的地方:模型对"导向指令"的遵从度相当好,尤其是当指令要求模拟特定的失败场景时,模型能够可靠地生成符合预期的错误状态,而不会无端生成成功结果。
当然,专家们也指出了几类反复出现的问题。最常被提到的是数字类型错误:模型有时会把应该是整数的字段输出为字符串,或者相反。还有就是API密钥格式错误,生成的密钥看起来不像真实系统里会出现的格式。另一个值得关注的问题是"错误级联":如果一个工具在某一轮返回了错误,模型会倾向于让后续所有工具也返回错误,即使那些工具在逻辑上应该是成功的。研究团队认为这与麻省理工学院相关研究中观察到的"多样本越狱"行为有相似之处。
---
**八、哪些情况会让世界模型翻车**
研究团队还专门设计了一组"压力测试"场景,故意用各种刁钻情况来考验MDLM世界模型,并与传统大语言模型做了对比。
这些压力场景包括:查询数据库时没有直接答案但有相邻信息(需要推理);信息不足以做出确定性决策(需要表达不确定性);工具返回结果非常冗长(对生成模型的记忆和注意力提出挑战);轨迹长度限制各不相同;任务本身用现有工具无法完成;以及需要跨多页翻页的分页查询(需要准确追踪已经返回了哪些内容)。
观察到四个一致性规律。第一,MDLM对于导向指令中的元素顺序基本不敏感——你把要求写前面还是写后面,它都能理解,这是双向感知带来的天然优势。但是,当工具需要输出整个数据库状态这类极长文本时,MDLM在没有重复惩罚的情况下会陷入重复循环,一遍又一遍地输出相似内容。传统大语言模型虽然不产生重复,但会开始输出没有根据的捏造内容。第二,MDLM能够在参数空间里完成基础的数据库关联操作(类似SQL里的JOIN),并且能很好地维持整条轨迹内部的一致性,适合状态追踪型任务。第三,当任务对于现有工具来说根本无法完成时,MDLM会继续生成合理的环境状态,而不是直接中断或报错——这其实是个优点,因为训练中需要AI探索各种可能性,而不只是遇到死路就停下来。第四,在高温度(即生成随机性较高)设置下,MDLM偶尔会陷入"块级重复"——整段整段地重复相同内容。这个问题在更大的MDLM上明显减轻,研究团队认为随着模型规模扩大会进一步改善。
两个持续存在的局限性需要特别指出:格式规范的API密钥生成问题(研究团队推测这部分是因为基础模型Qwen3的安全对齐导致的),以及分页工具的"分页漂移"问题(模型不能准确追踪当前在第几页、已经返回了哪些记录)。这两个问题目前只能通过精细调整导向指令来缓解,根本解决还有待未来工作。
---
**九、一个被忽视的变量:推理时"想一想"能补上差距吗**
研究团队还做了一个有趣的附加实验:给传统大语言模型开启"思维链"模式——让它在生成答案之前先"想一想",写出一段内部推理过程,然后再给出最终答案。
结果表明,开启思维链确实能提升传统大语言模型的世界模型质量,这印证了思维链能提升文本生成多样性的既有发现。然而代价是时间:开启5000词的思维链预算后,推理时间变为原来的3.75倍;开启10000词预算后,变为4.87倍。而MDLM在不需要任何思维链的情况下,就能在质量上达到或超过开启思维链的传统大语言模型,且推理时间和普通的传统大语言模型相当(WeDLM-8B甚至比传统模型快0.68倍)。
这个对比揭示了一个关于效率的深层道理:MDLM通过改变生成的基本机制来实现高质量,而不是通过堆砌推理步骤。在需要大批量生成训练数据的场景下,这种效率优势非常实际——用传统模型加思维链来生成24万条轨迹数据,时间成本会高得多。
---
归根结底,这项研究传递了一个简洁而有力的信息:在让AI来模拟外部世界这个任务上,阻碍大语言模型发挥的不是它的规模,而是它"从左往右、一条路走到黑"的生成方式本身。换一种"先打草稿、再双向修订"的生成机制,一个参数量只有传统模型四分之一的小模型,反而能做出更连贯、更多样的世界模拟。
这个发现的实际意义相当直接:未来的AI助手训练,可以越来越少地依赖人工搭建的固定练习场,转而让世界模型按需生成各种情境,随着AI变强而调整难度。对于普通用户来说,这意味着你将来使用的AI助手,会在一个更丰富、更接近真实世界的虚拟环境里练就本事,遇到各种意外情况时不会轻易抓瞎。
当然,现阶段的MDLM世界模型还不是完美的环境替代品——分页追踪的问题、API密钥格式的问题,在某些场景下还是会给训练信号带来噪声。研究团队坦诚地记录了这些局限,并且特别提醒:要留意AI可能会"钻世界模型的空子"来刷高奖励——换句话说,AI可能会学会迎合世界模型的生成偏好,而不是真正提升解决实际问题的能力。
这个警告本身,反映了世界模型研究领域一个尚待解决的根本问题:当"虚拟环境"和"真实环境"之间存在差距时,AI在虚拟环境里练出来的技能,到底有多少能转移到现实?Patronus AI的这项工作在这个问题上迈出了重要的一步,但答案的全貌,仍然在未来的研究中等待揭晓。对这个方向感兴趣的读者,可以通过arXiv编号2607.16204v1查阅完整论文,研究团队也已开源了数据集和训练代码,供社区进一步探索。
---
Q&A
Q1:掩码扩散语言模型(MDLM)和普通的大语言模型在生成方式上有什么根本区别?
A:普通大语言模型从左往右逐字生成,每个词只能看到前面已有的内容。MDLM则不同,它把目标文本里的一部分词随机遮盖掉,然后同时参考整段文本中未被遮盖的所有内容来预测被遮盖的词,包括出现在后面位置的词。这种双向感知能力让MDLM在预测需要全局一致的结构化输出(如API返回结果)时,能避免传统模型常见的"前半段说成功、后半段说出错"的矛盾现象。
Q2:GRPO是什么类型的训练方法,为什么这篇论文要把它和世界模型结合起来?
A:GRPO是一种强化学习算法,让AI通过不断尝试、获得反馈、调整策略来提升表现,类似于通过反复练习来提高技能。传统GRPO需要真实环境来提供反馈,但真实环境往往数量有限、难以扩展。把世界模型接入GRPO流程,相当于给AI提供了一个随时可用的虚拟练习场,可以按需生成各种情境,让AI在完全陌生的任务上也能大量练习,这就是为什么用世界模型训练的AI在新环境里能提升最高47个百分点的原因。
Q3:SDAR和WeDLM这两个MDLM模型分别是什么,它们在这项研究里有什么不同表现?
A:SDAR和WeDLM都是把已有的大语言模型(基于Qwen3-8B)改造成掩码扩散模式的模型,都属于8B参数规模。两者的主要区别在于推理机制:SDAR使用块扩散方式,默认块大小为4;WeDLM使用窗口式扩散,默认窗口大小为6,并且在推理速度上比传统大语言模型快约2.5倍。在生成质量测试中,SDAR-8B的综合表现略优于WeDLM-8B;而在推理速度上,WeDLM-8B更有优势。研究选用SDAR-8B作为下游强化学习训练的主要世界模型。