Training Large Language Models to Reason in a Continuous Latent Space——训练大型语言模型在连续潜空间中进行推理
2026/8/22 20:33:59 网站建设 项目流程

论文《Training Large Language Models to Reason in a Continuous Latent Space》(COCONUT)的核心是挑战传统思维链(CoT)必须使用自然语言的假设,提出让大语言模型(LLM)在连续潜空间中进行推理的新范式。以下是全面总结:

一、研究问题与动机

  • 问题:传统CoT用自然语言词元表示推理过程,但语言是为交流而非推理优化的,大多数词元只保证流畅性,关键步骤却计算不足;且模型一旦生成错误词元,难以回溯。

  • 核心假设语言空间并非推理的最优载体,允许模型在不受约束的潜空间中推理,可能更高效、更灵活。

二、提出方法:COCONUT(Chain of Continuous Thought)

核心思想

  • 将LLM的最后一个隐藏状态作为“连续思维”的表示;

  • 不将其解码为词元,而是直接作为下一个输入嵌入,反馈给模型;

  • 通过特殊标记<bot><eot>控制潜推理模式的进入和退出。

训练策略

  • 采用多阶段课程学习,从完整语言CoT开始,逐步用连续思维替换前几个推理步骤;

  • 损失函数只计算后续语言部分的交叉熵,不直接监督连续思维的内容,只要求其有助于预测未来推理;

  • 推理时可固定连续思维数量(简单),或训练分类器动态决定终止时机。

三、关键发现与机制分析

1.潜推理涌现出广度优先搜索(BFS)模式

  • 连续思维可以同时编码多个候选下一步,模型不是贪心选择一个路径,而是维持多种可能性;

  • 通过分析发现,模型在早期思维中保持高多样性(并行探索),后期逐步聚焦到最优路径;

  • 这避免了传统CoT“过早承诺单一路径”的缺陷。

2.潜空间更适合规划型任务

  • 在作者新提出的ProsQA数据集(需在多分支DAG中找有效推理路径)上,COCONUT显著优于CoT;

  • 分析显示:靠近目标节点的中间节点更容易被准确评估,而早期节点不确定性高——推迟决策、先探索后选择有利于准确规划。

3.连续思维是更高效的推理表示

  • COCONUT用更少的生成词元达到接近或超过CoT的准确率;

  • 在GSM8k上,即使未超越CoT,也提供了更好的准确率-效率权衡

  • 解码连续思维时,常能对应到问题的中间变量,说明其确实承载了有效推理信息。

四、实验设置与结果

数据集类型关键结果
GSM8k数学推理COCONUT准确率34.1%,显著高于无CoT(16.5%),略低于CoT(42.9%),但生成词元远少于CoT
ProntoQA逻辑推理COCONUT达99.8%,与CoT持平,词元数仅9 vs 92.5
ProsQA复杂规划逻辑COCONUT达97.0%,优于CoT(77.5%),词元数14 vs 49.4

消融实验表明

  • 多阶段课程是必需的,直接训练潜推理(无课程)效果接近无CoT;

  • 连续思维数量 cc 增加,性能提升(c=2 优于 c=1),说明可扩展;

  • 在Llama 3.2-3B和Llama 3-8B上也观察到一致(但较小)的提升。

五、理论解释与后续工作

  • 理论支撑:后续理论工作(Zhu et al. 2025a,b)证明连续CoT可通过叠加态编码多条路径,在特定任务上比离散CoT更高效。

  • 局限性

    • 当前方法仍需语言CoT作为训练监督;

    • 多阶段训练中的顺序前向传播影响并行效率;

    • 大模型由于预训练过度适应语言空间,潜推理提升幅度较小;

  • 未来方向:将潜推理扩展到预训练阶段,结合最新的潜表示学习方法(如Large Concept Models),实现真正的“无语言约束推理”。

六、总体结论

COCONUT证明了让LLM在连续潜空间中推理是可行且有优势的:它不仅提升了规划型任务的准确率,还提供了更好的效率,并涌现出类似树搜索的复杂推理模式。这项工作为突破“语言中心”的推理范式、构建更强大的机器推理系统开辟了新方向。

这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

大型语言模型(LLM)被限制在“语言空间”中进行推理,它们通常通过思维链(CoT)来表达推理过程,以解决复杂的推理问题。然而,我们认为语言空间并非总是推理的最优选择。例如,大多数词元主要确保文本连贯性,对推理并非关键,而一些关键词元则需要复杂的规划,给LLM带来巨大挑战。为了探索LLM在不受限制的潜空间而非使用自然语言进行推理的潜力,我们引入了一种新范式COCONUT(连续思维链)。我们利用LLM的最后一个隐藏状态作为推理状态的表示(称为“连续思维”)。我们不将其解码为词元,而是直接将其作为后续输入嵌入,在连续空间中反馈给LLM。这种潜推理范式促成了一种高级推理模式的出现:连续思维可以编码多个备选的下一步推理步骤,使模型能够执行广度优先搜索(BFS)来解决问题,而不是像CoT那样过早地承诺于单一确定性路径。COCONUT在某些需要大量规划搜索的逻辑推理任务上优于CoT,并在准确性和效率之间展现出更好的权衡。

1 引言

大型语言模型(LLM)展现了卓越的推理能力,这源于它们在人类语言上的广泛预训练(Dubey et al., 2024; Achiam et al., 2023)。虽然下一个词元预测是一个有效的训练目标,但它对作为推理机器的LLM施加了一个根本性限制:LLM的显式推理过程必须以词元形式生成。例如,一种流行的方法,即思维链(CoT)推理(Wei et al., 2022),涉及提示或训练LLM使用自然语言逐步生成解决方案。然而,这与某些人类认知结果形成鲜明对比。神经影像学研究一致表明,语言网络——负责语言理解和产生的一组大脑区域——在各种推理任务中大多保持非活跃状态(Amalric and Dehaene, 2019; Monti et al., 2012, 2007, 2009; Fedorenko et al., 2011)。进一步的证据表明,人类语言是为交流而非推理而优化的(Fedorenko et al., 2024)。

当LLM使用语言进行推理时,会出现一个重大问题:每个特定词元所需的推理量差异巨大,然而当前的LLM架构为预测每个词元分配了几乎相同的计算预算。推理链中的大多数词元仅为了流畅性而生成,对实际推理过程贡献甚微。相比之下,一些关键性词元需要复杂规划,给LLM带来巨大挑战。虽然先前的工作试图通过提示LLM生成简洁的推理链(Madaan and Yazdanbakhsh, 2022),或在生成某些关键性词元之前执行额外推理(Zelikman et al., 2024)来解决这些问题,但这些解决方案仍然受限于语言空间,并未解决根本问题。相反,理想情况下,LLM应能自由地不受任何语言约束地进行推理,并仅在必要时将其发现转化为语言。

在这项工作中,我们转而通过引入一种新颖的范式COCONUT(连续思维链)来探索LLM在潜空间中的推理。它涉及对传统CoT过程的一个简单修改:COCONUT不是使用语言模型头和嵌入层在隐藏状态和语言词元之间进行映射,而是直接将最后一个隐藏状态(一个连续思维)作为下一个词元的输入嵌入(图1)。此修改将推理从语言空间中解放出来,并且系统可以通过梯度下降进行端到端优化,因为连续思维是完全可微的。为了加强潜推理的训练,我们采用了受Deng等人(2024)启发的多阶段训练策略,该策略有效地利用语言推理链来指导训练过程。

有趣的是,我们提出的范式带来了一种高效的推理模式。与基于语言的推理不同,COCONUT中的连续思维可以同时编码多个潜在的下一步,从而允许一种类似于广度优先搜索(BFS)的推理过程。虽然模型最初可能无法做出正确决策,但它可以在连续思维中保留许多可能的选项,并通过推理(由一些隐式价值函数引导)逐步消除不正确的路径。这种先进的推理机制超越了传统的CoT,尽管模型并未被明确训练或指示以这种方式运作,这与先前的工作(Yao et al., 2023; Hao et al., 2023)不同。

实验上,COCONUT成功提升了LLM的推理能力。对于数学推理(GSM8k, Cobbe et al., 2021),使用连续思维显示出对推理准确性的益处,这与语言推理链的效果相似。这表明通过链接更多的连续思维,有潜力扩展到解决日益具有挑战性的问题。在逻辑推理任务上,包括ProntoQA(Saparov and He, 2022)和我们新提出的ProsQA(第4节,该任务需要更强的规划能力),COCONUT及其某些变体甚至超越了基于语言的CoT方法,同时在推理过程中生成的词元显著更少。我们相信,这些发现强调了潜推理的潜力,并可为未来的研究提供有价值的见解。

2 相关工作

思维链(CoT)推理。我们广义地使用术语“思维链”来指代在输出最终答案之前,以语言形式生成中间推理过程的方法。这包括提示LLM(Wei et al., 2022; Khot et al., 2022; Zhou et al., 2022),或通过监督微调(Yue et al., 2023; Yu et al., 2023)或强化学习(Wang et al., 2024; Havrilla et al., 2024; Shao et al., 2024; Yu et al., 2024a)来训练LLM生成推理链。Madaan和Yazdanbakhsh(2022)将CoT中的词元分类为符号、模式和文本,并提出基于对其作用的分析来引导LLM生成简洁的CoT。近期的理论分析从模型表达力的角度论证了CoT的有效性(Feng et al., 2023; Merrill and Sabharwal, 2023; Li et al., 2024)。通过采用CoT,Transformer的有效深度得以增加,因为生成的输出被循环回输入(Feng et al., 2023)。这些分析,连同CoT已被证实的有效性,激发了我们设计将连续思维作为输入嵌入反馈给LLM的方案。虽然CoT在某些任务上已被证明有效,但其自回归生成的性质使其难以模仿人类在更复杂问题上的推理(LeCun, 2022; Hao et al., 2023),后者通常需要规划和搜索。有一些工作为LLM配备了显式的树搜索算法(Xie et al., 2023; Yao et al., 2023; Hao et al., 2024),或在搜索动态和轨迹上训练LLM(Lehnert et al., 2024; Gandhi et al., 2024; Su et al., 2024)。在我们的分析中,我们发现,在消除语言空间的约束后,一种类似于BFS的新推理模式出现了,尽管模型并未以这种方式被明确训练。

LLM中的潜推理。先前的工作大多将LLM中的潜推理定义为Transformer中的隐藏计算(Yang et al., 2024; Biran et al., 2024)。Yang等人(2024)构建了一个两跳推理问题的数据集,并发现从隐藏表示中恢复中间变量是可能的。Biran等人(2024)进一步提出通过“反向修补”隐藏表示来干预潜推理。Shalev等人(2024)发现了LLM中的并行潜推理路径。另一项工作发现,即使模型生成CoT进行推理,模型实际上可能利用了一个不同的潜推理过程。这种现象被称为CoT推理的不忠实性(Wang et al., 2022; Turpin et al., 2024)。为了增强LLM的潜推理,先前的研究提出用额外的词元来增强它。Goyal等人(2023)通过在训练语料库中随机插入可学习的<pause>词元来预训练模型。这提升了LLM在各种任务上的表现,尤其是在使用<pause>词元进行监督微调之后。另一方面,Pfau等人(2024)进一步探索了填充词元(例如“...”)的使用,并得出结论,它们对于高度可并行化的问题效果很好。然而,Pfau等人(2024)提到这些方法不会像CoT那样扩展LLM的表达力;因此,它们可能无法扩展到更普遍和复杂的推理问题。Wang等人(2023)提出在生成下一个推理步骤之前,预测一个规划词元作为离散潜变量。最近,还发现可以通过知识蒸馏(Deng et al., 2023)或一种逐步缩短CoT的特殊训练课程(Deng et al., 2024)将CoT推理“内化”到Transformer的潜推理中。Yu等人(2024b)也提出从使用复杂推理算法生成的数据中蒸馏一个能够进行潜推理的模型。这些训练方法可以与我们框架相结合,具体而言,我们发现,受iCoT(Deng et al., 2024)启发,将连续思维的学习分解为多个阶段对训练非常有益。其他工作探索了用于潜推理的替代架构,包括循环Transformer(Giannou et al., 2023; Fan et al., 2024)、句子嵌入空间中的扩散模型(Barrault et al., 2024)。与这些工作不同,我们专注于一般的多步推理任务,旨在研究潜推理相较于语言空间的独特性质。除推理任务外,Pham等人(2023)也探索了使用连续空间进行多智能体通信。在COCONUT的基础上,Zhu等人(2025b)开发了一个理论框架,证明在某些任务上,连续CoT可以通过在叠加态中编码多条推理路径,比离散CoT更高效。随后,Zhu等人(2025a)分析了训练动态,以解释这种叠加是如何在COCONUT训练目标下出现的。

3 COCONUT:连续思维链

方法概述。在所提出的COCONUT方法中,LLM在“语言模式”和“潜模式”之间切换(图1)。在语言模式下,模型作为标准语言模型运作,自回归地生成下一个词元。在潜模式下,它直接利用最后一个隐藏状态作为下一个输入嵌入。这个最后的隐藏状态代表了当前的推理状态,被称为“连续思维”。

图2:连续思维链(COCONUT)的训练过程。给定带有语言推理步骤的训练数据,在每个训练阶段,我们整合 c 个额外的连续思维(本例中 c=1),并移除一个语言推理步骤。然后,对连续思维之后的剩余词元使用交叉熵损失。

在训练过程中,我们优化标准的负对数似然损失,但屏蔽问题和潜思维上的损失。需要强调的是,该目标并不鼓励连续思维去压缩被移除的语言思维,而是促进对未来推理的预测。因此,LLM有可能学习到比人类语言更有效的推理步骤表示。

训练细节。我们提出的连续思维是完全可微的,并允许反向传播。当在当前训练阶段安排了 n 个潜思维时,我们执行 n+1 次前向传播,每次计算一个新的潜思维,最后再进行一次前向传播以获得剩余文本序列的损失。虽然我们可以通过使用KV缓存来节省任何重复计算,但多次前向传播的顺序性质给并行化带来了挑战。进一步优化COCONUT的训练效率仍是未来研究的一个重要方向。

推理过程。COCONUT的推理过程类似于标准的语言模型解码,不同之处在于,在潜模式下,我们直接将最后隐藏状态作为下一个输入嵌入。一个挑战在于确定何时在潜模式和语言模式之间切换。由于我们关注问题解决场景,我们在问题词元之后立即插入一个 <bot> 词元。对于 <eot>,我们考虑两种潜在策略:a) 在潜思维上训练一个二元分类器,使模型能够自主决定何时终止潜推理,或 b) 总是将潜思维填充到固定长度。我们发现两种方法效果相当。因此,为简化起见,我们在实验中使用第二种选项,除非另有说明。

4 连续空间实现潜树搜索

在本节中,我们为连续潜空间推理的优势提供了一个概念验证。在ProsQA(一个需要大量规划能力的新数据集)上,COCONUT优于语言空间CoT推理。有趣的是,我们的分析表明,推理的连续表示可以编码多个备选的下一步推理步骤。这使得模型能够执行广度优先搜索(BFS)来解决问题,而不是像语言CoT那样过早地承诺于单一确定性路径。

我们首先介绍实验设置(第4.1节)。通过利用COCONUT在语言和潜空间推理之间切换的能力,我们能够控制模型在完全潜推理和完全语言推理之间插值,并测试其性能(第4.2节)。这也使我们能够将潜推理过程解释为树搜索(第4.3节)。基于此视角,我们解释了为什么潜推理可以帮助LLM做出更好的决策(第4.4节)。

4.1 实验设置

数据集。我们引入了ProsQA(带搜索的证明问答),一个新的逻辑推理数据集。一个可视化示例如图4所示。ProsQA中的每个实例由一个概念之间的有向无环图(DAG)逻辑关系组成,并以自然语言陈述呈现。任务要求模型通过在该图中找到有效路径来确定逻辑关系,这需要复杂的规划和搜索策略。与之前的逻辑推理数据集(如ProntoQA(Saparov and He, 2022))不同,ProsQA的DAG结构引入了复杂的探索路径,使得模型难以识别正确的推理链,尤其具有挑战性。关于数据集构建和特征的更全面细节可在附录A中找到。

设置。我们使用预训练的GPT-2模型作为所有实验的基础模型。学习率设置为 1×10−4,有效批量大小为128。我们按照第3节的训练过程训练COCONUT模型。由于ProsQA中的最大推理步骤为6,我们在训练过程中将训练阶段数设置为 N=6。在每个阶段,我们训练模型5个周期,并在最后阶段保持训练直到50个周期。选择最后阶段中验证准确率最高的检查点用于评估。作为参考,我们报告了以下性能:(1)CoT:模型使用CoT数据进行训练,推理过程中,模型将生成完整的推理链来解决问题。(2)无CoT:模型仅使用问题和答案对进行训练,没有任何推理步骤。推理过程中,模型将直接输出最终答案。

为了理解潜推理和语言推理空间的特性,我们通过在推理过程中手动设置 <eot> 词元的位置,操纵模型在完全潜推理和完全语言推理之间切换。当我们强制COCONUT使用 kk 个连续思维时,模型预期会以语言形式输出剩余的推理链,从第 k+1 步开始。在我们的实验中,我们在ProsQA上测试了 k∈{0,1,2,3,4,5,6} 的COCONUT变体。需要注意的是,所有这些变体仅在推理时间上有所不同,而共享相同的模型权重。

指标。我们应用两组评估指标。其中一组基于最终答案的正确性,而不考虑推理过程。它也是后续章节(第5.3节)使用的主要指标。为了对ProsQA进行细粒度分析,我们定义了另一个关于推理过程的指标。我们将推理链分类为:(1)正确路径:输出是通向正确答案的最短路径之一。(2)

图3:COCONUT的多个变体及基线方法在ProsQA上的最终答案准确率(左)和推理过程准确率(右)。

较长路径:一条能正确回答问题但长于最短路径的有效路径。(3)幻觉:路径包含不存在的边或是断开的。(4)错误目标:图中一条有效路径,但目标节点并非所问节点。这四个类别自然适用于输出完整路径的COCONUT(k=0)和CoT。对于 k>0 的COCONUT,它仅以语言形式输出部分路径(初始步骤以连续推理进行),如果存在一个有效的解释可以补全该路径,我们将该推理分类为正确路径。同时,我们也类似地定义部分路径的较长路径和错误目标。如果没有有效的解释能补全该路径,则将其分类为幻觉。在无CoT和较大 kk 的COCONUT中,模型可能仅输出最终答案而不带任何部分路径,这属于(5)正确标签或(6)错误标签。这六个类别涵盖了所有情况且无重叠。

4.2 总体结果

图3展示了在ProsQA上评估的各种推理方法的比较分析。使用CoT训练的模型频繁地幻觉不存在的边或输出通向错误目标的路径,导致答案准确率较低。相比之下,利用连续空间推理的COCONUT,随着使用越来越多的连续思维,其准确率得以提高。同时,正确推理过程的比例(由“正确标签”和“正确路径”表示)显著增加。同时,“幻觉”和“错误目标”实例显著减少,这些问题通常在模型在推理过程早期犯错时出现。

语言空间推理局限性的一个直观演示由图4中的案例研究提供。如图所示,在语言空间中运作的模型通常无法提前规划或回溯。一旦它们承诺了一条错误路径,它们要么幻觉不支持的边,要么以无关结论终止。相比之下,潜推理通过使模型能够在多个推理步骤中迭代地优化其决策来避免这种过早承诺。这种灵活性允许模型逐步消除不正确的选项并收敛于正确答案,最终获得更高的准确率。

4.3 将潜推理解释为树搜索

为了更好地理解COCONUT,我们通过强制模型在中间连续思维之后显式生成语言推理步骤来探测潜推理过程(图5)。使用图4中呈现的示例,在初始推理步骤中,模型必须选择接下来要考虑“Alex”的哪个直接子节点,具体来自集合{“lempus”,“sterpus”,“zhorpus”,“grimpus”}。这些候选下一步的分布可视化在图5左侧。在随后的推理步骤中,这些节点进一步扩展到一组扩展的潜在路径,包括“Alex”的所有孙节点(图5右侧)。

图4:ProsQA的案例研究。使用CoT训练的模型在陷入死胡同后幻觉了一条边(Every yumpus is a rempus)。COCONUT (k=1) 输出了一条以无关节点结束的路径。COCONUT (k=2) 正确解决了问题。

我们将连续思维之后预测一个概念的概率定义为一个价值函数(图5),用于估计每个节点达到正确目标的潜力。有趣的是,COCONUT采用的推理策略并非贪心搜索:虽然在第一个推理步骤中“lempus”最初具有最高价值(0.33)(图5,左),但模型随后将最高价值(0.87)分配给了“grimpus”的一个子节点“ropus”,而不是跟随“lempus”(图5,右)。这种特性类似于广度优先搜索(BFS)方法,与传统CoT方法典型的贪心解码形成鲜明对比。连续表示固有的编码多个候选路径的能力使模型能够避免做出即时确定性决策。重要的是,这种树搜索模式不仅限于所展示的示例,而是构成了在COCONUT中随着 kk 值增大而观察到的一致改进的基础机制。

图6展示了模型在前两个思维步骤中潜推理并行性的分析。对于第一个思维(左图),计算了前1、前2和前3个候选节点的累积价值,并相对于它们在测试集中的百分位数进行绘制。三条线之间的明显差距表明,模型在此阶段保持了其推理路径的显著多样性,表明了对替代可能性进行广泛探索。相比之下,第二个思维(右图)显示这些差距正在缩小。这种趋势表明,模型在第二个潜推理步骤中从并行探索转向更集中的推理,这可能是因为它对最有希望的路径获得了更多确定性。

图6:潜树搜索前两步的并行性分析。每个面板中的三条曲线分别描绘了前1、前2和前3个候选节点的累积价值。

4.4 为什么潜空间更适合规划?

基于树搜索视角,我们进一步探讨为什么潜推理有益于规划任务——特别是,为什么保持多个候选路径并推迟确定性决策能提升推理性能。我们的假设是,在早期推理阶段探索的节点本质上更难被准确评估,因为它们距离最终目标节点更远。相比之下,位置更接近潜在目标的节点,由于后续探索可能性更少,可以被更高置信度地准确评估。

为了系统性地验证这一点,我们将节点的高度定义为其到任何叶节点的最短距离,并分析节点高度与模型估计价值之间的关系。理想情况下,一个正确节点——即能够通向目标节点的节点——应获得高估计价值,而一个错误节点——即无法通向目标节点的节点——应获得低价值。整个测试集的实证结果(图7)支持我们的假设:高度较低的节点始终获得更准确和明确的概率评估。相反,高度较高的节点表现出更模糊的评估,反映了不确定性的增加。

这些发现强调了潜空间推理的优势。通过推迟确定性决策并允许向终止状态进行探索,潜推理显著增强了模型区分正确路径与错误路径的能力,从而在复杂的、规划密集型任务上,相较于传统的贪心方法,提升了性能。

5 COCONUT的实证结果

在分析了COCONUT有前景的并行搜索模式后,我们通过更全面的实验验证了LLM在连续潜空间中进行推理的可行性,突出了其相较于语言空间更好的推理效率,以及其通过测试时扩展来增强模型表达力的潜力。

表1:在GSM8k、ProntoQA和ProsQA三个数据集上的结果。更高的准确率表示更强的推理能力,而生成更少的词元表示更高的效率。\*结果来自Deng等人(2024)。

5.1 实验设置

数学推理。我们使用GSM8k(Cobbe et al., 2021)作为数学推理数据集。它包含小学水平的数学问题。为了训练模型,我们使用了Deng等人(2023)生成的合成数据集。我们对每个推理步骤使用两个连续思维(即 c=2)。除了初始阶段外,模型还经历了3个阶段。然后我们增加一个额外阶段,在该阶段中,仍像前一阶段一样使用 3×c 个连续思维,但移除了所有剩余的语言推理链。这处理了推理链长度超过3步的长尾分布。我们在初始阶段训练模型6个周期,在每个剩余阶段训练3个周期。

逻辑推理。逻辑推理涉及正确应用已知条件,使用逻辑规则来证明或反驳一个结论。我们使用了ProntoQA(Saparov and He, 2022)数据集,以及我们新提出的ProsQA数据集,后者由于有更多干扰分支而更具挑战性。我们对每个推理步骤使用一个连续思维(即 c=1)。除了初始阶段外,模型还经历了6个训练阶段,因为这两个数据集中的最大推理步骤数为6。然后,在最后阶段,模型完全使用连续思维来解决问题。我们在每个阶段训练模型5个周期。

对于所有数据集,在标准计划结束后,模型保持在最终训练阶段,直到达到50个周期。我们根据验证集上的准确率选择检查点。对于推理,我们手动将连续思维的数量设置为与其最终训练阶段一致。我们对所有实验使用贪心解码。

5.2 基线方法与COCONUT变体

我们考虑以下基线方法:(1)CoT 和(2)无CoT,这些在第4节中已介绍。(3)iCoT(Deng et al., 2024):模型使用语言推理链进行训练,并遵循一个精心设计的计划,将CoT“内化”。随着训练进行,推理链开头的词元逐渐被移除,直到只剩下答案。在推理过程中,模型直接预测答案。(4)暂停词元(Goyal et al., 2023):模型仅使用问题和答案进行训练,没有推理链。然而,与无CoT不同,在问题和答案之间插入了特殊的 <pause> 词元,这为模型推导答案提供了额外的计算能力。<pause> 词元的数量设置为与COCONUT中的连续思维数量相同。

我们还评估了COCONUT的一些变体:(1)无课程,即直接在最后阶段训练模型。模型使用连续思维来解决整个问题。(2)无思维:我们保留多阶段训练,但不添加任何连续的潜思维。虽然这与 iCoT 在高层思想上相似,但为了严格比较,确切的训练计划设置为与COCONUT一致,而不是与 iCoT 一致。

5.3 结果与讨论

我们在表1中展示了总体结果。使用连续思维有效地增强了LLM推理能力,相较于无CoT基线有提升。例如,通过使用6个连续思维,COCONUT在GSM8k上达到了 34.1% 的准确率,显著优于无CoT(16.5%)。我们在下面强调几个关键发现。

“链接”连续思维增强推理。语言CoT被证明可以增加LLM的有效深度并增强其表达能力(Feng et al., 2023)。因此,生成更多词元作为推理的一种测试时扩展方式(Guo et al., 2025; Snell et al., 2024)。这一理想属性对COCONUT也自然成立。在GSM8k上,COCONUT优于使用类似策略训练的其他架构,包括COCONUT(暂停作为思维)和COCONUT(无思维)。特别是,它超越了最新的基线iCoT(Deng et al., 2024),后者需要更精心设计的训练计划。

此外,我们实验调整了超参数 cc,它控制对应于一个语言推理步骤的潜思维数量(图8,II)。随着我们将 cc 从0增加到1再到2,模型性能稳步提升。² 这进一步验证了连续思维扩展到更困难问题的潜力。在其他两个合成任务中,我们发现COCONUT的变体(无思维或暂停作为思维)以及iCoT基线也达到了令人印象深刻的准确率。这表明在这些任务中,模型的计算能力可能不是瓶颈。相比之下,GSM8k涉及更复杂的上下文理解和建模,对计算能力提出了更高的要求。

连续思维是高效的推理表示。与传统的CoT相比,COCONUT在ProntoQA和ProsQA上生成更少的词元,同时达到更高的准确率(表1)。尽管COCONUT在GSM8k上并未超越CoT,但它在推理效率和准确性之间提供了优越的权衡(图8,I)。为了说明这一点,我们训练了一系列逐步“内化”(Deng et al., 2024)初始 m={0,1,2,3,ALL} 个推理步骤的CoT模型,并绘制了它们的准确率与生成词元数量的关系(图中标记为“语言”)。这些模型随着跳过更多推理步骤,准确率迅速下降。相比之下,通过应用COCONUT训练策略——用两个连续思维替换每个语言推理步骤——准确率的下降得到了显著缓解,即使在生成更少词元时也能保持更高的性能。另一个有趣的观察结果是,当我们解码第一个连续思维时,它通常对应于计算中可能的中间变量(图9)。这也表明连续思维是更高效的推理表示。

图8: 推理空间的效率比较及不同 \(c\) 值的COCONUT。

图9: 将数学文字问题中的连续思维解码为语言词元。解码出的词元对应于有助于解决问题的中间变量。

LLM仍然需要指导来学习潜推理。在理想情况下,模型应该通过问题和答案上的梯度下降自动学习最有效的连续思维(即,无课程的COCONUT)。然而,从实验结果来看,我们发现这样训练的模型并不比无CoT表现更好。

相反,通过多阶段课程,COCONUT能够在各种任务上达到顶尖性能。多阶段训练也能很好地与暂停词元结合(COCONUT-暂停作为思维)。尽管使用了相同的架构和类似的多阶段训练目标,我们观察到 iCoT 和 COCONUT(无思维)之间在性能上存在微小差距。iCoT 中更细粒度的移除计划(逐词元)和其他一些技巧可能简化了训练过程。我们将结合 iCoT 和 COCONUT 留作未来工作。虽然用于COCONUT的多阶段训练已被证明有效,但绝对需要进一步研究来开发更好、更通用的策略,用于在潜空间中学习推理,尤其是在没有语言推理链监督的情况下。

6 结论

在本文中,我们介绍了COCONUT,一种在连续潜空间中进行推理的新范式。实验表明,COCONUT在各种推理任务上有效提升了LLM的性能。在潜空间中的推理引出了先进的涌现行为,其中连续思维可以表示多个备选的下一步骤。这使得模型能够对可能的推理路径执行BFS,而不是像语言空间CoT推理那样过早地承诺于单一确定性轨迹。需要进一步研究来完善潜推理并将其扩展到预训练中,这可能会提升在更广泛推理挑战中的泛化能力。我们希望我们的发现能激发对潜推理的持续探索,最终推动开发更有能力的机器推理系统。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询