2026年6月到7月,大模型行业发生了一连串看似独立、实则指向同一个趋势的事件。
DeepSeek联合北京大学发布DSpark推理加速框架。几乎在同一时间,阶跃星辰发表JetSpec,让大模型解码速度最高提升近10倍。腾讯混元推出Hy3的1bit量化版本,让295B参数模型单卡可跑。
这三件事的共同点是:它们都不在追求"更聪明的模型",而是在追求"更高效的智能"。
一、从"Scaling Law"到"Efficiency Law"
过去几年,大模型行业信奉的是Scaling Law——参数越多、数据越多、算力越多,模型就越聪明。这个逻辑在过去几年被反复验证,但2026年正在出现微妙的变化。
变化的信号来自多个方面。训练算力的投入边际效益在递减——从千亿到万亿参数的提升,带来的能力增益远不如从百亿到千亿那么显著。推理成本在暴涨——当模型被高频调用时,推理成本可能超过训练成本。应用场景在变化——从"偶尔问一个问题"到"Agent持续运行",对效率的要求完全不是一个量级。
阶跃星辰的技术路线很能说明问题。从Step 3.5 Flash到Step 3.7 Flash,阶跃一直强调的并不是"大而全"的模型竞赛,而是面向Agent场景的高效智能:更快的输出速度、更优的调用成本、更好的工具调用与多模态任务执行能力。JetSpec进一步从推理算法层面补上了这块拼图。
二、"效率"不是一个维度,是一个系统
"效率优先"不是说要牺牲能力换速度,而是说要在保持能力的前提下,把效率做到极致。
这需要系统级的优化。JetSpec是算法层面的突破——让投机解码的并行度更高。DSpark是系统层面的优化——让高并发推理的验证效率更高。Hy3的量化是部署层面的创新——让大模型可以在更便宜的硬件上运行。PD分离是架构层面的重构——让预填充和解码各自在独立的资源池中优化。
这四个层面不是孤立的,而是相互依赖的。算法突破需要系统支持才能落地,系统优化需要架构配合才能发挥最大效果,部署创新需要算法和系统的共同支撑。一个真正高效的推理系统,是这四个层面协同优化的结果。
三、"效率优先"的更深层含义
"效率优先"不仅仅是一个技术路线选择,它还意味着竞争逻辑的根本变化。
在Scaling Law时代,竞争的核心是"谁有更多的钱买算力"——参数越多越好,数据越多越好。这是一个资本密集型的竞争。在Efficiency Law时代,竞争的核心是"谁能把算力用得更聪明"——同样的算力,谁能跑出更高的效率、更低的成本、更好的用户体验。这是一个智力密集型的竞争。
这个转变对行业格局的影响是深远的。资本雄厚的巨头不再拥有绝对的先发优势——如果一家创业公司能把效率做到极致,它完全可以用十分之一的成本达到巨头八成的效果。开源社区的集体智慧可能比闭源公司的秘密研发更有优势——当效率优化的知识可以共享时,整个行业的效率水位都会提升。
四、一个判断
大模型行业正在从"Scaling Law"的单极叙事走向"Scaling Law + Efficiency Law"的双极叙事。Scaling Law决定了能力的上限——模型能有多聪明。Efficiency Law决定了能力的下限——在给定的成本约束下,模型能跑多快、多便宜。
2026年的竞争,赢家不会是"最聪明的模型",也不会是"最快的模型",而是"在给定的成本下,最聪明的模型"——也就是性价比最高的模型。JetSpec、DSpark、Hy3量化、PD分离,这些技术创新的共同指向,都是"在有限的资源下,榨出最大的智能"。
这场效率竞赛才刚刚开始。