前沿模型密集发布,RSI 时代来临
九月仅过去 3 天,已有五个前沿模型发布,包括 Anthropic 的 Fable 5.1 和 Mythos 5.1、谷歌的 Gemini 3.8 Flash 和 Cyber,以及 Meta 的 Muse Spark 1.3。这是否意味着 RSI 已经到来?
Meta 强势出击,Muse Spark 1.3 挑战谷歌
昨晚,谷歌的 Gemini 3.8 Flash 成为轻量霸主,然而 Meta 迅速踢馆。小扎在 X 上官宣 Muse Spark 1.3 正式发布,称其以前沿性能带来几乎便宜到无需计量的体验,是编程和智能体工作的最大飞跃。Meta 超级智能实验室掌舵人 Alexandr Wang 揭秘核心杀手锏,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少无效轮次,工具调用次数减少约 20%,token 消耗减少约 25%,长周期任务中能更好保持需求。跑分显示,Muse Spark 1.3 提升更大,反超 GPT-5.6 Sol 和 Fable 5,Max 推理强度下智力指数达 62 分,进入第一梯队。
Muse Spark 1.3 实力超群,打乱行业阵脚
在五个月里,Meta 已迭代 4 个 Muse Spark 版本。在 DeepSWE v1.1 基准测试中,Muse Spark 1.3 超越 Opus 5 和 GPT-5.6 Sol,甩开刚发布的 Gemini 3.8 Flash,拿下最高分。在其他关键开发者指标中,Muse Spark 1.3 也表现出色,如在 SWEAtlas CodeBase QnA 中获 59.4 分,Terminal-Bench 2.1 中获 88.8 分,MRCR 512K - 1M 上获 98.1 分,碾压 GPT-5.6 Sol。在 Agent 能力上基本追平前沿水平,Artificial Analysis 上甩开 Gemini 3.8 Flash,智能指数与 Claude Fable 5 持平,跻身顶尖行列。成本方面,Muse 输入成本比 Fable 5 低 8 倍,输出成本低近 12 倍,性价比极高。Alexandr Wang 嘲讽谷歌,戏称其只能“吸别家模型尾气”。
Less is More,Muse Spark 1.3 成性价比之王
如今 AI 圈,好用且便宜才是开发者关注重点。Muse Spark 1.3 被称为性价比之王,它不走“大力出奇迹、疯狂堆叠参数”的路,而是做减法。针对长周期编程和指令遵循能力专门训练,减少交互轮次,输出更简洁,成本大幅下降。开发者 @SPAC89 实测,Muse Spark 1.3 Ultra Contributor 模式与 Fable 5.1 xHigh 对比,在严苛规则下运行约 2 小时,Muse Spark 1.3 进行 20 轮自我改进循环,启动 3 个智能体,2 小时内跑 60 多次智能体运行,总成本不到 1 美元。宏观定价上,新模型加量不加价,贡献者版定价更是国外模型地板价。在同等智力水平模型中,Muse Spark 1.3 单任务成本仅 0.55 美元,远低于 Grok 4.6、GPT-5.6 Sol 和 Claude Opus 5。开发者 Kartik 指出,它具备类似 Sol 和 Fable 的“循环深度”推理能力,token 效率惊人。
Alexandr Wang 助力,Meta 瞄准智能体工程
Muse Spark 1.3 的快速迭代是 Alexandr Wang 接手 Meta 超级智能实验室的成果。今年 7 月,Meta 发布 Muse Spark 1.1,主打 1M 超长上下文和计算机操作,不到两个月,1.3 版本将长程编码能力提升到 GPT-5.6 档次。Meta 目标是“智能体”和“便宜到忽略不计”,瞄准“智能体工程”风口。Meta AI 负责人 Alexandr Wang 表示,所有改进是为打造 7×24 小时在线个人智能体。该智能体需极度聪明稳定,能撑住长对话线程、并行处理工作流、主动提问、求助、确认且不产生幻觉;还需极度便宜,否则只能是少数人玩具。Muse Spark 1.3 为其铺路,像资深工程师,能自我规划、纠错和交付。北大校友、Meta 研究员孙之清透露,团队对牛油果 avocado 模型再次后训练,实现更好测试 scaling。
狂欢背后,Muse Spark 1.3 遭质疑
Muse Spark 1.3 也受到质疑。知名 AI 机构 BridgeMind 指出,本月 AI 发布分数飙升,但真实体验无长进,对基准测试信任减少。网友压力测试揭穿 Muse Spark 1.4 和 Gemini Flash 3.5 老底,前者没那么好,后者纯刷榜。目前,各大实验室陷入“为跑分而训练”怪圈,Muse Spark 1.3 也有退步,如 AA - Omniscience 测试中,xhigh 和 max 版本下降,因“弃权率”变高,虽降低幻觉率,但说明绝对知识储备提升没跑分夸张。
大模型下半场,比拼什么?
今天 Muse Spark 1.3 和 Gemini 3.8 Flash 发布带来思考。首先,基座模型“参数红利”见顶,靠扩大参数规模提升智力边际效益降低,未来需引入“循环深度”推理机制、工具调用做“减法”才能提升体验。其次,“智能体工程”是胜负手,大模型之争从“谁更会说话”转向“谁更能干活”,核心壁垒是低成本下长程任务真实落地能力,像 Muse Spark 1.3 这样低成本跑完多次试错循环的模型将重塑商业模式。那么,大模型的未来究竟会走向何方?