☰
开源 mini 硬刚闭源三巨头:Agent 场景的成本与性能账
2026/10/10 19:56:41 网站建设 项目流程

开源 mini 硬刚闭源三巨头:Agent 场景的成本与性能账

【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini

当大模型从"回答问题"进化到"持续干活",成本模型发生了根本性变化。一个 Agent 任务往往包含十几次甚至几十次工具调用:每次调用都要把完整上下文回传模型,推理轨迹、环境反馈、失败重试层层累积,token 消耗比单轮聊天放大一个数量级。在这种场景下,按 token 计费的闭源 API 账本会以肉眼可见的速度膨胀,而"固定成本 + 近乎为零的边际成本"的自托管路线反而成了越来越值得认真核算的选择。

Nex-N2.5-mini 恰好提供了一个高价值对照样本:一张 35B 参数的 MoE 模型,在 BrowseComp、OSWorld 等 Agent 基准上咬住甚至反超 Claude Opus 5、GPT-5.6 Sol 等闭源旗舰,同时整个仓库只要求两张 H100 单机部署。本文基于 README.md 中官方基准数据与仓库源码,把这场不对等竞争的账,从性能、场景、成本三个维度算清楚。

响应速度、准确性与资源消耗的三维对比

先看资源账。mini 的规模由 config.json 和 model.safetensors.index.json 直接给出:模型总权重 70,214,363,872 字节,bfloat16 精度,即约 35B 参数,切分为 16 个分片。关键在于它是 256 专家的 MoE 架构,每个 token 仅激活 8 个专家(另有共享专家),意味着推理时实际参与计算的参数量远小于总量——稀疏激活是速度与显存双优的根本原因。

注意力层同样做了降本设计。40 层中采用 linear_attention 与 full_attention 交替,每 4 层插入一次全注意力(full_attention_interval: 4),其余 30 层为线性注意力。线性注意力把 KV 缓存与计算开销从"随序列长度平方增长"的路径上拉下来,对长上下文 Agent 场景意义重大:会话越长,省下的越多。这就是 mini 能以 262,144 token(262K)的上下文窗口稳定运行、且只需--tp 2两张 H100 单机部署(见 README.md 部署一节)的底层原因。

成本端的现实证据同样来自社区实测:有开发者基于 mlx-optiq 将 70.2GB 权重做 3/6 位混合量化压至 17.8GB,峰值内存约 17.9GB,推理约 50 tokens/秒——这意味着从 2×H100 到单机 MLX、再到安卓端 GGUF,mini 的资源门槛可以逐级下探。

准确性与延迟之间的杠杆,则由"自适应思考"提供。README 定义了三个reasoning_effort档位:none(直接作答,无推理轨迹)、medium(默认,由模型自行决定思考深度)、high(强制完整思考)。翻译成工程语言就是:简单任务走none/浅思考换延迟,难题走high换精度,粒度比闭源 API 的"一次调用只能选一种模式"更细。

再看准确性账。以下为 README.md 官方评测中 mini 与闭源旗舰的核心对比(Opus 5 = Claude Opus 5,GPT = GPT-5.6 Sol):

基准Nex-N2.5-miniOpus 5GPT差距解读
Terminal-Bench 2.173.489.188.8达旗舰约 82%
BrowseComp83.490.890.4差距收窄至约 7 分
Toolathlon Verified54.676.574.9工具调用明显落后
SWE-Bench Pro43.879.264.6深度工程任务差距大
OSWorld-Verified71.283.483.2电脑操作差距约 12 分
OSWorld-G82.976.877.7反超两巨头
OmniDoc89.7—92.9达 GPT 的 96.6%

这张表的信息量在于它不是一条单调曲线:mini 在某些维度落后 20 分以上,在另一些维度却能反超。答案藏在训练目标里——这正是下一节的"主场优势"。

Agent 类基准上的主场优势

README 开篇就点明了产品定位:为真实环境中的 long-horizon(长周期)任务打造的 agentic 模型,强调"通过视觉反馈持续行动与自我纠正"(act continuously and self-correct through visual feedback)。Vision 在这里不是输入模态,而是 Agent 感知环境、验证结果、推进任务的接口。

这条定位直接在基准上兑现。OSWorld-G(通用图形界面操作)上 mini 以 82.9 反超 Claude Opus 5 的 76.8 与 GPT-5.6 Sol 的 77.7——35B 开源模型在两个闭源旗舰的主场拿到优势,这是"为 Agent 而训练"而非"顺带支持工具调用"的差异。BrowseComp 83.4 逼近 90 分档、OmniDoc 89.7 达到 GPT 的 96.6%,同样验证了"浏览器探索 + 视觉理解"这一 Agent 主干能力的扎实程度。

源码层面能直接看到 Agent 能力的三个支撑件:

一是工具协议内建于模板。chat_template.jinja 定义了严格的<tool_call><function=...><parameter=...>XML 调用格式,包含工具描述注入、参数多行传递、多轮工具结果(<tool_response>)结构化回传,以及"连续 tool 消息合并进同一条 user 消息"的上下文压缩策略——这套协议让模型在数十轮工具调用后仍能保持格式稳定。

二是推理轨迹显式建模。模板为 assistant 消息强制包裹<think>...</think>块,配合 README 中--reasoning-parser qwen3将思考与回答分离。思考被显式标记、可被消费方读取,是 Agent 编排系统做"反思—重试"循环的基础设施。

三是多模态闭环。tokenizer_config.json 与 preprocessor_config.json 显示模型内建 image/video/vision 三套特殊 token,图像以<|vision_start|><|image_pad|><|vision_end|>内联,视觉编码器 27 层、patch 16×16——截图、UI 元素、网页渲染图可以直接成为 Agent 的"眼睛",支撑"看屏幕 → 操作 → 再看屏幕验证结果"的闭环。

成本账:开源自托管 vs 闭源 API

把前面两节的账合并,就得到成本结论。

闭源 API 的账是"线性放大"的。Agent 循环的 token 放大器来自结构本身:一次任务 = N 次工具调用 × 每次调用回传的完整上下文 × 失败重试的额外轮次。每多一次交互,计费 token 都以超线性速度累积,而精度优势(如 SWE-Bench Pro 上的差距)在这种长尾分布里未必每次都派上用场。

自托管的账是"固定成本摊薄"的。mini 的部署规格在 README 中明确为单节点 2×H100、--tp 2,相比同家族 Nex-N2.5-Pro 的 8×H100 与 Nex-N2.5-Max 的 16×H200,硬件门槛呈数量级递减——而模型是 Apache-2.0 开源的,算力到位后,每一次额外推理的边际成本趋近于零。配合量化路径(MLX 混合精度 17.8GB、移动端 GGUF),2×H100 之下还有更便宜的落地档位。

稀疏激活与自适应思考进一步压单价。每 token 仅 8/256 专家激活 + 30/40 层线性注意力,决定了 mini 单 token 的计算成本天然低于稠密旗舰;而reasoning_effort让"不值得思考的问题不思考",把推理 token 产量按需裁剪。这两点是开源自托管能够把单次 Agent 循环成本压到 API 定价零头的结构性原因。

中间路线客观存在。官方同时提供 OpenRouter 托管访问(mini 与 Pro 均可),团队可以在"先按量付费验证效果、再自托管摊薄成本"的路径上平滑迁移,避免了"自建失败 vs 纯 API 烧钱"的二选一。

诚实的边界

社区对这类模型的主流评价,概括起来是一句冷静的提醒:"别急着说它打败 GPT,先看它到底开源了什么。"这个判断在数据上是成立的——SWE-Bench Pro 43.8 vs 79.2、Job Bench 28.5 vs 65.7、Vision2Web 52.9 vs 79.8:涉及大规模代码库修改、深度工程推理、复杂视觉—网页联合任务的场景,mini 与闭源旗舰仍有明确差距。它的"开源赢面"集中在 Agent 主干能力(工具调用、浏览器与 GUI 操作、文档理解)上,而非全面性能碾压。

这恰恰让成本账更有意义:它不是"更便宜的全能替代",而是"在主流 Agent 工作流上性价比最优的选项"。当 80% 的生产任务是终端操作、网页浏览、工具编排、文档处理时,把旗舰模型留给那 20% 的高难任务,其余交给自托管的 mini——这才是把性能和成本同时算对的做法。

Nex-N2.5-mini 的价值不在单点跑分,而在它证明了:Agent 时代,35B 开源模型与万亿参数闭源模型之间,隔的不是性能鸿沟,而是部署与成本的结构性选择。

【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询