当整个AI行业都在卷榜单、拼SOTA时,有一个团队选择了一条截然不同的路——它问了一个看似简单却极其务实的问题:如果开源模型的首要价值不在于性能的摸高,而在于能力、成本、多模态和可微调性之间的平衡,会怎样?
模型地址:https://modelscope.cn/models/thinkingmachines/Inkling
一、为什么这个模型值得你停下来读?
如果你接触过大模型企业落地,你一定对这样的困境习以为常:想用开源模型做二次微调?要么模型太大跑不动,要么能力单一不够用,要么开源协议限制多。企业需要一个能真正用自己数据持续改造的模型底座——但市面上很难找到。
但Inkling给出了一个颠覆性的答案:
975B总参数、每次仅激活41B的MoE架构,原生支持文本、图像、音频多模态输入,上下文窗口高达100万token,Apache 2.0协议完整开放——专为企业二次微调打造。
更绝的是,它的创造者Thinking Machines Lab(TML)由OpenAI前CTOMira Murati、前应用研究VP翁荔等“OpenAI梦之队”联合创立。成立5个月便完成20亿美元种子轮融资,估值120亿美元,创下AI行业种子轮纪录。
但TML却以业内少有的坦诚姿态主动放弃了SOTA叙事:
“Inkling并非当今最强的模型,开源闭源都不是。”
在他们看来,开源模型的首要价值是在能力、推理成本、原生多模态和可微调性之间找到平衡,成为企业可以用自己数据持续改造的模型底座。
这不是在现有模型上做点微调——它是从企业定制这个终极目标出发,重新定义了“开源模型应该怎么做”。
二、核心亮点:四大杀手锏
2.1 ★ 975B参数MoE架构,每次只激活41B
Inkling最核心的设计是稀疏混合专家(MoE)架构:
| 维度 | Inkling |
|---|---|
| 总参数量 | 9750亿(975B) |
| 每次激活参数 | 410亿(41B) |
| 架构 | 66层纯解码器Transformer + MoE |
| 专家配置 | 256个路由专家(top-6)+ 2个共享专家 |
| 上下文窗口 | 最高100万token |
| 预训练数据 | 45万亿token(文本、图像、音频、视频) |
数据来源:
效果:拥有975B模型的“知识储备”,却只有41B模型的推理成本。这就是MoE的魔力——参数多但不贵,能力强但不慢。
架构上大体沿用DeepSeek-V3的MoE设计,每层256个路由专家加2个共享专家,每个token激活6个路由专家。
2.2 ★ 原生多模态:文本、图像、音频“一网打尽”
Inkling不是“文本模型+外挂视觉模块”——它是从头原生支持多模态:
- 图像:通过分层块编码器编码,任意基于像素的图像格式(建议每维40px–4096px)
- 音频:通过离散token编码,16kHz采样率的WAV格式(建议不超过20分钟)
- 视频:训练数据中也包含视频内容
- 所有模态均被投影到共享的隐藏空间中,由解码器联合处理
音频输入以dMel频谱图形式送入,图像被切成40×40像素的patch通过四层hMLP编码,两者经过轻量嵌入层后与文本token一起处理,整个过程不依赖外部编码器。
2.3 ★ “可控思考深度”:同样的结果,只用1/3的token
Inkling最值得关注的设计是**“可控思考深度”(controllable thinking effort)** :
开发者可以通过reasoning_effort参数在0.2到0.99之间调节模型的推理投入,在性能和成本之间找到最优平衡点。
实际效果:在Terminal Bench 2.1(智能体编程基准)上,Inkling达到与Nemotron 3 Ultra相同分数时,生成的token量只有后者的约三分之一。
对于需要大规模调用模型的生产场景,这意味着成本和延迟的显著下降。
2.4 ★ Apache 2.0开源 + 量化全家桶:从企业到个人都能用
Inkling的开源程度令人叹为观止:
| 版本 | 格式 | 适用场景 |
|---|---|---|
| BF16(原版) | Safetensors | 最高精度,企业级部署 |
| NVFP4 | 量化 | 4-bit,显存占用大幅降低 |
| FP8 | 量化(RedHatAI提供) | 精度几乎无损,vLLM就绪 |
| GGUF | llama.cpp | 本地CPU/GPU部署 |
最低硬件要求:
- BF16检查点:2TB聚合显存(示例:8张B300或16张H200)
- NVFP4量化版:600GB起步
虽然门槛不低,但Apache 2.0协议意味着可自由用于商业及非商业用途——企业可以放心地用自己数据做二次微调并商业化。
三、性能表现:美国开源阵列登顶
3.1 第三方综合评分:登顶美国开源模型
第三方机构Artificial Analysis结果显示:Inkling以41分的综合得分,超越了英伟达Nemotron 3 Ultra、谷歌Gemma 4 31B以及OpenAI的GPT-OSS-120B,登顶美国开源模型。
3.2 核心基准测试成绩(effort=0.99全力模式)
| 基准测试 | Inkling | 对比模型 |
|---|---|---|
| AIME 2026 | 97.1% | Nemotron 3 Ultra 94.2% |
| SWE-Bench Verified | 77.6% | Nemotron 3 Ultra 70.7% |
| GPQA Diamond | 87.2% | — |
| MMMU Pro(视觉) | 73.3% | Gemini 3.1 Pro 82.5% |
| MMAU(音频) | 77.2% | Gemini 3.1 Pro 82.5% |
| StrongREJECT(安全) | 98.6% | 同类最高 |
| FORTRESS(对抗性测试) | 78.0% | 同类开源模型最高 |
数据来源:
3.3 与主流模型全面对比
| 基准 | Inkling | Nemotron 3 Ultra | Kimi K2.5 | DeepSeek V4 Pro | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| Reasoning HLE (text only) | 29.7% | 26.6% | 29.4% | 35.9% | 44.7% |
| HLE (with tools) | 46.0% | — | — | — | — |
数据来源:
3.4 ★ Inkling-Small:12B激活参数的“反超小弟”
更令人震撼的是,TML同期发布了Inkling-Small预览版:
| 维度 | Inkling-Small |
|---|---|
| 总参数量 | 2760亿(276B) |
| 每次激活参数 | 120亿(12B) |
| 体量 | 仅为Inkling的1/4 |
数据来源:
最亮眼的是:这个“12B小弟”在多项基准上直接实现了对“万亿大哥”的性能反超:
| 基准 | Inkling-Small | Inkling(975B) |
|---|---|---|
| HLE(带工具) | 46.6% | 46.0% |
| GPQA Diamond | 88.3% | 87.2% |
| IFBench指令遵循 | 83.4% | 79.8% |
| SWE-Bench Verified | 77.4% | 77.6%(几乎持平) |
如何做到的?
- 用Inkling当老师做on-policy蒸馏,先出预览版检查点
- 从这个检查点接着跑了整整两周的智能体编码强化学习
“学生超过老师”的结果,证明了TML跑通了一条能反复出模型的产线——第一个模型是作品,第二个模型是产能证明。
实测显示,8张B200、TP8、NVFP4环境下,用SGLang跑Inkling-Small,开DSpark可达648 tok/s解码速度。
四、快速上手
4.1 模型下载
# ModelScope 下载gitlfsinstallgitclone https://modelscope.cn/models/thinkingmachines/Inkling4.2 Tinker Playground在线体验
在Tinker Playground上直接试用Inkling。
4.3 Hugging Face Transformers部署
fromtransformersimportpipeline model_id="thinkingmachines/Inkling-NVFP4"pipe=pipeline("image-text-to-text",model=model_id)messages=[{"role":"user","content":[{"type":"image","image":image_url},{"type":"text","text":"分析这张图片的内容"},],},]output=pipe(messages,max_new_tokens=2000,return_full_text=False,reasoning_effort="medium",# 0.2 - 0.99 可调)代码来源:
4.4 可控思考深度参数
| effort值 | 适用场景 |
|---|---|
| 0.2 – 0.5 | 快速响应、成本敏感场景 |
| 0.5 – 0.8 | 日常对话、常规任务 |
| 0.8 – 0.99 | 复杂推理、Agent任务 |
4.5 第三方推理服务
Inkling已上线Vercel AI Gateway、Modal等第三方推理服务平台。
五、总结与思考
Inkling的价值,远不止于“又出了一个开源模型”。它真正值得深思的地方在于:
第一,它重新定义了开源模型的价值主张。不是“性能最强”,而是**“最能改的底座”** 。TML的收入来源是靠微调服务(自研平台Tinker专门卖模型定制服务)——所以他们比谁都清楚:一个模型好不好,不只看跑分,更看能不能被企业真正用起来。
第二,它证明了“可控思考深度”的商业价值。用1/3的token达到相同的效果——对于大规模调用的生产场景,这意味着成本和延迟的断崖式下降。
第三,它展示了“后训练蒸馏”的威力。Inkling-Small用1/4的体量反超了Inkling——模型大小不是能力的唯一决定因素,训练方法的迭代同样关键。
第四,它代表了“美国开源反击”的战略意义。在中国开源模型主导开源AI生态的当下,TML用975B参数、Apache 2.0协议、原生多模态的Inkling,在美国开源模型阵列中登顶。
当然,Inkling也有明显局限:BF16版本需要2TB聚合显存,门槛极高;在多模态的某些细分领域(如MMMU Pro)与闭源顶尖模型仍有差距;Inkling-Small目前还是预览版,正式权重尚未全部释放。
但它打开了一扇门:如果开源模型的未来不一定是“更大更强”,而是“更懂企业、更好定制、更讲求成本与性能的平衡”呢?
模型地址:https://modelscope.cn/models/thinkingmachines/Inkling
欢迎下载、部署、微调——一起探索企业级开源模型的另一种可能。