Inkling:975B参数原生多模态“美国开源新王”,专为企业定制而生!
2026/8/3 2:22:17 网站建设 项目流程

当整个AI行业都在卷榜单、拼SOTA时,有一个团队选择了一条截然不同的路——它问了一个看似简单却极其务实的问题:如果开源模型的首要价值不在于性能的摸高,而在于能力、成本、多模态和可微调性之间的平衡,会怎样?

模型地址:https://modelscope.cn/models/thinkingmachines/Inkling


一、为什么这个模型值得你停下来读?

如果你接触过大模型企业落地,你一定对这样的困境习以为常:想用开源模型做二次微调?要么模型太大跑不动,要么能力单一不够用,要么开源协议限制多。企业需要一个能真正用自己数据持续改造的模型底座——但市面上很难找到。

Inkling给出了一个颠覆性的答案:

975B总参数、每次仅激活41B的MoE架构,原生支持文本、图像、音频多模态输入,上下文窗口高达100万token,Apache 2.0协议完整开放——专为企业二次微调打造。

更绝的是,它的创造者Thinking Machines Lab(TML)由OpenAI前CTOMira Murati、前应用研究VP翁荔等“OpenAI梦之队”联合创立。成立5个月便完成20亿美元种子轮融资,估值120亿美元,创下AI行业种子轮纪录。

但TML却以业内少有的坦诚姿态主动放弃了SOTA叙事

“Inkling并非当今最强的模型,开源闭源都不是。”

在他们看来,开源模型的首要价值是在能力、推理成本、原生多模态和可微调性之间找到平衡,成为企业可以用自己数据持续改造的模型底座。

这不是在现有模型上做点微调——它是从企业定制这个终极目标出发,重新定义了“开源模型应该怎么做”


二、核心亮点:四大杀手锏

2.1 ★ 975B参数MoE架构,每次只激活41B

Inkling最核心的设计是稀疏混合专家(MoE)架构

维度Inkling
总参数量9750亿(975B)
每次激活参数410亿(41B)
架构66层纯解码器Transformer + MoE
专家配置256个路由专家(top-6)+ 2个共享专家
上下文窗口最高100万token
预训练数据45万亿token(文本、图像、音频、视频)

数据来源:

效果:拥有975B模型的“知识储备”,却只有41B模型的推理成本。这就是MoE的魔力——参数多但不贵,能力强但不慢

架构上大体沿用DeepSeek-V3的MoE设计,每层256个路由专家加2个共享专家,每个token激活6个路由专家。

2.2 ★ 原生多模态:文本、图像、音频“一网打尽”

Inkling不是“文本模型+外挂视觉模块”——它是从头原生支持多模态

  • 图像:通过分层块编码器编码,任意基于像素的图像格式(建议每维40px–4096px)
  • 音频:通过离散token编码,16kHz采样率的WAV格式(建议不超过20分钟)
  • 视频:训练数据中也包含视频内容
  • 所有模态均被投影到共享的隐藏空间中,由解码器联合处理

音频输入以dMel频谱图形式送入,图像被切成40×40像素的patch通过四层hMLP编码,两者经过轻量嵌入层后与文本token一起处理,整个过程不依赖外部编码器

2.3 ★ “可控思考深度”:同样的结果,只用1/3的token

Inkling最值得关注的设计是**“可控思考深度”(controllable thinking effort)** :

开发者可以通过reasoning_effort参数在0.2到0.99之间调节模型的推理投入,在性能和成本之间找到最优平衡点。

实际效果:在Terminal Bench 2.1(智能体编程基准)上,Inkling达到与Nemotron 3 Ultra相同分数时,生成的token量只有后者的约三分之一

对于需要大规模调用模型的生产场景,这意味着成本和延迟的显著下降

2.4 ★ Apache 2.0开源 + 量化全家桶:从企业到个人都能用

Inkling的开源程度令人叹为观止:

版本格式适用场景
BF16(原版)Safetensors最高精度,企业级部署
NVFP4量化4-bit,显存占用大幅降低
FP8量化(RedHatAI提供)精度几乎无损,vLLM就绪
GGUFllama.cpp本地CPU/GPU部署

最低硬件要求

  • BF16检查点:2TB聚合显存(示例:8张B300或16张H200)
  • NVFP4量化版:600GB起步

虽然门槛不低,但Apache 2.0协议意味着可自由用于商业及非商业用途——企业可以放心地用自己数据做二次微调并商业化。


三、性能表现:美国开源阵列登顶

3.1 第三方综合评分:登顶美国开源模型

第三方机构Artificial Analysis结果显示:Inkling以41分的综合得分超越了英伟达Nemotron 3 Ultra、谷歌Gemma 4 31B以及OpenAI的GPT-OSS-120B,登顶美国开源模型

3.2 核心基准测试成绩(effort=0.99全力模式)

基准测试Inkling对比模型
AIME 202697.1%Nemotron 3 Ultra 94.2%
SWE-Bench Verified77.6%Nemotron 3 Ultra 70.7%
GPQA Diamond87.2%
MMMU Pro(视觉)73.3%Gemini 3.1 Pro 82.5%
MMAU(音频)77.2%Gemini 3.1 Pro 82.5%
StrongREJECT(安全)98.6%同类最高
FORTRESS(对抗性测试)78.0%同类开源模型最高

数据来源:

3.3 与主流模型全面对比

基准InklingNemotron 3 UltraKimi K2.5DeepSeek V4 ProGemini 3.1 Pro
Reasoning HLE (text only)29.7%26.6%29.4%35.9%44.7%
HLE (with tools)46.0%

数据来源:

3.4 ★ Inkling-Small:12B激活参数的“反超小弟”

更令人震撼的是,TML同期发布了Inkling-Small预览版

维度Inkling-Small
总参数量2760亿(276B)
每次激活参数120亿(12B)
体量仅为Inkling的1/4

数据来源:

最亮眼的是:这个“12B小弟”在多项基准上直接实现了对“万亿大哥”的性能反超

基准Inkling-SmallInkling(975B)
HLE(带工具)46.6%46.0%
GPQA Diamond88.3%87.2%
IFBench指令遵循83.4%79.8%
SWE-Bench Verified77.4%77.6%(几乎持平)

如何做到的?

  1. 用Inkling当老师做on-policy蒸馏,先出预览版检查点
  2. 从这个检查点接着跑了整整两周的智能体编码强化学习

“学生超过老师”的结果,证明了TML跑通了一条能反复出模型的产线——第一个模型是作品,第二个模型是产能证明

实测显示,8张B200、TP8、NVFP4环境下,用SGLang跑Inkling-Small,开DSpark可达648 tok/s解码速度


四、快速上手

4.1 模型下载

# ModelScope 下载gitlfsinstallgitclone https://modelscope.cn/models/thinkingmachines/Inkling

4.2 Tinker Playground在线体验

Tinker Playground上直接试用Inkling。

4.3 Hugging Face Transformers部署

fromtransformersimportpipeline model_id="thinkingmachines/Inkling-NVFP4"pipe=pipeline("image-text-to-text",model=model_id)messages=[{"role":"user","content":[{"type":"image","image":image_url},{"type":"text","text":"分析这张图片的内容"},],},]output=pipe(messages,max_new_tokens=2000,return_full_text=False,reasoning_effort="medium",# 0.2 - 0.99 可调)

代码来源:

4.4 可控思考深度参数

effort值适用场景
0.2 – 0.5快速响应、成本敏感场景
0.5 – 0.8日常对话、常规任务
0.8 – 0.99复杂推理、Agent任务

4.5 第三方推理服务

Inkling已上线Vercel AI GatewayModal等第三方推理服务平台。


五、总结与思考

Inkling的价值,远不止于“又出了一个开源模型”。它真正值得深思的地方在于:

第一,它重新定义了开源模型的价值主张。不是“性能最强”,而是**“最能改的底座”** 。TML的收入来源是靠微调服务(自研平台Tinker专门卖模型定制服务)——所以他们比谁都清楚:一个模型好不好,不只看跑分,更看能不能被企业真正用起来

第二,它证明了“可控思考深度”的商业价值。用1/3的token达到相同的效果——对于大规模调用的生产场景,这意味着成本和延迟的断崖式下降

第三,它展示了“后训练蒸馏”的威力。Inkling-Small用1/4的体量反超了Inkling——模型大小不是能力的唯一决定因素,训练方法的迭代同样关键

第四,它代表了“美国开源反击”的战略意义。在中国开源模型主导开源AI生态的当下,TML用975B参数、Apache 2.0协议、原生多模态的Inkling,在美国开源模型阵列中登顶

当然,Inkling也有明显局限:BF16版本需要2TB聚合显存,门槛极高;在多模态的某些细分领域(如MMMU Pro)与闭源顶尖模型仍有差距;Inkling-Small目前还是预览版,正式权重尚未全部释放。

但它打开了一扇门:如果开源模型的未来不一定是“更大更强”,而是“更懂企业、更好定制、更讲求成本与性能的平衡”呢?

模型地址:https://modelscope.cn/models/thinkingmachines/Inkling

欢迎下载、部署、微调——一起探索企业级开源模型的另一种可能。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询