☰
AI 大模型开始收“速度税“了:GLM-5.3-FlashX 收 2.5 倍、Claude 收 6 倍、MiMo 收 3 倍,DeepSeek 一分不收
2026/9/26 7:07:13 网站建设 项目流程


同一道题,有人花 1 块、有人花 5 块。差在哪?不是模型,是你提问的语言,和它思考的习惯。

本文基于官方价目表 + 本号 12 跑思考实测,盘点 2026 年大模型定价里的三种"税",文末附可收藏的自查表。

太长不看(TL;DR)

  1. "快"已经被单独定价:Claude Fast 6 倍价、MiMo UltraSpeed 3 倍价、GLM-FlashX 2.5 倍价——速度从附带属性变成了商品。
  2. 长考税:思考过程按 token 计费,同一道题成本方差能到 5-6 倍(实测数据见第二节)。
  3. 语言税:同一模型同一道题,英文提问思考量比中文多 71%(实测)。
  4. DeepSeek 三项都没收,但 8 月 17 日已悄悄涨过一轮价,输出价至今没降回原价。
  5. 自查表:3 分钟判断你正在被收的是哪张税(第五节)。

一、速度税:为什么"快"能单独卖钱

先说机制,再说考古。

快不是免费送的。200 tokens/s 的推理,意味着这批 GPU 是预留给你的:独占推理资源、调度优先、SLA 保障。你不用的时候,这些算力也在空转烧钱。厂商把这笔独占成本单独定价,就是速度税的来源。上半年大家还在卷价格战:降价抢量,用便宜的算力冲规模;下半年敢把价格往上标:用速度筛客户,用独占换溢价。竞争从"谁的模型便宜"变成了"谁的速度值得加钱"。

把今年公开报道过的"速度定价"案例按时间排一排:

今年一季度,Claude Opus 4.6 推出 Fast Mode(官方文档指向 2 月底–3 月)。速度比标准版快 2.5 倍(输出 token/秒),价格翻 6 倍:输入从 $5 涨到 $30、输出从 $25 涨到 $150(每百万 token)。这是目前公开案例里税率顶格的一笔,比 GLM 这次的 2.5 倍高出一大截。

今年 5 月,智谱自己就干过一轮:面向部分企业客户推出 GLM-5.1 高速版 API,输出速度 400 tokens/s,当时号称刷新全球大模型厂商的 API 速度上限。9 月的 FlashX 已经是它第二次收税,区别只在这次把价格和速度写进了公开发布会。

今年 6 月,小米 MiMo-V2.5-Pro 推出 UltraSpeed 模式:万亿参数模型跑在普通 8 卡 GPU 上,输出破 1000 tokens/s,峰值接近 1200。定价是标准版的 3 倍,官方口号很直白:“3 倍价格,10 倍输出体验”。限时两周、申请制,想交钱还得排队。

9 月 18 日,GLM-5.3-FlashX:2.5 倍价换 5 倍速,常态化开放。

四笔税放在一起看,趋势清清楚楚:**速度从模型的附带属性,变成了一项可以单独定价、单独售卖的商品。**有分析把这总结成一句话:大模型竞争,正在从训练 Scaling Law 转向速度 Scaling Law。

这里插一条我自己的数据。我用官网 chat 实测过 DeepSeek V4.1 Flash 的思考速度:单跑思考 4 万字符上下,平均耗时 2 分 17 秒,粗折吞吐大约在每秒两三百 token 的量级,刚好落在 GLM-5.3-FlashX 收税的那一档附近。口径比较粗,字符数不等于 token 数,也没走 API 实测,这个数字先立此存照,回头我用账单把它坐实。但体感是一致的:DS 的思考速度,已经摸到了别人要加价才能买到的档位。

二、长考税:慢的那批,罚单换了一种开法

速度税明码标价,还有其他隐形的税种吗?有,只是罚单换了一种开法。

先说一句:**思考过程正在变成一项计费科目。**各家陆续把 thinking 预算、reasoning tokens 单列计费之后,模型"想多久"直接决定账单多长。而同一道题的思考长度,方差可以很大。这就是长考税的来源:单价可能不高,但用量随机,同一道题的成本能差出几倍。速度税写在价目表上,长考税写在你的账单波动里。

Kimi K3。Artificial Analysis 的独立实测(2026 年 7 月快照):输出速度 32.6 tokens/s,在 190 款模型里排第 147,同价位中位数是 72.7;更难受的是首 token 延迟,等 161 秒才开始吐字。智力指数上它排在第七位,能力配得上它的价格,但慢也是真慢,"K3 为什么这么慢"甚至成了评测文章的固定小标题。中文社区有测试者统计过:单个任务生成 40 分钟起步,一天跑 4 到 5 个任务,烧掉 699 元会员 40% 的 token 额度,粗算下来 K3 单个任务的订阅成本是 GPT-5.6 Sol 的两倍(这些是社区自测,口径各不同,参考即可)。

GPT-6 Astra。两个数字比任何跑分表都有冲击力。一个是 Simon Willison 的标志性 pelican 测试:max 档出一张 SVG,用时 4 分 02 秒,按目录价折算 63.2 美分,他自己的评价是质量提升撑不起这 40 倍的延迟溢价。另一个是社区实测的《传送门》通关:人类玩家 3 小时的游戏,Astra 跑了近 23 小时,触发 3336 次智能体循环,按目录价折算 API 成本约 571 美元(实测走的是 200 美元订阅,账面没花那么多,但烧掉的配额是实打实的)。更扎心的细节是,token 大量烧在"想"上,实际输出占比很低,配额消耗是标称的 1.5 到 2 倍。

顺带接一句热点:这段时间社区里都在喊 MiMo 2.6 是"新斩杀线",而它家的钱袋子思路是一脉相承的,前代 V2.5-Pro 就干过 3 倍价的速度生意。我在上一篇四家实测里踩过同一类坑,只是踩在了免费网页版上:MiMo Pro 三跑的用时是 6 分 38 秒、22 分 12 秒、31 分 40 秒,Flash 三跑是 5 分 23 秒、16 分 52 秒、32 分 38 秒。同一道题在同一个模型身上,最快和最慢差出 5 到 6 倍,其中两跑思考到最后一个字都没输出。换成 API 计费场景,这两跑就是纯烧掉的钱,而且你发出请求之前,没有任何办法知道这一次会落在哪一档。

这就是长考税的本质。对照之下,DS 的做法值得单独说一句:**它的思考链精炼程度,本身就是一种降价技术。**同一道 Q4,DS 三跑思考合计 12 万字符,MiMo 两家六跑合计 80.6 万,差出 6.7 倍,而答案质量都是对的。把思考写短,其实是替用户把长考税直接降没了。快加上省,这两样在 DS 身上是一体的。

三、语言税:连用什么语言想,都在计价

第三种税最隐蔽,它不取决于你买了什么,只取决于你怎么问。

机制先讲明白:**大模型按 token 计费,而 token 是按"字/词"切出来的。**中文的信息密度高,同样一段意思,中文切出来的 token 数通常少于英文。同一个模型,思考链用英文写,账单天然比中文多一截。所以"模型用什么语言思考"本质是个成本问题,翻译只是表面现象。

在做 deepseek 测试的时候我做过一组对照实验:同一道题、同一个 DeepSeek,中文提问三跑,思考全中文,平均 4.0 万字符;逐句对齐翻译成英文再问三跑,思考瞬间切成全英文(中文字符从 79052 个掉到 46 个),单跑思考涨到 6.8 万字符。用时相当、答案等价,变量只剩下语言。

也就是说,同样的问题,你用英文问,DS 的思考账单要多出七成。反过来讲,**中文提问是一个零配置的省钱开关。**而 MiMo 拿到中文题面,会先在脑子里把题翻译成英文再想:思考全程英文、最后交付中文,中间那段烧钱的过程,用的是最贵的语言。上一篇实测里,MiMo Pro 的中文思考占比只有 1.1%,几乎等于"用中文问你,用英文想"。

三种税到这里就齐了。速度税写在价目表上,明码标价;长考税藏在账单波动里,随机扣款;语言税最隐蔽,它只取决于你怎么问。

四、把倍数换成钱:同一道题,三种花法

倍数看着抽象,换成钱就具体了。用一个最朴素的算法:把 DS 用中文提问跑完 Q4 的思考账单记作 1 块钱,其他几种跑法按思考量等比例放大,同一道题的思考开销是这样的:

同一道 Q4,只看思考账单相对开销
DS · 中文提问1 元(基准)
DS · 英文提问约 1.7 元
MiMo Pro · 中文题面,它英文想约 3.1 元
MiMo Flash · 中文题面,它英文想约 3.6 元
Step · 中文思考跑约 0.4 元
Step · 英文思考跑约 5 元(混入深度变化)

算法很笨:各家单跑思考字符量,除以 DS 中文跑的 4 万字符,保留一位小数。表里的"元"只是记账单位,你把你家模型的每百万输出 token 单价乘上去,它就变成真金白银。

两个口径照实交代。字符口径换 token,英文吃亏:同样一段意思,英文 token 只多不少,所以按 token 算,表里的倍数只会更大。思考占输出的大头,答案文本两边又差不多,这个简化在倍数量级上站得住。

这张表真正想说的是:**同一道题、都能做对,思考账单能差出 3 倍多,而差价藏在两个价目表上没有的变量里:你提问的语言,和模型自己的思考习惯。**价目表上一个数字都没动,你的账单动了。

五、三税自查表·收藏版:下次选模型,对着这张表查

写到这里,三张税单都有了数字,可以压成一张四行的自查表。四行全是零成本动作:前两行上官网就能查,后两行花你十几分钟跑两遍。

先记三步自查法,对应三张税:

  1. 查价目表(≈2 分钟):看有没有"极速/高速/FlashX"档位,溢价几倍 → 对应速度税。
  2. 同题三跑(≈10 分钟):拿你手头最贵的那道题,同一题跑三遍记用时 → 对应长考税。
  3. 换语言(≈10 分钟):中英文各问一遍,看思考流语言和字数 → 对应语言税。

然后对照这张表:

你要做的事打开查什么危险信号本文实测对照
选模型扔一道中文题,看思考流语言中文题面,英文思考MiMo Pro,中文占比 1.1%
比价格有没有极速档/高速版,溢价几倍同能力起步就 2.5 倍FlashX 2.5 倍,Claude 6 倍
接进流程同一道题多跑几遍,记用时同题用时差出 5 到 6 倍Pro 6分38~31分40;Flash 5分23~32分38
省一笔换提问语言各跑一遍对比英文问,思考贵七成+71% 纯语言税

这张表建议收藏。下次哪家涨价、上新档位,拿出来对一遍,五分钟就能判断它收的是哪张税、你有没有办法绕开。价目表只是入场券,税单才是成交价。

六、DeepSeek 一项没收,但账本会变

盘完这张价格表,你会发现一个很有意思的事实:本篇出现的三种税,DeepSeek 一项都没收。速度上,它的思考吞吐摸到了别人要加价的档位;长考上,它的思考链精炼程度把这项税降没了;语言上,你用中文问,它就用中文想,一分钱不加。

这份三重优惠,目前是白给的。

但是。关注 DeepSeek 价格的朋友应该记得,8 月 17 日那次没有提前打招呼的调价,后来输出价也没有降回原价:9 月 10 日 Flash 换代降价后,输出价格(闲时 4 元/百万 token)依然没回到调价前的水平。免费网页版用户可能无感,API 用户已经体验过一次"说变就变"。

所以我真正想问的是:这份白得的速度税减免、长考税减免、语言税减免,哪些能长期保持,哪些随时可能变成收税模式?也许有一天,"极速 DS"会和"极速 GLM"一样,变成价目表上单独的一行;也许长思考会被拆成档位,按 thinking 预算计费;也许连"用中文问便宜些"这种事,都会在某次调价里被抹平。

可能就在明天,可能也已经在它内部的会上讨论开了。谁都不知道答案,我们能做的,就是把每一轮测试的数据存好,下次调价那天,第一时间知道谁在收新税。

每日一问

算完今天这笔账,你最近一次 AI 账单里最意外的开销是什么?是某次长思考烧掉的额度,还是换了个提问语言后凭空多出来的钱?评论区聊聊,高赞回答我会单独成篇。

留言区最想拆哪家的账单,也可以点名,热度最高的选题我优先排期。也欢迎大家关注我的同名GZH一起讨论。


测试口径:DeepSeek V4.1 Flash 思考速度与语言对照为本号官网 chat 实测(2026-09-23,同一道自编 Q4 陷阱题,中文/英文提示词各三跑,思考流全文存档,脚本逐跑统计);MiMo 思考量、用时区间对照同上。GLM-5.3-FlashX 定价与速度引自智谱官方发布及证券日报报道(2026-09-18);Claude Opus 4.6 Fast Mode 价格与 2.5 倍速引自 Anthropic 官方文档;GLM-5.1 高速版引自智谱官方文档;MiMo UltraSpeed 引自小米官方发布(2026-06-08);Kimi K3 速度数据引自 Artificial Analysis(2026-07 快照)及中文社区实测;GPT-6 Astra 数据引自 Simon Willison 公开实测与社区《传送门》通关记录(账单为目录价折算)来源;DeepSeek 调价日期与价格引自公开报道(2026-08-17 生效)。所有第三方价格以各家官网为准。三税换算表与自查表基于本号 12 跑思考实测及文中公开数据整理,换算口径见第四节。前篇:《DeepSeek MiMo 2.6 思考链实测》《DeepSeek 思考语言实测》。考卷公开:https://free-llm-exam.app.workbuddy.host/

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询