8月17日零时起,DeepSeek-V4 API 新价格正式生效:高峰时段输出价格涨到 27 元/百万 tokens,是此前的 4.5 倍;缓存未命中价格 9 元/百万 tokens,是此前的 3 倍;缓存命中输入价格 0.30 元/百万 tokens,直接是此前的 12 倍;空闲时段价格为高峰时段的一半(据21世纪经济报道)。
这一波不是 DeepSeek 一家的事。据报道,过去几个月国产模型厂商已经集体调价:智谱年内三轮提价——2月 GLM Coding Plan 结构性调价打响"第一枪",3月 GLM-5-Turbo 发布时 API 提价 20%,4月 GLM-5.1 发布时再提价 10%;MiniMax 6月发布第三代旗舰 M3 时 API 价格全面翻倍;月之暗面 7月发布 Kimi K3 时输入涨到 20 元、输出涨到 100 元/百万 tokens,均较前代涨超 3 倍。"大模型六小虎"里,智谱、月之暗面、MiniMax、DeepSeek 都涨了。摩根士丹利统计的官方报价显示,2026 年第二季度国产大模型平均 API 输入价格 4.9 元、输出 21.9 元/百万 tokens,相比 2025 年一季度分别上涨约 48% 和 80%。
技术本质:推理成本是真实的,补贴撑不住了
前两年是"百模大战"的白菜价阶段:2024年5月 DeepSeek-V2 把 API 打到输入 1 元、输出 2 元/百万 tokens,混元-lite、文心 ERNIE Speed 等直接免费;今年 5 月 DeepSeek 还在把 V4 Pro 永久降到原价四分之一。为什么现在集体转向?根本原因是推理算力成本——每次调用都消耗真实算力,长上下文、深度推理、Agent 任务又显著拉高单次推理负载,高峰时段算力供给依然紧张(据21世纪经济报道援引业内人士观点)。行业走完了"市场教育期",企业客户从"要不要用 AI"变成"用哪个、怎么用得稳",厂商开始从"烧钱换市场"转向按价值定价。
几个数据能看出这个转折有多明显。智谱一季度 API 定价比去年底提高 83%,调用量反而增长 400%(据报道)——涨价没吓退企业客户,说明对生产系统来说,确定性比便宜更重要。华泰证券研报指出,行业定价正从价格战转向理性定价,而 OpenAI、Anthropic 为应对中国模型竞争反而选择部分降价。国内涨、海外降,这个反差本身就说明问题:国产模型的价格洼地正在被填平。
分层定价时代,开发者和打工人怎么应对
涨价之后,选模型和控成本成了日常工作。几个实操方向:
1. 吃透峰谷定价。DeepSeek 闲时价格是高峰的一半。批处理、离线报表、定时任务这类没有实时性要求的活,排到闲时跑,成本直接对半。写个成本估算函数就能看清楚差距:
defest_cost(output_tokens:int,peak:bool,price_peak=27.0,price_offpeak=13.5)->float:"""按输出 token 估算单次调用费用(元),价格按元/百万 tokens"""price=price_peakifpeakelseprice_offpeakreturnoutput_tokens/1_000_000*priceprint(est_cost(50_000,peak=True))# 高峰输出 5 万 token ≈ 1.35 元print(est_cost(50_000,peak=False))# 闲时输出 5 万 token ≈ 0.68 元2. 把缓存命中率做上去。DeepSeek 缓存命中输入价 0.30 元 vs 缓存未命中 9 元/百万 tokens,相差 30 倍。保持 prompt 前缀稳定、系统提示词不变、公共上下文提前缓存,能显著省钱。
3. 按任务分层选模型。简单分类、抽取、润色用轻量模型或便宜档位,复杂推理、代码生成才上旗舰。阿里通义千问已提供按量计费、Token Plan 包月、Coding Plan 三套方案,OpenAI 在 GPT-5.6 同代内做了 Sol/Terra/Luna 三层定价——各家都在引导你"按需付费"。
4. 评估涨价值不值。涨价本身不是问题,问题是涨价后能力有没有同步提升、稳定性跟不跟得上。独立模型厂商没有云业务兜底,涨价是生存需要;大厂有云生态交叉补贴,更多是变相调价(据报道,阿里云 4 月对百炼大模型单元提价 2%-5%,字节 5 月给豆包上付费体系)。采购时把任务成功率、重试率、人工接管率算进综合成本,比单看 token 单价更接近真实成本。
一个趋势是确定的:用一套价格覆盖所有用户的时代过去了,按价值分层定价会成为常态。对企业来说是成本结构变化,对个人开发者来说,几十块钱跑应用原型的日子可能还在,但"免费午餐"会越来越少。你们公司的 AI 账单涨了多少,评论区聊聊。