国产模型冲上编程榜:千问登顶前端,GLM 首次进代码前十
2026/9/4 11:29:47 网站建设 项目流程

据 IT之家 9 月 2 日报道,Arena(arena.ai)发布了 2026 年第 35 周(8 月 24 日~8 月 30 日)的大模型盲测周榜。这期榜的看点是国产模型扎堆亮相:阿里 9 月 2 日更新的 Qwen3.8-Max-0902 首次入榜就登顶前端开发榜,智谱的 GLM-5.3-Flash 首次进入代码榜前十,腾讯 Hy4-Preview、阿里 Qwen3.8-Flash-Next 也同期首秀。一圈看下来,国产模型在"写代码"这条细分赛道上,已经从陪跑变成了前排选手。

榜单上发生了什么

先把这期的关键名次摆一下(数据来自 Arena 周榜,据 IT之家报道整理):

  • 前端开发榜:Qwen3.8-Max-0902 以 ELO 1691 分首次入榜即登顶,把上一任榜首 Claude-Opus-5-Max(1687 分)挤到第二;Kimi K3 Max 第三;腾讯 Hy4-Preview 第八、Qwen3.8-Flash-Next 第九都是首秀,GLM-5.3-Flash 排第十二。新入榜的国产模型就有四款挤进前 12。
    • 代码榜:头部依旧是 Anthropic 的天下,Claude-Opus-4-7-high 以 1552 分排第一,前三名分差只有 1 分(误差范围内算并列);GLM-5.3-Flash 首次入榜就排到第七(1535 分),前十里的国产面孔是第六的 Kimi K3 Max 和它。
    • 综合榜:Claude-Fable-5 以 1508 分蝉联第一,Anthropic 占据前七名中的六席;国产最高是第十名的 Kimi K3 Max。
      另据阿里官方发布信息(量子位获授权转载):9 月 2 日更新的 Qwen3.8-Max 总参数 2.4 万亿、支持 100 万 token 上下文,新版本针对编程(Coding)和专业办公(Cowork)做了专项后训练,在 CodeArena 的 WebDev 榜上提升 22 分至 1691 分居第一;按官方口径每百万 token 的综合平均成本约 5 美元。目前新模型已上线千问平台 API,千问办公、Qoder、千问 App 都已接入。

技术本质:还是组合拳,不是新范式

这两个主角的卖点值得拆开看。

GLM-5.3-Flash 是智谱 GLM-5 系列第一个原生多模态模型,8 月 26 日发布,总参数 3200 亿、激活参数只有 180 亿,采用线性注意力加稀疏注意力的混合架构。这类架构这两年很常见,思路就一条:总参数可以大,但推理时只激活一小部分,把单次调用的算力成本压下来。榜单里标注它的 API 价格是输入 0.15 美元、输出 0.5 美元每百万 token,比自家 GLM-5.3-Max(1.4/4.4 美元)低一个数量级,也远低于多数海外头部模型。这款模型还开源了(Ox Alpha 版),据 IT之家报道摩尔线程已官宣完成 Day-0 适配,商汤大装置也上线提供国产算力支持——开源加国产芯片适配,走的是和上一代 DeepSeek 类似的路线。

Qwen3.8-Max 则是另一个路子:不省参数(2.4 万亿),靠"专项后训练"把能力往工程任务上掰。所谓专项后训练,就是在通用训练完成后,再用大量编程、办公协作类数据做定向强化,让模型更会"干活"而不是更会"聊天"。

所以这一轮的变化本质是三件事叠一起:更省的推理架构、更低的定价、更定向的任务训练。底层并没有出现新范式——综合榜和代码榜头部依旧被 Anthropic 系占着就是证据。变的是细分市场:前端开发这种"任务明确、反馈快、量又大"的场景,国产模型先用性价比撕开了一个口子。

顺带提醒一句榜单怎么读。Arena 是匿名盲测投票、用 ELO 算分,反映的是用户主观偏好而不是绝对能力测试;不同分榜互相独立,不能拿前端榜的分去和综合榜比;分差在误差范围内都算并列。所以"登顶"要理解成"用户投票层面占优",别当成"所有编程任务绝对第一"。

对普通开发者的实际建议

我一个运维转运营的人,写代码不算多,但这两年用 AI 写脚本、处理报表数据的频率明显在涨——这类模型卷起来,最先受益的其实就是"够用就行"的用户。具体怎么用,给几条实在的:

  1. 前端/页面类活可以降本了。组件、页面、样式、接口联调这类高重复度任务,让便宜的国产模型当主力、人来做 review,性价比比全程用顶配海外模型高。接口基本是 OpenAI 兼容格式,切换成本很低。
    1. 复杂工程和长任务 Agent 先别急着换。重构老系统、跨模块排错、长链路 Agent 这类活,目前头部梯队(Claude 系、Kimi K3 Max 等)稳定性更可预期,建议留一个强模型兜底。
    1. 别信排名,信自己的用例。抽一两个真实业务小需求,同一份 prompt 跑几个候选模型对比:
# OpenAI 兼容接口示例;具体 base_url 与可用模型名以各平台文档为准importosfromopenaiimportOpenAI client=OpenAI(api_key=os.environ["LLM_API_KEY"],# 换成你自己的 keybase_url=os.environ["LLM_BASE_URL"],# 如 DashScope 兼容模式地址)prompt="用 Vue3 + Element Plus 写一个带搜索、空状态、加载骨架的用户列表页"formodelin["qwen3.8-max","glm-5.3-flash"]:resp=client.chat.completions.create(model=model,messages=[{"role":"user","content":prompt}],temperature=0.2,)print(f"---{model}---")print(resp.choices[0].message.content[:300])``` 跑的时候留意三个坑:一是"能用""能上线"差距很大,生成代码必须人工过一遍;二是便宜模型往往意味着更有限的指令遵循能力,长 prompt 和复杂约束要多测;三是榜单价是每百万 token 的标价,实际账单还要看上下文长度和缓存命中情况。## 小结国产模型这周在编程榜上的成绩单确实亮眼,但含金量要打折看:赢的是细分场景和性价比,不是全面碾压。对写代码的人来说这是好事——可选项变多、价格往下走,省的是自己的时间和公司的预算。你平时写代码用哪家模型,最近换过吗?评论区聊聊。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询