9 月 2 日(周三)凌晨,谷歌把 Gemini 3.8 Flash 端了上来。这是六周里第三个 Flash 版本——3.6、3.7、3.8 轮流上,几乎三周一版。发布当天,两个消息在开发者群里传得最凶:一是 DeepSWE 1.1 拿了 71%,只比 Claude Opus 5 低 3 个百分点;二是限时价格跟 3.7 持平,输入 0.75 美元、输出 3.75 美元每百万 token,大约是 Opus 5 的七分之一。
我手上正好有一个跑了两周的长任务 Agent,用的还是 3.7 Flash 的接入代码,想着换过去能省一笔。结果模型 ID 一换,控制台直接抛错:thinking_level 的 minimal 档在 3.8 上已经不存在了。翻完文档才意识到,这一代不是改个模型 ID 那么简单——接口在变、计费口径在变、连模型的「工作习惯」都变了。这篇把从零接入和从 3.7 迁移的完整路径写清楚,最后附 3 个避坑点。
发布前一天,华尔街日报先放了个料:谷歌内部工程师在 Jetski 平台上做编码评测时,更愿意选 3.8 Flash 而不是 Anthropic 的 Opus——写代码这事,内部人先投了票。发布当天,Antigravity 和 Managed Agents 的默认模型也直接换成了它,等于官方用行动表态:Flash 档就是现在的主推。至于网上「遭全网狂嘲」的热搜,嘲的不是跑分,而是它「单价没涨、单任务反而更贵」的隐性涨价套路——具体数字在下面的表里。
先看数据:便宜在哪,代价在哪
先给结论:3.8 Flash 不是 3.7 的简单升级,而是谷歌把同一套网络「调教」得更勤快了。官方博客的原话是 works harder——遇到复杂任务时拆更细的推理步骤、反复调用工具、自己检查中间结果。好处是长程任务完成率上去了,代价是 token 烧得更多。
| 对比项 | Gemini 3.8 Flash | Gemini 3.7 Flash | Claude Opus 5 |
|---|---|---|---|
| 输入价($/百万 token) | 0.75 | 0.75 | 5.0 |
| 输出价($/百万 token,含思考) | 3.75 | 3.75 | 25.0 |
| DeepSWE 1.1(长周期软件工程) | 71%(第三方口径到过 73.7%) | 65.3% | 74.0% |
| Terminal-bench 2.1(终端编码) | 89.4% | — | 89.1% |
| 上下文窗口 | 1M | 1M | — |
| 单任务 token 消耗(AA 实测) | 约 4.8 万 | 约 3.7 万 | — |
| 首字延迟(AA 实测) | 平均 13.3 秒 | — | 同类中位数 2.99 秒 |
这张表读出来的故事有两条。能力侧:3.8 把与 Opus 5 在 DeepSWE 上的差距压到了 3 个百分点以内(第三方口径 73.7%,只差 0.3),Terminal-bench 2.1 的 89.4% 甚至反超 Opus 5 的 89.1%,而价格只有后者的约七分之一。成本侧:Artificial Analysis 用真实任务实测,同一个任务 3.8 比 3.7 多烧约 30% 的 token(3.7 万 → 4.8 万),单任务成本从 0.40 美元涨到 0.58 美元,首字延迟平均 13.3 秒——同类模型的中位数只有 2.99 秒。翻译成人话:单价没涨,但「同样的活」更费 token、开口更慢。这正是网上吵翻天的「隐性涨价」说法的来源。
再补一个背景,帮你理解 71% 这个数字的含金量:DeepSWE 1.1 考的是「给一个真实的 GitHub issue,模型能不能自己端到端改完代码、跑通测试」。上一代 3.7 Flash 的成绩是 65.3%,3.8 直接跳到 71%,单代提升 5.7 个百分点——而 Opus 5 的 74% 是闭源旗舰堆了半年才到的位置。也就是说,谷歌靠「更勤快的推理习惯」,在 Flash 档上追平了旗舰档约八成的差距。网上流传的 73.7% 是第三方在更高推理档位下测出的口径,官方默认口径 71%,两个数字指向的结论一致:和 Opus 5 只差 3 个百分点以内。
价格窗口的来龙去脉也值得单独说:3.7 Flash 八月发布时就把限时价砍半到 0.75 / 3.75,3.8 延续同价,但谷歌明确标注 2026 年 12 月 31 日之后翻倍到 1.50 / 7.50。也就是说,现在到年底是明牌的锁价窗口——这也是我把迁移清单里的时间点单独拎出来的原因。
想了解其他几款的实测数据吗?第二部分有完整的对比表格——【关注后查看完整对比】
从零接入:3 段代码跑通
第 1 步:拿 Key,装 SDK
在 AI Studio(个人调试)或 Vertex AI(生产环境)里建一个 API Key,然后装官方 Python SDK:
pipinstallgoogle-genai第 2 步:发出首次请求
fromgoogleimportgenai client=genai.Client(api_key="<YOUR_API_KEY>")resp=client.models.generate_content(model="gemini-3.8-flash",contents="给下面这个函数写 3 个单元测试,覆盖边界条件:\n\ndef parse_ts(line):\n # 从日志行里解析时间戳\n ...",config={"thinking_level":"low"},)print(resp.text)四个要点:模型 ID 是gemini-3.8-flash;上下文窗口 1M token,适合整仓库塞进去做分析;输出上限 64K token;thinking_level 支持low/medium(默认)/high三档。
除了文本,它还吃图片、视频、音频和 PDF 输入(输出仍只有文本),知识截止到 2026 年 3 月。接入时容易漏的一点:模型内置了函数调用、Google 搜索、代码执行、URL 抓取等工具,Agent 场景下不用自己再套一层工具层,直接在请求里声明 tools 就行。
第 3 步:多轮对话走新交互接口
session=client.interactions.create(model="gemini-3.8-flash")r1=session.send("分析这个仓库的构建脚本,找出最慢的环节")r2=session.send("针对刚才的结论给一份优化清单")# 服务端保留上文传统的 generateContent 还能用,但谷歌新推的 Interactions API 把多轮状态挪到了服务端(靠 previous_interaction_id 续接),不用再自己拼历史消息,对 Agent 场景友好得多。REST 形态是 POST /v1beta/interactions,非 Python 语言直接照这个端点封装即可——多轮会话的状态由服务端保存,相当于把 Agent 的对话历史托管了出去。
从 3.7 迁移:3 步清单
如果你和我一样是 3.7 Flash 的老用户,迁移不是改一行 model 参数,按下面 3 步走。
第 1 步:改掉 minimal 档
3.8 把 thinking_level 的minimal档位移除了,文档写得很直白:请求里带 minimal 会直接报错,最低只能从low起步。
# 3.7 的写法(3.8 上报错)config={"thinking_level":"minimal"}# 改成config={"thinking_level":"low"}更隐蔽的变体是:很多 Agent 框架把档位写死在配置模板里,框架不升级的话,换了模型 ID 会一直撞 400。迁移前先全局搜一遍代码和配置里的 minimal。
第 2 步:重算 token 预算
works harder 的代价是每任务多烧约 30% token。如果你按 3.7 的用量做了成本预估,记得整体乘 1.3~1.4;延迟敏感的场景还要把首字延迟的差异算进去——13.3 秒是平均值,多轮工具调用链里每一轮都要吃这个延迟。
第 3 步:12/31 前锁价
0.75 / 3.75 是限时价,2027 年 1 月 1 日起翻倍成 1.50 / 7.50。要长期跑的长任务、批处理、无人值守 Agent,窗口期内迁过去等于锁住三个半月的低价。反过来,谷歌明确说 3.7 会继续完整支持,官方文档里有一句很实在的话:不是每个工作流都需要这种强度的验证——短问答、简单工具调用这类效率型负载,留在 3.7 反而更划算。
3 个避坑点
坑 1:minimal 报错不是个例,是接口变更信号。我最初以为是参数写错,翻 GitHub issues 才发现 3.8 的模型卡直接指向 3.7 的架构文档——这一代是同一套网络的「行为重训」,不是新架构。所以除了 thinking_level,其他 3.7 专属参数也要逐个核对是否还在支持列表里,别只改报错的那一个。
坑 2:输出价含思考 token,长输出任务的账单会出乎意料。3.8 没有单独的 reasoning 计费项,思考 token 和输出 token 一起按 3.75 美元计。深度推理任务里思考 token 占比经常过半,跑完记得看 usage 字段里 thinking 相关的统计,把真实单价算出来再决定要不要长期用。
坑 3:首字延迟 13.3 秒是均值,不是上限。这个数字来自 Artificial Analysis 对真实任务的统计,对比同类模型 2.99 秒的中位数,差距接近 4 倍。交互式补全、Copilot 类场景基本劝退;无人值守的 Agent 任务无所谓——反正不用人盯着等。
真实任务长什么样:能跑,短板也明显
公开实测里最有参考价值的一组来自腾讯云开发者社区 9 月 3 日的三项目实录:三个全栈项目全程无人干预,总花费约 30 元人民币。挑几个有信息量的细节:
- Markdown 写作图床(Express + Sharp + better-sqlite3):5 分钟开发完并跑通测试,87.87 KB 的图片自动转 WebP 压到 12.13 KB(压缩率 86.2%),还自己实现了 SHA-256 秒传去重——重复上传直接返回原链接,不占额外磁盘。
- 3D 烟花仿真系统:要求上万颗粒子维持 60 帧,压测时把同屏活跃粒子拉到 4 万颗(要求的 4 倍),依然稳定 120 帧。
- 3D 动画短片:遇到 Canvas 导出视频只录画布、丢失 HTML 字幕的问题,模型自己搭了一套双层复合录制管线,把字幕和协议标签压进视频帧。
跑得动、能自主解决问题,这是它强的一面。短板同样清楚:前端视觉表现偏弱(配色和字体「AI 味」重)、首字延迟明显、和国产模型比没有价格优势——同样的任务交给 GLM-5.3、Kimi K3,效果未必差。另外它 6 周发 3 版,迭代快得文档都有点跟不上,接入时别只信博客,以模型卡和 API 文档为准。
还有一组数字值得放进成本语境:Artificial Analysis 实测它的输出速度约 305 tokens/s,在主流模型里属于快的一档——也就是说它慢在「开口」(首字延迟),快在「开口之后的输出」。这个特性决定了它的适用形状:一次性长输出任务体验尚可,多轮短交互会很难受。把「输出快、开口慢、token 烧得多」三个特征叠在一起看,3.8 Flash 的画像就很清晰了:它是为无人值守的长任务设计的,不是为人机对话设计的。
什么时候换、什么时候别换
按任务类型给结论,不按人分。先看一张 Flash 档横向表——把同价位的轻量档模型摆在一起,选型逻辑会清楚很多:
| 模型 | 厂商 | 定价亮点 | 特点 |
|---|---|---|---|
| Gemini 3.8 Flash | 谷歌 | 输入 0.75 美元/百万 token(限时价,明年翻倍) | DeepSWE 71%、1M 上下文、长程 Agent 取向 |
| Gemini 3.7 Flash | 谷歌 | 同价 | 效率型负载,官方承诺继续支持 |
| Qwen3.8-Flash | 阿里 | 输入 1 元/百万 token | 125B 只激活 6B,多模态 MoE |
| GLM-5.3-Flash | 智谱 | 定价约为 Opus 4.8 的 1/40 | 原生多模态,国产算力 |
横向读这张表:谷歌的定价策略是美元计价、全球统一,国产这边是人民币计价、贴身肉搏——绝对单价上国产 Flash 档更便宜,而且中文场景体验往往更好。但如果你要的是 1M 上下文加长程 Agent 稳定性,3.8 Flash 的限时价窗口反而是当下值得先锁的。具体怎么选:
- 换:长程 Agent 无人值守任务、批量代码审查、高吞吐离线任务。这类任务吃满 1M 上下文和 64K 输出,对首字延迟不敏感,还能在 12/31 前锁住限时价。
- 先别换:低延迟交互场景(补全、聊天、IDE 内联);前端视觉要求高的任务;已经在国产生态里跑得好好的负载——GLM-5.3-Flash 用 1/40 的价格、Qwen3.8-Flash 输入只要 1 元/百万 token,性价比不见得输。
- 折中:把 3.7 留着跑效率型负载,3.8 只切给验证型任务,跑两周对比 usage 数据再决定要不要全量迁。
最后说点看法。旗舰模型在拼能力上限,Flash 档在拼「每分能力花多少钱」——3.8 Flash 最值得注意的信号不是跑分,而是谷歌把 Antigravity 和 Managed Agents 的默认模型都换成了它,等于官方自己用脚投票。但对开发者来说,换模型的正确姿势永远是先算自己的 token 账,别只盯着单价表。Artificial Analysis 的智能指数里它排在 636 个模型的 27 位左右,是「性价比梯队」的尖子,不是「能力天花板」——想清楚你要的是哪个,再动手不迟。
延伸阅读:Claude Code 额度缩水 17%:9/14 生效前,4 款 AI 编程工具成本横评
DeepSeek V4 Pro 正式版上线:DeepSWE 7.3→62.7 的 Agent 实测,3 步迁移 API + 8/17 涨价前省钱清单
Grok 4.6 API 接入踩坑实录:价格砍半是真的,但 5 个坑让我多花了 3 倍钱
📌系列文章
- Qwen3.8-Flash 实测:125B 只激活 6B,输入 1 元/M,4 个场景验证多模态 MoE
- GLM-5.3-Flash 正式版迁移踩坑:免费窗口今天截止,1/40 的价格也有 5 个坑
- 匿名模型 OX Alpha 横评:DeepSWE 80% 反超 Fable 5 与 GPT-5.6 Sol,免费窗口最后 2 天
- GLM-5.3 vs Fable 5 vs GPT-5.6 Sol:6 项基准横评,743B 国产编程模型的正面硬刚
看完有收获?点个关注 👆 我会持续分享更多AI编程实战教程。