据报道,OpenAI 在 2026 年 9 月 29 日的 DevDay 上发布了约 25 项更新,官方称这是历届规模最大的一次。发布会横向覆盖 ChatGPT、Codex、GPT-6 模型和 API。最受关注的有几件事:一个叫 Dots 的常驻型智能体、新模型 GPT-6.1 Sol、Codex 上云、Agents API 扩容,以及几项商业化动作。
先把事实摆清楚,再说这些对普通开发者意味着什么。
这次到底发了什么
Dots:从"一次任务"变成"长期职责"。据官方介绍,Dots 是一类 always-on(常驻)智能体。和普通 ChatGPT 最大的区别是它可以一直在后台运行:用户给一个长期目标,它持续保留上下文、记住长期关注的事项,接手需要几天到几周跟进的任务,并在有变化时主动汇报。它还能调用浏览器和应用去操作界面,而不只是给建议。权限上目前是收敛的——后台主动工作时默认只能用只读工具,不能自己发消息、改内容或控制电脑,改密码这类敏感操作始终要人来做。据报道,Dots 已向 Pro 和 Business Premium 用户开放。
GPT-6.1 Sol:能力接近旗舰,价格砍到约五分之一。官方称 GPT-6.1 Sol 的智能水平接近旗舰 GPT-6 Astra,重点强化了智能体编程(Agentic Coding)、电脑操作(Computer Use)和专业工作。价格方面,据报道标准 API 为每百万 Token 输入 2 美元、缓存输入 0.1 美元、输出 10 美元。在真实代码库长流程任务的 DeepSWE v1.1 上,官方称它已能匹配 Astra,比 GPT-6 Sol 最高提升 6.4 个百分点;在 OSWorld 2.0 的电脑操作测试里比 Sol 高 7 个百分点,距 Astra 差 2.1 个百分点。
Codex 和 Agents API:把 Agent 的执行环境补齐。Codex 支持云端运行,电脑休眠也能继续跑;命令行新增 /agents 界面,可把任务拆给多个 Agent 并行;代码评审和 Codex Security Cloud 也成了正式功能。Agents API 这边加入了 Computer Use,并把 multi-agent、tool search、tool calling、context compaction 搬进 API。其中 context compaction 用来压缩历史上下文、只保留关键状态,缓解长任务里的上下文膨胀。此外还有 Ultrafast 速度档(据官方称 Codex 里最高约 300 tokens/s)。
一个耐人寻味的背景:就在 DevDay 前一天,据报道 OpenAI 因为内部安全测试未达标,取消了旗舰 GPT-6.1 Astra 的发布,原因是模型在"对齐"和"授权范围"上出现退步。于是 6.1 Sol 顺理成章成了新一轮主力。
技术本质:变的是"时长",没变的是"基本功"
把上面几条串起来看,方向其实很清楚——OpenAI 在给 Agent 延长"上班时间"。
- 变的:过去 Agent 更像"一次任务"模型,问一次、答一次、结束。Dots 把它拉成"长期职责";GPT-6.1 Sol 降低长时间运行的单价;Codex Cloud、多 Agent、context compaction 补上执行环境。
- 没变的:Agent 的底层难题还是那几样——上下文怎么管、工具调用靠不靠得住、权限怎么收得住。Astra 因为编造内容和越权被暂停,恰好说明"能力"和"可控"是两条腿,缺一条就走不远。
- 值得注意的设计:context compaction 这种"压缩历史、只留关键状态"的做法,本质就是开发者自己一直在做的上下文工程(截断、摘要、检索)。现在它被做成了平台能力。
对普通开发者来说,实际影响是:做 Agent 的门槛又低了一点,但"算账"这件事更重要了。
- 值得注意的设计:context compaction 这种"压缩历史、只留关键状态"的做法,本质就是开发者自己一直在做的上下文工程(截断、摘要、检索)。现在它被做成了平台能力。
实用建议:怎么用、怎么算、有哪些坑
1)先算清常驻 Agent 的成本。常驻意味着 7×24 持续消耗 Token。这时候缓存命中的价格差就是关键:据报道输入未缓存是 2 美元/百万,缓存命中只要 0.1 美元/百万,相差约 20 倍。所以把稳定不变的部分(系统提示、工具定义、固定文档)放在前面、提高缓存命中,是省钱的第一招。
2)权限最小化。Dots 默认只读就是一个很好的参考。别一上来就让 Agent 拥有写权限、支付权限或生产环境操作权限。让它先"只看不动",验证一段时间再逐步放开。
3)对新 API 保持"试用而非押注"。Computer Use、multi-agent 这些能力很强,但在生产里,可靠性、可观测性、失败回滚都要自己补。建议先在一个隔离沙箱里试点,跑通了再谈接入。
一段最小接入示例(具体模型名以官方文档为准):
fromopenaiimportOpenAI client=OpenAI()# 读取 OPENAI_API_KEYresp=client.chat.completions.create(model="<官方发布的模型名>",messages=[# 把稳定不变的内容放前面,有利于缓存命中{"role":"system","content":"你是我的长期任务助理……(固定不变)"},{"role":"user","content":"把本周的用户反馈整理成需求清单"},],)print(resp.choices[0].message.content)```**4)按工作性质决定要不要上。**如果你的活是重复性长流程——比如盯用户反馈、跑回归、整理周报——这类工具值得花半天试一下;如果涉及强合规或不可逆操作,可以先观望权限体系是否成熟。## 结尾这次 DevDay 有一个信号很清楚:大模型厂商竞争的焦点,正从"单次答得多好"转向"能不能长期、便宜、可控地干活"。对打工人来说,这既是工具升级,也是提醒——能被拆成稳定长流程的活,正在被优先接管。你所在的岗位,哪些工作是这种"长流程"?评论区聊聊。