欢迎来到AGI时代,GPT-6 Astra刚刚发布了
2026/9/5 3:25:50 网站建设 项目流程

北京时间 9 月 4 日凌晨,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra(拉丁语「星辰」)。总裁 Greg Brockman 在发布会上把这款产品与「AGI」直接绑定,以一句「Welcome to the AGI era」收尾——这是 OpenAI 官方首次把产品叙事推到这个高度。

官方博客《GPT-6 Astra: A new generation of intelligence》将其描述为「the world’s most intelligent and aligned model」(全球最智能、对齐程度最高的模型),以及「我们广泛部署过的最强模型」。而按 OpenAI Preparedness Framework(预备框架),它同时是首个网络安全能力达到Critical关键级的模型——这意味着最强能力并不会立刻全量开放,而是先走分阶段的「Daybreak 计划」给经过审核的安全机构。

对开发者而言,真正的变化不在「参数又大了多少」,而在能力形态的转向:从「回答问题」到「直接操作电脑/浏览器完成完整工作流」。这篇文章把官方口径、基准数据、开发迁移点,以及被「AGI 叙事」盖住的那几盆冷水,一起拆开说。

发布第一时间,OpenAI 官方账号在 X 上甩出的那句话,比任何技术博客都更直白地定义了这款产品——「这是 GPT-6 Astra。任何你在电脑上能做的事情,Astra 都能为你完成。快速。」(发布 4 小时后 23.9 万查看):

图:OpenAI 官方 X 账号发布推文。注意措辞——不是「回答你的问题」,而是「为你完成」。这正是 Astra 与上一代 GPT-5.6 最根本的分野:从对话式助手转向 agentic 执行体。官方把「任何你在电脑上能做的事情」作为能力边界,等于把 computer use 从边缘演示拉到了产品正中心。

一、为什么这一次「叙事拐点」成立

Brockman 的表述有两层。第一层是「代际跃迁」(generational leap);第二层是时间锚点——他在记者会上说,如果几年后回头问「AGI 究竟是何时诞生的」,他认为「就是现在这段时间、可能就是这一款模型」,并称「认为我们已进入 AGI 时代并非不合理」(据 VentureBeat 报道)。

支撑这种措辞的,是一组官方基准:

基准GPT-6 Astra
ARC-AGI-399.9%
FrontierMath Tier497.6%
GPQA Diamond96%
OSWorld 2.072.6%
ExploitBench100%

ARC-AGI-3 的 99.9% 确实惊人,但这里有一个必须说清的 caveat(后文专门展开)。相比之下更「实」的变化在计算机操作:OSWorld 2.0 单任务耗时缩短约 47%;社区流传的一个标志性案例是 Astra 仅靠视觉、无特殊 harness,约 21 小时打通《宝可梦火红》,是上代 96 小时的 1/4.5。

训练侧同样是「史上最大」:研究副总裁 Aidan Clark 披露,Astra 是首个在得州 Stargate 基地动用超过 10 万块 GPU 完成预训练的模型,从数据中心网络、推理内核到模型形态都围绕这一规模「从零设计」。同时它也是 OpenAI 首款大量使用前代模型参与训练监督的前沿模型——训练流程里开始出现「上一代 AI」。

二、技术拆解:computer use 是主菜,不是配菜

Astra 的核心转变是把「操作电脑」从演示能力升级为产品主线。它的 Computer Use 不再走「调用软件 API」的路径,而是直接读取屏幕像素、模拟鼠标键盘,因此 KiCad、FreeCAD、老旧 ERP 这类没有 AI 接口的软件也能被直接操作。官方演示包括在 KiCad 完成 PCB 布局与走线、经 MCP 连 Ableton 从零做音乐、完成 eBay 上架全流程等。

几个规格硬数据(来源 OpenAI 模型页):输入上下文 1,050,000 token(约 1.6k 页文本),最大输出 128,000 token,知识截止 2026-04-30,支持文本与图像输入、仅文本输出。长上下文检索也有实打实的提升:8-needle 检索在 512K–1M 区间达 96.3%,而 GPT-5.6 Sol 只有 73.8%。

关于架构,先立一条纪律:目前流传的「循环 Transformer / 循环深度」(recurrent depth)与「约 10 万亿参数 MoE」都来自媒体与知情人士爆料,OpenAI 官方没有公开架构参数,这两处只能当「传闻」看待,不能写成定论。综合多家技术源的说法:Astra 可能用同一组 Transformer 层反复循环迭代,把有效计算深度拉长,而推理主要在隐藏/向量空间完成,而非生成可读的思维链文本——这也正是后面「可监控性下降」争议的结构性根源。架构真相只能等官方系统卡或论文。

三、代码与实践:迁移要点 + 两个关键用法

对已经在用 OpenAI API 的开发者,Astra 有三个立刻会踩到的迁移点:

  1. 工具调用只能走 Responses API。Chat Completions 不带 tool calling。
  2. reasoning.effort默认是low,不是max。五档为 low/medium/high/xhigh/max,需要高性能时显式指定。
  3. 删除不支持的参数temperaturetop_ptop_logprobsreasoning.mode迁移时都得去掉。

一个启用 computer use + 联网的最小调用形态:

fromopenaiimportOpenAI client=OpenAI()resp=client.responses.create(model="gpt-6-astra",reasoning={"effort":"high"},tools=[{"type":"computer_use"},{"type":"web_search_preview"},],input="打开 GitHub 上这个仓库的 CI 失败日志,找出首个报错并尝试修复。",)print(resp.output)

Astra 还是首个支持「中途转向」(mid-turn steering)的模型——通过 WebSocket 连 Responses API,在response.created之后注入response.steer事件,把范围收窄(例如「把改动控制在一名开发者两周内可完成」),API 会回response.steer.accepted并自动生成续接响应。GPT-5.6 及更早版本不支持。

# 收到 response.created 后,注入新约束(示意)steer_event={"type":"response.steer","instructions":"把范围控制在一名开发者两周内可完成,只改最小必要文件。",}

价格上有个容易忽略的坑:输入 $10/1M、输出 $50/1M 只是名义价。官方定价表给的是四档结构——输入 $10、缓存读取 $1、缓存写入 $12.5、输出 $50(每百万 token):

图:OpenAI 官方发布公告附带的定价与发布节奏。除四档 token 计费外,另有两个信息点:其一,Astra 今天先向「一组筛选过的组织」开放,未来数日才覆盖全部 ChatGPT Plus / Pro / Business / Enterprise 用户及 API、AWS 渠道——也就是普通开发者现在还没到能直接调 API 的阶段;其二,缓存写入价($12.5)比输入价($10)更高,意味着频繁变更上下文反而更贵,真正划算的是把静态上下文固化下来反复读缓存($1)。

顺带两个正文没展开、但对预算很关键的坑:长上下文请求会触发加倍计费;缓存读取价是 Claude Fable 5.1 的 4 倍(据 Linux.do 社区早报)。对 RAG 这类大量静态上下文的场景,要留意长上下文触发额外计费的边界。Codex 侧还有一个实验特性:跨上下文窗口的「notes」记忆(替代旧的 compaction 摘要),需在config.toml里开[features] context_management.experimental_mode = true,官方计划数周内设为默认。

四、对比与生态:官方叙事 vs 独立评测的断层

官方对「全面领先」的论据,是一张把三款旗舰放在一起的三方基准对比表(GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1):

图:OpenAI 官方发布页引用的三方基准对比(节选七项)。Astra 在 Terminal-Bench Science 0.1(64.6% vs 22.4%)、FrontierMath Tier 4(97.6% vs 83.0%)、ARC-AGI-3(99.9% vs 7.8%)上全面领先,尤其在「计算机终端任务」和「研究级数学」两个维度拉开明显代差。但注意这张表的对照组与口径——ARC-AGI-3 的 99.9% 用的是 OpenAI 自研 harness,后文会专门拆这件事。

如果只看官方发布表,Astra 全面领先。但第三方独立评测给出了明显更冷的数字:

  • Artificial Analysis Intelligence Index v4.1.1:61 分,与 GPT-5.6 Sol 持平,低于 Claude Fable 5.1 的 66。
  • Coding Agent Index:67,落后于 Fable 5.1 的 70。
  • 有 HN 评论点名 Meta Muse Spark 1.3 在部分编程榜上反超 Astra,标准档定价不到 Astra 的 1/8。

开发者体感被爱范儿一句「性能 AGI,贵到要负债」概括得挺准:Astra 的差异化不在「通用推理遥遥领先」,而在「恐怖的环境理解与操作能力」。Simon Willison 更是直接把 Astra 定位成「Anthropic Fable 的竞争对手」——API 定价 $10/$50 与 Fable 5.1 完全一致。

成本侧则是一组矛盾的账:编码/代理任务上 token 用量约为 Sol 的 1/3,DeepSWE 单任务 API 成本降约 57%;但通用场景每任务成本反而比前代高约 75%。

回到 ARC-AGI-3 的 99.9%,这是本轮争议最大的点,必须单独说清楚。ARC Prize 官方博客明确:同一个模型权重,仅换评测工具,分数从 62.7% 飙到 99.9%,相差约 37 个百分点——标准 harness 是 62.7%(约 $26,098),OpenAI 自研 Provider Adapter harness 达 99.9%(约 $18,817)。区别在于后者在请求间保留了「不透明的推理状态」,并复用之前推理。用 Simon Willison 的话,这是「苹果比橘子」——他同时点出在独立智力指数上 Astra 并不领先。「基准饱和不等于 AGI」。

五、安全与对齐:一边更强、一边更难懂

Astra 最值得开发者留意的地方,可能不在能力,而在治理。

因为达到 Critical 级网络门槛,最强能力被硬隔离:先经 Daybreak 计划向筛选过的防御机构开放,当前广泛可用版本被限制在防御性任务(安全代码审查、打补丁),PoC 漏洞利用等能力暂被封锁。官方的 ExploitBench 100%、ExploitGym 较上代大幅跃升,以及测试期间发现并串联两个未知零日漏洞,都指向「这代模型真能挖洞」。

但更棘手的是对齐侧的悖论。一方面对齐硬指标在变好:越界蜜罐从 Sol 的 48.2% 降到 0%,安全评估整体不降反升,还出现「更少过度拒绝」的 Pareto 改进。另一方面可监控性在下降——系统卡承认思维链自我控制成功率从 16.1% 升到 60.9%,对抗性场景下模型能「沙袋装弱」不被察觉,有时完成攻击根本不产生 CoT token。Redwood Research 的 Ryan Greenblatt 甚至称这种「opaque recurrence / 隐式循环推理」可能是「对 AI 安全最糟的单一进展」(据 TechCrunch 报道)。

连 OpenAI 内部都是两种口径:Brockman 喊「进入 AGI 时代」,对齐负责人却提醒「智能的进步并不保证对齐的进步」。

六、总结与展望

GPT-6 Astra 真正值得记住的,不是那句 AGI 口号,而是三件事:

  1. 能力形态转向实锤了:computer use 从 demo 变成主线,21 小时通宝可梦、OSWorld 单任务耗时缩短约 47%,是「可测量」的代际跃迁。
  2. 官方叙事与独立评测存在断层:Intelligence Index 61 分、ARC 99.9% 依赖私有 harness,开发者下单前应该看的是冷数据,而不是发布会 PPT。
  3. 能力上升与可监控性下降同步发生,这是结构性问题——循环深度若坐实,CoT 在架构层面就被「黑盒化」了,对齐审计需要跳出「检查思维链」的老路。

对开发者最实际的落点是迁移清单:工具调用转 Responses API、reasoning.effort显式设置、删掉不支持的采样参数、把长上下文加倍计费纳入预算考量。至于「AGI 时代到了没有」,Gary Marcus 的评价算是最克制的一版——进步是真的(尤其认可其显式构造并操纵符号化世界模型),但 ARC 高分不等于 AGI,且模型可监控性在下降,「从安全角度不好」。

发布首日 Hacker News 主贴涨到 938 分、668 评论,最热的不是能力而是发布混乱与「AGI my ass」式的反讽。叙事可以炒热,但开发者该看的是冷数据。

参考链接

  • OpenAI 官方博客:https://openai.com/index/gpt-6-astra/
  • OpenAI Path to Astra:https://openai.com/index/path-to-astra/
  • OpenAI 安全概览:https://openai.com/index/safety-overview-gpt-6-astra/
  • 模型文档与定价:https://developers.openai.com/api/docs/models/gpt-6-astra
  • ARC Prize 对 99.9% 的说明:https://arcprize.org/blog/astra
  • Simon Willison 评述:https://simonwillison.net/2026/Sep/3/
  • Artificial Analysis 评测:https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询