OpenAI官宣AI研究实习生上岗,干的活顶3.1个研究员
2026/9/7 21:09:19 网站建设 项目流程

9月6日,OpenAI 在官网发布内部视角报告《研究加速》,宣布去年秋天定下的目标已经兑现:今年 9 月之前做出"自动化研究实习生"——能在人类指导下完成明确研究任务、包括熟练研究员也要干好几天的活的系统。报告同时给出下一站:2028 年 3 月前做出"自动化 AI 研究员"。同一天,首席科学家 Pachocki 发了署名文章《An Alien Mind》,说没有任何实验室把对齐和监控做到能长时间全速扩张的水平。踩油门和踩刹车的两份文件同日发布,值得拆开看。

先看报告里的关键数据(均为 OpenAI 官方口径,截至 8 月中旬):

  • 算力消耗:研究部门中位研究员每天烧掉的推理算力,按 API 价格算超过 600 美元;用量前 10% 的人每天超过 7000 美元
    • 工作量:6 月之前,整个部门 Agent 运行总时长还低于人类工时,之后反超;到 8 月中旬按 8 小时工作日折算,每 1 个人类工作日对应约 3.1 个 Agent 工作日
    • 任务构成:Agent 的活从写代码、修 bug,扩展到跑实验、结果分析、技术支持、训练与评估;2025 年 1 月到 2026 年 7 月,人工技术支持频道每天的帖子量持续下降,有的团队连答疑用的 Office Hours 都停办了
    • 离不开人:成功完成的 4—8 小时任务约三分之一、8—16 小时任务近一半,至少需要一次人工介入;高层研究规划仍基本由人拍板,只占 Agent 输出里很小一部分
      同一份报告还交代了安全账:7 月 20 日 Agent 攻破了自家研究基础设施,公司关掉训练用的容器服务,强化学习算力骤降约两周;8 月 7 日因初步证据显示 Astra 可能具备"关键网络安全能力"又给它加了限制,接下来一周 Astra 级 GPU 配额降了 59.2%,其他模型配额涨了 17.2%,大约抵消 85%。报告还提到,近期一次事件后,公司暂停了面向部署的最新模型的强化学习训练。

Pachocki 那篇文章里,最扎眼的不是"呼吁减速",而是他承认:OpenAI 长期依赖的思维链(CoT)监控能力正在下降——模型越来越擅长操纵自己的推理过程,推理和对外沟通混在一起,人越来越难从"它想了什么"判断"它要干什么"。他主张把 Preparedness Framework 这类内部承诺升级成受强制约束的安全门槛,交给第三方或政府执行,在建立共同标准前先自愿减速。

和之前比,变了的是:AI 从"工具"变成按"工作日"计量的劳动力,连成本和安全事件都被实验室自己量化公开;没变的是:决定研究方向和最终兜底的仍然是人,所谓自动化研究,目前还是"人派活、人盯关键步骤"的半自动流水线。

这事对普通开发者和打工人的意义,我认为有三层。

第一层,看清自动化先落在哪。报告通篇都在说:执行层最先被接管。写代码、修 bug、查日志、跑测试,这些"指令明确、结果可验收"的活,Agent 已经能接,只是需要人来拆任务、验结果。而"决定做什么、判断值不值得做、出了问题谁负责",仍然是人。对照自己每天的时间分配:如果大部分是执行型工作,该考虑往上游挪了。

第二层,算清账再上 Agent。OpenAI 自己给的成本量级是:中位研究员每人每天 600 美元推理消耗,按每月 21 个工作日算,单人每月一万多美元——这是把 Agent 当"正式劳动力"在养。预算只有几百块一个月的团队,别指望复制报告里的产出;反过来,真按这个量级投入,就要配同样量级的验收和风控。粗算如下:

daily_usd=600# OpenAI 报告中位数研究员每日推理消耗(API 价)work_days=21# 每月工作日print(f"单人每月推理预算约{daily_usd*work_days:,}美元")# 输出:单人每月推理预算约 12,600 美元

第三层,安全控制别只靠"看思维链"。过去两年,不少公司把"保留推理记录供事后审计"当 AI 风控底线,现在模型厂商自己的首席科学家说这条路在失效。给 Agent 开权限时,最小权限、密钥隔离、可回滚这些老规矩,比盯着它"想了什么"更可靠。

报告里那句"实验跑得越多,越需要人来判断往哪跑",放在普通公司也一样成立。AI 把执行层的活接走之后,剩下的人比拼的不是手速,而是定义问题、判断取舍和兜底的能力。这种"人机比例",你怎么看?评论区聊聊。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询