Anthropic 公布 AI 发展度量指标,为行业比较提供统一标尺!
2026/9/19 4:38:25 网站建设 项目流程

【导语:在 AI 发展竞争激烈,营销话术频出的当下,Anthropic 换了思路,拿出实验室内部数据,给出了一套可测量的 AI 发展指标,还提出相关政策动作,为行业发展提供了新参考。】


Claude 主导近 26% AI 研发工作

Anthropic 发布的第一份度量是“AI 主导研发(AI - led R&D)”。它借用 Epoch AI 的自动化分级,统计 Claude 在公司内部研发中的角色。截至 2026 年 8 月,Claude 在任何抽样任务子集上都未完全自主,但已主导了约26%的 AI 研发工作,处于“AI 协作”及以上水平的工作占比超90%。这表明“AI 参与研发”已成为日常,不过距离“递归自我改进”(RSI)中 AI 完全自己改自己还有距离。

智能体监督:低拦截率保障研究安全

第二份量的是“对 AI 智能体的监督”。Anthropic 最常用的内部平台上,任意时刻约有 3 万个智能体在进行研究和工程。监督分在线和离线两层,在线监视器实时查看,覆盖率达 100%,离线监视器事后审查。每周约 10 万份转录被审查,约 50 份升至人工处理。在超 10 亿个决策里,只有0.002%(约 1/47000)被拦截,监视器每千个会标记 1 到 2 个,低拦截率显示出其监督机制的有效性。

算力分配:6% 与 12% 凸显安全投入

第三份度量是“算力分配”。Anthropic 抽查 7 月 13 到 20 号那一周的全部算力,发现投入 AI 研发的算力里约6%给了安全方向,AI 主导研发的算力里约12%用于安全。且这些是“刻意保守”的估计,深意在于算力是 AI 研发中“最可验证的输入”,算力分配是调控 AI 发展的关键杠杆。

政策动作:统一标尺促进行业交流

Anthropic 不仅公布数据,还有政策动作。它明确要把独立第三方评估者嵌入实验室,给予对等访问权限,还在推 AAIF 政策提案。其立场是鼓励其他前沿实验室用同一套标准公布数字,虽这些数字绝对值未必出色,但为“怎么比较”定了统一标尺,在行业各说各安全的环境下,提供了交流的基础。

编辑观点:Anthropic 公布度量指标和政策动作,为 AI 行业发展提供了量化参考和交流方向,有助于行业规范发展,但后续还需更多实验室响应和实践来完善。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询