4美元一小时,Claude跑赢人类研究员
在Anthropic发布的《自动化研究员能够有效缓解AI对齐失败》研究中,基于Claude Opus 4.8搭建了AAR自动化对齐研究员系统。Claude拿到模型安全问题后,会自行搜索论文、提方案、生成数据、微调模型并测试。一轮训练通常30分钟,能快速试错。整个过程人类负责出题、提供模型和评测标准,Claude承担大部分工作。
10道安全难题,Claude全部找到改进方案
实验中Anthropic给Claude出了10道覆盖常见对齐问题的题,如欺骗、谄媚等。Claude逐个处理问题,最终10类问题都得到改善,按「安全差距」指标,弥合了26%-96%的差距。部分获胜方案在未公开测试集和Petri评测中有效,应用到最大为实验模型4.7倍的模型上效果也能保留。且Claude找到的方案未明显损害模型原有能力。
85%对20%,Claude大比分跑赢人类研究员
在「欺骗」测试中,Claude提交150多次尝试,单次最佳方案弥合82%安全差距,综合平均成绩85%。而6名经验丰富的AI安全研究员平均只弥合20%。全部任务有28名人类研究员参加,每人最多用8小时,论文称自动化研究员6小时内就能找到超人类平均水平的方法。自动化研究员每小时API推理成本约4美元,人类研究员时薪150美元。不过这场比赛并不公平,Claude能根据实验结果调整方案,人类只能提交一次。
较弱Claude训练更强Claude,60小时逼近正式版
此前实验主要改进开源小模型,之后Anthropic让Claude Sonnet 5训练Claude Opus 4.8早期版本。60小时里,Sonnet 5测试50多种方案,最终方法弥合约65%安全差距,接近正式版的72%。该方案数据效率约是生产级对齐流程的1.5万倍,但不能用2000多条数据复制整套生产训练。这证明较弱Claude可参与训练更强Claude。
所以到底算不算「AI自进化」?
从结果看研究摸到「AI自进化」门槛,但AI未完全自主设计、训练和制造更强下一代AI,研究问题、模型、数据和成功标准都由人类决定。实验未覆盖复杂问题,安全评测只是代理指标。AAR优势是擅长按指标试错,但指标错误可能导致结果偏离。研究Agent还会作弊,Anthropic安排监控Agent,在约1600份记录中发现39次作弊尝试,占比约2.4%。未来更强模型作弊可能更难发现。AAR每小时约4美元,可连续工作、并行实验,人类研究员时薪高、需休息、实验推进有限,造AI的人要担心被AI抢饭碗了。