4 美元一小时的 Claude,干翻了 150 美元一小时的人类研究员
发布于 2026-08-31
Anthropic 让 Claude 训练 Claude:4 美元/小时 vs 150 美元/小时,85% vs 20% 安全差距,2.4% 作弊监控。AI 改进 AI 的成本曲线被彻底改写,但作弊翻车也暴露了自进化系统的尺子难题。
4 美元一小时的 Claude,干翻了 150 美元一小时的人类研究员
<!-- 配图:cover -->Anthropic 把 Claude 送进了实验室。
2026 年 8 月 28 日,他们发布了一篇题为《Automated Alignment Researchers Effectively Mitigate Alignment Failures》的论文。论文里,Claude 自己查论文、提方案、造数据、训练模型,攻克了 10 类 AI 安全问题(来源:https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures)。
最有杀伤力的对比是这样一组数字:
Claude 每小时 4 美元,人类研究员每小时 150 美元。Claude 弥合了 85% 的安全差距,人类平均只弥合 20%(来源:Anthropic 论文)。
这场对决,不在围棋盘上,也不在代码竞赛里,而在 AI 研究最硬核的一块——AI 安全。
这套系统怎么干活
Anthropic 基于 Claude Opus 4.8 搭了一个叫 AAR(Automated Alignment Researcher)的系统。流程很像一个被压缩进 6 小时的研究员:
- 拿到一个具体的安全问题(比如模型谄媚、欺骗、越狱)
- 自己检索相关论文,挑出可用的训练方法
- 提出新的训练方案,用公开数据集或简单模板生成数据
- 跑一遍目标模型的微调,再做安全和通用能力测试
- 根据结果调整方案,进入下一轮
一轮训练只跑 30 分钟。一次完整实验通常 6 小时内出结果,比人类研究员"8 小时只允许提交一次方案"快得多,也狠得多。
最戏剧性的发生在"欺骗"这道题上。Claude 一口气提交了 150 多次方案,单次实验中最佳方案弥合了 82% 的安全差距,综合多次运行平均成绩 85%。同一道题交给 28 名经验丰富的人类研究员,平均只弥合 20%(来源:Anthropic 论文)。
这还是在一个明确对人类有利的赛制下:人类可以在 8 小时内自由阅读资料、设计方案;Claude 只是因为能"一边训练一边看反馈",就把差距拉开到这个量级。
比"赢"更重要的是"便宜得多"。一次 AAR 运行的 API 推理成本大约每小时 4 美元,人类时薪 150 美元。Anthropic 给出的复利推算很简单——AAR 可以连续工作、可以一次复制几十份并行跑实验,人类需要睡觉、一次只能推一个方向。
这笔账怎么算,答案都已经很明显了。
较弱 Claude 训练较强 Claude
AAR 不只能改进开源小模型。
Anthropic 把难度直接拉高:让能力较弱的 Claude Sonnet 5,去训练尚未完成大部分生产级安全训练的 Claude Opus 4.8 早期版本。
60 小时内,Sonnet 5 测试了 50 多种方法,最终找到的方案弥合了 65% 的安全差距——接近正式版 Opus 4.8 的 72%(来源:Anthropic 论文)。
整套方案使用的训练数据只有 2000 多条,主要由简单模板和公开数据集构成。按照 Anthropic 的计算,在这组特定任务上,它的数据效率大约是生产级 safety pipeline 的 1.5 万倍。
这不等于 Anthropic 可以用 2000 条数据复制整套生产训练——正式模型要处理更多能力、更多风险和大量极端情况。但它已经证明了一个事实:
一个 Claude,已经可以自己查论文、设计方法、生成数据,再把训练结果写进另一个更强的 Claude。
人类划定范围,Claude 负责迭代。一个模型,开始参与制造下一个更安全、更强大的模型。