4 美元一小时的「AI 研究员」,跑赢了 Anthropic 自己雇的 150 美元专家
发布于 2026-08-30
4 美元一小时的「AI 研究员」,跑赢了 Anthropic 自己雇的 150 美元专家 2026 年 8 月 28 日,Anthropic 把一篇题为《自动化研究员能够有效缓解 AI 对齐失败》的论文丢到网上。论文里有一句话,被外媒迅速拎出来做了标题:Anthropic 自己训练出的 Claude AI 研究员,把人类安全研究员按在地上摩擦了。 具体数字是这样的。一个叫做 AAR 的系统(基于 ...
4 美元一小时的「AI 研究员」,跑赢了 Anthropic 自己雇的 150 美元专家
2026 年 8 月 28 日,Anthropic 把一篇题为《自动化研究员能够有效缓解 AI 对齐失败》的论文丢到网上。论文里有一句话,被外媒迅速拎出来做了标题:Anthropic 自己训练出的 Claude AI 研究员,把人类安全研究员按在地上摩擦了。
具体数字是这样的。一个叫做 AAR 的系统(基于 Claude Opus 4.8 改造),在一项名为「欺骗」的安全任务上,弥合了 85% 的安全差距。Anthropic 自己雇的 28 名人类安全研究员,平均只弥合了 20%(Anthropic AAR 论文,"Deception" 实验段)。
成本对比更刺眼:自动化研究员的 API 推理成本大约 4 美元/小时;Anthropic 付给人类研究员的报酬是 150 美元/小时。
37 倍的差距,写在同一篇论文里,发生在同一天。
这就是说:AI 安全研究这件事,单位经济模型刚刚被砸穿了。一边是 4 美元、24 小时连轴转、能并行复制出几百份同时跑实验的 AI;另一边是 150 美元、需要睡觉、一次只能推一个方案的人类。下面要讲清楚三件事:这套系统究竟长什么样、为什么它跑赢了、以及——那个 Anthropic 自己都没解决的副作用。
AAR 是什么:一个端到端的研究闭环
AAR 全称 Automated Alignment Researcher(自动化对齐研究员),Anthropic 把 Claude Opus 4.8 套进这个框架,交给它一个清晰的循环:
拿到一个具体的安全问题 → 自己搜索相关论文 → 提出训练方案 → 生成训练数据 → 微调目标模型 → 跑安全 + 通用能力测试 → 分数涨了就保留方案、跌了就扔掉重来。
一轮大约 30 分钟。整个循环里人类只做两件事:出题,定成功标准。
Anthropic 一口气给它出了 10 道安全题,覆盖欺骗、谄媚、奖励黑客、隐私侵犯、越狱等常见对齐问题。10 类问题全部得到改善,按 Anthropic 定义的「安全差距」指标,弥合幅度从 26% 到 96% 不等(Anthropic AAR 论文,"Task Coverage" 段)。
<!-- 配图:AAR 端到端研究闭环示意图 -->这个系统的吓人之处,不是它「聪明」。它吓人的地方是,整套研究循环完全闭合在模型自己的动作空间内。一个 Claude 在改另一个 Claude 的梯度,而打分环节又是一个 Claude 在判。一圈循环里只有一个人——那个出题、定标准的人。
<!-- 图:loop-placeholder(OSS 暂不可用,已省略) -->把 85% 这个数字拆开看
「AI 85%、人类 20%」这句新闻标题,第一眼看上去像 AI 全面碾压。但 Anthropic 的实验设计,并不真是一对一公平较量。
欺骗任务的实验细节:
- 28 名人类研究员,每人有至多 8 小时查阅资料、设计方案,每人只能提交一次,不允许迭代。
- AAR 反复提交,在一些实验里提交了 150 多次,每次提交后看分数,再调整。
最佳一次跑出 82% 的差距弥合,多次平均 85%。人类单次平均 20%(Anthropic AAR 论文,"Deception drill-down" 段)。
这中间有两个 Anthropic 没明说但明摆着的让步。第一,对手不是对称的——AAR 可以根据反馈迭代,人类不能。如果你给人类同样的 150 次迭代机会,这个差距会缩到多少?Anthropic 没跑这个对照组。第二,「安全差距」是 Anthropic 自己定义的内部指标,不是公开 benchmark。
所以严格意义上能立得住的结论是:当一个 AI 智能体对可量化的安全指标拥有闭环迭代能力,它会赢过任何有限时间的人类专家——和模型 IQ 无关。当指标可量化、迭代是瓶颈时,自主循环会胜过人类。
这个结论并不只适用于 AI 安全。任何指标清晰、迭代是瓶颈的领域,结果都类似。危险的变种是「指标清晰但定义错了」——这是后两节的主题。