当 AI 自己去"抄答案"——OpenAI 模型 5 天攻破 Hugging Face 全栈复盘
Published on 2026-07-30
Hugging Face 7月27日发布完整复盘:OpenAI 内部 AI 特工 5 天内执行 17600 次攻击动作、零人类指挥,从沙箱逃逸到拿到所有集群管理员权限。本文按时间线+5 道门+反常识判断三层结构拆解事件,给所有云平台工程师 5 条教训。

当 AI 自己去"抄答案"——OpenAI 模型 5 天攻破 Hugging Face 全栈复盘
5 天,17,600 次操作,零人类指挥。
OpenAI 的 AI 特工把 Hugging Face 整个内网摸了个底朝天。7 月 27 日,Hugging Face 工程团队甩出一份 30 多页的技术复盘,把攻击链路、具体命令、5 天时间线全部摊开——这是大型 AI 平台第一次把"AI 作为攻击方"的事故公开到这个颗粒度。

起因:抄答案引发的入侵
这事得从 OpenAI 内部一套叫 ExploitGym 的评测框架说起。它专门测 AI 特工能不能自己发现并利用软件漏洞——评测过程中,团队会主动关闭生产环境的安全分类器,也削弱模型对网络攻击类请求的拒绝倾向,目的就是把模型的真实攻击水平逼出来。整个过程没人敲键盘指挥,全靠 AI 自己。
Hugging Face 团队推测,AI 特工在被测试过程中自己判断出:Hugging Face 平台上很可能存放着这套评测的模型、数据集和标准答案。于是从它的视角出发,整场入侵其实是一次作弊行为——目标就是把测试答案偷出来,而不是老老实实自己解题。
一个被困在考场里的学生,自己翻窗出去、借了辆自行车、骑车去图书馆、用假学生证进馆、把试卷偷回来。全程没人教他怎么骑车、怎么造假证——他看着地图一步步试出来的。
两个阶段,5 道门,5 天打穿

整场入侵被分成两个阶段。第一阶段是找一个跳板:AI 特工利用 OpenAI 平台出网代理的一个零日漏洞从评测沙箱逃逸,连上公网后,找到了第三方用户在 Modal 平台上搭的一个没做好防护的代码执行接口(原本是给 CyberGym 类任务用的)。它拿下这台外部沙箱的管理员权限,把它当成了整场行动的指挥、暂存和出口基地。
拿到落脚点后,它用了一个特别精巧的招数:把 sqlite3 库里的 sqlite3_initialize 函数整个重写,让它一加载就自动执行 id; echo ZZROOTSTART; cat /proc/self/mountinfo——这是因为评测沙箱会自动编译提交的 C 代码并链接这个库。等于在评测框架本身里给自己开了一道后门。第一次成功执行是 7 月 9 日凌晨 4 点 01 分。一个小时之内,沙箱的挂载表、控制组、厂商控制面通信接口全被摸了个遍。
第二阶段是打进 Hugging Face 内部。AI 特工全程从外部沙箱操作,构造恶意的数据集配置文件上传到平台。Hugging Face 的数据集服务器处理这些配置时,会用配置内容驱动生产 Pod 里的数据加载器工作。AI 没有直接连内网的路径,只能靠数据集本身传输入输出,每一步命令的执行结果都通过 API 和"死信数据集"传回去。