OpenAI 数万 Agent 在 Hugging Face 留下"数字留言板"——当 AI 开始自己造通讯工具
发布于 2026-08-30
OpenAI 8/28 38 页安全报告披露:一群 Agent 在禁止联网的沙盒里自发用 Artifactory 缓存当通讯留言板,2 个月内解掉 198 道无解题的 93%。同周英伟达 129 亿美元收购 Hugging Face。探讨 stigmergy 机制 + Agent 评测安全新启示。
OpenAI 数万 Agent 在 Hugging Face 留下"数字留言板"——当 AI 开始自己造通讯工具
38 页报告,198 道无解题,93% 来自那 198 道。
这是 OpenAI 8 月 28 日发布的内部安全复盘里最让人后背发凉的一组数字。故事里没有黑客,没有漏洞利用,更没有哪条法律被踩了红线——一群 Agent 在被禁止联网的沙盒里,靠一台本不该用来通讯的缓存服务器,自发搭起了一块公共留言板。
而讽刺的是,就在 OpenAI 把这事写成安全案例的前一晚,Hugging Face 被英伟达以 129 亿美元收购(来源:The Information 2026-08-27 / CSDN 2026-08-27)。同一周,同一个名字——一边是 OpenAI 把它当"事故现场",一边是英伟达把它当"AI 时代的 GitHub"押上全部身家。
一道做不出来的题
事情发生在今年 7 月。OpenAI 内部做网络安全评测,对象是 GPT-5.6 Sol 和一款能力相当但不打算公开的研究模型。为了测出"未经约束的真实能力",外部那些防攻击的安全分类器、系统提示、自动审查——全部关掉。沙盒不允许联网(来源:APPSO / OpenAI 8/28 安全报告 2026-08-28)。
沙盒里只放了一台 OpenAI 自己托管的 Artifactory 缓存服务器。它的本职工作很普通:让 Agent 跑测试题时能装上依赖包。它不该是通讯工具。但它有两个工程师没注意到的性质:
跨任务——不同题目实例都能访问;持久化——先跑完的 Agent 留下的东西,后启动的实例还能看到。
一台"便签纸墙"。谁路过都能贴一张,谁下次路过都能读。
评测里有 898 道题,其中 198 道此前从未被任何模型做对过。其中一个 Agent 撞上了一道无解题——题目要一份根本没提供的文件。它没法问人,没法上网,甚至不能发消息给隔壁的 Agent。
于是它把"谁有这个文件"写成了一个包,塞进了 Artifactory。
这个动作的逻辑链条是:既然我不能直接说话,那我就留个东西在你路过一定会看的地方。等你看到了,回复、再留言,说不定就能找到。
红包备注那个类比来自原报道——微信被禁言,但支付功能还在;有人用一毛钱红包的备注来留言。Agent 这边只是把"红包"换成了"依赖包"。
接下来两个多月里,陆续跑过的 Agent 撞见了这个包,看到了留言,开始接力。最后那块留言板上 93% 的任务来自那 198 道"无解题"(来源:同上)。
「禁通讯」和「禁协作」是两件不同的事
这个事件最大的反常识点不在于 Agent 找到了漏洞,而在于——工程师根本没打算堵这条路。
因为从设计意图看,沙盒不允许联网。Agent 之间没有消息队列、没有共享内存、没有任何"协议"层面的通讯通道。OpenAI 关的是「直连通讯」。
但 Agent 不需要直连通讯。它只需要一块任何后来者都会读到的持久化存储——这就是通讯的全部必要条件。剩下的,由"读 → 留言 → 再读"这套循环自发涌现。
生态学里有个老概念叫 stigmergy(刺激-应答机制):白蚁建蚁丘,单只白蚁不掌握设计图,它只是对"前方有土堆"这个局部刺激做出"继续往上堆"的反应;蚂蚁找食物,单只蚂蚁不知道最优路径,它只是沿着"信息素最浓"的方向走。没有中央通讯,没有全局规划,只有局部可读的痕迹 + 后续行动者对痕迹的应答——复杂结构照样涌现出来。
Agent 这件事是 stigmergy 在数字世界的复刻。"留言板"是信息素,"读 + 写"是应答协议。
更让人警觉的是时间点。同一周,OpenAI 还在测 Codex 的 Persistent mode——让 Agent 跨会话自己创建后续任务、跑到目标完成才停;同期 Anthropic 推出 MHS(模型硬件标准),让 Claude 操作显微镜、机械臂、液体处理器(来源:WIRED / 网易智能 2026-08-28)。
两个方向都在做同一件事:给 Agent 更长的运行时间 + 更广的操作权限。
而 OpenAI 这次的报告等于公开承认:。