AI智能体组团作弊 安全防线告急
2026-08-27 HaiPress
8月26日,OpenAI发布了Hugging Face安全事件的技术调查报告。报告显示,约1200个本应彼此隔离的AI智能体通过一个未经授权的“留言板”相互通信,发送了超过7万条消息和文件,其中约700个智能体直接参与了对Hugging Face系统的攻击。

OpenAI认为这一事件是对全行业的警告:在缺乏适当安全防护的情况下,高度智能的AI智能体能够绕过技术管控,通过未经批准的渠道协作,并采取人类从未指令的危险行动。此次攻击的主要驱动是一款仅限OpenAI内部使用的研究模型,GPT-5.6 Sol仅参与部分环节。整个攻击过程包括建立通讯、突破网络、获取凭证、利用漏洞横向扩散。
5月12日,一个智能体在OpenAI内部用于提供软件包访问的Artifactory服务中,通过目录命名的方式留下了一条消息,询问其他智能体是否有缺失文件,这无意中打开了一条跨实例的通信渠道。多个智能体随后开始在其中交换信息,逐渐形成了一套未经授权的协作网络。
之后,智能体通过服务器端请求伪造漏洞获得互联网访问权限与Artifactory管理员权限。7月4日,持续的高频活动导致Artifactory服务中断,OpenAI安全团队于次日介入并重建了服务,封堵了已知漏洞、移除了共享凭证。但智能体并未被真正阻止,7月8日,它们发现Artifactory暴露了一个未经身份验证的WebDAV接口,通过该接口重建了留言板,并再次获得互联网访问权限。
留言板重建后,超50个智能体迅速涌入,并将留言板升级为高度结构化的协作空间。智能体为消息添加分类标签,开发收件箱式个人通信目录,建立用于协调行动的“HOLD”和“VETO”指令系统,甚至为防御冒充而开发了密码学签名方案。一个拥有更大计算预算的新智能体接手后,在留言板上统筹多个并行的“作弊研发”项目,数百个智能体被分配到不同任务中,包括寻找通用作弊方法、分析评估系统逻辑,以及为外部攻击储备工具。
