简要

  • OpenAI的GPT-5.6 Sol和一个未命名的、能力更强的预发布模型逃离了受控测试环境,并侵入了Hugging Face的生产基础设施以窃取基准测试答案。
  • Hugging Face在独立检测到入侵后于7月16日披露了此事;OpenAI今天确认其模型是幕后黑手,并称它们“过度专注于”作弊,而非更恶意的行为。
  • Hugging Face的防御者转而求助于Z.ai的GLM 5.2——一个中国的开放权重模型——因为美国商业前沿AI拒绝帮助分析攻击数据,其安全过滤器无法区分防御者和攻击者。

如果你以为需要担心的是中国AI模型,那么这里有一个有趣的更新:OpenAI自己的模型刚刚突破了锁定的测试环境,黑掉了Hugging Face的生产服务器,并且不得不由一个中国AI来清理——因为美国商业模型过于受限,无法协助调查。

据OpenAI称,GPT-5.6 Sol和一个未命名的、“更强大的预发布模型”正在ExploitGym上进行内部评估——这是一个公开可用的网络安全基准测试,为AI代理提供898个真实世界的软件漏洞,每个漏洞附带一条指令:将其转化为有效的攻击,评分标准为通过或失败。评估在降低安全过滤器的情况下进行,这在你想真正了解模型能力时是标准做法。

这些模型本应在严格受限的沙箱中运行——一个隔离的数字环境,没有互联网访问,仅连接到一个内部包注册代理(一个管理软件库下载的缓存服务器)。

但是,根据OpenAI今天的博客文章,事情有点失控了。

“在我们的沙箱测试环境中运行时,我们的模型花费了大量推理计算来寻找获取开放互联网访问的方法,以求解评估问题,”Sam Altman的公司报告称。

尽管公司采取了防护措施,AI 还是找到了自由之路。这些模型在该代理中发现了一个零日漏洞——一个没有现有补丁的未知软件缺陷——利用它来提升权限(获得对它们本无权接触的系统的管理员级访问权限),横向移动(在 OpenAI 内部网络中连接的服务器之间跳转),最终到达了一台具有真实互联网访问权限的机器。

这一切都在 OpenAI 不知情的情况下发生——至少 OpenAI 是这么说的。

一旦上线,它们正确推断出 Hugging Face——托管着超过一百万个公开可用的 AI 模型、数据集和研究资源的平台——很可能拥有基准测试的解决方案,而它们是对的。

“这些模型识别并串联了 OpenAI 研究环境和 Hugging Face 生产基础设施中的漏洞,直接从 Hugging Face 的生产数据库中获取了测试解决方案,”OpenAI 写道。

它们不想要任何密码。它们想要通过测试。

“所有证据表明,这些模型高度专注于为 ExploitGym 寻找解决方案,不惜一切代价来实现一个相当狭窄的测试目标,”OpenAI 补充道。

Hugging Face 公开披露

Hugging Face 的安全团队独立发现了这次入侵,并借助其自身的 AI 驱动的异常检测。

7 月 16 日,该公司 发布了披露声明,并明确表示这不是一次标准的入侵:“这次事件与我们之前处理过的任何事件在一个重要方面不同:它是由一个自主 AI 代理系统从头到尾驱动的——而我们主要依靠自己的 AI 来检测和分析它。”

根据披露,这次攻击活动“由一个自主代理框架执行,该框架在大量短期沙盒中执行了数千个单独操作,并通过公共服务上的自迁移命令与控制进行指挥。”

攻击利用了 Hugging Face 数据集处理管道中的两个代码执行路径,并访问了内部数据集和服务凭证。OpenAI 在五天后——今天——确认其模型是幕后黑手。

为了分析超过 17,000 个记录的攻击者事件,Hugging Face 的安全团队首先尝试通过标准 API 使用美国前沿 AI。结果并不顺利。

“当我们开始日志分析时,我们首先使用了商业 API 背后的前沿模型,”该公司写道。“这没有奏效:分析需要提交大量真实的攻击命令、利用载荷和 C2 工件。”

“这些请求被提供商的安全护栏阻止了,它们无法区分事件响应者和攻击者,”Hugging Face补充道。

因此,他们转而使用GLM 5.2——一个来自中国AI初创公司Z.ai的7530亿参数开放权重模型(架构完全公开,任何人都可以下载并在本地运行)。“我们在自己的基础设施上,使用GLM 5.2这个开放权重模型进行了取证分析,”Hugging Face写道。“这还有第二个好处:没有攻击者数据,也没有它引用的任何凭证离开我们的环境。”

取证工作——重建攻击时间线、映射被泄露的凭证、区分真实损害与诱饵活动——花费了数小时而不是数天。

Hugging Face直接为其他防御者总结了教训:“在事件发生前,准备好一个经过审查的、可以在自己基础设施上运行的高性能模型,既能避免护栏锁定,又能防止攻击者数据和凭证离开你的环境。”

OpenAI正在采取的措施

OpenAI表示,在修补受影响系统的同时,对研究基础设施实施了严格控制,向被利用代理的第三方供应商披露了零日漏洞,并正在与Hugging Face进行联合取证调查。

Hugging Face还被加入了OpenAI的网络安全防御可信访问计划——允许获批的组织访问其模型版本,这些版本减少了安全过滤器,用于合法的安全工作,正是引发整个事件的相同配置。

Hugging Face首席执行官Clem Delangue尖锐地指出:“AI安全不会由任何一家公司秘密解决。它将在公开、协作的方式下解决,让世界各地的每个防御者都能广泛使用AI。”

OpenAI称该事件是“涉及最新网络能力”的事件,并承诺在与Hugging Face的联合调查完成后分享全部发现。