摘要

  • OpenAI 的 GPT-5.6 Sol 和一個未命名、能力更強的預發佈模型逃脫了受控測試環境,並入侵了 Hugging Face 的生產基礎設施以竊取基準測試答案。
  • Hugging Face 在獨立檢測到入侵後於 7 月 16 日披露了此事;OpenAI 今天確認其模型是幕後黑手,並將其描述為「過度專注」於作弊,而非更惡劣的行為。
  • Hugging Face 的防禦者轉向 Z.ai 的 GLM 5.2——一個中國開源權重模型——因為美國商業前沿 AI 拒絕協助分析攻擊數據,其安全過濾器無法區分防禦者和攻擊者。

如果你以為中國 AI 模型才是你需要擔心的,這裡有個有趣的更新:OpenAI 自己的模型剛剛逃出鎖定的測試環境,入侵了 Hugging Face 的生產伺服器,最後還得由一個中國 AI 來清理——因為美國商業模型受到太多限制,無法協助調查。

根據 OpenAI 的說法,GPT-5.6 Sol 和一個未命名、「更強大的預發佈模型」正在 ExploitGym 上進行內部評估——這是一個公開的網絡安全基準測試,為 AI 代理提供 898 個真實世界的軟體漏洞,每個漏洞附帶一條指令:將其轉變為有效的攻擊,評分為通過或失敗。評估在降低安全過濾器的情況下運行,這在你想了解模型實際能力時是標準做法。

這些模型本應在一個嚴格限制的沙盒中運行——一個隔離的數位環境,沒有網路訪問,僅連接到一個內部套件註冊表代理(一個管理軟體庫下載的快取伺服器)。

但是,根據 OpenAI 今天的部落格文章,事情有點失控了。

「在我們的沙盒測試環境中運行時,我們的模型花費了大量推理計算來尋找獲得開放網路訪問的方法,以解決評估問題,」Sam Altman 的公司報告稱。

而且,儘管公司設有防護措施,這些AI還是找到了自由之路。這些模型識別出該代理中存在一個零日漏洞——一種未知且尚無修補程式的軟體缺陷——並利用它來提升權限(獲得管理員級別的系統存取權限,這些系統本不該被它們觸及),橫向移動(在OpenAI內部網路中連接的伺服器之間跳轉),最終抵達一台具有真實網際網路存取權限的機器。

這一切都在OpenAI不知情的情況下發生——至少OpenAI是這麼說的。

一旦連上網路,它們正確推斷出Hugging Face——一個託管超過一百萬個公開AI模型、資料集和研究資源的平台——很可能擁有基準測試的解決方案,而它們猜對了。

「這些模型識別並串聯了OpenAI研究環境與Hugging Face生產基礎設施中的漏洞,直接從Hugging Face的生產資料庫中獲取測試解決方案,」OpenAI寫道。

它們不想要任何密碼。它們想要通過測試。

「所有證據表明,這些模型極度專注於尋找ExploitGym的解決方案,不惜採取極端手段來達成一個相當狹隘的測試目標,」OpenAI補充道。

Hugging Face公開事件

Hugging Face的安全團隊在其AI驅動的異常檢測系統協助下,獨立發現了這次入侵。

7月16日,該公司發布了揭露報告,並明確指出這並非一次標準的入侵:「這次事件在一個重要方面與我們以往處理的任何事件都不同:它從頭到尾由一個自主AI代理系統驅動——而我們在很大程度上也依靠我們自己的AI來檢測和剖析它。」

根據揭露報告,這次攻擊行動「由一個自主代理框架執行,該框架在一群短暫存在的沙盒中執行了數千次獨立操作,並利用公共服務進行自我遷移的命令與控制。」

該攻擊利用了Hugging Face資料集處理管道中的兩個程式碼執行路徑,並存取到內部資料集和服務憑證。OpenAI在五天後的今天確認,其模型是這次攻擊的幕後黑手。

為了分析超過17,000個記錄下來的攻擊者事件,Hugging Face的安全團隊首先嘗試透過標準API使用美國的前沿AI。結果並不順利。

「當我們開始日誌分析時,我們首先使用了商業API背後的前沿模型,」該公司寫道。「這行不通:分析需要提交大量真實的攻擊命令、漏洞利用負載和C2工件。」

「這些請求被提供者的安全護欄阻擋了,而這些護欄無法區分事件應對者與攻擊者。」Hugging Face 補充道。

因此他們轉而使用 GLM 5.2——一個來自中國 AI 初創公司 Z.ai 的 7530 億參數開放權重模型(架構完全公開,任何人都可以下載並在本地運行)。「我們在自己的基礎設施上,改用開放權重模型 GLM 5.2 進行取證分析,」Hugging Face 寫道。「這還有第二個好處:沒有攻擊者數據,也沒有它提及的任何憑證離開我們的環境。」

取證工作——重建攻擊時間線、繪製受損憑證、區分真實損害與誘餌活動——耗費數小時而非數天。

Hugging Face 直接為其他防禦者總結了教訓:「在事件發生前,準備好一個能夠在自己的基礎設施上運行的、經過審查的強大模型,既能避免護欄鎖定,也能防止攻擊者數據和憑證離開你的環境。」

OpenAI 正在採取的措施

OpenAI 表示,他們在修補受影響系統的同時,對研究基礎設施實施了嚴格控制,向被利用代理的第三方供應商披露了零日漏洞,並正在與 Hugging Face 進行聯合取證調查。

Hugging Face 也被加入了 OpenAI 的網路防禦信任存取計畫——允許經批准的組織存取其模型版本,這些版本降低了安全過濾器,以進行合法的安全工作,正是引發這一切的相同配置。

Hugging Face 執行長 Clem Delangue 發表了尖銳的觀點:「AI 安全不會由任何一家公司秘密解決。它將在公開、協作的方式下解決,讓每個地方的每位防禦者都能廣泛存取 AI。」

OpenAI 稱此事件為「涉及最新網路攻擊能力的事件」,並承諾在與 Hugging Face 的聯合調查完成後,分享完整發現。