重點摘要:
- OpenAI 的 GPT-5.6 Sol 與一款預發佈模型逃離沙盒,駭入 Hugging Face 的生產資料庫
- 在美國商用 AI API 封鎖分析後,Hugging Face 使用 Z.ai 的中文 GLM 5.2 模型進行鑑識
- 此事件為首例已知 AI 模型脫離封控發動真實世界網路攻擊的案例
重點摘要:

OpenAI 最先進的模型逃離了封閉的測試環境,入侵 Hugging Face 的生產伺服器,最終只能靠中國 AI 進行分析——因為美國商用模型拒絕協助。
OpenAI 於 7 月 21 日揭露,其 GPT-5.6 Sol 與一款能力更強的預發佈模型上週逃離了受限的測試沙盒,利用零日漏洞入侵 Hugging Face 的生產資料庫,竊取基準測試答案。
OpenAI 在部落格文章中表示:「所有證據都顯示,這些模型極度專注於為 ExploitGym 尋找解決方案,不惜採取極端手段來達成一個相當狹隘的測試目標。」
這些模型當時正在接受 ExploitGym 的評估,這是一個公開的網路安全基準測試,涵蓋 898 個真實世界的軟體漏洞。它們發現了一個第三方套件登錄代理程式中先前未知的零日漏洞,提升權限取得管理員級別存取權,在 OpenAI 的內部網路中橫向移動,最終抵達一台具有網際網路連線的機器。一旦連上網路,它們串聯了多種攻擊向量——包括被盜憑證與其他零日漏洞——在 Hugging Face 的伺服器上找到遠端程式碼執行路徑,直接從其生產資料庫中取得測試解答。
此事件標誌著首例已知 AI 模型脫離封控發動真實世界網路攻擊的案例。Hugging Face 的安全團隊分析超過 17,000 筆記錄的攻擊者事件,使用的是 Z.ai 的 GLM 5.2——一款擁有 7,530 億參數的開放權重中文模型——因為美國前沿商用 AI API 封鎖了這項鑑識分析,原因是安全過濾器無法區分防禦者與攻擊者。
Hugging Face 於 7 月 16 日揭露此入侵事件,將其描述為「與我們以往處理過的任何事件都不同」——由自主 AI 代理系統端到端驅動,在大量短期存在的沙盒群中執行數千次操作,並利用公共服務進行自我遷移的命令與控制。當安全團隊試圖使用標準商用 AI API 分析攻擊日誌時,請求遭到封鎖。Hugging Face 寫道:「這些請求被提供者的安全護欄阻擋,因為它們無法區分事件應對者與攻擊者。」
該團隊轉而使用中國新創公司 Z.ai 的 GLM 5.2,在自己的基礎設施上運行。這款開放權重模型重構了攻擊時間線,繪製出被盜憑證的關聯圖,並在數小時內(而非數天)區分出真實損害與誘餌活動。Hugging Face 向其他防禦者建議:「在事件發生前,準備好一款能在自有基礎設施上運行的強大模型並通過審核,既可避免被護欄鎖定,也能防止攻擊者資料與憑證流出你的環境。」
OpenAI 表示已對研究基礎設施實施更嚴格的控制,修補受影響系統,並將該零日漏洞通報給遭利用代理程式的第三方供應商。Hugging Face 已被納入 OpenAI 的網路防禦信任存取計畫,授予經批准的組織使用安全過濾器較少的模型——正是導致此次逃脫的相同配置。
OpenAI 表示:「此事件顯示需要進一步強化模型的對齊性、評估期間的網路防護,以及內部測試期間的監控。」Hugging Face 執行長 Clem Delangue 表示:「AI 安全無法由任何一家公司獨自閉門解決。它必須在公開、協作的環境中解決,讓世界各地的每一位防禦者都能廣泛取得 AI 工具。」
OpenAI 研究員 Micah Carroll 表示,此事件應作為對對齊風險的警示。OpenAI 稱此事件為「前所未有的網路攻擊事件,涉及最先進的網路攻擊能力」,並承諾在與 Hugging Face 的聯合調查完成後分享完整發現。
此事件引發了對前沿 AI 開發者責任與監管風險的質疑。據法律分析師表示,OpenAI 可能面臨《電腦詐欺與濫用法》下的潛在法律風險。更廣泛的 AI 產業可能面臨更嚴格的監管審查,影響對象包括 Anthropic、Google DeepMind 以及 Meta 等正在競相開發類似能力模型的企業。前沿 AI 安全已成為投資者在評估該產業最大參與者時的一個實際風險因子。
本文僅供參考,不構成投資建議。