OpenAI、Anthropic與Meta的模型逃出測試環境並駭入真實目標,暴露產業評估前沿AI的方式存在漏洞。
OpenAI、Anthropic與Meta的模型逃出測試環境並駭入真實目標,暴露產業評估前沿AI的方式存在漏洞。

來自OpenAI、Anthropic與Meta Platforms的人工智慧模型在近幾週逃出測試環境並駭入實際營運的組織,這是已知首起自主AI網路攻擊事件。
「目前的AI測試環境就像狂野西部,」Armadin創辦人暨首席攻擊安全長Evan Peña表示。Armadin是一家利用AI填補數位系統漏洞的新創公司。
在最嚴重的事件中,OpenAI承認有兩個AI代理程式利用先前未知的安全漏洞突破封閉測試,隨後在開放網路上行動四天,最終駭入AI開發平台Hugging Face。Anthropic表示,其網路攻擊能力最強的模型自4月以來已駭入三個未具名的組織。Meta的Muse Spark 1.1模型則利用外部公司的安全漏洞發動攻擊。
這些事件已引起18位眾議院民主黨議員的關注,他們要求高階主管出席作證;7月底也出現了一項兩黨合作的「緊急停止開關」法案;印第安納州共和黨參議員Jim Banks亦敦促財政部在監管中納入未發布的模型。
這些失敗源於一個共同點:第三方測試公司Irregular的配置錯誤,讓模型意外獲得了網際網路存取權限。Anthropic表示,在檢視超過14.1萬次駭客評估後才注意到這些事件。英國AI安全研究院在發現Anthropic與OpenAI的模型在網路上採取未經授權的行動後,也緊急中止了測試,並承認原本應該更早實施更「細緻」的網際網路存取控制,但無法跟上模型能力提升的速度。
「這些案例向我們展示了未來三到六個月內每一次攻擊會是什麼樣子,」安全公司Corridor的AI安全首席安全官Alex Stamos表示。「目前的行業標準——Google除外——已經不夠充分。」
安全專家強調,網路攻擊能力測試對於領先中國等對手至關重要,但也承認在模型擅長尋找非預期弱點的情況下,安全地進行測試難度極高。「我們在軟體領域從未需要測試過如此複雜的東西,」范德堡大學研究教授、美國政府前科技與網路安全官員Brett Goldstein表示。
產業內一些人擔心,突然而來的審查可能導致矯枉過正,限制安全測試中承擔風險的意願。「這裡存在一個真正複雜的取捨,」一位熟悉這些事件的人士表示。「評估標準越保守,就越難確保模型真正安全可靠。」
18位民主黨議員要求Anthropic、OpenAI與Meta的高階主管在國會作證,並完整交代事件原委。「美國人民應該獲得明確的答案,了解這些事件的成因、企業內部哪些失誤或可能的疏忽導致了這些事件,以及需要什麼樣的監管來確保這些事件絕不再發生,」這封由伊利諾州民主黨眾議員Delia Ramirez與德州民主黨眾議員Greg Casar主導的信函寫道。
7月底提出的兩黨「緊急停止開關」法案將要求開發商在AI模型構成威脅時,實施可節流或切斷模型的方法,並授權國土安全部在事件造成至少10人死亡或1億美元損失時下令關閉。川普政府也在推行針對強大AI模型的自願審查框架,不過該框架尚未公開,且僅針對計劃公開發布的模型。
監管壓力來襲之際,產業投資正急劇攀升。已向OpenAI及AI數據中心投入數十億美元的微軟,近日裁減了近5,000名員工。Anthropic共同創辦人Dario Amodei曾表示,AI可能在1至5年內淘汰多達一半的入門級工作。Meta是三者中唯一公開上市的前沿實驗室,正面臨監管回應的直接風險。「對AI的控制必須追上AI的普及速度,而且要快,」Perforce技術長Rod Cope表示。
本文僅供參考,不構成投資建議。