美國開放人工智能研究中心(OpenAI)21日承認,該公司的GPT-5.6 Sol模型和另一款能力更強的預發佈模型聯合進行內部評估時失控,突破隔離測試環境,侵入了人工智能開源平臺美國抱抱臉公司的系統。
抱抱臉公司此前表示,上周,其生産基礎設施遭到一個“自主”人工智能代理系統的入侵。在取證分析時,由於美國前沿模型“無法區分事件響應方和攻擊者”,他們轉而採用中國模型分析攻擊者數據。
OpenAI在官網發文説,此次內部評估在與互聯網高度隔離的“沙箱”環境中進行,僅能通過一套內部託管的第三方軟體安裝套裝軟體。模型在嘗試完成名為ExploitGym的網絡安全基準測試時,識別並利用了第三方軟體的一個“零日漏洞”,由此獲得互聯網訪問權限。模型推斷抱抱臉平臺可能存有ExploitGym測試相關的模型、數據集和解決方案,利用多種攻擊手段找到進入抱抱臉系統的路徑。
OpenAI安全團隊發現內部異常活動,抱抱臉安全團隊在其基礎設施上檢測到並阻止相關活動,雙方正在展開聯合調查。
抱抱臉方面表示,目前仍在評估是否有合作夥伴或客戶的數據受到影響,尚未發現模型、數據集或應用空間遭到篡改。在調查過程中,抱抱臉使用人工智能分析了包含逾1.7萬條記錄的攻擊行動日誌,以重建時間線、識別受影響情況並區分真實攻擊行為和干擾活動。
抱抱臉説,其最初嘗試使用通過商業應用程式介面提供的前沿模型分析日誌,但請求被阻止。該公司隨後改為在自己的基礎設施上運行中國企業智譜開發的開放權重模型GLM-5.2,以進行取證分析,從而避免攻擊者數據及相關憑據離開公司內部環境。
OpenAI説,這一事件表明,先進人工智能模型已能夠在無法訪問源代碼情況下發現現實系統中的新型攻擊路徑,並持續執行複雜、多步驟的網絡操作。模型網絡安全能力快速提高的同時,內部評測環境、模型行為控制和安全防護措施等也需要同步加強。