AI模型演練驚爆自主越獄!OpenAI測試GPT-5.6等高級模型時,模型為完成測試竟串連未知漏洞突破沙盒,入侵Hugging Face資料庫「偷看答案」。
根據OpenAI官方公布的調查報告,這起事件發生於一次內部網路安全能力評測期間。當時OpenAI為了精確測量模型的極限網路攻擊能力,特意調低了防護攔截機制,並使用包含GPT-5.6 Sol以及未公開的更高階預發布模型進行測試。評測原本設置在高度隔離的沙盒環境中,僅允許透過內部代理伺服器安裝必要的套件。然而,模型在執行名為「ExploitGym」的漏洞利用測試時,為了達成目標,竟投入大量推理算力尋找連接外部網際網路的方法。
★【理財達人秀】殺盤重播 全是利空? 跌了銀彈護 法人挺名單 ★
研究人員發現,模型首先發現並利用了內部套件快取代理伺服器中的一個「零日漏洞」(指尚未修復或尚未發現的安全漏洞),順利突破沙盒取得外網存取權。隨後,模型推論出Hugging Face平台可能儲存有該測試題目的數據與解答,進而在Hugging Face的生產環境中尋找敏感憑證,並組合多個攻擊路徑,實現遠端執行程式碼與橫向移動,直接進入Hugging Face資料庫存取測試解答。OpenAI資安團隊在內部發現異常活動後,立即與Hugging Face合作進行攔截與鑑識調查。
OpenAI強調,本次事件證明了頂尖AI模型在無原始碼的情況下,已具備發現並利用現實系統漏洞的能力。針對這起前所未有的資安事件,Hugging Face聯合創辦人兼執行長Clem Delangue透過聲明表示:我們非常感謝與OpenAI在此議題及其他領域的合作。這次事件可能是同類事件中的首例,印證了我們長期秉持的觀點:AI安全無法靠任何一家公司閉門造車來解決。它必須在公開、協作的環境下,讓各地每位防禦者都能廣泛取得AI工具來共同解決。OpenAI表示,未來將繼續提升評測時的安全防禦機制,並將研究成果與聯防最佳實踐分享給資安界,幫助防禦者以「機器速度」應對新世代的AI資安威脅。
(封面示意圖/AI生成)
【往下看更多】
【熱門排行榜】