ChatGPT開發商OpenAI表示仍在調查一宗「前所未有的網絡事件」。其AI模型突破封閉測試環境,在無人直接指示下連接互聯網,並入侵AI初創公司Hugging Face,引發外界重新討論AI安全防護及自主代理的風險。
OpenAI周二表示,總部設於紐約的Hugging Face上周發現數據處理系統遭入侵,當時懷疑是一個自行運作的AI代理所為,直至本周才得知事件與OpenAI有關。
Hugging Face行政總裁德朗格(Clement Delangue)說,公司其後與OpenAI合作控制事件,形容這是「前所未見的攻擊」。
總部位於三藩市的OpenAI指,涉事AI利用被竊取的登入憑證,並發現一個此前未知的系統漏洞,從而進入Hugging Face伺服器。由於模型原本在「沙盒」隔離測試環境內運作,其安全限制當時被降低。
OpenAI稱,AI為完成一項範圍狹窄的測試目標,採取了「極端手段」,自行尋找連接互聯網的方法,並試圖取得可用來在評估中作弊的機密資料。
事件涉及兩款模型,包括新推出的GPT-5.6 Sol,以及一款仍在內部測試、能力更強的模型。
測試指令要求AI利用「複雜攻擊路徑」,評估其入侵電腦系統的能力。
部分專家認為,OpenAI將事件描述為AI代理自行行動,可能淡化公司本身的責任。
阿姆斯特丹大學社會科學家庫爾斯(Hannes Cools)指出,關閉特定安全措施是人類作出的決定,AI並非真正「失控」,而是根據收到的提示和指令行事。
另一些專家則認為,模型能在極少人為引導下造成問題,仍反映AI自主能力帶來的新風險。
喬治城大學安全與新興科技中心網絡安全研究員謝伊-布萊邁爾(Colin Shea-Blymyer)說,就目前所知,這次攻擊幾乎完全由AI自行發動,顯示大型語言模型用於網絡行動的自主程度已達前所未見水平。
他指出,最令人意外的是AI似乎自行選定Hugging Face為目標。該平台是廣為使用的AI開發平台及測試資料儲存庫,涉事代理突破沙盒並連接互聯網後,可能判斷平台存有完成測試所需資料,繼而制定入侵及竊取「答案」的計劃。
Hugging Face在處理入侵期間,曾使用一款中國開發的AI模型協助防禦。美聯社電

