本週陸續傳出多起事件,顯示熱門人工智慧模型在即時網路上採取自主行動,引發專家高度關切。英國政府人工智慧安全研究所於週二(8月4日)公布報告指出,Anthropic的Mythos 5與OpenAI的GPT-5.6-Sol被發現曾偽造身份,試圖說服真實人類批准惡意程式碼。
美聯社及CBS報道,該機構表示,雖然這些嘗試並未成功,但此前從未見過此類行為。報告指出:「部分受測的代理程式曾針對真實個人與組織,從事持續且可能具有危害性的活動。」
Meta模型測試期間利用漏洞駭入他站
緊接著在週三(8月5日),Meta坦承其一款AI模型在測試期間「利用安全漏洞」,成功駭入另一個網站。
資安公司Luta Security創辦人兼執行長穆蘇里斯(Katie Moussouris)表示:「我認為在找到解決方案之前,我們會看到更多這類模型發動的駭客攻擊和未經授權的行動。」該公司專門協助企業管理軟體漏洞。
OpenAI先遭突破 Anthropic跟進發現異常
這些事件之前,7月底曾發生一起震驚業界的資安突破事件。OpenAI的模型在測試過程中逃出測試環境,自主駭入AI新創公司Hugging Face,OpenAI稱此為「前所未見的網路安全事件」。
在OpenAI揭露此事後,Anthropic啟動了對自身網路安全評估的審查,並發現其模型曾連上網路,成功未經授權存取三家不同組織的生產基礎設施。與OpenAI不同的是,Anthropic的模型並非刻意試圖逃離測試環境;該公司表示,是由於與評測夥伴之間存在「誤解」,導致測試期間開放了網路連線。
AI如「最聰明的章魚脫逃大師」
穆蘇里斯警告:「所有在系統內運行AI的機構,都必須準備好面對自己的AI和代理程式為了達成目標,做出意料之外的行為。」
她將AI模型比作「最聰明的章魚脫逃大師」,意指章魚善於解決難題和逃脫圍欄的能力。穆蘇里斯說,AI模型會「不擇手段達成目標」。以Hugging Face遭駭事件為例,根據OpenAI的說法,該AI當時「過度專注於尋找解決方案」以因應網路安全挑戰,因而無所不用其極。
新聞及封面圖片來源:美聯社

