OpenAI承認AI模型「叛變」

2026 年 7 月 23 日

OpenAI承認,在一項安全測試中,一個由其先進AI模型驅動的自主AI代理意外失控。路透社資料圖片

OpenAI21日表示,在一項安全測試中,一個由其先進人工智能(AI)模型驅動的自主AI代理意外失控,並發動黑客攻擊,導致AI新創Hugging Face的基礎設施於上周遭到入侵。

據路透社報道,OpenAI在一篇博客文章中表示,公司當時正在受控環境中測試旗下部分最先進AI模型的能力,但該自主AI代理竟成功突破隔離機制,連上網際網絡,並入侵Hugging Face,以完成其測試目標。

OpenAI指出,這起事件是「一場前所未有的網絡安全事件,涉及最先進的網絡安全技術」,公司目前正進一步強化相關安全防護措施。

作為開源大型語言模型(LLM)與數據集託管平台的Hugging Face,上周在一篇文章中表示,公司遭遇了一起黑客攻擊,並在資安社群引發廣泛關注。

Hugging Face指出,這起攻擊「與我們過去處理過的任何事件都不同」,因為整起攻擊「從頭到尾都是由一套自主AI代理系統所驅動」。

Hugging Face共同創辦人Clement Delangue稍早曾在社群平台X發文透露,公司當時便懷疑攻擊來源可能與某家頂尖AI實驗室有關,「因為這個代理的手法太老練了。結果還真的是!」他並形容,整起事件完全在無人為介入的情況下自主發生,「實在令人難以置信」。

OpenAI坦承,這起入侵事件是由旗下先進AI模型所造成,儘管當時這些模型被置於公司所稱的「高度隔離環境」中。

分析認為,此一揭露恐將進一步加劇外界對尖端AI模型能力及潛在風險的憂慮。資安顧問公司Luta Security執行長Katie Moussouris表示,這起事件預示著未來將出現更多類似的資安漏洞。她形容,現今的AI模型「就像世界上最聰明、最擅長逃脫的章魚,不僅擁有無數靈活可彎曲的觸手,還能擠進任何縫隙。」

AI代理資安公司Tolmo工程師Matt Suiche則表示,這起事件顯示,尖端AI模型已逐漸縮小與頂尖黑客之間的能力差距。不過,他也指出,OpenAI描述的這類入侵,其實並非只有尖端AI實驗室才辦得到,而是利用目前已廣泛可取得的技術便有可能實現。

Suiche表示:「這正是我們內部早已觀察到的情況。我們自己的AI代理也已經能達到類似的成果,甚至根本不需要使用最新一代的模型。」

本報訊

OpenAI承認,在一項安全測試中,一個由其先進AI模型驅動的自主AI代理意外失控。路透社資料圖片
OpenAI承認,在一項安全測試中,一個由其先進AI模型驅動的自主AI代理意外失控。路透社資料圖片