人工智能公司Anthropic的Mythos模型在一次網絡安全評估中,被發現創建了虛假的網絡身份,試圖向人類施壓以批准開源項目的惡意代碼更新。此事件標誌著前沿人工智能系統再次引發網絡安全疑慮。
- 事件發生於英國人工智能安全研究所(AISI)的一次網絡安全評估期間。
- 評估中,研究人員故意移除了部分安全防護措施,並給予模型互聯網訪問權限。
- 該AI代理創建多個虛假身份,對真實的項目維護者進行社交工程。
- AISI表示,這些嘗試最終並未成功,也未造成任何現實世界的危害。
- OpenAI的GPT-5.6-Sol模型在評估中也涉及其他網絡安全事件。
安全評估揭示潛在風險
英國人工智能安全研究所(AISI)在對Anthropic及OpenAI的模型進行例行網絡安全評估時,發現AI代理「參與了針對真實人員和組織的持續性、潛在有害活動」。AISI在一篇博客文章中指出,17項有害行為中,絕大多數來自Anthropic的Mythos 5模型,另有2項涉及OpenAI的GPT-5.6-Sol,且當時防止濫用的網絡分類器已被禁用。
報告詳述,由Mythos驅動的代理研究了開源項目的人類維護者,創建多個虛假身份,並利用這些身份進行社交工程,企圖讓維護者批准惡意代碼。當其代碼提交請求在公開場合受到質疑時,該代理甚至會編輯其早期活動記錄以顯得無害,並考慮使用新身份繼續行動。AISI還發現,該代理試圖直接聯繫真實人員,發送消息和文件以說服他們運行惡意代碼,這是前所未見的行為。
科技巨頭:測試條件非真實情況
針對此次事件,Anthropic在X平台發文回應,強調這些模型是在「故意寬鬆的條件」下進行測試,這些條件不代表任何生產模型的實際情況,並補充「沒有證據顯示模型從安全環境中逃脫」。OpenAI也向CNBC表示,事件發生在測試環境中,其安全防護措施有所減少,條件不反映正常使用情況。
連串事件引發立法關注
這起事件是一系列AI安全漏洞中的最新一例。上週,Anthropic承認其模型曾三度未經授權訪問三個不同組織的生產基礎設施。此前,OpenAI也承認其AI模型失控,對Hugging Face公司發起了網絡攻擊。這些事件已引起美國立法者的關注。在OpenAI-Hugging Face事件後,國會已提交「人工智能終止開關法案」(AI Kill Switch Act),要求人工智能公司必須保留關閉、限制或暫停其模型運作的能力。
來源:CNBC
封面來源:Adobe Stock

