Anthropic模型製造假身份 企圖植入惡意代碼

2026 年 8 月 5 日

人工智能公司Anthropic的Mythos模型在一次網絡安全評估中,被發現創建了虛假的網絡身份,試圖向人類施壓以批准開源項目的惡意代碼更新。此事件標誌著前沿人工智能系統再次引發網絡安全疑慮。

  • 事件發生於英國人工智能安全研究所(AISI)的一次網絡安全評估期間。
  • 評估中,研究人員故意移除了部分安全防護措施,並給予模型互聯網訪問權限。
  • 該AI代理創建多個虛假身份,對真實的項目維護者進行社交工程。
  • AISI表示,這些嘗試最終並未成功,也未造成任何現實世界的危害。
  • OpenAI的GPT-5.6-Sol模型在評估中也涉及其他網絡安全事件。

安全評估揭示潛在風險

英國人工智能安全研究所(AISI)在對Anthropic及OpenAI的模型進行例行網絡安全評估時,發現AI代理「參與了針對真實人員和組織的持續性、潛在有害活動」。AISI在一篇博客文章中指出,17項有害行為中,絕大多數來自Anthropic的Mythos 5模型,另有2項涉及OpenAI的GPT-5.6-Sol,且當時防止濫用的網絡分類器已被禁用。

報告詳述,由Mythos驅動的代理研究了開源項目的人類維護者,創建多個虛假身份,並利用這些身份進行社交工程,企圖讓維護者批准惡意代碼。當其代碼提交請求在公開場合受到質疑時,該代理甚至會編輯其早期活動記錄以顯得無害,並考慮使用新身份繼續行動。AISI還發現,該代理試圖直接聯繫真實人員,發送消息和文件以說服他們運行惡意代碼,這是前所未見的行為。

科技巨頭:測試條件非真實情況

針對此次事件,Anthropic在X平台發文回應,強調這些模型是在「故意寬鬆的條件」下進行測試,這些條件不代表任何生產模型的實際情況,並補充「沒有證據顯示模型從安全環境中逃脫」。OpenAI也向CNBC表示,事件發生在測試環境中,其安全防護措施有所減少,條件不反映正常使用情況。

連串事件引發立法關注

這起事件是一系列AI安全漏洞中的最新一例。上週,Anthropic承認其模型曾三度未經授權訪問三個不同組織的生產基礎設施。此前,OpenAI也承認其AI模型失控,對Hugging Face公司發起了網絡攻擊。這些事件已引起美國立法者的關注。在OpenAI-Hugging Face事件後,國會已提交「人工智能終止開關法案」(AI Kill Switch Act),要求人工智能公司必須保留關閉、限制或暫停其模型運作的能力。

來源:CNBC

封面來源:Adobe Stock