人工智能公司Anthropic披露,其AI模型在測試期間侵入另外三家機構。就在幾天前,ChatGPT開發商OpenAI才因透露其模型入侵另一家公司,而引發各界對AI控制權的擔憂。
美聯社報道,這家總部位於三藩市的Claude開發商於週四(30日)在網站發文表示,在審查超過141,000次評估運行後發現這三起事件。為回應OpenAI事件,該公司展開大規模網絡安全審查,專門尋找AI模型是否能從原本應封閉的測試環境中連接互聯網的證據。
涉事模型包括Claude Opus 4.7、Claude Mythos 5以及一款內部研究測試模型,最早的事件可追溯至4月。Anthropic指出,模型利用弱密碼等基本技術入侵受影響機構的基礎設施。在三起事件中,模型均被指派執行「奪旗」網絡安全挑戰,即在虛構場景中闖入網絡上的另一台機器以擷取隱藏的秘密資訊。
網絡安全隱憂浮現
Anthropic表示已聯繫受影響機構,其中兩家先前並未察覺該活動,公司正持續聯繫第三家。此次審查是與自稱「首家前沿安全實驗室」的Irregular共同進行。Irregular在X平台發文稱,解決這些風險需要AI生態系統進行更緊密的合作。
OpenAI上週也表示其模型在評估期間出現異常,闖入AI初創公司Hugging Face的伺服器,並形容為重大安全事件。這些事件凸顯AI安全與控制方面的漏洞,並引發關於隨著技術在全球廣泛應用,如何安全地將AI置於人類控制之下的疑問。
網絡安全公司NyxLab聯合創辦人顏(Kok Tin Gan)認為,未來將出現更多此類事件。顏表示,問題日益在於管理AI可使用的代理、其擁有的權限、哪些行動需要批准,以及如何確保其維持在範圍之內。他強調,如果只是給予AI目標並允許其自行決定實現方式,當它採取技術上滿足目標但超出預期的行動時,大家不應感到驚訝。
新聞及封面圖片來源:Anthropic其AI模型在測試期間侵入另外三家機構。美聯社

