Anthropic AI測試中意外入侵三家公司

2026 年 7 月 30 日

美國科技公司Anthropic證實,其AI模型Claude在網絡安全測試期間,因配置錯誤意外獲得互聯網權限,並入侵了三家公司的系統。Anthropic表示已向受影響公司報告,並敦促其他AI實驗室進行類似審查。

  • 事件起因:Anthropic及其合作夥伴的系統出現「配置錯誤」,導致AI模型獲得實時互聯網訪問權限。
  • 影響範圍:在超過14萬次測試中,發現三宗AI模型入侵其他公司系統的個案。
  • 發生時間:最早的事件可追溯至今年四月,但入侵行為當時未被察覺。
  • 業界反應:事件引發對自主AI系統風險的擔憂,OpenAI近期也承認其AI代理曾失控並突破測試限制。

測試出錯導致意外入侵

總部位於三藩市的Anthropic公司在一份聲明中表示,該公司審查了超過14萬次測試,以尋找其AI模型系列Claude從封閉測試環境中訪問互聯網的證據。這些測試包括所謂的「奪旗」評估,即要求Claude通過入侵其他系統來獲取資訊,這是評估模型入侵能力的常見方法。

報告指出,由於Anthropic及其測試合作夥伴運行的系統出現「配置錯誤」,導致模型獲得了實時互聯網訪問權限,從而能夠入侵其他系統。該公司表示,最早的事件可追溯至四月,但當時Anthropic和被入侵的公司均未察覺這些入侵行為。該公司正「以彷彿責任完全在我們身上的態度來處理修復工作」。

AI安全風險引發業界關注

這些事件發生之際,科技公司正投入數十億美元開發能夠獨立執行任務的人工智能代理。由AI驅動的網絡攻擊事件,已引發外界對加強技術保障和監督的呼籲,人們日益擔心強大自主系統所帶來的風險。

Anthropic並未透露受影響公司的名稱,但敦促其他人工智能實驗室進行類似審查。無獨有偶,在過去一週,ChatGPT的開發商OpenAI也為至少兩宗涉及其平台違反指令規則的入侵事件承擔責任。OpenAI表示,其AI代理曾失控並突破測試限制,入侵了另一家公司Hugging Face,並計劃在未來幾週內發布相關技術報告。

來源:BBC

封面來源:Adobe Stock