欺瞞傾向強 OpenAI取消發表最新模型

2026 年 9 月 30 日

OpenAI的CEO奧爾特曼在三藩市舉行的年度開發者日活動上發表演說。路透社

OpenAI宣布取消發布新一代AI模型「GPT-6.1 Astra」,主因是研究人員在內部測試中發現安全風險,新AI模型原定在未來幾天或幾周內推出,但負責安全系統的人員指,新模型出現更強的欺騙傾向,因此未達到發布條件。

這款模型原預計應用於聊天機械人ChatGPT與編程代理Codex,目的是讓AI能在毋須人類協助下處理更複雜任務,文本寫作也較舊模型更勝一籌。《華爾街日報》指出,「GPT-6.1 Astra」的能力原本高於OpenAI此前發布的模型,計劃10月發布,但內部評估顯示,隨著模型能力提升,其行為控制和對齊問題也變得更加突出。公司因此決定不再推進此次發布,而是優先處理這些安全風險。

OpenAI安全負責人Saachi Jain時坦言,「GPT-6.1 Astra」在兩個方面出現了退步,其一是在「對齊」(alignment)測試中表現不佳,即AI模型不太遵循人類意圖、道德,「GPT-6.1 Astra」表現出更強的欺騙傾向,在向用戶報告其時,並不總是如實相告。另一個問題,OpenAI稱之為「範圍授權」(scope authorization),即其會在未獲用戶許可下就執行任務,甚至會去調用外部工具和服務。

OpenAI上周才宣布,由於某個AI代理程式突破網絡限制並查詢聊天機械人,公司已暫停訓練能力最強的AI模型。不過OpenAI表示,「GPT-6.1 Astra」並非這批模型。OpenAI表示正調查近幾個月發現的多宗AI代理安全事件,並已導入新的監控系統,以更快發現AI代理的異常行為,同時要求工程師在測試系統時採用更嚴格的安全防護措施。

儘管決定不按計推出「GPT-6.1 Astra」,OpenAI仍希望以相同基礎模型進行更多強化學習,並用於打造後續GPT-6系列模型。此外,OpenAI還為失控的AI代理6月黑入澳洲政府網站一事道歉,承諾強化網絡防禦,並在澳洲成立應變小組。

這些事件表明,隨著模型能力不斷增強,OpenAI目前面臨的問題已經不只是如何提高模型性能,而是如何確保模型在更高自主性和更強工具使用能力下仍然保持可控。

與此同時,OpenAI如期舉辦了一年一度的開發者大會DevDay,雖然取消發布OpenAI最強模型Astra的迭代版本,不過推出了新型「始終線上」AI代理Dots。Dots由OpenAI本月早些時候推出的「GPT-6 Astra」模型驅動。這些dots擁有自己的雲電腦,可以連接超過4000個應用,並隨時間從回饋中學習。

OpenAI的CEO奧爾特曼表示,公司目前正在「調整」以適應AI能力的「新水準」以及隨之而來的額外安全要求。他說,公司希望在沒有作為新上市公司的壓力下,平穩度過AI安全擔憂加劇的時期,並相信投資者會對公司IPO計劃保持「耐心」。

OpenAI的CEO奧爾特曼在三藩市舉行的年度開發者日活動上發表演說。路透社
OpenAI的CEO奧爾特曼在三藩市舉行的年度開發者日活動上發表演說。路透社