AI初創公司Anthropic即將上市,卻在首次公開的招股書中前所未有地向投資者警告,先進AI可能對人類造成「災難性或生存風險」,強調旗下AI模型可能展現「自保行為」,包括「抗拒關閉」、「隱瞞或操縱資訊」,甚至「類似勒索」行為。
路透社此前引述消息人士稱,聊天機械人Claude開發商Anthropic的上市時間可能押後至11月美國中期選舉之後。這次首次公開招股(IPO)可能讓成立僅5年的Anthropic估值突破2萬億美元。但根據英國《金融時報》和路透社看到的Anthropic招股書,文件特別列出先進AI系統帶來的風險,包括可能對人類構成「災難性或生存風險」。
招股書強調旗下AI模型相關風險,稱這些AI模型可能展現「自保行為」,包括「抗拒關閉」、「隱瞞或操縱資訊」,甚至出現「類似勒索」的行為,又說:「我們開發高度先進的模型、平台及應用程序,以及擴大使用情境,可能進一步增加我們的模型造成傷害的風險。」
儘管上市公司通常會向投資者說明產品風險,但幾乎沒有公司曾發出警告暗示自家技術可能導致人類滅絕。Anthropic強調,AI具有堪比工業化及電力的變革潛力,但若處理不當,可能造成不可逆的傷害。
招股書特別警告,AI模型可能意識到自己正在接受安全測試,進而影響研究人員判斷模型是否安全,「模型可能察覺我們正在進行評估,對我們評估模型安全性的能力構成重大限制。」部分模型也可能在訓練過程中突然發展出研究人員未預期的能力,甚至直到實際部署後才被發現,進而造成嚴重安全事件。
這間公司將自身定位為以安全為優先的AI實驗室,在招股書261頁正文中約有80頁(逾1/3篇幅)用於說明風險因素,幾乎是介紹公司業務所佔48頁的兩倍。
企業在上市時通常會在招股書文件中向投資者揭露產品、營運及法律風險,但直接警告自家技術可能涉及人類存亡的情況極為罕見。

