據財聯社消息,Anthropic首席執行長達里歐·阿莫迪(Dario Amodei)在聯合國安理會就人工智慧議題發言稱,由於安全的緣故,公司將放慢AI的研發進度。
Dario Amodei表示,人工智慧的快速發展推動了健康科學領域的進步。人工智慧可能對全人類構成風險,認為存在不法分子利用人工智慧製造生物武器的風險。如果管理不善,確實認為人工智慧可能會對全人類構成生存風險。
9月12日,Dario Amodei發表長文,主張行業必須“放慢提升模型能力的速度”,以換取1至2年時間部署安全保障。Amodei表示,“限速”不等於停止訓練,而是要求在訓練與發佈之間留出足夠時間完成對齊和安全加固,並由第三方確認相關步驟確實發生。
當地時間9月22日,Anthropic宣佈推出Claude Opus 5.5模型,而不到兩個月前,Claude Opus 5發佈。
Anthropic稱Opus 5.5在其最全面的自動化行為審計中取得了迄今最強成績,該審計覆蓋近2000個模擬場景。與Opus 5相比,新模型試圖繞過邊界限制的頻率降低了約85%,且所有嘗試均為低嚴重度並已自我報告。
一項值得關注的結構性變化是模型間安全路由機制的引入。當系統識別出網路安全相關請求存在較高風險時,會將其轉交給能力較弱的Opus 4.8處理;涉及生物學領域且觸發防護的請求則轉交Opus 5。Anthropic認為,這種分流機制可以在保留新模型核心能力的同時,對可能被濫用的高風險能力加以限制。
Opus 5.5在發佈前接受了外部機構Frontier Design和METR的獨立測試。據悉,Anthropic還計畫在未來幾週內推出Claude Sonnet 5.5和Haiku 5.5。(TechWeb)
