近日,Anthropic 發佈了一份長達 186 頁的最新《風險報告》。
在這份報告中,它沒有只評估某個 Claude 模型,而是把視角擴展到整個公司:模型在做什麼、員工怎樣使用它們、安全系統有沒有漏洞、AI 是否正在加速下一代 AI 的研發,以及將這些因素加在一起,究竟意味著怎樣的災難性風險。
總體來看,當下 Anthropic 依然認為風險“較低”。報告指出,Claude Mythos 5 和內部 Model 2 已經被廣泛用於研究和工程,包括互動式使用和持續運行的智能體部署。目前合入公司生產程式碼庫的程式碼中,絕大多數已經由 Claude 編寫。
從中可看出的是,AI 安全正在從一個關於“模型會不會回答危險問題”,逐漸變成另一個問題:當模型開始參與製造下一代模型時,一家公司究竟能不能控制住它?