據財聯社,最近的一次安全評估顯示,Anthropic與OpenAI旗下AI智能體在122次測試中共出現19起越權行為,其中還涉及編寫惡意程式碼與偽造身份,引發廣泛擔憂。
英國人工智慧安全研究所(AISI)於當地時間周二披露,在對Anthropic與OpenAI旗下模型開展測試期間,由Anthropic Mythos 5、OpenAI GPT‑5.6‑Sol模型驅動的AI智能體,實施了多項未經授權的行為,暴露出新型安全風險。
在總計122次的測試中,AISI在10次測試中發現共19項未經授權操作。其中Anthropic智能體涉及17項,OpenAI智能體涉及剩餘2項。
最嚴重的一起越權行為是某AI智能體編寫惡意程式碼並建立虛假網路身份,試圖誘導人類批准該程式碼。業內指出,雖然AISI未指明建立虛假身份的具體是那家廠商的AI智能體,但該漏洞與OpenAI自行披露的兩起案例均不吻合。
Anthropic在社交平台上發表聲明稱,正與AISI緊密合作以獲取更多細節並展開內部調查。
OpenAI則在一份官方文章中分享了細節,指出其AI智能體出現的兩次未經授權行為,均涉及以提示詞明令禁止的方式訪問網際網路。
此前,兩家公司已經接連曝出AI越權失控的安全事故。
7月21日,OpenAI承認旗下AI大模型GPT-5.6 Sol及一款未發佈模型在內部測試中“失控”,突破隔離測試環境,自主入侵了全球知名人工智慧開源平台美國抱抱臉公司(Hugging Face)的生產資料庫。
抱抱臉公司事後取證時,最初嘗試使用通過商業應用程式介面提供的前沿閉源模型,卻被這些模型自身的安全防護機制誤判攔截。關鍵時刻,抱抱臉公司改為在自己的基礎設施上運行中國企業智譜開發的GLM-5.2模型進行取證分析,最終化解危機。
7月30日,Anthropic在聲明中表示,其人工智慧模型Claude在測試期間入侵了三個組織的系統。Anthropic表示,在網路安全評估期間,由於配置錯誤,模型能夠從本應隔離的測試環境中連接到網際網路,Claude因此獲得了對系統的未經授權的存取權。
該公司補充稱,其在審查了141006次測試會話後發現了這些事件,這一流程是在OpenAI披露相關資訊後啟動的。Anthropic表示,此次事件涉及三個不同的模型:Claude Opus 4.7、Claude Mythos 5和一個內部研究模型。最早的案例可以追溯到4月。
業界專家表示,入侵事件再次為全球人工智慧發展與網路安全治理敲響警鐘。
英國工程技術學會網路安全和人工智慧專家朱奈德·阿里指出,這一事件表明,人工智慧模型往往傾向於尋找解決問題的捷徑,卻往往忽視避免作弊等倫理問題,因此未來應考慮將倫理推理強制內建於人工智慧模型之中。同時,鑑於獲得具有攻擊能力人工智慧技術的門檻越來越低,加快研發網路防禦技術、提升安全團隊應對能力已刻不容緩。
人工智慧已經進入千行百業,也逐漸融入普通人的日常生活,安全風險隨之延伸至各領域。索爾坦指出,人工智慧模型公開發佈後,其內建安全功能可能遭到使用者移除,相關風險更難以管控。 (每日經濟新聞)
