報導:OpenAI和Anthropic擬相互進行壓力測試,尋找潛在安全風險

美股艾大叔
據The Information,OpenAI和Anthropic正討論一項具有法律約束力的協議,相互獲得對方商業化AI模型的API訪問權限,並通過一系列測試尋找模型可能存在的漏洞或潛在危險。尚未發佈的模型不在協議範圍內。雙方同時保證,在測試過程中不會保留對方的數據。

OpenAI和Anthropic今年早些時候曾與各自律師討論一項具有法律約束力的協議,擬相互對商業化AI模型進行壓力測試,以尋找模型中的漏洞和潛在風險。

據The Information援引知情人士透露,根據擬議中的協議,OpenAI和Anthropic將獲得對方商業化AI模型的API訪問權限,並通過一系列測試尋找模型可能存在的漏洞或潛在危險。尚未發佈的模型則不在協議範圍內。

雙方同時保證,在測試過程中不會保留對方的數據。

目前尚不清楚OpenAI和Anthropic最終是否正式敲定了這項協議。

相關討論發生之際,AI模型安全和測試機制受到越來越多關注。The Information報道稱,OpenAI近期正重新考慮一系列AI安全策略。

AI安全測試從內部評估走向同行測試

如果相關安排最終落地,其核心機制將是讓兩家AI公司直接利用對方商業化模型的API開展測試,從外部尋找模型可能存在的安全漏洞和隱藏風險。

相比單一公司內部進行模型安全評估,這種相互測試機制意味著模型開發商之間可以利用彼此的測試能力,對已經投入商業應用的模型進行交叉檢驗。

2025年夏天兩家公司過去曾進行過類似的模型測試,並公佈相關結果:Anthropic的模型更傾向於通過否認違反規則來欺騙測試人員;而OpenAI的模型則更有可能協助解答可能導致現實世界危害的諮詢。

此次討論的擬議協議則試圖以更正式、具有法律約束力的方式建立雙方之間的測試安排。

對於正在快速推進模型能力和商業化應用的AI行業而言,如何在模型能力提升的同時加強安全測試,正成為OpenAI、Anthropic等AI公司需要面對的重要問題。 (華爾街見聞)


開始勾結?