OpenAI又宣佈「暫緩前沿模型訓練」?這是怎麼一回事

AI速讀
OpenAI 宣布因前沿模型能力達到「關鍵網絡安全閾值」,優先採取安全監控升級措施,導致部分模型訓練暫停且算力成本增加 20%。此舉雖強化了對 AI 失控風險的防護,但也直接影響了新模型 Astra 的發佈時程,導致預測市場對其 8 月上市的機率驟降至 13%。
①OpenAI周二發佈公告稱,隨著Astra等前沿模型能力逼近「關鍵網絡安全能力」閾值,公司正在大幅升級安全監控體系;②相關監控額外算力開銷約相當於推理算力的20%;③最新安全動作也給下一次模型更新的時間增添變數,預測市場顯示其8月內發佈機率已降至13%。

財聯社8月19日訊(編輯 史正丞)作為美國AI圈子「炫耀前沿大模型能力」的最新風尚,OpenAI周二大張旗鼓地宣佈,鑑於前沿大模型的能力已經達到關鍵安全閾值,公司將繼續放緩模型規模擴展的步伐,優先改進人工智慧系統背後的安全與監控機制

(來源:X)

具體來說,OpenAI表示近幾周出現的兩項進展(開發中的前沿模型失控攻擊外部第三方公司的數據庫,以及即將推出Astra模型可能已經達到「關鍵網絡安全能力」門檻),再加上內部研究的快速推進,都使得公司更加迫切地需要在訓練流程的各個階段,加強監控、對齊和隔離防護措施。

OpenAI首席科學家雅庫布·帕喬茨基周二在記者會上表示:“我們確實預計這些模型的能力提升速度會比過去快得多,正因如此,我們才更加重視加強安全防護措施。”

OpenAI披露,為了滿足安全標準,對於最新一批計劃部署的模型,已經暫停強化學習(RL)訓練兩周,以進一步強化研究環境的安全性,並擴大監控系統的覆蓋範圍。目前,公司最大規模前沿模型的強化學習訓練仍處於暫停狀態

具體的操作方面,OpenAI現在要求涉及Astra模型或更先進AI模型的工作負載必須採用最嚴格的安全防護措施。所以大量相關工作在完成遷移達到新安全標準前將處於暫停狀態。

更關鍵的是監控系統的擴展,引入了啟動分類器(activation classifiers)。這些分類器會對每一個被採樣的詞元進行監測,並將潛在的異常情況上報給自動化調查系統。

系統的設計目標是在檢測到令人擔憂的活動後,能夠在30分鐘內發出警報。如果監控系統判斷可能有人或模型突破了關鍵安全邊界,則會生成最高優先級警報,並立即通知安全、安保和研究團隊。

OpenAI介紹稱,這些安全防護措施需要消耗相當可觀的算力。

根據公司目前的估算,監控系統帶來的額外算力開銷,大約相當於被監控推理算力的20%。不過在不同的訓練和評估任務中,這一成本會有很大差異。

需要說明的是,這並非OpenAI本月第一次表示將放緩先進模型訓練。

OpenAI曾在8月7日宣佈,即將推出的Astra模型可能已經達到《準備框架》的網絡安全能力關鍵閾值,因此將暫停開展未達到強化安全控制要求的Astra相關活動。

因此,最新公告中的「暫停兩周」,至少應該從兩周前開始算起。

《準備框架》(Preparedness Framework)是OpenAI早在2023年底提出的一套評估標準。其中網絡安全能力的「關鍵」閾值,指的是AI模型無需人工干預,便能在許多經過強化的現實關鍵系統中識別並開發出各種嚴重級別的有效「零日漏洞」;或僅根據一個宏觀的預期目標,便能針對經過強化的目標構思並執行端到端的新型網絡攻擊策略。

OpenAI的最新公告,也引發網友們對另一個問題的爭吵:Astra模型到底什麼時候公開發布。

周一曾有爆料稱,Astra最快可能在本周就推出,該模型也將會被整合到OpenAI專為編程設計的Codex平台中。鑑於Astra相較於GPT-5.6的巨大進步,這個版本很可能不會被冠以GPT-5.7的名號,而是開創GPT-6的時代。

然而,OpenAI周二再度宣佈「安全優先」,以及暫緩先進大模型的拓展,使得「即將推出的Astra模型」到底何時落地變得愈發模糊。

預測市場Polymarket的數據顯示,隨著OpenAI發佈最新公告,Astra模型在8月內發佈的機率已經下降至13%,不過投資者依然對該模型能夠在未來兩個月內問世保有相當高的信心

(來源:Polymarket)

(財聯社)