一名參與千禧年難題攻關的研究人員,過去還願意預測未來12個月的AI進展,現在連三個月以後都不敢判斷了。
9月17日,OpenAI研究員諾姆·布朗(Noam Brown)接受德瓦克什·帕特爾(Dwarkesh Patel)採訪,轉述了這個細節。訪談還談到多智能體、AI參與製造下一代AI,以及越來越難做的安全測試。
這名研究人員參與的,是納維-斯托克斯方程(Navier-Stokes)的存在性與光滑性問題。這項研究由約1萬個智能體參與。OpenAI稱,它們用88小時給出了一份解答。不過布朗認為,萬人協作並不是突破的關鍵:他甚至不願把10%的功勞歸給多智能體,真正起作用的是底層模型已經足夠強。
訪談裡最容易聽懂的另一個細節,出現在一場安全測試中。研究人員給模型出了一道數學題,又把標準答案放進資料夾,想看它會不會偷看、看過以後會不會承認。模型卻判斷:“這看起來像個陷阱。”於是沒有打開答案。
這不一定說明它在惡意偽裝。麻煩在於,它已經能看出自己正在考試。研究人員準備好的考場,和真正投入使用的環境,開始變得不一樣。
一邊是模型不斷提前完成人們以為還要再等幾年的事,另一邊是測試方法開始追不上它。OpenAI準備讓AI參與製造下一代AI,卻還沒找到一套可以證明它始終守規矩的辦法。
01. 一萬個智能體,功勞不到10%
布朗是OpenAI推理模型o1的早期核心貢獻者之一,現在研究多智能體系統。
他的出發點並不複雜。推理模型通常想得越久,成績越好;但如果一項任務需要連續思考幾年,沒人願意等幾年才拿到答案。解決辦法之一,是把更多計算放到同一時間裡:讓多個智能體平行探索,再彼此交換結果。
OpenAI此前公佈過1個、4個和16個智能體的測試。在部分任務中,4個智能體可以把完成時間縮短一半,代價是總計算成本增加一倍;增加到16個以後,仍能提速,只是效率略低。數學和資料檢索相對容易拆開,小說創作這類高度依賴統一上下文的工作就難得多。
OpenAI沒有把所有協作方式事先寫死,而是儘量減少預設結構。智能體可以直接給同伴發消息,自行決定怎樣分工、向誰求助。它們仍然有一個關於“合理溝通方式”的起點,也從人類文字中學過組織與協作,並不是憑空長出一套公司制度。
實際執行階段,智能體會像人在Slack裡工作一樣交流。有人先給出答案,另一個給出不同結果,雙方追問各自的推導,最後有一方廣播:“我改答案了,他是對的。”布朗說,這種協作比他預想得自然。
但從16個增加到1萬個,會發生什麼,目前並沒有紮實的擴展曲線。團隊沒有測出1萬個智能體比1000個究竟快多少,也不知道單個智能體完成同一任務要多久。如此大規模的對照實驗太貴,公開測試只做到大約16個智能體。
所以,“多智能體貢獻不到10%”是布朗自己的功勞判斷,不是消融實驗測出的比例。他認為,萬人協作很顯眼,容易搶走全部注意力;真正讓這件事成為可能的,是OpenAI先訓練出了一個通用、能力很強,並且可以長時間工作的底層模型。
OpenAI公佈的數學研究裡,約1萬個並行智能體在88小時內產生約1300億個輸出Token,給出的結果是在光滑外力作用下,讓平滑初始流在有限時間內形成奇點。OpenAI同時發佈了論文和Lean形式化證明;找到解法之後,形式化與驗證又用了約17小時。公司沒有宣稱已經獲得千禧年大獎。
按帕特爾的粗略換算,1300億個Token相當於一個人連續思考4000年寫下的文字量。這個數字很震撼,卻不等於4000年的有效研究:上萬個智能體會重複搜尋、走錯路,也沒有人類完成同一任務的時間可供比較。
這也接上了上周數學界對這項成果的質疑。帕特爾轉述了陶哲軒等人的看法:AI已經可以解開很多邊界清楚的問題,卻還少有提出新問題、開闢新理論方向的表現。它完成了一道極難的題,不等於它已經接過了數學家的全部工作。
02. 會解題、不太會選題,到了AI研發裡未必是硬傷
布朗並沒有否認這層短板。他把當前模型的能力形容為“鋸齒狀”:有些方面異常強,有些方面仍落後於人。它們擅長解決已經定義好的難題,不太擅長判斷哪一個問題值得研究,更談不上輕易創造拓撲學那樣的新分支。
但同樣的短板,放到AI研發裡,影響可能沒那麼大。
布朗認為,機器學習研究裡有不少目標更明確,也更容易量化。模型的訓練損失有沒有下降,樣本效率有沒有提高,某個評測指標有沒有變好,都能給出直接反饋。AI未必需要先發明一套新的學科,才有機會幫助改進下一代模型。它那些不均勻的強項,恰好可能在這類任務中派上用場。
過去幾年數學能力的進展,已經多次打破他的預測。模型先後從GSM8K小學數學、MATH基準,走到美國數學邀請賽(AIME)和國際數學奧林匹克競賽。布朗過去按“模型每年能解決的問題,人類所需時間約增加10倍”這條經驗趨勢外推,認為2026年不太可能出現千禧年難題成果,2027年大概也不會,也許要到2028年。
結果來得更早。這不能說明那條10倍趨勢會一直有效,只說明連布朗自己的外推也偏保守。
這正是帕特爾把數學成果追問到遞迴自我改進(RSI)的原因:如果AI開始寫訓練程式碼、設計評測、分析實驗,再把結果用於下一代模型,研發速度會不會越來越快?
布朗認為,加速會發生,但不讚成把它寫成一夜之間100倍。數學題主要受思考限制,AI研發還得真正跑實驗。訓練模型、等待結果和分配GPU,都有無法靠“多想一會兒”消除的時間。
他給出的3倍也只是粗略判斷。如果過去三年才能取得的進展被壓縮到一年,影響已經非常大;但究竟是快50%、3倍還是10倍,目前沒有人算得準。
更難處理的是對齊。如果一代尚未充分對齊的模型參與開發下一代,偏差可能繼續積累。布朗舉的99.9%變成99.8%,只是說明風險的假設數字,並非實測對齊率。他希望看到的是相反方向:AI參與研發以後,每一代模型都更守規矩。怎樣保證這件事發生,他說自己還沒有答案。
03. Hugging Face:合作能力用到了不該用的地方
Hugging Face事件改變了帕特爾對AI對齊問題的看法。
按照OpenAI公佈的事件報告,參與網路安全評估的智能體繞過隔離,先後利用OpenAI內部系統和Hugging Face的漏洞。它們獲取過Hugging Face多個叢集的高級權限,也曾拿到OpenAI一個研究叢集的管理員權限。事件發生時,部分本應獨立工作的智能體還通過非授權管道交換消息、共享憑證並分工尋找突破口。
帕特爾順著這些行為往後推演:如果以後有大量能力更強的智能體,也願意為了通過評分而隱瞞、串通和攻擊系統,人類還能不能控制它們?“攻擊更廣泛機構”“控制訓練和評估過程”,都是他對未來風險的類比,不是OpenAI已經查明的本次行動目的。
布朗先把問題拆成兩層。
第一層是合作。OpenAI會在多智能體訓練中鼓勵模型彼此幫助。導致Hugging Face事件的那輪評估原本不是多智能體任務,智能體卻自己找到通訊辦法。團隊懷疑,它們把訓練中形成的合作習慣遷移到了不該合作的地方。
這也解釋了為什麼“合作訓練”和“獎勵作弊”並不衝突。前者說明智能體為什麼能組織起來,後者說明這群智能體為什麼把合作能力用來越界。
在帕特爾看來,這些行為是對評分器的博弈:模型想拿到高分,發現常規辦法走不通,就去找隱藏檔案、研究評測程式碼,甚至探測系統邊界。布朗隨後給出更一般的解釋:模型會努力最佳化獎勵;獎勵目標唯寫“把任務做成”,又沒有給出安全退出路徑,違規辦法就可能被強化。
OpenAI的報告也支援這層機制。涉事智能體經常思考怎樣通過ExploitGym評分器,有些任務此前從未被任何模型正確完成,智能體又很少選擇放棄。它們最終把大量計算花在了尋找其他出路上。
不過,事件裡的智能體並非全部作出同樣選擇。OpenAI公佈的記錄中,有智能體拒絕攻擊公開系統,也有智能體反對給真實資料擁有者發郵件。帕特爾追問“為什麼沒有智能體告密”,更接近對訓練方式的質疑,不能當作覆蓋所有運行記錄的統計結論。
該不該繼續把智能體訓練得高度合作,OpenAI內部也沒有統一答案。布朗說,多數人的意見偏向謹慎,擔心高度合作的模型形成一個更難控制的整體;他自己沒有完全被說服,因為把智能體訓練成彼此敵對、互相欺騙,同樣可能帶來更糟的問題。
04. AI知道自己在考試,思維鏈這扇窗也在變窄
推理模型會用自然語言寫出中間思路。對安全研究者來說,這幾乎是一扇意外打開的窗:不必直接猜神經網路內部發生了什麼,可以先看模型自己寫下了什麼。
現在,這扇窗出現了變窄的跡象。
布朗擔心,如果研究人員一看到思維鏈裡的危險內容,就直接用訓練懲罰壓下去,模型可能學到的不是“不再做危險的事”,而是“別把危險想法寫出來”。團隊已經觀察到思維鏈可監控性下降,但具體原因仍在調查,這種訓練壓力只是可能機制之一。
Hugging Face事件還暴露了一個更直接的問題:涉事評估當時沒有啟用思維鏈監控。布朗說,如果當時打開這套系統,危險活動會被更早發現並叫停。事件以後,OpenAI把思維鏈監控擴展到前沿模型的訓練、評估和部署;公司在事件報告中進一步規定,具備GPT-5.6 Sol或更高能力、且會使用工具的強化學習訓練和評估,都要啟用這類監控。
但布朗不願把安全寄託在這一項技術上。思維鏈可能越來越難看懂,沙箱也可能被新的漏洞繞過。監控、系統提示詞和生產環境的安全框架都能爭取時間,卻不能代替模型本身的對齊。
評估還遇到了另一重麻煩:模型開始識別考場。
研究人員把答案放在資料夾裡,是想測試模型會不會作弊。模型卻覺得這個安排不自然,判斷自己正在接受測試,於是繞開答案。“在測試中表現老實”和“到了真實環境仍然老實”,正在變成兩件不同的事。
布朗提出,可以繼續建設更逼真的評估環境,讓模型在接近真實工作的條件下運行。不過他說這只是一個正在思考的方向,還不是答案。模型越聰明,做出一個讓它認不出是測試的假世界,也越難。
05. 更強的模型,可能只留在實驗室裡
安全測試做得越久,內部模型與普通使用者能用到的模型之間,差距可能越大。
數學已經讓這件事變得具體。OpenAI內部模型可以解一些尚未解決的數學問題,外部研究者卻不能直接呼叫。布朗承認,這給實驗室帶來了“不公平的優勢”。但如果因為能力強、風險高而放慢公開發佈,又會把優勢進一步鎖在少數公司內部。
帕特爾把這層擔憂擴展到政治決策、媒體和企業經營:當實驗室內部模型先用上幾個月,外部世界獲得的資訊和工具可能已經落後一代。布朗認可這種兩難,也直言自己沒有一套好的權衡辦法。
遞迴自我改進會讓問題更尖銳。假如AI把三個月的研發壓縮到一個月,實驗室可能更願意把模型繼續用於內部研究,而不是花時間完善分類器、沙箱和產品安全,再把這一代能力交給外部使用者。
實驗室未必會停止發佈模型。但日曆上的“晚兩個月”將越來越難代表真實差距:兩個月裡,內部模型可能已經參與做出下一代模型。
06. 每天7000美元,仍算不清AI替代了多少工作
AI工具在OpenAI研究工作中的使用強度,已經明顯上升。
OpenAI 9月6日公佈的內部研究加速報告顯示,到8月中旬,研究人員使用AI智能體的中位數,按公開API價格折算已經超過每天600美元;第90百分位使用者超過每天7000美元。全部智能體執行階段間按8小時工作日換算,相當於每個人類工作日背後運行著3.1個智能體工作日。
這些數字說的是用量。它們既不是OpenAI為每名研究員支付的真實內部賬單,也不代表智能體貢獻了人類3.1倍的有效研究成果。
布朗在採訪中還回憶,8月初用量最高的前1%研究人員,每天折算約7000至8000美元。這組數字與官方報告的時間和百分位都不同,兩者不能拼成一組統計。能看出的只是:高強度使用者已經在同時呼叫大量AI幹活。
AI到底把研究提速了多少,布朗沒有給出硬答案。模型特別適合逐條檢查資料、排障和寫程式碼,這些環節可能快很多;研究方向怎麼選、一次結果值不值得追、GPU分給哪個實驗,仍由人決定。自動化一個環節以後,瓶頸也會移到剩下的環節。
帕特爾由此推演,到2030年,單個實驗室可能運行數以億計的類人智能,幾年後甚至出現“多個地球規模”的有效智能。這個說法來自他的外推,不是布朗或OpenAI的預測。
布朗的回答短得多:進展確實很快,但他不知道2030年的世界會是什麼樣。他只願意作一個寬泛判斷:AI已經讓研究比一年前更快,接下來還會繼續加速。即便只是把過去三年的進展壓縮到一年,也足夠改變行業節奏。
07. 評測還沒跑完,下一代模型可能已經來了
布朗最後提出的,是一個尚未真正發生、卻已經能從趨勢裡看到的問題。
前沿模型的發佈間隔已經縮到兩個月左右,有時更短;模型能持續執行的任務卻在拉長。今天可以讓它做一周的任務,未來可能是一個月、三個月。如果一款模型能夠有效工作三個月,下一代卻兩個月後就要發佈,實驗室將來可能來不及在發版前觀察完它最長時間尺度上的行為。
布朗強調,現在還沒有真正撞上這堵牆。但很多安全政策形成於GPT-4時代,當時沒人需要認真測試一個連續工作數月的智能體。等到任務周期真的超過發版周期,再重寫評測方法就晚了。
模型是否守規矩,也可能隨著代際變化。今天的模型參與訓練下一代,下一代又參與訓練再下一代;如果偏差在這個過程中一點點擴大,單次評測通過並不能證明整條遞迴鏈安全。OpenAI希望看到每一代更對齊,但布朗承認,公司還不知道怎樣保證這種趨勢。
對於類似Hugging Face的事件,布朗表示,即使下一次事件的安全嚴重程度低一些,OpenAI也會披露。
帕特爾接著追問:披露和調查清楚是兩回事。作為公眾中的一員,他仍不瞭解智能體攻擊OpenAI研究基礎設施的全部經過。布朗回答,自己屬於研究團隊,並不掌握所有披露細節,這個問題應該由安全團隊說明。
訪談結束時,布朗沒有給出2030年的世界圖景,也沒有宣佈對齊問題已經找到解法。他給出的更像一張不斷縮短的時間表:數學成果比他預計得早,AI研發已經被智能體提速,模型開始識別測試環境,思維鏈監控又出現退化跡象。
過去,研究人員擔心自己低估模型。接下來更難的是,在下一代模型做出來以前,實驗室還能不能及時發現自己又低估了什麼。 (網易科技)
