9月25日,Anthropic公佈Claude在理論物理領域的一項新成果。
Claude計算出了平面 N=4 超對稱楊-米爾斯理論(planar N=4 super-Yang-Mills)中的九圈六粒子散射振幅。
這道題,是前理論物理學家Matt von Hippel在8月公開向AI公司下的戰書。
一個月後,挑戰被破解。整個過程幾乎沒有科學上的人工指導。總成本約1000到2000美元,其中核心計算只花了約100美元。
該領域八圈紀錄的保持者、史丹佛大學和SLAC國家加速器實驗室教授Lance Dixon親自驗證了結果。他坦言,自己原本認為這個問題太難,不可能直接算出來。
幾乎在同一時間,中國科學院理論物理研究所的何頌也表示,他的課題組借助GPT-6已經拿到了九圈結果的大部分。
就在幾天前,Anthropic剛剛宣佈自建濕實驗室,並公佈了Claude自主發現全新DNA系統ART的成果。
一週之內,從生物到物理,Anthropic正在密集亮出Claude的科研底牌。
難道馬斯克預言成真了?近日馬斯克在一條AI4S的相關推文中預言:人工智慧最遲在明年年底或2028年,就會在所有(科學)領域佔據主導地位。
計算物理學、計算化學、計算生物學、計算醫學.....甚至計算考古學。逼真的模擬、巨量資料分析,以及AI將無處不在。
AI4S的新時代,已經全面開啟。
01. 一封戰書,一個月被AI破解
Matt von Hippel曾是理論物理學家,如今是科學作家,長期在個人部落格上寫物理。
近幾年,他寫物理越來越繞不開AI,但AI圈的專家意見嚴重分裂:一派認為幾年內就會出現超級智能,另一派認為大模型已接近天花板,連像樣的物理研究都做不了。
他不想站隊,決定親自出題。
有意思的是,他特意避開了數學方向的題目。在他看來數學突破靠靈感,難度很難提前判斷。計算難題則不同,需要多少機器跑多少天這個過程可以直接對比的。
於是在8月,他點名挑戰AI公司:用普通學者拿得到的計算資源,判斷 N=8 超引力在七圈是否發散,或者把N=4超楊-米爾斯算到九圈。
Anthropic選了後者,並最終成功了。
02. 九圈有多難?領域紀錄停在八圈
這道題出自理論物理中“散射振幅”的方向。
散射振幅描述的是粒子相撞時發生各種反應的機率。算得越準,越能和大型強子對撞機的實驗資料比對,一旦對不上,就可能指向暗物質等新物理。
圈數越多,計入的量子漲落就越多,結果越精確,但計算量也急劇上升。Matt 在戰書裡表示:圈數是結果精度的粗略衡量,而且每多一圈,計算量通常按指數、甚至階乘增長。
所以,九圈的意思是把精度一直推到第九層修正。現實中的粒子物理計算大多停在兩圈,最精確的預言之一也只用了五圈。
N=4超楊-米爾斯是一個“玩具模型”,每個粒子配有四個超對稱夥伴,不描述真實世界。但正因為結構高度對稱,它反而更好算,成了物理學家打磨新方法的試驗場。
計算採用的是一種叫bootstrap(自舉)的技術。這個過程有點像數獨數獨。先列出所有可能的答案,再用各種已知規則逐一排除,直到只剩唯一解。
此前的紀錄是八圈,由Dixon團隊在2023年取得。而且走的是一條間接路線。先算更簡單的“形狀因子”,再借助一種奇特的“對跖對偶”對稱性,繞回振幅本身。
在業內看來,直接再往前推一圈並不現實。
8月底,Anthropic的兩位物理學家Liam Fitzpatrick和Siddharth Mishra-Sharma聯絡作者表示挑戰已經完成。
他們沒有動用大規模算力,而是用了Anthropic面向科學家的平台Claude Science,驅動模型為Fable 5.1。
整個流程簡單得出奇。研究者先問Claude那道題它最有把握。隨後只給了一句題目:計算平面N=4超楊-米爾斯中六粒子振幅的九圈結果。
此後,人類幾乎只是下指令讓它繼續。其中一次,研究者睡前交代Claude一直算下去,每4到6小時匯報一次進展。
結果Claude不僅算出了九圈結果,還用兩種方法各完成了一遍:一種是原始的bootstrap路線,另一種是Dixon團隊的間接形狀因子路線。
成本方面,任選一種方法,終端使用者約需1000到2000美元,主要花在Claude長時間運行上。真正的計算部分用Python和SymPy完成,只花了約100美元。
作者感嘆,在他十年前做研究時算是一筆不小的開銷,如今只要理由充分,誰都負擔得起。
更戲劇性的細節來了。
Anthropic聯絡作者幾天後,中國科學院的何頌團隊也發來消息:他們同樣算出了九圈結果的大部分。
何頌與 Jirong Jing、Xiang Li 在 Zenodo 上公開了一份資料集,題為《六膠子 MHV 振幅直至九圈的符號》,涵蓋二圈至九圈的符號(symbol)資料。
何頌團隊也用了AI,不過是GPT-6,但只用於計算部分約束條件,整體框架仍由人類主導。
同一個前沿問題,兩種範式幾乎同時抵達終點。一邊是幾乎無人參與的AI自主計算,一邊是人類主導讓AI助攻。
但他真正佩服的,不是計算量,而是這套流程的脆弱性。整個計算環環相扣,只要一處出錯就會全盤崩潰,而且大量構造細節瑣碎到論文裡都不會完整記錄。這意味著,Claude必須從零寫出全部程式碼。
不過被搶先,Dixon並不沮喪。一方面,他的團隊本就在用自研transformer模型預測更高圈數,口號之一就是有能力驗證機器給出的任何答案。
另一方面,Claude用的全是他們多年積累的方法,連結果格式都與此前保持一致。換句話說,他在驗證Claude,Claude也在驗證他們過去的所有工作。
Dixon甚至評價:除合作者外,Claude比任何人都更懂他們2019年和2023年的論文。
結果最終將由人類研究者整理發表。
03. 不是超級智能,但已經足夠可靠
儘管結果亮眼,出題人Matt von Hippel的評價卻相當克制。
他原本希望看到AI用意想不到的新方法突破計算極限。但實際上,Claude用的都是已知方法,只是比前人多投入了一些算力,工程習慣更好一些,談不上超級智能。
不過,他從中得出了兩個判斷。
第一,低垂的果實比想像中多。即便目標明確,專家也可能高估它的難度。那些常年勸物理學家多雇幾個程式設計師的電腦背景人士,這次被證明是對的。
第二,AI已經足夠可靠。這類計算繁瑣易錯,作者坦言換作自己,一週的工作大機率要拖成兩週,因為第一次幾乎必然出錯。而這一次,全程沒有外部專家介入,平台自己把計算推到了終點。
值得注意的是進步速度。今年3月,AI做物理項目還像個學生,任務小、需要手把手指導、錯誤不斷。僅半年後,它完成的已是通常由領域頂尖專家攻克的前沿計算。
Dixon則留下了一句更有份量的話:真正值得深刻反思的時刻,會是大模型先於人類提出新的物理原理的那一天。
04. Anthropic的科研版圖,正在成形
把時間線拉開看,這不是一次孤立的展示。
9月23日,Anthropic宣佈成立生命科學研究組、自建濕實驗室,同時公佈Claude自主發現全新DNA系統ART。兩天后,便是高能物理領域的九圈振幅計算。
同一時期,Anthropic還公佈了另一項成果:Claude在不到四週內最佳化了30多個開源生物分子建模模型,平均提速約4倍。
從生物學發現,到計算工具最佳化,再到理論物理前沿計算,貫穿其中的是同一個平台:Claude Science。
Anthropic想讓Claude扮演的,顯然不只是查文獻、寫程式碼的助手,而是科研流程中最昂貴、最耗時的那個執行者。
當算得出來變得越來越便宜,科研的瓶頸正在轉移:誰能提出好問題,誰能驗證答案,誰就握有下一階段的話語權。 (智藥局)
