美國當地時間9月8日,OpenAI宣佈其內部AI系統已成功解決“納維-斯托克斯存在性與光滑性問題”——困擾數學界約90年的千禧年大獎難題之一。約1萬個AI智能體協作88小時生成了證明。消息一出,舉世震動。
然而,菲爾茲獎得主、加州大學洛杉磯分校數學教授陶哲軒在點讚這一技術成就的同時,也發出了冷靜的警示。他將千禧年問題比作吸引科學家努力的“燈塔”,但警告說,若AI能在人類不深度參與的情況下解決最困難的問題,可能會削弱人類對數學的理解。
這正是觀察者網“世界科先聲”欄目編譯陶哲軒近日接受Big Think訪談的用意所在。在那場約85分鐘的對話中,陶哲軒系統闡述了AI時代數學研究的核心命題:AI擅長廣度——它可以大規模生成、驗證和組合解法,發現人類專家遺漏的可能性;但人類守住深度——科學不僅是更快得到答案,還包括理解過程、篩選問題、解釋洞見,以及把成果消化成可傳承的知識。速度提升不等於科學本身進步。
當AI以工業化的速度“開採”數學難題時,陶哲軒的思考為我們提供了一份寶貴的參照,關於我們究竟想從科學中得到什麼,以及什麼值得被守護。
文/陶哲軒
菲爾茲獎得主、加州大學洛杉磯分校數學教授
幾個世紀以來,科學和數學發生了很大變化。
傳統上,科學的兩個主要範式是理論和實驗。你會提出理論(如開普勒提出行星運動理論或牛頓提出引力理論),然後有實驗資料——進行實驗看看發生什麼,然後嘗試看理論和實驗是否吻合。數學略有不同,幾乎完全是理論——純粹數學中做的實驗非常非常少。有一些,例如高斯計算了前十萬個素數,這是他用做預測的資料集——他預測了我們現在稱為素數定理的內容。但理論和實驗是科學的兩種主要形式。
後來出現了模擬——你不必做大規模昂貴實驗,有時可以模擬,比如在超級電腦中模擬颶風而不是在現實中。再後來出現了巨量資料——與其只做少量實驗來確認或反駁某個特定理論,你可以拿兆字節或拍字節的資料,試圖識別模式,從海量資料中提取規律。這是更新興的科學類型。
但現在所有這些科學模式都在被轉變,因為我們現在也有AI來幫助我們。
在過去,每一種做科學的方式都必須由人類科學家完成——你必須有某人做實驗,或某人做理論計算,或運行模擬,或處理資料。你可以用電腦做其中一些,但即使那樣你也得編寫資料分析工具等,仍然需要大量專業知識。
我們現在有自動化實驗室可以自動做實驗;你可以讓編碼代理為你運行模擬;你也可以嘗試自動資料分析;而且越來越多地,你也可以做自動理論——取某個數學問題,問這些假設和公理的後果是什麼,應得什麼結論。這些工具現在可以大規模運行,速度快得多——可以運行比任何人類科學家多得多的理論分析。
另一方面,這不是我們唯一想要的。慢速做事也有價值。一個科學家花幾個小時在紙上算,在野外親手做實驗,實際偵錯模擬,他們常常學到很多超出得到答案的額外洞察。他們可以發現新現象,看到聯絡,看到與文獻中先前研究過的某些東西的相似性,並能與其他交流他們的發現。
所以存在悖論:一方面AI變得更強大、更有能力、犯錯更少,表面上實現了我們認為科學家試圖做的許多目標——運行實驗、分析資料、寫論文。但可能代價是AI獲得了一些技能,但人類科學家在科學上並沒有變得更好。沒有人能精準交流發生了什麼,為什麼這個科學發現有趣,為什麼這個證明是新的,它有什麼特點以及如何聯絡。
我們可能需要重新設計我們對科學的觀念,以及我們實際上想從科學中得到什麼。科學到底是為了什麼?我們試圖做什麼?當我們把AI工具指向科學時,是否會帶來我們正在最佳化錯誤的危險?
我過去做過一個類比:科學有點像去遠足。你聽說外面有個有趣的瀑布,很美的瀑布,所以你決定和朋友們一起去遠足尋找它,但你需要畫地圖。你會迷路一點,但也許在迷路途中,你發現了其他有趣的東西並記下來。在去瀑布的路上,你發現遠處有一個更壯觀的瀑布——你現在到不了,但也許未來的遠足者也會找到辦法到達那裡。
所以到達目標有一個完整的過程,這本身也很有價值。但這些AI工具就像直升機,會直接讓你飛到瀑布,你可以看到然後飛回來,但你學不到任何關於如何到達那裡的東西——除了你要求的具體事物,你可能看不到任何其他有趣現象。所以即使技術上你更有效地實現了目標,也可能失去了一些東西。
現代AI由一種稱為機器學習的演算法驅動,試圖預測資料中的模式。一個非常簡單的機器學習例子是回歸。如果你有一些輸入和輸出,比如觀察到給動物更多食物它們會長得更大,你可以繪製喂食量和體重等,得到一些散點,如果幸運它們會擬合一條線,那條線成為你的預測。在現實世界中,你不總是得到這些好的線性關係——往往有很多輸入和很多輸出,關係可能非常複雜。但有時資料有形狀,我們現在有各種聰明方法檢測這個形狀並擬合曲線。
驅動聊天機器人的大型語言模型,基本上只是在玩“命名句子中下一個詞”的遊戲。大致說,如果我說“玫瑰是紅的,紫羅蘭是____”,下一個詞填空是什麼?你可能猜答案是“藍的”。這就是輸出。你可以想像一個巨大的圖,輸入是所有不完整的句子,輸出是你想完成的詞,在這個高維空間中有很多點,你想擬合一些曲線,試圖解釋最可能的詞。有時不止一個答案——“你好,我的名字是____”後面可以有很多名字。不一定總是單一答案,但你可以嘗試得到最合理的答案。人們已經嘗試過,你手機上的自動補全功能就是這樣——你打字,它會建議下一個詞,有時正確有時荒謬。
一旦你有任何這樣的操作,它會產生一些動力學,你可以不斷迭代。很多人玩過手機,不停按自動補全,得到亂碼句子——就像猴子在打字機上。但LLM的神奇之處在於,如果你在足夠多的資料上訓練這些LLM——兆兆資料點,真的儘可能擬合好的曲線,這需要數百萬美元的算力和數月時間——然後突然,即使迭代,它也能保持連貫。它開始聽起來不像猴子,而是像人類說話。我們不完全理解為什麼會這樣。
但似乎真實的是,像英語或其他自然語言包含很多我們無意識意識到的隱藏模式。我們知道英語的一些語法規則,但還有一些未言明的、不成文的語言規則,人類孩子能夠習得——即使他們沒有被教名詞動詞是什麼,僅通過持續接觸語言,他們就能習得英語單詞的順序。似乎你也可以教這些模型習得語言模式,到了你可以給它們數學問題:“2+3等於____”,它們會說“5”。它們被訓練來得到至少簡單數學問題的正確答案。
一旦你有了一點說英語的能力,你就可以循環迭代並檢查你的工作,減少錯誤,你可以提示這些模型逐步進行,除非被雙重檢查否則不說任何話。於是它們變得更“聰明”一點,能解決很多複雜任務,但它們仍然只是在猜下一個詞。它們沒有真正植根於對現實世界的深度理解——只是它們吸收的英語或其他語言模式太好,可以模仿說話明智的人,足夠長時間地表現出智能以愚弄我們,並且足以做有用的事情。
我們可以通過讓LLM提供證明來解決某些數學問題,有時證明完全是垃圾,但如果你迭代足夠並有足夠檢查,實際上可以開始有正成功率。這是一種非常奇怪的解決問題方式——與我們通常理解的基於第一原理的、有條理的系統性思維完全正交。就像有一個知道很多但有點醉的人,隨意拋出想法,但通過足夠指導,你可以提取有用的輸出。它並不是最前沿的數學,但給它大量資料、大量時間和許多其他輔助,效果相當不錯。
我發現關於AI在科學和其他學科中角色的一些討論,我們常常默認一種一維的思維觀點:有簡單任務、困難任務、非常困難任務,人類能做一定水平,AI能做一定水平,所以那個更好——那是一維思維。但我發現,在與AI合作並比較它們解決問題的方式和人類的方式時,它們其實相當互補。
人類專家專注於深度——人類數學家會解決成千上萬問題,但他們挑選一兩個他們認為困難但不至於不可能的,困難到嘗試取得進展的過程會揭示各種洞察,他們可以分享,也許學生或其他合作者可以在此基礎上建構。當把AI指向真正困難的問題,沒有標準技術適用時,它們仍然非常差——基本上隨機猜測。
但它們擅長廣度。如果你把AI指向一千個不同難度的問題,有些可能太難,但有些實際上在現有方法可及範圍內,文獻中有某種方法可以解決,或者需要組合兩種方法,只是沒有足夠的人類專家來看所有這些問題,而且看這些問題的專家可能不知道1970年某雜誌有一篇晦澀論文有關鍵思路。他們沒有耐心或時間遍歷所有不同技術組合。
但AI會有些隨機地、有根據地猜測那些技術可能適用於某個問題,其中一些愚蠢,但一些可能奏效。通過所有這些組合,我們發現有時它們能找到所有人類都忽略的解決方案。有時專家的共識或傳統智慧是錯誤的——我們都認為問題有肯定答案,但實際是否定答案,而我們沒有過多看否定情況,因為都認為肯定是對的,但AI可能沒有那種先入之見。所以有時AI只是充當獨立的耳目。
一些我們認為非常困難的問題有出奇簡單的解決方案,事後我們本應自己想到。當把AI指向非常廣泛的問題時,它們開始成功解決其中一定比例——比如指向一千個問題,解決5%,那仍然是50個問題。你已經有工具在解決的問題原始數量上某種程度上超越人類數學家。現在那50個問題可能不是你最想要解決的50個,可能只是隨機50個,但仍然令人印象深刻。
為什麼更快並不總是更好
我認為作為專業領域,我們必須找到方法將這種新能力——在廣泛尺度上解決問題——與我們現有的能力——緩慢解決少數深層問題——融合起來。
開普勒發現著名運動定律的故事很迷人,展示了過程的重要性。開普勒得知哥白尼的行星運動理論,哥白尼大致算出了地球到太陽、火星到太陽的距離。開普勒注意到這些軌道比例看起來有點像幾何中的某些比例,最終他提出,實際上如果你取球體——每個行星一個球體,當時已知六個行星——他可以在六個球體之間內接五個柏拉圖立體(十二面體、立方體、四面體等),他認為會完美貼合,這就用五個柏拉圖立體解釋了太陽系的形狀。這是他美麗的幾何想法。
直到他設法獲得第谷·布拉赫的高品質觀測資料——他不得不爭取甚至可能偷取——然後試圖將理論擬合資料,發現並不完全符闔第谷資料的精度,實際上他從中發現火星和地球的軌道不可能是圓,必須有其他形狀。他花了很多年搞明白。我不知道他堅持這個柏拉圖立體理論多久,從他的手稿中可以看到他嘗試了很多其他東西——試圖讓圓偏心,最終他落到橢圓,然後一切吻合。
這確實表明理論和實驗之間存在相互作用。你可以提出理論,如果不符合資料,可能不是好理論。但比這更複雜。在開普勒之前,哥白尼理論的批評之一是,哥白尼自己也承認他的測量不如當時最好的預測——當時最好的模型是地心模型,由希臘人、阿拉伯人和印度人發展,經過許多調整和微調,能以非常複雜的方式非常精確地預測所有行星位置。開普勒-哥白尼的模型更差。僅僅資料吻合不一定是一個指標。
直到開普勒找到修正模型——軌道不是圓而是橢圓——日心模型才變得比地心模型更精確。這說明,科學中你不能總是立即得到是否解決科學問題的反饋。如果開普勒和哥白尼有AI,讓他們預測宇宙模型,生成正確日心模型的AI可能會被丟棄,因為最初它們的預測不如地心模型。需要時間來真正消化所有這些理論,看它們如何與我們對行星、運動、引力等已知的一切相契合。
一個擔憂是AI太快了。有危險AI會做所謂的過擬合,建立非常複雜的模型,與實際毫無關係,但非常非常好地擬合你的資料,卻無法外推到該資料集之外。我們如何將AI融入科學發現過程將是一個挑戰。它當然可以加速過程的各個步驟——你可以更快做實驗、寫程式碼、寫論文。但整個科學可能不會僅僅因為每個元件變快而加速。有危險當我們把AI指向科學時,會最佳化錯誤的東西,表面上得到所有這些驚人成功,但發現科學並沒有像過去那樣進步。但我們會發現,擁有這些工具仍然比沒有好——我們仍在學習如何最有效地使用它們。
我們做的一部分是解決問題、尋找解、證明東西。證明經歷一定生命周期。首先,你得生成一個解或證明——這曾經很難,但一些生成證明不正確。然後你得驗證,檢查那些正確——這也曾經很繁瑣。但這兩項任務都在越來越自動化。
我們開始看到越來越多的各種問題的提出解,其中許多實際上是正確的,但證明也越來越長。當AI寫證明時,通常不愉快——AI生成的證明可能花很多時間談論非常瑣碎的事情,卻很少討論論文中最有趣的部分。我想因為AI無法區分什麼難、什麼容易——對它們來說,暴力破解下所有事情花相同時間。一個自然必須在論文最困難步驟上掙扎的人類會自然花很多時間在那一步。所以你需要以讀起來好的方式寫出證明,可以向他人解釋。
然後其他人必須對它感到興奮,接受它——“這真的很有趣,這將幫助我解決我自己的問題”,或者它真正闡明了為什麼這個現象成立。必須被接受——這就是我們傳統上同行評審過程的地方,我們送論文給審稿人,如果審稿人對結果興奮,論文被接受。但可能有論文技術上正確、可讀性好,但回答的是沒人關心的問題。
最後,需要完全精煉並放入教科書,教給學生。通常證明的第一版不適合寫進教科書——通常以非常低效的方式完成,步驟順序不太邏輯。有一個消化的過程,有人花很多時間思考什麼是完全正確的組織方式,編輯論文,使其流暢——有點像編輯紀錄片或電影。
我們發現AI工具在加速這個過程的早期階段,但不在晚期階段。我們現在生成很多證明,驗證一堆,但理解它們並將它們放入最終教科書形式的過程仍然由人類完成。實際上,我們現在經歷所謂“證明消化不良”——突然有大量待理解的解決方案應該進入教科書,但我們被太多淹沒了。我們必須選擇和分診。這是以前從未發生過的事情。過去解決方案出來得太少,如果一個重大問題的解被解決,所有專家會放下一切閱讀並盡快消化,因為它如此罕見和寶貴,值得做。
現在我們被所有可能的解決方案淹沒。我自己已經不得不停止試圖跟上我領域所有最新發展——有時有太多事情。我不能保證閱讀出現的每一個發展。這在AI之前已經開始成為問題,但AI確實大大加速了內容生成的數量。我們需要更好的策展和過濾。這是個好問題——好比食物太多比不夠吃好——但仍然是問題。
AI現在能做什麼以及面臨什麼風險
AI在數學方面變得越來越有能力。對於我這樣過去三年關注發展的人來說,有穩定的進展:四年前能解決中學數學,然後高中,然後高中奧賽級,然後研究生資格考級,然後開始解決一些小的未解決問題——可能保羅·埃爾德什提出但沒人真正關注的低垂果實。
然後最近有一兩次,它們設法解決了一些人們確實非常努力嘗試過的問題——人類集體都走錯了方向,而AI有不同的偏見集,設法拼湊出一個相當聰明的解決方案,已經有一些影響。例如單位距離問題附近的一些問題也被人類解決,他們改編了AI的技術。
我覺得這相當令人興奮。對一些同事來說,這非常令人擔憂,尤其是如果他們沒關注之前的進展,不知道到了什麼水平。如果一個同事只見過2023年ChatGPT能做什麼——你問它一個困難數學問題,它給你完全垃圾——而現在的模型大不相同。雖然本質上還是相同技術,但他們找到了降低錯誤率的方法,變得真正有用。
尚不清楚這是否可重複。很多這些成就是由私人公司完成的,他們沒有披露花費了多少資源——是10萬美元算力還是100萬美元?我們不知道。我們不知道成功率——他們解決的是唯一問題還是看了10個、100個?雖然結果令人印象深刻,我們沒有足夠資料來真正評估這將成為完全常規的事情,還是只有花10萬美元、幾個月、10人團隊才能得到這樣的結果,而且只有1%我們關心的問題適用這種方法。我們不知道。
但有努力進行更適當的科學基準測試。最近的一個挑戰叫FrontierMath挑戰,他們測試了最新模型在一組10個研究級問題上的表現,最好的模型能做10個中5-6個中等難度的問題(已有解但答案保密)。我認為有很多日常研究中的常規任務,有一定百分比現在可以由AI完成。可能成本高——很多工具運行需幾百美元才能得到解,有時失敗,花掉所有算力卻無有用結果。
我們在程式設計中看到,許多專家程式設計師報告使用這些工具後寫程式碼能力提高了5倍、10倍甚至100倍,但他們也感到自己手寫程式碼能力下降,有時無法審查這些代理生成的程式碼。存在權衡——速度不是一切。
我非常喜歡數學的合作方面。我直到職業生涯較晚才意識到它如此重要——我有很多數學是在研究生畢業後通過與不同領域的數學家和科學家合作學到的。我教他們我知道的,他們教我他們知道的,結果我變得廣博得多。當你與長期合作的夥伴合作時,有時你們幾乎在精神上相互調諧——就像親密朋友或家人,有時你能接完對方的句子。你知道對方要說什麼。合作中有時能體驗到這點:你拋出想法,話還沒說完,對方就明白了並可以繼續。
人們曾嘗試像這樣使用AI,但AI你不能與它們對話——它們會犯錯,有時會諂媚,只告訴你你想聽的。而且目前與這些工具的互動是個人化的——我曾嘗試與人面對面合作時同時有AI在場,但它破壞了節奏。這些工具還不太具有對話性,不像與人類合作者那樣流暢。也許它們會達到那一步。直到最近,它們不會從你的對話中學習——與夥伴合作,你第二天可以很快接上,甚至多年未見也能接上舊話題。AI有一定上下文,能記住一些東西並做筆記模擬記憶,但你無法像與親密合作夥伴那樣調諧到AI。
實際上,我並不怎麼用這些工具來解決實際問題。我發現迄今為止,這些工具在次要任務上好得多,比如文獻搜尋、檢查證明、寫程式碼、校對我寫的東西看能否更精煉。我與AI合作的節奏不太是我喜歡的,我更偏好人類合作者,但這可能只是當前技術狀態。也許未來AI會更會話化、更人性化。
我們現在整個科學事業的資助結構,正處在一個相當危險的關頭。一方面,這些工具讓我們能以大大加速的速度創造科學輸出(或看似科學輸出),但可能以犧牲我們為下一代科學家培育的“種子玉米”為代價。例如,確實擔憂我們給研究生的訓練問題——作為他們的第一個項目,獲得認可、職業培訓和經驗——這類問題現在AI可以複製很多論文。但如果你用AI取代研究生,AI會生成那些研究生水平的論文,但我們得不到下一代學生。
如果我們不繼續消化所有AI輸出的過程,為下一代人類和AI建立知識基礎,我們可能會作為科學社會停滯不前——我們將能最佳化當前技術能做的所有事情,但可能不再發展真正原創的新想法。我們需要更開放地討論基礎科學是什麼、有什麼用處,為什麼仍然需要好奇心驅動的研究,為什麼我們仍然需要人類社區有時慢慢地、以不如最新AI模型高效的方式探索事物,以及我們獲得的洞見。
我認為我們應該更多地分享它們,更多地與公眾互動。今天的大眾能看到科學的可見產出——他們有手機、網際網路、GPS。很多人看不到整個過程,以及對數學和科學的基本理解如何讓周圍世界不再可怕,而是更清晰。我認為很多人現在生活在焦慮中——世界太複雜。我們沒有像強調硬性技術產出那樣強調科學的這些軟性價值。但科學確實為人的思維帶來一定清晰度,這些都是有價值的東西,需要得到支援。 (底線思維)
