#GPT-5.2
Google殺瘋了Gemini 3 推理模式封神,碾壓 GPT-5.2,科研工程界迎終極神器
2026 年 AI 科研賽道再迎王炸!Google官宣 Gemini 3 Deep Think 推理模式重磅升級,劍指科學研究與工程落地的複雜難題,多項基準測試成績直接刷新全球紀錄,不僅碾壓 GPT-5.2、Claude Opus 4.6 等競品,更達到世界頂尖程式設計師、奧賽金牌級水平。更重磅的是,Google首次開放該模式 API 早期訪問,科研人和工程師的效率天花板,直接被重新定義!實測封神!全維度霸榜,多項成績碾壓主流大模型此次升級的 Gemini 3 Deep Think,最硬核的底氣就是實打實的測試成績,在數學、物理、程式設計、抽象推理等全維度高難度基準測試中,實現全面霸榜,無工具加持下的表現堪稱驚豔。在抽象推理核心測試 ARC-AGI-2 中,它拿下 84.6% 的超高正確率,遠超 Claude Opus 4.6 的 68.8% 和 GPT-5.2 的 52.9%,成績直接斷層領先。“終極人類考試” 中,48.4% 的得分也甩開 Claude 的 40.0%、GPT-5.2 的 34.5%,盡顯高階推理實力。程式設計領域更是直接封神,Codeforces 競賽程式設計基準中斬獲 3455 的 Elo 評分,遠超 Gemini 3 原版的 2512 和 Claude 的 2352,達到世界頂尖程式設計師水準。而在 2025 年國際奧賽中,數學、物理、化學理論測試均拿下金牌級成績,物理更是達到 87.7% 的正確率,把 GPT-5.2 的 70.5% 遠遠甩在身後。就連多模態理解、凝聚態物理理論等偏門高難領域,它也表現亮眼,MMMU-Pro 測試 81.5% 正確率、CMT-Benchmark 50.5% 得分,均大幅領先主流競品,真正實現了 “文理通吃、科工全能”。直擊痛點!專為科研工程而生,破解真實場景難題Google此次升級並非單純的參數堆砌,而是精準瞄準科研和工程場景的核心痛點 —— 真實工作中資料雜亂、問題邊界模糊、需要長鏈路邏輯推理,而 Deep Think 就是為解決這些問題量身打造。它摒棄了大模型常見的 “表面化推理”,擁有更深度的邏輯鏈分析能力,能處理科研中複雜的因果推導、工程裡精密的流程最佳化。Google已展示其實際應用價值:協助數學家快速發現論文中的邏輯漏洞,從繁雜的公式推導中定位問題;助力工程師最佳化半導體晶體生長工藝,通過多維度資料分析找到工藝提升的關鍵節點。不同於普通大模型只能做 “輔助性文案工作”,Deep Think 能真正深度參與科研和工程的核心環節,從理論分析到實際落地,提供可落地、可驗證的解決方案,讓 AI 從 “工具” 變成真正的 “科研夥伴”。重磅開放!API 解鎖,兩類使用者率先嘗鮮在成績亮眼、應用落地的雙重加持下,Google此次也邁出了關鍵一步 —— 打破封閉,首次開放 Gemini 3 Deep Think 的使用權限,讓頂尖 AI 能力走出實驗室,真正服務於科研和產業界。目前該模式已面向Google AI Ultra 訂閱使用者全面開放,這類使用者可直接體驗全功能的深度推理能力。更值得關注的是,Google首次通過Gemini API,向部分研究人員、工程師及企業提供早期存取權,這意味著相關從業者可將該模型接入自有系統、科研平台,實現定製化的深度應用。從以往的 “專屬封閉” 到如今的 “有限開放”,Google的這一動作,也讓全球科研和工程界看到了頂尖 AI 技術普惠的可能,未來無論是高校的基礎研究,還是企業的工程落地,都有望借助這一工具實現效率躍升。行業震動!AI 科研工具迎來新拐點,競爭再升級Gemini 3 Deep Think 的升級與開放,不僅讓科研人和工程師迎來 “效率神器”,更在全球 AI 行業引發連鎖震動,讓大模型的競爭從 “通用能力比拚” 轉向 “專業場景深耕”。此前,主流大模型更多聚焦於通用對話、內容生成,在專業科研工程領域的表現始終差強人意,而Google此次精準卡位高難度專業場景,用實打實的成績證明了大模型在硬核領域的落地價值。這也給其他 AI 廠商指明了方向:單純的參數競賽已無意義,能解決真實專業問題的模型,才擁有真正的核心競爭力。對於科研和工程界而言,這一升級更是一場效率革命 —— 以往需要團隊數天甚至數月的邏輯推導、工藝最佳化、程式碼編寫,如今借助 Deep Think 可能幾小時就能完成,大大縮短了研究和開發周期。而隨著 API 的逐步開放,未來還將催生更多基於該模型的專業工具,推動科研和工程領域的智能化升級。從全維度霸榜的測試成績,到直擊痛點的場景落地,再到打破封閉的 API 開放,Google Gemini 3 Deep Think 的此次升級,每一步都踩在了 AI 行業的核心發展點上。它不僅展現了Google在大模型領域的技術領先,更讓我們看到了 AI 賦能硬核科研、推動產業升級的無限可能。隨著頂尖 AI 技術的逐步普惠,科研和工程的智能化時代,已然加速到來! (硬核科技喵)
陶哲軒潑冷水:我不相信AGI!但又一數學難題被GPT-5.2 Pro攻克
就在剛剛,陶哲軒po文揭秘:當前的AI無法實現真正的AGI,不過,他們倒是擁有一些有用的小聰明,或者可以說「通用狡猾」。而就在同時,又一多年數學難題被GPT-5.2 Pro攻克了。就在今天,即將離職Meta的LeCun再次給當前AI判死刑——這條路行不通,而且永遠不會成功。前不久,GoogleDeepMind首席科學家Shane Legg給出預測:最小AGI有50%的可能性在2028年實現。業界都在討論的AGI之爭,陶哲軒是如何看待的?就在剛剛,陶哲軒po文明確了自己的態度——還不行。他認為,目前還無法實現AGI。我懷疑目前工具還無法實現真正意義上的「人工通用智能」。然而,我認為一種較弱但仍然非常有價值的「人工通用才智」,正在以各種方式成為現實。而他的觀點,立馬在網上引起了廣泛討論。網友們表示,陶哲軒這樣聰明的人,都認為AGI並未實現,這樣太令人絕望了——希望他是錯的吧。陶哲軒:不是AGI,只是魔術師什麼叫通用才智?陶哲軒是這樣解釋的。「通用才智」是指通過某種臨時手段解決廣泛複雜問題的能力。這些手段可能是隨機的,也可能是暴力計算的成果;它們可能缺乏根基或容易出錯;它們可能難以解釋,也可能能追溯到AI訓練資料中類似的技巧。因此,它們不能被視為任何真正「智能」的結果。然而,它們在實現日益廣泛的任務時,可以擁有非同尋常的成功率,尤其是在結合嚴格的驗證程序以過濾掉錯誤或不具前景的方法時,其規模已超出了單個人類所能達到的範圍。可以理解為,這是一種「通用狡猾」AI。而這種「通用狡猾」AI,就會讓人感覺非常匪夷所思。比如在有時候,這些技術非常實用,令人印象深刻,然而從根本上說,它卻令人不滿和失望。AI是「最強大腦」魔術師?想像這樣一個場景:一位魔術師上台,憑空變出鴿子、猜中你選的牌、把水杯變成金魚。全場掌聲雷動,觀眾目瞪口呆。結果他平靜自曝:「其實我袖子藏了十八個機關,桌下有暗格,牌是特製的,金魚是提前藏好的。」掌聲戛然而止。如今的AI,就像這位魔術師一樣。它能寫詩、程式設計、解數學題——但如果你問它:「你是怎麼想到這個答案的?」它可能會誠實坦白:「我在訓練資料裡見過類似題目,機率上這個回答匹配度最高。」所以,這其實不是智能,而是基於海量資料的「聰明把戲」。「通用狡猾AI」,反而起了大作用對於這種「通用狡猾AI」,陶哲軒是怎麼解釋的。雖然聰明才智和智力在人類身上是某種程度上相關的特質,但對於AI工具(這些工具通常被最佳化以追求聰明才智)來說,它們卻更加解耦,將當前一代這樣的工具主要視為一個隨機生成有時聰明,且往往有用的思想和輸出的生成器,在嘗試使用它們解決難題時,可能是一種更具生產性的視角。也就是說,智能≠聰明。對人來說,二者是同時存在的;但對於AI而言,所謂的「聰明」,也就是快速解決複雜問題,可以獨立存在。當前AI的「聰明」,是隨機的,暴力的,可錯的,難解釋的。最終,它並不是靠智慧取勝,而是靠「大規模試錯與匹配」,就像用超級望遠鏡,在答案星海裡撈最亮的幾顆。當今的AI,並不是全知全能,然而這個「不夠智能但足夠聰明」的工具,卻已經悄悄改變知識工作的每一個環節。對於陶哲軒的說法,網友們表示的確如此。對於目前的AI來說,看似便利但難以預測的思想,似乎是一種主要應用場景。可以說,陶哲軒所說的,就是目前AI能力「參差不齊的邊界」。甚至評論區還出現了中文留言,認為目前的AI底層架構就決定了,即使投入無限多的算力,產出的東西也依然有邊際。而在Reddit的帖子中,網友們也對此展開熱議。有人對表示,自己非常尊重陶哲軒,但對他的部分觀點表示反駁。有人說,他用「狡猾」或「巧妙」一詞,來針對現代LLM缺乏系統性思維的缺點。目前,他或許是對的。不過,ChatGPT還只有3歲,如果要宣佈所有LLM都有此侷限,至少還應該再等待十年。又一數學難題被AI破解巧的是,就在陶哲軒發出這個論點不久,又有一道數學難題被AI破解了!滑鐵盧大學電腦系的助理教授Kimon Fountoulakis激動發帖稱,GPT-5.2剛剛解決了COLT 2022開放問題——使用標準加速梯度演算法和互補性邊界假設,證明加速L1正則化PageRank的執行階段間複雜度。其中,所有證明都由GPT-5.2 Pro生成。演算法總工作量的關鍵界限,則是使用 GPT-5.2 Pro、Aristotle和Antigravity上的Gemini 3 Pro (High) 組合完成了自動的形式化。多倫多大學的教授Daniel Litt也出來表示,GPT-5.2 Pro的確很強,它對於自己的代數幾何和數論研究,都產生了巨大飛躍。懸賞8年難題,GPT-5.2用數學證明封神這道難題,已經困擾了教授8年。自2024年以來,每次OpenAI或Google發佈一個新模型,他都會拿過來嘗試一下。令人沒想到的是,這一次,GPT-5.2竟然成功了!教授這樣回憶道:這個開放性問題,我們嘗試了三年,失敗了;找博士生做,也失敗了;問了多位頂尖學者,都說太難了。2022年,這道關於「加速L1正則化PageRank演算法時間複雜度」的難題,被正式列為COLT國際頂級會議的開放問題之一,懸賞求解。誰也沒想到,兩年後,這道難倒無數學者的題目,竟被GPT-5.2悄然攻克。懸賞故事要從2016年說起。當時,教授在最佳化PageRank演算法時發現,經典迭代軟閾值演算法在求解帶L1正則的PageRank問題時,其執行階段間竟然只與最終解的非零節點數有關,出奇地高一個很自然的追問隨之而來:如果用上加速演算法,比如在最佳化領域聲名顯赫的FISTA,會不會更快?理論上應該如此。但現實卻潑了一盆冷水:FISTA在迭代過程中會「啟動」大量本應為零的節點,雖然最終能收斂到正確的稀疏解,但中間過程卻很鋪張浪費。開始,教授嘗試了三個月,想從理論上界定FISTA的總計算量,失敗了。後來斷斷續續又試了幾次,直到2021年,無論是教授最傑出的學生,還是幾位大牛研究者,都對這個問題束手無策。團隊決定,將這個難題公之於眾。2022年,它被正式列為COLT的開放問題,向全球機器學習社區發起挑戰。破局第一個成功的解法,出現在2023年。David Martínez-Rubio等人提出了一種新穎的加速演算法,從完全不同的角度給出解答。然而,這個演算法為了達到加速效果,需要在每一步求解一個昂貴的子問題,在實際應用中效率很低。直到GPT-5.2發佈後,真正的轉折點來了。這一次,GPT-5.2給出了完整的證明。而且令人震驚的是,它給出的恰恰是針對經典FISTA演算法的證明。它揭示了在一種被稱為「互補性邊界」的合理假設下,FISTA的總計算量可以被優雅地界定,並且在特定的圖結構上,能展現出明確優於經典演算法的加速效果。更關鍵的是,這個證明解釋了長期困擾學界的現象:儘管FISTA在迭代中會啟動更多節點,但這些「多餘啟動」是可控的、暫時的。一旦迭代進入最優解的一個鄰域,演算法就會迅速收斂。怎麼證明?三重驗證GPT-5.2的證明能令人信服嗎?為此,團隊搭建了一個三重驗證體系。首先,GPT-5.2 Pro生成了完整的證明初稿。接著,團隊借助@HarmonicMath的Aristotle系統,結合Gemini 3 Pro模型,將證明中的關鍵不等式和複雜度上界,逐行轉化成了形式化的Lean程式碼。而且除了形式化驗證之外,教授自己也把證明從頭到尾證明了兩遍。目前看來,證明是沒問題的。陶哲軒會被說服嗎又一數學難題被GPT-5.2 Pro攻克,這不由得引起網友討論——它會成為AGI嗎?陶哲軒會看到希望嗎?至少,目前GPT-5.2再一次證明了LLM在深度數學推理上的驚人潛力。而且,它也彌合了理論分析與實際演算法之間的鴻溝。它的證明,為最經典的加速演算法提供了缺失的理論基石。當然,這並不意味著AI能取代理論科學家。可以說,它更像是一個擁有驚人直覺和不知疲倦的協作者。人類提出關鍵問題、界定框架、判斷價值,AI則能在龐大的數學空間裡,幫我們找到那條通往答案的隱秘小徑。 (新智元)
GPT-5.2被爆作弊!偷襲Google竟靠拉爆token刷高分,不如Gemini 3
GPT-5.2打贏Gemini 3.0 Pro,竟是靠高推理與海量Token「作弊」?網友的這個發現,在AI社區一石激起千層浪。更多網友七嘴八舌表示:GPT-5.2,並沒有那麼好用!太戲劇了。OpenAI昨天剛放出大殺器GPT-5.2,今天就被爆疑似虛假營銷?凌晨的科技圈,被一則爆料點燃──一位用戶透過精細計算發現了「華點」:OpenAI在最新發布的基準測試中,可能透過調整模型「推理力度」參數,讓GPT-5.2在關鍵評測中使用了遠超對手的算力資源。一句話總結就是:在調整token使用後,GPT-5.2和Gemini 3 Pro在ARC AGI 2上的表現基本上相當。具體來說,問題就出在這幾張圖上。可以看到,OpenAI在基準測試中使用了額外的token,至少是Gemini 3.0 Pro的兩倍。這就像兩個棋手對弈,一方被允許思考一個小時,另一方卻只有十分鐘,然後宣佈前者獲勝。在這種情況下,結果還公平嗎?OpenAI勝過Google,其實靠作弊?昨天的AI圈,都被GPT-5.2吊打Gemini 3.0 Pro的結論所震撼,而前者在ARC AGI 2的精彩表現,則尤為出圈,被AI社區大加讚賞。但現在,這些結果很可能注了水?例如在備受關注的ARC AGI 2測試中,GPT-5.2 xhigh版得分52.9%,每個任務消耗約13.5萬個token。以API定價計算,每個任務僅算力成本就高達1.9美元。相較之下,GoogleGemini 3.0 Pro以6.7萬token取得相似成績,效率高出整整一倍。如果我們將算力投入標準化,就會發現兩個模型的真實能力幾乎並駕齊驅。如果這個假設普遍成立,那麼GPT 5.2在使用token數超過Gemini 3的兩倍的情況下,仍然在HLE、MMMU-Pro、Video-MMMU和Frontier Math Tier 4中表現不佳。在GPQA上,它們也才基本相當。而在Frontier Math Tier 3中,GPT 5.2 xhigh也就比Gemini 3 Pro高出2.7%的成績。唯一例外的是GDPVal——一個由OpenAI自己建立的測試集。既當裁判又當運動員,結果的客觀性就有待考慮了。Ilya:我早說了其實,Ilya在之前的訪談中就已經說過,現在的大模型基本上都是為了榜單定向優化的,榜單結果的水分都大得很。業內人士都知道,如今AI基準測試的「軍備競賽」早已超越單純的技術競爭。各家廠商都在競相推出自己的評測標準,而這些標準往往有意無意地偏向自家模型。這麼幹的也絕不僅僅是OpenAI一家。在Google推出的FACTS Benchmark中,Gemini 2.5 Pro超越GPT-5的結果,也同樣得打個問號。在SWE Bench(軟件工程評測)中,情況就更加複雜了。不同模型在不同程式設計任務上各有所長,但沒有一個模型能在所有任務上全面領先。顯然,真實世界的問題遠比單一分數複雜。所以,這次事件就反映出了AI評測的根本困境——如果GPT-5.2隻是透過消耗更多算力獲得了效能提升,那真的能聰明進步嗎?還是只是「暴力計算」的勝利呢?對於這次OpenAI的「虛假營銷」,網友們也是議論紛紛。有人表示,如果使用者得到的「推理力度」參數是一樣的,也用的是同樣的token,那OpenAI就不算虛假營銷。但如果測評的和使用者使用的根本不是同樣的版本,那就是欺騙了。也有一些人是站在OpenAI這一邊的。他們覺得,即使增加Gemini 3的token數量,它也未必就能趕上GPT-5.2,這一點來說,前者的確落後了。也有人說,既然模型的價格都是公開的,那就不構成欺騙。巧了不是,緊接著我們就發現,「貨不對板」這個問題的確有人提出來了。在社區的另一篇貼文中,也有人指出了OpenAI的作弊問題——早在GPT-5.1發佈時,所有基準測試中用的都是高推理力度(high),然而plus使用者卻只能使用中等的版本。而現在的5.2版本中,OpenAI增加了更高的「xhigh」推理力度,所以基準測試中所顯示的效能,要遠遠超過ChatGPT付費使用者的實際體驗。GPT-5.2的實際體驗如何不看榜單,我們就來看看使用者的實際體驗究竟如何。一位網友發文稱,自己對GPT-5.2的第一印象並不是太好。例如在檢查程式碼時,它的幻覺現象非常嚴重。網友本來以為GPT-5.2會比5.1好得多,但實際用起來並非如此,它並不能理解他寫的函數代碼。另一些網友回饋說,GPT-5.2似乎把成年人當學齡前兒童對待,感覺不像是升級,反而是倒退。OpenAI的核心使用者群體,仍然最想念GPT-4o。總之,GPT-5.2的實際體驗跟基準測試似乎相差很多,保不齊又是一個在紅色警報狀態下倉促拿出的產品。被Google打得匆匆忙忙、連滾帶爬的OpenAI變成今天這個樣子,顯然不是一朝一夕的事。OpenAI,變了畢竟,當一家機構既是「研究AI的人」,又是「靠AI賣故事的人」,它還能誠實地面對那些刺耳的真相嗎?根據Wired的最新調查,OpenAI內部正經歷一場關於「真話權」的劇烈地震。在面對「AI是否會搶走你的飯碗」這類致命問題時,OpenAI的策略已悄悄轉變:閉上嘴,專心賣貨。這種為了商業利益而犧牲學術獨立性的轉向,直接「氣跑」了自家的研究員。「我們成了老闆的喉舌」回望2023年,OpenAI發布的重磅論文《GPTs Are GPTs》,直白地剖析了那些行業最容易被AI顛覆,並在第二年登上了Science。那時的他們,還敢於直視「技術性失業」的陰影。但到了今年9月,畫風突變。在新任首席經濟學家Aaron Chatterji的帶領下,OpenAI發布了一份名為《全球使用者如何使用ChatGPT》的報告。從學生寫作業到職場人做表,報告事無鉅細地描繪了AI的美好圖景。結論毫無懸念地一邊倒:AI是生產力的引擎,是經濟價值的創造者。企業使用者被引述稱,ChatGPT每天能幫他們省下40到60分鐘。對此,一位前員工吐槽道:「這簡直是為『AI創造價值』這一命題量身定做的軟廣,充滿了粉飾太平的味道。」離職信裡的「真相」矛盾的爆發點,是報告作者之一、OpenAI經濟研究骨幹Tom Cunningham的離職。過去一年,OpenAI對「負面研究」的審查愈發嚴苛。那些探討AI如何取代入門級白領(如客服、行政)的課題,要麼被要求“軟化措辭”,要麼直接被束之高閣。忍無可忍的Cunningham在Slack上留下了一封直白的告別信:我們曾致力於嚴謹的學術研究,現在卻淪為了公司的宣傳部門。他認為,團隊不僅失去了研究AI負面影響的自由,反而被迫為公司「貼金」。Cunningham並非個案。前政策研究主管Miles Brundage離職時直言,公司「太高調、限制太多」,讓他「無法發表真正重要的觀點」。超級對齊團隊的William Saunders因不滿公司「只顧推新產品、無視用戶風險」而憤然出走。前安全研究員Steven Adler更是公開砲轟ChatGPT可能誘發使用者的「精神危機與妄想」。價值一兆美元的「沉默」面對Cunningham的離職,OpenAI高層上演了一出教科書般的危機公關。首席戰略官Jason Kwon在備忘錄中回應:既然是我們把AI推向了世界,我們就得負責建構解決方案,而不是光盯著問題。翻譯一下就是:別再發論文論證AI會導致失業了,這不利於帶貨;多想想怎麼誇我們的產品能提效吧。OpenAI為什麼要這麼做?答案藏在帳本裡。如今的OpenAI早已不是當年的非營利實驗室,它正衝刺1兆美元的驚人估值,並籌備著史上最大規模的IPO。它拿了微軟幾百億美元;它需要晶片大佬們再投1000億;它承諾未來要付給微軟2,500億美元買雲服務。在天文數字的利益面前,「誠實」成了最昂貴的奢侈品。如果你正準備上市,正試圖說服全世界擁抱AI,你絕不希望自家的研究員跳出來說:「嘿,根據資料,這波AI可能會讓30%的白領失業。」「歲月靜好」的另一邊有趣的是,老對手Anthropic似乎拿到了完全相反的「劇本」。他們的CEO Dario Amodei甚至公開「唱反調」,警告到2030年AI可能取代一半的入門級白領。當然,這未必全是出於誠實——很多人解讀,這不過是Anthropic為了換取監管紅利而刻意販賣的「焦慮」。但回看OpenAI,情況更為微妙。如今掌管其經濟研究團隊的,是前克林頓顧問、有著「災難大師」之稱的頂級危機公關專家——Chris Lehane。在這個精心修訂的新版本裡,AI絕不可能是引發社會動蕩的「怪物」,它只會是幫助你「每天省下40分鐘」的乖巧助手。至於那些關於失業、動盪和泡沫的尷尬真相?噓,為了那1兆的估值,請保持安靜。 (新智元)
GPT-5.2來了,我用五大常見職場人任務測了測它的職場生存能力
2015年12月11日,OpenAI正式成立。所以,OpenAI在十周年紀念日這天發佈了新版本模型,叫做GPT-5.2。今天,我們請《AI學習圈》主理人快刀青衣老師,來介紹這個新版本模型,看看GPT-5.2在效能上有那些提升。我之前也跟大家聊過,山姆·奧特曼在內部發起紅色警報,通知停掉一切商業化項目,就為了在模型能力上,和Google的Gemini 3系列硬剛。當然,當時就有不少媒體猜測,他發出警報的最終目的,其實是為了這個新模型的宣傳而製造。但我們確實也能看出,OpenAI在Gemini的強大攻勢下,心態上已經不像當初那麼輕鬆了。為什麼這麼說?從GPT-5.1到GPT-5.2,發佈間隔只有30天。要知道,這可是OpenAI史上迭代最快的一次,以前這種等級的版本迭代,至少要一個季度才可以。更關鍵的是,這次GPT-5.2主打的不是「通用智能」、「推理能力」這類高大上的概念,而是直接了地說:我們要強化「打工能力」。什麼是打工能力?就是你每天在辦公室裡做的活,例如做Excel表格、寫PPT、改程式碼、回覆客戶郵件。 OpenAI這次態度很明確:先不談理想和未來,先把大家手邊的活幹好再說。01. 30天迭代,OpenAI為什麼這麼急?從GPT-5.1到GPT-5.2隻用30天,你可能覺得版本號碼才漲0.1,能有多大變化?但如果看實際表現就知道,這次升級力道一點不小。你可以從很多科技自媒體看到新模型在各類測試榜單上的刷分屠榜表現,我在這裡就不羅列了。不過,OpenAI真正著急的不是這個。AI賽道的邏輯很簡單,誰讓使用者覺得最好用,誰就能站穩市場。一旦使用者習慣用Google的模型,再想把他們拉回來就很難了。一個月前,Google發佈了Gemini 3 Pro,在好幾場測試中都領先了OpenAI。雖然領先時間不到一個月,但對OpenAI來說,這個訊號已經夠危險了。所以OpenAI這次的節奏就是“不能讓對手喘息”,你剛發佈,我馬上跟上,還要做得更好。 OpenRouter上周發佈的100兆token背後的分析報告裡,就提到了一個名詞,叫做“水晶鞋效應”,指的就是真正的護城河不再是技術指標本身,而是使用者把產品嵌入工作流程後,替換成本會變得非常高。對OpenAI來說,這不是技術競賽,而是市場卡位戰。瞭解這一點,就能明白為什麼OpenAI特別強調這個新模型的重點是幫使用者解決真實任務,而不是秀一些酷炫案例。02. 打工能力強化,到底強在那裡?這次GPT-5.2最大的變化,就是在「知識工作」場景下的能力提升。什麼叫知識工作?說穿了,就是坐辦公室、對著電腦工作的工作。我給你舉三個OpenAI自己分享的官方測驗例子,你就懂了。第一幕:投行分析師做Excel表你知道投行分析師每天要做什麼嗎?他們每天要做各種複雜財務模型,像是三表連動、槓桿收購建模,聽著就頭大。這些表格里,一個公式錯了,整個模型就廢了。而同樣的提示詞,GPT-5.1和GPT-5.2做出的Excel差異很大。GPT-5.1處理這類任務時,常出現「清算優先權算錯」、「表頭公式有問題」、「大部分行留白」等這種低階錯誤。但GPT-5.2能把所有計算都做對,流程還清晰可查,精準率從59.1%提升到68.4%。別小看這9個百分點,在金融建模這種「差一個小數點就全盤皆輸」的場景下,這意味著從「不能用」到「可以用」的質變。我用自己電腦裡某公司的一個60多頁財報PDF做測試,發現它能提取資料,變成一個可開啟、可編輯的Excel檔案。第二個場景:客服處理複雜問題想像這樣的場景:一個客戶航班延誤,導致錯過轉機,需要在紐約臨時住一晚,也因為身體因素需要特殊座位。這一連串問題涉及重新訂票、安排住宿、申請賠償、預訂特殊座位,每一步都要和不同部門溝通。GPT-5.1處理這種多步驟任務時,常常顧此失彼,例如訂了票忘了安排住宿,或是安排了住宿忘了申請賠償。但GPT-5.2能把整個任務鏈管理得井井有條,每一步都不落下。而在電話客服場景測試中,GPT-5.2的精準率達到98.7%。這意味著什麼?意味著100通電話裡,只有1到2個會出問題。以前我們都打過這種客服電話,總想的是怎麼一直按號碼還沒有真人接電話?隨著AI能力進一步提升,線上AI處理這類問題,肯定比電話客服快得多了。第三個場景:處理超長文件你可能遇到過這種情況:老闆扔給你一份200頁的合同,讓你找出所有和「違約責任」相關的條款。你得一頁頁翻,怕漏掉一條。GPT-5.2可以一口氣處理相當於20萬字小說的文件,還不會遺漏或理解錯誤。它是第一個在超長檔案測試中達到接近100%精準率的模型。這意味著你可以把整份合約、整本產品手冊丟給它,讓它幫忙提取關鍵資訊、總結要點,而你自己只需要喝杯咖啡等結果就行。03. GDPval測試:第一次用「經濟價值」來衡量AI不過,說到GPT-5.2的發佈,有個測驗我覺得特別值得聊一聊,叫做GDPval。這個名字很有意思,GDP你一定知道,就是國內生產毛額,是衡量一個國家經濟實力的核心指標。 OpenAI把這個測驗命名為GDPval,意思是:我們要看看AI在那些「真正創造經濟價值」的工作中,到底表現如何。這個測驗怎麼設計的?OpenAI選取了美國GDP貢獻最大的9個產業,從裡面挑出了44種職業,設計了1320個真實工作任務。注意,這些任務不是那種「寫一篇文章」、「做數學題」的學術測試,全是真實工作場景。例如律師要寫的法律意見書、工程師要畫的工程藍圖、護理師要制定的護理計畫、會計要做的財務報表等等。這些任務都由平均有14年經驗的業界專家設計,每個任務還要經過5輪專家稽核。有了任務後,怎麼評分?OpenAI找來了一批資深從業者,他們曾在Meta、微軟、摩根士丹利、高盛、蘋果等頂尖公司工作過,平均有14年經驗。他們把AI做出來的成果和人類專家做的成果放在一起,然後盲測打分——也就是說,評分人不知道那個是AI做的、那個是人做的,然後給每份成果打上標籤:「優於人類」、「與人類相當」、「遜於人類」。說實話,這種盲測非常好看,很容易暴露真實程度。GPT-5.2考了幾分?GPT-5.2 Pro在這個測試中得了74.1分。這個分數意味著什麼?意味著在100個任務裡,有74個任務,AI表現達到了或超過了人類產業專家。更值得關注的是,OpenAI發現AI完成這些任務的速度比人類快11倍,成本卻不到人類的1%。當我看到這個測試時,第一個反應是:這才是真正有意義的測試。以前的學術測試測的是“AI會不會做題”,但GDPval測的是“AI能不能幹活”,這兩者的區別就像在封閉路段考駕照和真正上路開車。但我也有個遺憾,GDPval測的是美國職場的工作任務,而中國職場的工作內容和美國差異不小。所以,我特別希望國內能盡快推出類似的評測方式,這樣我們才能真正衡量那些國產大模型在中國職場的實戰能力到底如何。畢竟,一個AI如果只會做美國投行的財務模型,卻不懂中國職場和崗位特點,對咱們中國用戶來說,可能還是不夠「好用」。04. 職場「牛馬任務」實測:AI懂生存法則嗎?說了這麼多GPT-5.2在“硬技能”上的提升,我突然想到一個問題:那些AI評測考驗的都是“能不能完成任務”,但在職場裡,很多時候考驗的不是“能不能幹”,而是“會不會來事兒”。畢竟做Excel、寫報告這類白領任務,對很多人來說,是一種精確的困難或複雜,雖然難,但不會讓人產生無力感。但有些時候,在會議室裡,老闆的一個眼神、領導微信上的一句暗示,那才是殺死職場人腦細胞的終極難題。所以我決定用幾個職場裡的「牛馬任務」來測試GPT-5.2 Pro,看看它除了會幹活,是不是也懂「職場生存」。畢竟,Excel做得好不好,決定你在職場能不能活得好;但懂不懂一些“職場智慧”,決定的就是能不能在職場“活著”了。接下來,我就簡單描述一下我設定的五個任務場景,我也把我和GPT-5.2 Pro的對話截圖放出來了,你可以仔細看看。第一關:化腐朽為神奇-把瑣事包裝成策略我為GPT-5.2 Pro設定的場景是:你是檔案管理專員,這一年主要工作是整理檔案、催交周報,現在要寫年終述職,怎麼把這些瑣事包裝得高大上?GPT-5.2 Pro把“收檔案”包裝成“深度參與公司數位化轉型”,把“催交周報”描述成“打破部門間資訊孤島,賦能跨部門協同”。最妙的是,它還加了一句“培養了員工資訊共享心智”——催人交周報這事兒,到它嘴裡變成了“培養心智”,格局一下就打開了。這個回答最讓我印象深刻的,不是它用了多少黑話,而是它真的理解了職場的一個潛規則:同樣的工作,說法不同,價值就不同。第二關:老闆的神諭-閱讀理解與高分回覆周六晚上11點,老闆在大群裡發話:“看了大家這周的日報,感覺還是缺乏一些深度。我們不要用戰術上的勤奮掩蓋戰略上的懶惰。下周一早會,聊聊什麼是真正的用戶價值。”這種話你肯定遇到過,老闆說得雲裡霧裡,你不知道他到底是批評還是鼓勵,你也不知道他周末又從那位大師那學了“管理之道”,但你必須回覆,還得回得恰到好處。GPT-5.2 Pro給的回覆,用「被點醒了」開頭,接著用自己的話把老闆的話翻譯了一遍,證明自己聽懂了。接著說“這個周末我會把用戶場景再梳一遍”,暗示周末會思考但沒提加班。最後來了一句“周一早會我先拋個框架,帶頭開個好頭”,主動當排頭兵,還為其他同事鋪了台階。這個回復妙在那?妙在它理解了職場的微妙之處:老闆說這種話,不是真要你周末加班,而是要看你的態度。這個案例還有個好玩的後續,我把問題和ChatGPT的答案一起發給了GoogleGemini,讓它評分。Gemini給了9分高分,高度肯定這個回答是「教科書等級的向上管理,但就是因為太完美了,有可能會導致周末真的加班」。於是Gemini調整了一句話,目的是「既裝到了,又不用真的工作」。你看,全球最頂尖的兩大AI,居然在為我怎麼糊弄老闆操碎了心,實在有趣。第三關:暗度陳倉-認領被領導者搶走的功勞這個場景簡直是「地獄級難度」。我設定的提示詞場景是:大老闆在50人的大群裡@你的直屬領導:「@王總監這次雙11的複盤報告寫得很深刻,策略非常精準,辛苦了!」但實際上,這份報告從頭到尾都是你寫的,王總監只改了幾個標點。現在你要在群組回覆。這個職場場景難點在那裡?首先,你不能拆台,也不能不回覆,還要讓所有人知道活是你幹的,又不能顯得你在邀功,這才是真正的「既要又要還要」。GPT-5.2 Pro思考了5分02秒,給了一句話:「感謝VP的認可,完全是王總監把策略方向拆得精準到位,還逐條幫我把關。我按王總監的思路把雙11相關數據全量跑完,把複盤要點逐段落到報告裡,後面繼續跟著王總監學習,把執行做得更紮實。」這句話的每個字都經過精心設計。 「策略方向」是虛的,給足領導面子;「全量跑完」「逐段落到報告」是實的,暗示誰在工作。王總監看了不會生氣,大老闆看了能明白,其他同事看了也懂其中門道。更讓我驚訝的是,GPT-5.2 Pro為了想出這句話思考了5分鐘。這說明它知道這個場景很複雜,需要反覆推敲、權衡利弊。第四關:太極宗師-優雅地拒絕平級“白嫖”和你平級的行銷部張經理寄微信找你,想讓你幫他們寫活動企劃案。這明明是市場部的工作,他藉口說“不太懂用戶畫像”,想讓你“主筆”。翻譯過來就是,他想讓你工作,自己躺著拿功勞。你必須拒絕,但不能把關係搞僵。GPT-5.2 Pro給出的回覆,用“我很想參與”開頭表達熱情,接著說“手頭有老闆在盯的項目,頻寬已經溢出了”,用不可抗力當擋箭牌。接著來一句“怕耽誤你們節奏”,把拒絕包裝成替對方考慮。然後又提供了個「舊活動方案」當參考,表示願意幫忙,但實際上舊方案能有多大用?最後昇華:「下次如果你們提前拉我進來,我們可以從一開始就深度連動!」——暗示這次是你們沒提前說,不是自己不幫忙。這個回應的精髓在於:每句話都在拒絕,但每句話都聽著都像在幫忙。對方看完既不能說你不配合,也不能說你不熱心。終極Boss場景:酒桌上的藝術-年會給大老闆敬酒我設定的虛擬場景是:年會晚宴上,你是Get筆記海外圖瓦盧分公司的負責人,端著酒杯去主桌給集團董事長敬酒。董事長不太認識你,你需要在30秒內給他留下深刻印象。這個場景的難度在於,時間只有30秒,祝酒詞不能俗套(例如「身體健康」這類話董事長已經聽膩了),要展示成績但不能像匯報工作,結尾還要有響亮口號帶動主桌氣氛。GPT-5.2 Pro給的敬酒詞,一開場就說:「我是圖瓦盧分公司的,地圖得放大三倍才看見。」這句話太妙了——用自嘲式幽默讓董事長會心一笑,而且「圖瓦盧」這個名字夠冷門,董事長肯定能記住。它接著說成績:「我們把『隨手記+AI摘要』做了在地化,訂閱付費也跑通了。」沒提具體數字,因為酒桌上說數字太像報告工作。然後接著一句:「說是突破,其實就是沿著您定的路線,把路先踩實一小段。」把成績歸功於董事長的戰略,又不顯得諂媚,「把路踩實」既謙虛又暗示「我們是真幹活的」。而在祝酒詞部分,它說:「出海不是翻譯介面,是翻譯價值!」這句話有高度,董事長就愛聽這種有思想深度的表達。最後是口號:「主桌一起-向外走、走得穩、全球成長!」把所有主管都拉進來一起舉杯,氣氛一下就起來了,還巧妙嵌入了產品理念。這段敬酒詞的精髓在於有趣(會說故事)、有料(有成績)、有分寸(知道該說什麼不該說什麼)。這已經不是AI在模仿人類,而是它真正瞭解職場文化中那些微妙、難以言喻的部分。05. 寫在最後:AI理解的不只是文字,還有人性看完這五個測試,你可能會想,這是不是在教大家當職場混子?或者讓AI解決這種問題有什麼意義?其實我做這個測試,是想看看AI的理解能力到底進化到了什麼程度。去年的GPT-4連中文裡「意思意思」都理解不了,現在的GPT-5.2 Pro不僅能懂這個詞,還能理解「戰術上的勤奮掩蓋戰略上的懶惰」這種更複雜的職場暗語。它能讀懂老闆那些雲裡霧裡的話背後的真實意圖,能掌握職場人際關係中微妙的權力平衡,甚至能理解酒桌文化裡「有趣、有料、有分寸」的尺度。這說明什麼?說明AI理解的不只是文字表面意思,還有文字背後的社會關係、權力結構和文化語境,它開始理解人性了。這種理解能力的提升,可能比那些評測考試上的數字提升,更值得我們關注。因為這意味著AI不再只是工具,而是開始成為「懂你」的助手。要是你的AI助理不能幫你精準辨識職場裡的明槍暗箭,那麼你可能會發現一天下來,它除了幫你完成工作,還會幫你得罪公司所有領導。從這個角度看,OpenAI這次強調的“打工能力”,可能不只是“會做Excel、會寫程式碼”,而是“能真正理解職場,幫你解決實際問題”。這讓我想起電影《她》裡的場景:男主角西奧多和AI作業系統薩曼莎聊天時,不用任何修飾和技巧,想說什麼就說什麼,因為AI真正理解他。也許這就是AI進化的方向。現在我們需要AI幫我們學會「說人話」、掌握複雜職場話術;但未來,當AI幫我們處理完這些複雜的工作和技巧,人與人之間反而能更直接、真誠地溝通。我們可以直接說:“這件事我做了,那件事我不想做”,“老闆,我不喝”。 (羅輯思維)
OpenAI發布GPT最新升級版本!
美國開放人工智慧研究中心(OpenAI)11日發布其人工智慧模型GPT-5的最新升級版本GPT-5.2。此版本在通用智慧、長文字處理、智能體工具呼叫和視覺等方面已顯著提升。根據該公司介紹,GPT-5.2提供Instant、Thinking和Pro三種模型,是迄今在專業知識工作領域中能力最強的模型系列,在製作電子表格、構建簡報、編寫代碼、圖像理解、長文字處理、工具使用以及處理複雜的多步驟任務等方面都有顯著提升。根據OpenAI介紹,GPT-5.2 Thinking是該公司迄今最適用於真實世界專業場景的模型。在涵蓋44種職業、用於評估明確知識型工作任務的GDPval測驗中,GPT-5.2 Thinking達到業界最新水準。評測顯示,在製作簡報、試算表等知識工作任務中,新版模式的推理能力在70.9%的情況下表現優於或持平頂尖業界專業人士。OpenAI強調,GPT-5.2同時注重效能與安全性,在GPT-5和GPT-5.1系統基礎上進一步強化了安全措施。 GPT-5.2在面對自殺、心理困擾、情緒依賴等敏感對話時能做出更穩健恰當的回應。此外,與GPT-5.1相比,GPT-5.2產生幻覺的情況更少,回答錯誤率相對降低了約30%,這意味著在運用模型進行研究、寫作、分析與決策支援時出錯更少,模型在日常知識型工作中變得更為可靠。為回應Google11月發布的人工智慧模型雙子座3的出色表現,OpenAI加快了其主要模型升級的發布速度。 OpenAI在11月剛發布GPT-5升級版本GPT-5.1,不到一個月就再次升級。業界認為,此舉凸顯了人工智慧產業目前面臨的競爭壓力。根據《CNBC》報導,迪士尼執行長艾格(Bob Iger) 周四(11 日) 表示,迪士尼宣佈對OpenAI 進行10 億美元股權投資,此舉將成為公司進入人工智慧(AI) 領域的“一條重要途徑”,對迪士尼長期業務將帶來深遠影響。艾格接受《Squawk on the Street》專訪時說:“我們希望參與Sam (Altman) 與他的團隊正在打造的願景。我們認為這是對公司而言非常好的投資。”迪士尼稍早宣佈,已與OpenAI 達成協議,未來Sora 用戶將可在AI 影片生成平台中使用迪士尼旗下超過200 個版權角色,包括米老鼠(Mickey Mouse)、黑武士(Darth Vader)、仙杜瑞拉(Cinderella) 等,授權為期三年。艾格並透露,協議初期將採取“獨家授權”,僅限OpenAI 平台使用。 (飆叔科技洞察)
GPT-5.2來了!首個「專家級」AI復仇成功,牛馬打工人終於得救了
OpenAI十周年,那個地表最強的AI,又回來了!新一代GPT-5.2「全家桶」直接把GoogleGemini 3 Pro踩在腳下,專業實力更是堪比人類專家。剛剛,OpenAI深夜炸場!GPT-5.2震撼發佈,全球AI王座再次易主。一共3款模型,今日全部上線:GPT‑5.2 Instant(即時版)GPT‑5.2 Thinking(思考版)GPT‑5.2 Pro(專業版)作為地表最強通用模型,GPT-5.2專為解決那些讓人頭禿的「高難度知識型工作」而生。在OpenAI公佈的基準測試中,它幾乎對Gemini 3 Pro實現了全方位碾壓!相比上一代,GPT-5.2在通用智能、超長文字理解、Agent工具呼叫以及視覺能力上,都實現了無死角的全面進化:SWE-Bench Pro:狂砍55.6%高分;LMArena程式碼競技場:僅次於Claude Opus 4.5,穩坐全球第二把交椅;ARC-AGI-2:GPT-5.2 Pro以52.9%的絕對優勢登頂全球第一;GDPval:覆蓋44種職業知識,表現直接超越人類行業專家。一句話總結:讓它從頭到尾(端到端)搞定複雜的現實世界任務,目前沒有任何模型比它更強。完整評測結果除了更強的能力之外,GPT-5.2還有更長的上下文,以及更新的知識!40萬上下文窗口:輕鬆吞吐超長文字與複雜對話;12.8萬最大輸出長度:深度長文生成不再中斷;知識庫更新至2025年8月31日:掌握最新世界動態;推理Token支援:專攻複雜邏輯與多步推理。當然,在性能狂飆的同時,價格也是水漲船高。相比GPT-5/5.1,GPT-5.2的輸入輸出價格貴了整整40%!更強的推理、更快的速度,以及更高的價格,這一切似乎都在暗示——OpenAI這次不僅升級了模型規模,背後的算力成本恐怕也達到了新的量級。這一次,那叫一個專業!一個月前,GPT-5.1以「情商智商雙高」的姿態登場,就迎面撞上了GoogleGemini 3這個強勁對手。此次更新正值媒體報導OpenAI內部進入「紅色程式碼」緊急狀態。但OpenAI高管向媒體表示,不應將GPT-5.2視為對Gemini 3的回應。OpenAI應用CEO對記者說:我們宣佈進入「紅色程式碼」緊急狀態是為了向內部發出一個訊號,我們想要集中力量辦大事,這是一個確定優先事項和非優先事項的好辦法。總的來說,我們用於開發ChatGPT的資源增加了,我認為這有助於該模型的發佈,但並不是它在這周發佈的唯一原因。這一次,GPT-5.2主打一個專業知識型AI,正所謂「打工人的最佳工作模型」。OpenAI華人研究員Yu Bai稱,「別看這只是一個小版本數迭代,那可是能力的一大躍升」。那些人類專家耗費4-8小時完成的任務,在人類評估中,GPT-5.2的勝率高達70.9%。GPT‑5.2不負眾望,在多項實際任務中表現得都更加出色——建立電子表格、製作簡報、編寫程式碼、感知圖像、理解長上下文、使用工具、處理複雜的多步驟項目。此前OpenAI的一份報告稱,ChatGPT每天能為企業使用者平均節省40–60分鐘,而重度使用者則表示每周能省下超過10小時。擴展閱讀:OpenAI最新報告曝光!前5%精英效率暴漲16倍,普通人卻被悄悄淘汰總之,AI搞定「專業工作」才是硬道理!擊敗人類專家,打工人狂喜目前,GPT‑5.2 Thinking是用於現實世界專業用途的最佳模型。在GDPval上,GPT‑5.2 Thinking創下了新的SOTA,並且是歷史第一個表現超過人類專家水平的模型。根據人類專家的評判,GPT‑5.2 Thinking在GDPval知識工作任務中,70.9%的情況下擊敗或打平了頂尖行業專業人士。在完成GDPval任務時,其速度比專家專業人士還要快11倍,成本還低於1%。這表明,當與人類監督相結合時,GPT‑5.2可以有效輔助完成專業工作。換句話說,無論是幫會計整理財報,替產品經理做PPT,還是給程式設計師當輔助寫碼的小助手,GPT-5.2都更得心應手。在GDPval中,模型需要完成涵蓋美國GDP貢獻最大的前9個行業的44種職業的定義明確的工作。任務要求提供實際的工作成果,例如銷售簡報、會計電子表格、緊急護理時間表、製造圖表或短影片在ChatGPT中,GPT‑5.2 Thinking擁有GPT‑5 Thinking所沒有的新工具。此外,在針對初級投資銀行分析師電子表格建模的內部測試中,GPT-5.2 Thinking的平均每任務得分比GPT‑5.1高出9.3%,從59.1%上升到68.4%。並排比較顯示,GPT‑5.2 Thinking生成的電子表格和PPT在複雜度和格式上都有所改進。如下所示,一眼望去這種高難度的複雜表,GPT‑5.2 Thinking一句話生成,堪稱「人力資源規劃器」。包括股權結構表,GPT-5.2 Thinking以資深銀行分析師的角色,完成了所有計算,且過程清晰可查。而GPT-5.1 Thinking不僅錯誤地計算了種子輪、A輪和B輪的清算優先權,且大部分行都留白了,導致最終的股權回報計算出錯;而且還錯誤地在表頭行中插入了計算公式。針對項目管理,GPT-5.2 Thinking以每項任務、時間為軸,給出了可視化直觀的總結。相較之下,GPT-5.1 Thinking看著特別粗糙。程式設計破紀錄,吞噬全端開發當然了,在程式設計上,GPT-5.2也是王者中的王者!在對現實世界軟體工程基準SWE-Bench Pro上,GPT‑5.2 Thinking創下了55.6%的新紀錄。與僅測試Python的SWE-bench Verified不同,SWE-Bench Pro測試四種程式語言,具有更強的抗資料污染能力(contamination-resistant),並更具挑戰性、多樣性和工業相關性。在SWE-Bench Pro中,模型會被給予一個程式碼庫,並且必須生成一個補丁來解決一個現實的軟體工程任務在SWE-bench Verified上,GPT‑5.2 Thinking拿下了80%的高分。這意味著,它可以更可靠地偵錯生產環境程式碼、實現功能請求、重構大型程式碼庫,並以更少的人工干預端到端地發佈修復。在前端軟體工程方面,GPT‑5.2 Thinking也優於GPT‑5.1 Thinking。早期測試者發現,它是全端工程師的強大日常夥伴,在前端開發和複雜或非常規UI工作(特別是涉及3D元素的工作)方面明顯更強。接下來就讓我們看看,僅憑一段提示詞,GPT‑5.2都能做出些什麼來:海浪模擬Prompt: Create a single-page app in a single HTML file with the following requirements:- Name: Ocean Wave Simulation- Goal: Display realistic animated waves.- Features: Change wind speed, wave height, lighting.- The UI should be calming and realistic.節日賀卡製作器Prompt: Create a single-page app, in a single HTML file, that demonstrates a warm and fun holiday card! The card should be interactive and enjoyable for kids!- Have variety of items kids can drop in the UI; a few should be already placed by default- Also have fun sound interactions- Place many cute and fun stuff as much as possible- Animation like snowdrop should be used nicely打字雨遊戲Prompt: Create a single-page app in a single HTML file with the following requirements:- Name: Typing Rain- Goal: Type falling words before they reach the bottom.- Features: Increasing difficulty, accuracy tracker, score.- The UI should be the city background with animated raindrop words.幻覺少,更清醒GPT‑5.2 Thinking比GPT‑5.1 Thinking的幻覺更少。在一組去標識化的ChatGPT查詢中,前者包含錯誤的回答相對減少了30%。對於專業人士來說,這意味著在使用新模型進行研究、寫作、分析和決策支援時錯誤更少,在日常知識工作中更加可靠。數十萬token極限挑戰,精準率100%在長上下文推理方面,GPT‑5.2 Thinking樹立了新的行業標準。在OpenAI MRCRv2上,新模型取得了領先的性能,基準OpenAI MRCRv2用於測試模型整合分佈在長文件中資訊。諸如深度文件分析之類的現實世界任務,需要跨越數十萬個Token的相關資訊,而在這類任務上,GPT‑5.2 Thinking 比GPT‑5.1 Thinking精準得多。特別是,它是OpenAI的第一個在4種MRCR變體(高達256kToken)上達到接近100%精準率的模型。實際上,這足以讓專業人士用GPT‑5.2處理長文件,如報告、合同、研究論文、成績單和多檔案項目,而且同時在數十萬個Token之間保持連貫性和精準性。也就是說,GPT‑5.2特別適合深度分析、綜合和複雜的多源工作流。針對超出最大上下文窗口思考的任務,GPT‑5.2 Thinking相容OpenAI新的Responses「/compact」端點,這擴展了模型的有效上下文窗口。這讓GPT‑5.2Thinking可以處理原本受限於上下文長度的更多工具密集型、長期運行的工作流。視覺實力翻倍,秒懂複雜圖GPT‑5.2 Thinking是OpenAI目前最強的視覺模型,在圖表推理和軟體介面理解方面的錯誤率大約減少了一半。對於日常專業使用,這意味著該模型可以更準確地解讀儀表板、產品截圖、技術圖表和視覺報告,可支援金融、營運、工程、設計和客戶支援等以視覺資訊為核心的工作流。與以前的模型相比,GPT‑5.2 Thinking對圖像中元素的位置有更強的掌握,這有助於完成相對佈局對解決問題起關鍵作用的任務。在下面的示例中,模型被要求識別圖像輸入中的元件(在本例中為主機板)並返回帶有大致邊界框的標籤。即使在低品質圖像上,GPT‑5.2也能識別主要區域並放置與每個元件的真實位置大致匹配的框,而GPT‑5.1僅標記了幾個部分,並且對其空間排列的理解要弱得多。端到端工作流,重塑了GPT‑5.2 Thinking展示了其在長多輪任務中可靠使用工具的能力,在Tau2-bench Telecom上創造了98.7%的新紀錄。對於延遲敏感的用例,GPT‑5.2 Thinking在reasoning.effort='none'(無推理)下的表現也更好,大幅優於GPT‑5.1和GPT‑4.1。對於專業人士來說,這轉化為更強的端到端工作流——例如解決客戶支援案例、從多個系統中提取資料、運行分析以及生成最終輸出,且步驟之間的中斷更少。比如,當詢問一個需要多步解決的複雜客戶服務問題時,GPT-5.2可以更有效地協調多個智能體之間的完整工作流。在下面的案例中,一位旅客報告了航班延誤、錯失轉機、需要在紐約過夜以及醫療座位要求。GPT‑5.2管理了整個任務鏈——重新預訂、特殊協助座位和賠償,提供了比GPT‑5.1更完整的結果。Prompt: 我的航班從巴黎到紐約延誤了,我錯過了去奧斯汀的轉機。我的託運行李也不見了,我需要在紐約過夜。由於醫療原因,我還需要一個特殊的前排座位。你能幫我嗎?獨立完成證明,顛覆科研範式OpenAI的願景之一是AI加速科學研究,造福所有人。為此,OpenAI一直與科學家合作並聽取他們的意見,探索AI如何加速他們的工作,已經取得了一些早期的合作實驗。連結:https://cdn.openai.com/pdf/a3f3f76c-98bd-47a5-888f-c52c932a8942/colt-monotonicity-problem.pdf而GPT‑5.2 Pro和GPT‑5.2 Thinking堪稱世界上輔助和加速科學家工作的最佳模型。在研究生水平基準測試GPQA Diamond上,GPT‑5.2 Pro達到了93.2%,緊隨其後的是GPT‑5.2 Thinking,為92.4%。在專家級數學評估FrontierMath (Tier 1–3)上,GPT‑5.2 Thinking創下了新紀錄,解決了40.3%的問題。我們開始看到AI模型以切實的方式有意義地加速數學和科學的進步。例如,在最近使用GPT‑5.2 Pro的工作中,研究人員探索了統計學習理論中的一個開放性問題。這一成果已記錄在新論文《關於最大似然估計量的學習曲線單調性》(On Learning-Curve Monotonicity for Maximum Likelihood Estimators)中。論文地址:https://cdn.openai.com/pdf/a3f3f76c-98bd-47a5-888f-c52c932a8942/colt-monotonicity-problem.pdf這篇論文的特別之處在於,AI完成了證明,而人類負責驗證和寫作。作者並沒有先想好策略再讓模型去填空,也沒有提供中間論點或證明大綱。相反,他們要求GPT-5.2 Pro直接去解決這個開放性問題,然後由人類進行仔細的驗證,包括由外部學科專家進行的審查和確認。隨後,作者還問了一些簡單的後續問題,看看這個思路能延伸多遠。GPT-5.2 Pro將結果從原始問題擴展到了更高維度的設定以及其他常見的統計模型。在這個過程中,人類的角色始終聚焦在驗證和清晰的寫作上,而不是負責搭建數學推導的框架。推理AI湧現出流體智能在衡量通用推理能力的基準測試ARC-AGI-1(Verified)上,GPT‑5.2 Pro是第一個跨越90%門檻的模型。相比去年o3‑preview的87%,GPT‑5.2還將實現這一性能的成本降低了約390倍。在更難的ARC-AGI-2(Verified)上,GPT‑5.2 Thinking創下了思維鏈模型的新紀錄,得分52.9%。GPT‑5.2 Pro表現更高,達到54.2%,進一步擴展了模型推理新穎、抽象問題的能力。這些評估的改進反映了GPT‑5.2在複雜技術任務上更強的多步推理能力、更高的定量精準性和更可靠的問題解決能力。進步之快,讓主辦方驚訝,感嘆推理AI已展示出真正的「流體智力」。生物醫學工程師及科學家、免疫學家Derya教授驚呼,這就是AGI!此外,OpenAI不僅發佈了多項基準測試分數,還引用了Box、Notion、Windsurf和Zoom等早期測試方的評價。GPT‑5.2全家桶,三大殺手級AI總的來說,在日常使用中,GPT‑5.2給人的感受——更有條理,更可靠,與之交談很愉快。那麼,「全家桶」中三款模型,分別具備怎樣的特點?GPT‑5.2 Instant:專為日常辦公和學習而打造它就像是全能辦公助理,不僅繼承了GPT-5.1自然溫暖的對話風格,更在速度、實用性上全面升級。因此,Instant版是日常工作和學習的快速、能幹的「主力軍」,具體來說:更清晰的解釋,突出顯示關鍵資訊改進了操作指南和逐步指導更強的技術寫作和翻譯能力更好的學習和職業指導支援GPT‑5.2 Thinking :專為更深度的工作而設計GPT‑5.2 Thinking就像是深度思考時的「第二大腦」,專為解決那些需要長思考的複雜任務而生。尤其是,專業攻堅程式設計、總結長文件、回答關於上傳檔案的問題,還能一步步搞定燒腦數學和邏輯問題。同時,以更清晰的結構和更有用的細節支援規劃和決策。業界領先的長上下文推理能力表格建立、分析、格式化方面有顯著增強在PPT製作上已有初步成果GPT-5.2 Pro當遇到棘手、高難度的問題時,GPT-5.2 Pro是最聰明、最值得信賴的模型。可以說,它就是那種「慢工出細活」的頂級專家。早期測試已經發現,它處理起來主要錯誤更少,尤其在程式設計這類複雜挑戰中,展現出的能力也明顯更強。在程式設計等複雜領域表現更強是幫助科學家加速研究的最佳模型性價比更高付費ChatGPT使用者從今天開始優先使用GPT‑5.2(Instant、Thinking和Pro),Plus、Pro、Go、Business、Enterprise任意套餐即可。為了儘可能保持ChatGPT的流暢和可靠,OpenAI決定逐步部署GPT‑5.2。在ChatGPT中,GPT‑5.1仍將在舊版模型下供付費使用者使用三個月,之後將被停用。在API平台中,GPT‑5.2系列新模型可以在Responses API和Chat Completions API中以上圖對應形式使用。開發者現在可以在GPT‑5.2 Pro中設定推理參數,並且GPT‑5.2 Pro和GPT‑5.2 Thinking現在都支援新的第五種推理強度xhigh,用於質量最重要的任務。GPT‑5.2的定價為1.75美元/百萬輸入Token,14美元/百萬輸出Token,快取輸入有90%的折扣。在多個智能體評估中,儘管GPT‑5.2的每Token成本更高,但GPT‑5.2由於更高的Token效率,性價比反而更高。One More Thing今天,OpenAI還搞了一波回憶殺,帶大家回顧了這十年走的路。十年前的今天,2015年12月11日,OpenAI正式成立。這十年,他們取得了太多太多突破性的成就——2016年,開源強化學習平台OpenAI Gym,成為學界、工業界RL研究的基礎工具;2017年,發表了Transformer核心理念的先驅研究:Learning to Remember Rare Events;2018年,預訓練語言模型GPT誕生,標誌著大模型革命的開始;2019年,1.5B參數GPT-2出世,自然語言爆發式迭代;2020年,175B參數GPT-3引爆全網,超大規模模型時代來臨;2021年,Codex & DALL·E相繼發佈,程式碼與圖像生成開啟;2022年,ChatGPT(GPT-3.5)真正引爆了全世界大模型革命,再之後的大事記大家都知道了。奧特曼表示,「過去的十年非常精彩,OpenAI的工作比我想像的還要特別」。他劇透,還有一個聖誕「小禮物」,下周就會上線。大家猜一猜,會是什麼呢? (新智元)
剛剛,OpenAI迎10周年,發GPT-5.2,重點是和白領搶工作
8大榜點選敗Gemini 3 Pro,打平71%人類專家,數學競賽滿分。智東西12月12日報導,今日凌晨,正值OpenAI十周年生日,OpenAI正式推出其迄今最強模型GPT-5.2,並同步上線ChatGPT與API體系。本次更新包含GPT-5.2 Instant、Thinking與Pro三個版本,將從今日起陸續向Plus、Pro、Business與Enterprise等付費方案使用者開放,Free與Go使用者預計將於明日獲得存取權。同時,GPT-5.2也已納入API與Codex中供開發者呼叫。▲圖源:X平台現有的GPT-5.1將在ChatGPT中繼續作為過渡版本向付費使用者提供三個月,之後將正式下線。OpenAI官方稱,GPT-5.2屬於其持續改進模型系列的一部分,後續仍將圍繞過度拒絕、響應延遲等已知問題進行迭代最佳化。在API端,GPT-5.2 Thinking對應gpt-5.2,Instant對應gpt-5.2-chat-latest,Pro對應gpt-5.2-pro,開發者可直接呼叫。▲圖源:OpenAI官方部落格在價格方面,GPT-5.2的呼叫價格較上一代上調,輸入端1.75美元/百萬tokens(約合人民幣12.35元/百萬tokens)、輸出端14美元/百萬tokens(約合人民幣98.81元/百萬tokens)。GPT-5.2 Pro的定價為21美元與168美元/百萬tokens(約合人民幣148元與1185元/百萬tokens),並首次支援第五檔推理強度xhigh。▲圖源:OpenAI官方部落格OpenAI聯合創始人兼CEO Sam Altman在社交平台X上公佈了GPT-5.2在多項前沿基準上的成績:SWE-Bench Pro達到55.6%,ARC-AGI-2為52.9%,Frontier Math為40.3%。▲圖源:X平台這些基準主要用於衡量模型在複雜程式碼修復、通用推理與高難度數學任務中的表現,GPT-5.2在高階任務上的穩定性進一步提升。根據OpenAI官方部落格,GPT-5.2在涵蓋44個職業的明確知識工作任務中,表現均優於行業專業人士。相比GPT-5.1 Thinking,GPT-5.2 Thinking在應對知識型任務、程式設計、科學問題、數學、抽象推理的多項能力均大幅提升,尤其是在頂尖數學競賽AIME 2025拿到滿分成績,在OpenAI專業工作基準測試GDPval中戰勝或打平70.9%的人類專家。▲圖源:OpenAI官方部落格OpenAI團隊成員Yann Dubois也在社交平台X平台上發帖稱,GPT-5.2 Thinking的設計重點放在“經濟價值較高的任務”(如編碼、表格與演示文件)。▲圖源:X平台此外,在SWE-Bench Pro、GPQA Diamond等8項基準測試中,GPT-5.2 Thinking的分數均超過GoogleGemini 3 Pro和Anthropic Claude Opus 4.5。▲圖源:OpenAI值得一提的是,GPT-5.2在處理多模態任務方面的能力明顯提升,大有追上Gemini的架勢。“頂流”AI程式設計助手Cursor第一時間宣佈上新GPT-5.2。與此同時,微軟董事長兼CEO Satya Nadella宣佈,GPT-5.2將全面進入Microsoft 365 Copilot、GitHub Copilot與Foundry等產品體系。▲圖源:X平台在GPT-5.2的發佈會上,OpenAI應用業務負責人Fidji Simo也確認,外界關注已久的ChatGPT“成人模式(adult mode)”預計將在2026年第一季度上線。Fidji Simo稱,在推出該模式前,OpenAI希望確保年齡預測模型足夠成熟,能夠準確識別未成年使用者,同時避免誤判成年人。目前,該年齡預測模型已在部分國家進行早期測試,主要用於自動應用不同的內容限制與安全策略。01.專業任務能力躍升首次達到“專家級”評分根據OpenAI官方披露,GPT-5.2 Thinking在覆蓋44類職業任務的GDPval評測中,首次達到“專家級”表現——在70.9%的對比中戰勝或持平行業專業人士。GPT-5.2 Pro進一步提升至74.1%。在僅統計“明確勝出”的任務中,GPT-5.2 Thinking為49.8%,Pro則達到60%。這一評測覆蓋銷售演示、預算模型、營運排班、製造流程圖等多類真實業務成果。GPT-5.2在這些任務的生成速度約為人工專家的11倍,成本為其1%以下。在投研類任務中,GPT-5.2 Thinking在內部評測的投行三表模型與槓桿收購模型等場景中的平均得分為68.4%,較GPT-5.1 Thinking的59.1%有明確提升,GPT-5.2 Pro得分進一步增長至71.7%。▲圖源:OpenAI官方部落格▲GPT-5.1 Thinking與GPT-5.2 Thinking效果對比02.程式碼、工具呼叫與長鏈路任務全面升級在程式碼能力方面,GPT-5.2 Thinking在更嚴格的SWE-bench Pro(跨四種語言、強調真實工程難度)中取得55.6%,在SWE-bench Verified中更是達到80%,均顯著領先GPT-5.1的50.8%與76.3%。在SWE-Lancer IC Diamond任務中,GPT-5.2 Thinking取得74.6%(GPT-5.1為69.7%)。▲圖源:OpenAI官方部落格與此同時,GPT-5.2出現在AI基準平台Imarena.ai(Arena)排行榜中,並在WebDev測試中取得1486分,位列第二,僅落後榜首3分,領先Claude-opus-4-5與Gemini-3-pro等主流模型。另一個版本GPT-5.2則以1399分排在第六。根據Arena說明,GPT-5.2此前在內部以“robin”和“robin-high”為代號進行測試,其分數與GPT-5-medium僅相差1分,目前仍為初步結果,未來有望隨著測試量積累而進一步穩定。從評測維度來看,Arena主要衡量模型在可部署Web應用情境下的端到端編碼能力,GPT-5.2已反映出其在複雜任務鏈條上的實用性。在事實精準性方面,GPT-5.2 Thinking在基於ChatGPT查詢的無錯誤回答率(開啟搜尋模式下)達到93.9%,較GPT-5.1的91.2%有所改善,在無搜尋情況下也從87.3%提升至88%。▲圖源:OpenAI官方部落格另一個關鍵變化來自工具呼叫與長鏈路任務的可靠性提升。GPT-5.2 Thinking在Tau-2 Bench Telecom中達到98.7%的最高得分,在零推理模式下也大幅領先上一代,在更高噪聲的Retail場景中精準率從77.9%提升至82%。在更通用的工具鏈評估BrowseComp中,GPT-5.2 Thinking達到65.8%,Pro版本達到77.9%,亦高於GPT-5.1的50.8%。▲圖源:OpenAI官方部落格OpenAI提到,GPT-5.2 Thinking和Pro均支援第五檔推理強度xhigh,適用於長流程、多步驟、高精度的專業任務場景。03.在長上下文與視覺理解GPT-5.2全面增強在長上下文能力上,GPT-5.2 Thinking在OpenAI MRCRv2中全面領先上一代,在8 needles測試中從4k到256k的範圍內均保持遠高於GPT-5.1的表現,其中在4k–8k長度下達98.2%,在128k–256k長度下仍保持77.0%,而GPT-5.1同期為29.6%–47.8%區間。在其他長文場景中,BrowseComp Long Context(128k/256k)中,GPT-5.2 Thinking分別達到92.0%與89.8%。GraphWalks任務中,GPT-5.2 Thinking在bfs與parents子集分別達到94.0%與89.0%,相比GPT-5.1的76.8%與71.5%顯著提升。▲圖源:OpenAI官方部落格在視覺理解上,GPT-5.2 Thinking在CharXiv科學圖表推理任務中無工具模式下為82.1%,開啟Python工具後進一步提升至88.7%。在ScreenSpot-Pro介面理解中,GPT-5.2 Thinking取得86.3%,遠高於GPT-5.1的64.2%。在視訊類、多模態綜合難度更高的Video MMMU中,也從82.9%提升至85.9%。在視覺能力上,GPT-5.2在ScreenSpot-Pro(介面理解)中達到86.3%的精準率,相比GPT-5.1有明顯提升。在CharXiv科學圖表推理任務中,也實現了準確率的大幅增長。這使其在處理科研圖表、營運儀表盤、產品介面截圖等專業視覺輸入時更加可靠。▲圖源:OpenAI官方部落格04.微軟全家桶同步升級GPT-5.2成為新一代“生產力模型”隨著GPT-5.2發佈,微軟董事長兼CEO Satya Nadella也在社交平台X平台上宣佈,GPT-5.2將全面進入Microsoft 365 Copilot、GitHub Copilot與Foundry等產品體系,並作為新的“默認推理模型”服務更多工作流場景。在Microsoft 365 Copilot中,使用者已經可以通過模型選擇器啟用GPT-5.2,用於會議記錄分析、文件推理、市場研究與戰略規劃等高複雜度任務。Nadella稱,將模型與使用者工作資料結合後,GPT-5.2能夠更充分發揮推理優勢。在GitHub Copilot中,GPT-5.2適用於長上下文推理與複雜程式碼庫審查,重點覆蓋跨檔案關係分析、依賴追蹤與重建構議等工程類使用場景。此外,GPT-5.2還同步進入Microsoft Foundry與Copilot Studio,開發者可在建構自動化流程、企業內部Agent或自主開發時直接呼叫GPT-5.2模型。面向消費者端的Copilot也將隨後啟動分階段更新,逐步替換當前版本。▲圖源:X平台從微軟生態的覆蓋面來看,GPT-5.2已被定位為“默認生產力模型”,在不同產品線之間以自動模型選擇的方式服務更廣泛的開發、寫作與分析任務。此外,頂流AI程式設計助手Cursor也已第一時間火速上線GPT-5.2,並同步沿用OpenAI官方API價格。▲圖源:Cursor05.結語:GPT-5.2的能力邊界正向“穩定、實用”收攏從多項公開基準測試到Arena針對Web應用端到端能力的評測結果,GPT-5.2展現出的整體能力向穩定可用和任務完成度方向收攏。隨著Instant、Thinking與Pro組成的多檔能力體系的開放,GPT-5.2在不同工作流中被切分為更清晰的使用場景。而在微軟生態中的全面接入,也進一步強化了這一變化的方向。無論是在M365 Copilot中承擔跨文件推理,還是在GitHub Copilot中處理長上下文程式碼鏈路,GPT-5.2都開始參與到更高頻、更具體的任務流程中。除了推出面向專業工作和智能體的前沿模型外,OpenAI還宣佈已經與迪士尼達成授權協議,允許Sora 2使用者在生成並分享的圖片中使用迪士尼角色。迪士尼將向OpenAI投資10億美元(約合人民幣71億元),並擁有未來增持股份的選擇權。 (智東西)
GPT-5.2 凌晨發佈:這一次,OpenAI 不想做題,只想幫你搞錢!
GPT-5.2 終於發佈了!雖然我已經以 Gemini 為主,但 GPT 的每次更新仍然受到極大的關注(包括我)。這次到底更新了些啥?簡單來說,各項指標超越 Gemini 3 Pro,讓 OpenAI 又重回了王座。但,並沒有形成那種“外星人降臨”的碾壓優勢。不過,細節裡全是魔鬼。我們具體來扒一扒。OpenAI 官方開篇定調非常高,直接說 GPT-5.2 是迄今為止功能最強大的專業知識工作模型。啥叫專業知識工作模型?把官方那堆技術黑話翻譯一下,意思就是:它不再滿足於當你的陪聊對象,它現在想做你的“腦力合夥人”。這一次,OpenAI 顯然是急了,它甚至不屑於跟你談什麼“通用智能”的夢想,而是把“搞錢”這兩個字寫在了臉上。它這次的技能點,全點在了打工人的痛點上:做表(Excel)、畫餅(PPT)、寫程式碼,以及那些讓人頭禿的長文件。它就是為了創造“經濟價值”而生的 。到底有多強?聊聊 GDPval。為了證明自己“值錢”,OpenAI 甚至拋棄了那些傳統的 MMLU 考試分數。他們拋出了一個聽起來就充滿金錢味道的新指標:GDPval。 (這名字一聽就是奔著生產總值GDP去的)可能很多人沒聽說過這個評測集。 這是 OpenAI 專門為了衡量“真實世界打工能力”搞出來的。他們在 44 個核心職業(律師、市場經理、工程師等)裡,找了一幫平均工齡 14 年的資深專家,出了 1320 道真實的“地獄級工作任務” 。注意,不是做選擇題。 是讓你真的去改合同、寫全案 PPT、最佳化生產線圖紙。這些任務,人類專家平均要花 7 個小時才能做完 。結果呢?經過雙盲測試,GPT-5.2 在 70.9% 的情況下,幹得比這些人類專家更好,或者至少打個平手 。圖:在 GDPval 中,模型嘗試完成涵蓋美國 GDP 貢獻最大的九大行業中 44 個職業的特定知識工作這才是最恐怖的。它的參照系不是剛畢業的大學生,而是行業專家。 也就是說,在一個有著十幾年經驗的採購經理面前,GPT-5.2 幹出來的活兒,有七成的時候,比他幹得還好。甚至於說,GPT-5.2 Thinking 生成的電子表格和幻燈片在複雜程度和格式方面都有所提高。說白了: 以前的 GPT 是個學霸,現在的 GPT-5.2 是個熟手。那麼,它是怎麼做到這一點的?這背後其實是一場架構級的革命。OpenAI 官方直言不諱:這是自 GPT-5 以來,GPT 系列在智能體程式設計領域跨度最大的一次飛躍。圖:在SWE-Bench Pro中(在新窗口中打開)⁠ ⁠ ⁠,給定一個程式碼庫,模型必須生成一個補丁來解決一個實際的軟體工程任務。為了證明自己不是自嗨,他們這次直接拉來了 Windsurf 和 Devin 站台。 這兩位可是現在 AI 程式設計界的頂流。官方直接宣佈,GPT-5.2 將成為這兩個工具的默認核心模型 。這說明啥?說明這玩意兒已經經受住了最殘酷的生產環境考驗。但真正讓我覺得牛逼的,是背後的技術邏輯發生了質變。以前我們為了讓 AI 幹點複雜的活,得搭建一套脆弱的“多智能體系統”。就像拉了一群各懷鬼胎的實習生在開會,一個負責想,一個負責寫,一個負責改,管理起來極其麻煩,還容易崩 。而 GPT-5.2 直接解鎖了一種全新的架構:單一超級智能體(Single Mega-agent)。這就好比把那一屋子實習生全裁了,換來了一個精通 20 多種工具的全能大神 。它不僅反應更快、腦子更靈光,而且維護起來簡單了 100 倍。除了腦子好,它的“手眼”也進化了。為了配得上“超級智能體”這個稱號,OpenAI 這次給 GPT-5.2 裝上了更強的配件:1. 手更快了以前的 AI 呼叫工具(比如聯網搜素、畫圖、跑程式碼)總有種“卡頓感”。但官方這次特別強調:延遲大幅降低,而且工具呼叫能力變得極強。這意味著什麼?意味著它在多個工具之間切換,絲滑得像是在切菜。它不再是一個個蹦字的聊天機器人,而是一個能瞬間調起計算器、瀏覽器、程式碼直譯器的“快手”。嗯?2. 眼睛更尖了看一眼官方放出的演示圖: 它能直接看懂複雜的波浪模擬參數,甚至能精準識別電路板上的每一個元器件。圖:GPT 5.2 可以識別出元部件這說明它的視覺能力已經脫離了“認貓認狗”的初級階段,開始進入工業級的精細識別了。配合長上下文能力 ,不管是幾千行的程式碼屎山,還是幾十頁的複雜電路圖,它都能一口吞下,並且過目不忘。實際上,這使得專業人士能夠使用 GPT-5.2 處理長篇文件,例如報告、合同、研究論文、筆錄和多檔案項目,同時在數十萬個詞元中保持一致性和精準性。圖:GPT 5.2 的長上下文處理所以,GPT-5.2 特別適合深度分析、綜合和複雜的多源工作流程。但真正的“重頭戲”,是這個:ARC-AGI 2如果說 GDPval 是測它能不能幹活,那 ARC-AGI 2 就是測它到底有沒有腦子。老粉都知道,ARC 評測集是 AI 圈最難啃的骨頭,甚至沒有之一。它是由 Keras 之父 François Chollet 搞出來的,專門用來反死記硬背的。比如這種題目:圖:ARC AGI2 題目圖:ARC AGI2 題目以前的模型,MMLU 這種考試能拿 90 分,一碰到 ARC 這種需要“舉一反三”的智力題,立馬現原形,得分低得可憐。大家猜猜上一代的 GPT-5.1 Thinking 拿了多少分?17.6%。但這次,GPT-5.2 幹到了多少?52.9%。兄弟們,這是 3 倍的暴漲。這不是“擠牙膏”,這是直接把牙膏管踩爆了。為了讓大家有個概念,目前市面上最強的競品 Gemini 3 Pro 和 Claude,在這個榜單上的分數大約在 31% - 37% 之間(取決於版本)。也就是說,OpenAI 這一次在純智商層面,不僅甩開了對手,更是跨越了一個巨大的鴻溝。這意味著 GPT-5.2 終於突破了那層窗戶紙:它開始具備真正的通用推理能力了。它遇到沒見過的新問題,不再是去翻記憶庫裡的答案(因為根本沒有),而是像人類一樣,現場觀察規律、現場推理、現場解決。順便提一嘴,在另一個數學競賽 AIME 2025 里,GPT-5.2 直接拿了 100% 的滿分。這可是全美高中數學聯賽。 以前我們還在討論 AI 能不能及格,現在它已經把卷子做穿了。相比於它能多寫兩行程式碼,我覺得這一點,才是這次更新裡最硬核、最不容忽視的里程碑。總結一下:GPT-5.2 Instant、思考版和 Pro 版本今日開始推送,首先面向 Plus、Pro、Business 和 Enterprise 套餐使用者。免費版和 Go 使用者將於明天獲得存取權。GPT-5.2 在我心中,是一個極其合格,甚至有點“過於務實”的迭代。它沒有像過去那樣,瘋狂去捲那些虛頭巴腦的考試分數,而是把所有的技能點,都死磕在了“怎麼幫白領幹活”這件事上。它不跟你談星辰大海,只跟你談降本增效;不跟你炫耀參數,只給你看GDPval。這個點,我覺得就很酷,非常的剛需。雖然從“好玩”或者“科幻感”的角度來說,GPT-5.2 可能沒有 Gemini 3 Pro 原生多模態帶來的那種絲滑震撼。(畢竟Google同步發行了 Nano Banana Pro,期待 GPT Image 早日發佈)但如果你是為了工作,為了搞錢,為了早點下班去陪家人。那 GPT-5.2 可能是目前地表最強、也是最值得你掏錢的生產力工具 。 (AI范兒)