2026 年 3 月,史丹佛大學以人為本人工智慧研究所(HAI)發佈了一份長達 423 頁的《2026 年人工智慧指數報告》。報告裡有一個數字被反覆引用:中美頂級大模型綜合性能差距,2.7%。
但很少有人追問:這 2.7% 是怎麼算出來的?史丹佛報告採用的是多基準綜合評測框架,覆蓋 MMLU(知識理解)、GSM8K(數學推理)、HumanEval(程式碼生成)、SWE-bench(軟體工程)等多個維度。問題就出在這裡——不同基準的權重分配直接影響最終得分,而 2.7% 是一個被"平均"過的數字。
拆開看,美國在複雜推理、長鏈數學證明等少數高難度任務上仍有明顯優勢;中國在中文理解、本地化知識、工程落地效率等維度已經反超或持平。所以 2.7% 的真實含義不是"全面追平",而是
兩件事擺在一起,構成了一個被很多人忽略的戰略訊號:當中美前沿模型的性能差距縮小到個位數,真正的較量才剛剛開始。分數不再說話,規則、成本、治理、產業載體才開始說話。