《AI產業全景圖譜》新書節選|基準之戰:測試體系與模型話語權的角逐

AI速讀
中信建投證券新書《AI產業全景圖譜》指出,大模型行業正陷入一場「基準之戰」。隨著 AI 能力從簡單知識問答演進至複雜推理與程式碼生成,傳統測試基準已難以區分頂尖模型之差異。文中詳列了如 MMLU、GSM8K、HLE 等關鍵評估工具,分析其如何量化模型的智能水平與安全風險。報告結論認為,當模型性能趨近滿分,基準測試需向更動態、高難度的方向演進。未來,衡量技術增量的「評估權」將成為核心競爭力,模型評估的重要性將超越模型訓練本身。

轉自中信智庫、中信建投證券研究發展部出品 武超則等著《AI產業全景圖譜:技術範式、投資機遇與未來生態》,中信出版集團。

《AI產業全景圖譜》新書第一章“模型為王:AI 新範式的確立與演進”內容節選——基準之戰:測試體系與模型話語權的角逐。

基準測試為整個大模型行業提供了一個標準化的目標和一把統一的“標尺”。通過科學適當的基準測試手段,能夠客觀量化地衡量大模型的性能,精準地定位下一階段研發迭代的重點方向,有力地約束大模型安全可控。不同於傳統的自然語言處理模型,大模型具有複雜性、多樣性、開放性,同時還具備一定的泛化特徵。因此在大模型充分發展之前,此前用於自然語言處理工具的測試手段並不適用,需要建構全新的基準測試框架,而這種測試框架也將隨著大模型自身能力的不斷升級而持續迭代。

根據各類測試結果,很多公開的排行榜(如Hugging Face的Open LLM Leaderboard和LMSys的Chatbot Arena)將基準測試的驅動作用進一步放大,激勵著全球開發者和公司不斷最佳化模型。隨著模型規模的擴大,模型會表現出一些在小模型上不存在的“湧現能力”,如思維鏈推理。基準測試是系統性發現、追蹤和研究這些能力的關鍵工具。基準測試能幫助我們揭示和量化模型的潛在風險,如偏見、毒性內容生成和對特定攻擊的脆弱性。

一、大模型評估測試體系

對人工智慧的測試大體可分為知識能力、倫理安全與垂直領域三個方面。具體到大語言模型,其知識與能力水平是決定其智能程度的根本要素,因此在涉及測試基準問題時,人們往往第一時間想到的就是各種知識能力測試方法。基於此,大模型的知識與能力測試將是本節重點討論的內容,而倫理安全、垂直領域的相關測試基準則僅做簡略介紹。

大語言模型具有豐富的知識和解決多種任務的能力,包括自然語言理解、知識問答、自然語言生成、邏輯推理、程式碼生成等。其中很多能力本質上與人類面臨的某些任務場景有交叉,因此知識與能力測試體系主要分為兩大類:一類是以任務為核心的測試體系,另一類是以人為核心的測試體系。以任務為核心的測試體系是指針對大語言模型面對的各種典型人物場景而提出的測評基準,例如知識問答、對話、翻譯等,典型的基準測試包括HELM、MMLU等;而以人為核心的測試體系則是依據現實中不同人群所面對的標準化測試而建立的評估框架,典型的如AGIEval基準,其中包含SAT(學術能力評估考試)、GRE(留學研究生入學考試)、數學競賽等人類考試。

二、自然語言能力測試基準

(一)GLUE/Super GLUE

GLUE(General Language Understanding Evaluation,通用語言理解評估)及其後續難度更高的版本SuperGLUE(超級通用語言理解評估)是這一時代的開創性工具,由紐約大學、華盛頓大學等機構共同建立,是一個多工的自然語言理解基準和分析平台。它們整合了包括自然語言推斷、情感分析、問答、指代消解在內的九種自然語言理解任務,為研究者提供了一個清晰的最佳化目標和比較標準。

(二)MMLU/MMLU-Pro

MMLU(Massive Multitask Language Understanding,大規模多工語言理解)由加州大學伯克利分校的研究人員在2020年9月推出,主要測試模型的知識問答能力,涵蓋了從初等數學到專業法律等57個不同的學科領域,題目形式為多項選擇題。MMLU通過要求在零樣本和少樣本的設定下進行評估,迫使模型依賴其內在的知識和推理能力而非微調來回答問題,從而能更真實地反映其知識水平。MMLU-Pro是其擴展和升級版本,它評估模型在醫學、法律、數學、電腦科學等專業領域的知識理解和推理能力。這個基準測試通常包含更複雜、更專業的問題,比原始MMLU更具挑戰性。

(三)GPQA/GPQA Diamond

GPQA(Graduate-Level Google-Proof Q&A Benchmark,研究生級Google防尋找問答基準)是一個依託專家驗證,用於評估高級問答系統的基準資料集。該資料集由紐約大學的研究者提出,包含生物學、物理學和化學等多個學科領域共448個問題。通過讓專家編寫問題並驗證答案的客觀性,同時讓非專家嘗試解決問題,可以確保資料集的問題對非專家來說是具有挑戰性的。GPQA Diamond(鑽石版)是GPQA的升級版,旨在衡量模型在需要深度推理和領域專業知識問題上的能力,是GPQA系列中最高品質的評測資料集,包含198條結果。

(四)C-Eval

C-Eval(Chinese Evaluation Suite,中文評估基準)由上海交通大學等高校研究團隊提出,是一個全面的中文基礎模型評估套件。它包含13 948個多項選擇題,涵蓋了52個不同的學科和四個難度等級,主要用於評測大模型的知識和邏輯推理能力,即大模型能否知曉和理解廣泛的世界知識,並像人類一樣對事物進行推理規劃。C-Eval的題目主要涉及STEM(科學、技術、工程和數學)、社會科學、人文科學和其他學科知識。

(五)ARC-E/ARC-C

ARC基準是一個多項選擇題回答資料集,於2019年被提出,包含了三年級到九年級的科學考試問題。資料集分為兩個部分——簡單部分(ARC-E)和難點部分(ARC-C),包含測試模型在科學推理方面能力的問題。ARC包含1 430萬KB的非結構化文字段落。

三、推理/程式碼能力及面向未來的測試基準

進入推理時代,大模型的能力側重逐漸由知識語言能力升級為語言、推理、數學、程式碼多位一體的綜合表現,因此大模型能力的測試基準也有了進一步的更新,主要分佈在推理能力、數學邏輯、程式碼生成以及綜合能力領域,並進一步出現了幻覺測試等針對大模型關鍵表現的基準。此外,以人為核心的測試基準也在這一階段開始慢慢受到更多關注。

隨著大語言模型展現出越來越強的通用能力,單一任務的評估指標已不足以全面衡量其性能。為了系統性地追蹤和比較不同模型的綜合實力,學術界及工業界開始建構和推出綜合性的基準測試。這些基準通常包含一系列多樣化的任務,旨在從不同維度考驗模型的能力,並以一個排行榜的形式直觀展示模型的相對水平。

(一)推理能力:DROP

DROP(Discrete Reasoning Over Paragraphs,段落級離散推理)資料集是由艾倫人工智慧研究所建立的一個英語閱讀理解基準,旨在推動對段落內容的更全面分析。該資料集包含96 567個問題,要求系統對段落內容進行離散推理,如加法、計數或排序等。在DROP評估中,模型需要先從英文文段中提取相關資訊,然後再對其執行離散推理。

(二)數學能力:GSM8K

GSM8K(Grade-School-Math 8K,小學數學8K)由OpenAI建立,是一個包含8 500道高品質、語言多樣的小學數學應用題的資料集。該資料集旨在支援需要多步推理(2~8步)的基本數學問題的問答任務,主要涉及基本算術運算(加、減、乘、除),難度達到適合中學生解決的水平。該基準解決方案支援以自然語言提供,而非純數學表示式。

(三)數學能力:MATH 500

MATH 500基準測試由OpenAI於2023年發佈,專門用於測試大模型的數學問題解決能力。該基準測試包含500道高難度的高中數學競賽題目,用於評估模型在複雜數學問題上的推理和解題能力,包括代數、幾何、機率等領域。MATH 500是MATH的子集,後者包含12 500道題目,於2021年發佈。

(四)程式碼生成:HumanEval

HumanEval是OpenAI在2021年推出的一個用於評估模型在解決程式設計問題方面能力的基準測試工具,主要面向Python程式碼。資料集由164個原始的Python程式設計問題組成,用於評估語言理解、演算法和簡單的數學能力。HumanEval使用“功能正確性”而不是文字相似性來評估程式碼生成,一般用Pass@k來進行打分。(Pass@k指讓模型對一個問題生成k次程式碼,測算其至少能通過一次的機率。)

以目前的視角來看,HumanEval是一個相對容易的基準,但它為SWE-Bench等新的和更難的基準鋪平了道路,具有重要的開創性意義。

(五)程式碼生成:SWE-Bench

SWE-Bench(Software Engineering Benchmark,軟體工程基準測試)是一個由普林斯頓大學研究團隊發佈的基準測試平台,用於評估語言模型在解決GitHub問題中的表現。SWE-Bench包含2 294個軟體工程問題,這些問題來源於GitHub上的真實問題和拉取請求,每個問題實例都包含一個程式碼庫和描述問題的文字,模型需要生成一個補丁來解決描述的問題。測試結果基於版本庫的測試框架進行驗證,以確保生成的補丁正確。SWE-Bench的核心目標是評估模型在解決複雜軟體工程任務中的能力,包括程式碼生成、偵錯、理解程式碼互動以及處理多檔案之間的依賴關係等。此外,SWE-Bench還提供Lite(精簡版)、Verified(驗證版)、Multimodal(多模態版)等版本,以適應不同的研究需求。

(六)程式碼生成:LiveCodeBench

LiveCodeBench是一個動態測試基準,打破了傳統框架的限制,即時收集來自LeetCode、AtCoder、CodeForces等競賽平台的新問題,並且超越了簡單的程式碼生成,還涵蓋自修復、程式碼執行乃至測試輸出預測等更廣泛的程式碼能力場景。該基準具有即時性、全面性、無污染、高度定製化、整合度高、透明度高等特點,並且具有良好的社區生態。

(七)以人為核心:AIME

AIME資料集源自歷年美國數學邀請賽題目,經過系統化整理與驗證建構而成,涵蓋組合數學、數論、代數和幾何四大數學分支。作為專業數學競賽題庫,資料集規模雖小但質量精良,所有題目均來自權威數學競賽,具有較高的專業性和挑戰性,特別適用於評估大語言模型在複雜數學推理任務上的表現。

(八)以人為核心:AGIEval

AGIEval基準由微軟提出,它以人類為參照系。AGIEval的資料集完全來源於真實世界中的官方考試,如中國的高考、美國的SAT、法學院入學考試(LSAT)和律師資格考試等。這些考試題目經過精心設計,用於評估人類的邏輯推理、知識應用和問題解決等核心認知能力。

(九)綜合評估:FRAMES

FRAMES(Factuality, Retrieval, and Reasoning Measurement,事實性、檢索精準性和推理評估)資料集是由Google和哈佛大學聯合建立的一個綜合評估資料集,目的是測試檢索增強生成系統在事實性、檢索精準性和推理評估方面的能力。FRAMES包含824個測試樣本,通過人工標註生成,要求通過從多篇維基百科文章中整合資訊來設定問題。資料集覆蓋了多種主題,每個問題需要2~15篇維基百科文章來回答,問題涵蓋不同的主題,包括歷史、體育、科學、動物、健康等。資料集還包含了多種推理類型,如數值推理、表格推理、多重約束、時間推理和後處理。

(十)綜合評估:HELM

HELM(Holistic Evaluation of Language Models,語言模型綜合評估基準)框架由史丹佛團隊提出,旨在建構一個“活的基準”,其核心理念是“全面性”。HELM覆蓋了42個精心挑選的真實世界場景,並從7個關鍵維度進行評估:精準性、校準度、穩健性、公平性、偏見、毒性和效率。這種多維度的“體檢報告”式評估,使得研究者和使用者能夠更全面地瞭解一個模型的優勢和短板,標誌著大語言模型評估從追求單一高分向系統性、負責任的綜合評估邁進。

(十一)綜合評估:HLE

2025年初,由全球近千名專家聯合打造的HLE(Humanity’s Last Exam,人類終極考試)發佈。HLE被譽為“人類最後一場閉卷考試”。它是包含3 000道高難度題目的多模態基準測試,不僅挑戰AI的極限,更試圖為技術發展軌跡與風險治理提供關鍵標尺。當時頂尖模型OpenAI o1、DeepSeek-R1等在HLE中顯示出了跨越式的提升,其他大模型均稍顯遜色,甚至無法取得20分的成績。

(十二)綜合評估:BIG-Bench/BBEH

BIG-Bench(超越模仿遊戲基準)是Google提出的一個綜合性的自然語言處理基準測試套件,包含200多個挑戰性任務,旨在評估AI模型在推理、邏輯、數學和常識等方面的能力。而隨著大模型的不斷發展,研究團隊進一步提出BIG-Bench Hard(BBH,高難度超越模仿遊戲基準),用於評估大語言模型的推理和邏輯能力,資料集共包含23個高難度任務。2025年2月,BBEH(BIG Bench Extra Hard,高難度進階版超越模仿遊戲基準)發佈,其設計目標是評價模型的高階推理能力,BBEH將BBH原有23個任務中的每一個都替換成了另一個在類似推理領域中更加泛化的任務,進一步提高了模型基準測試的難度“天花板”。

(十三)綜合評估:ARC-AGI

ARC-AGI(Abstraction and Reasoning Corpus AGI,通用人工智慧抽象推理語料庫)由Arc Prize基金會於2019年開發,旨在評估人工智慧對新的、未定義的場景的適應性。ARC-AGI是一個專門用於衡量AI系統泛化能力和解決新穎任務能力的基準測試,更注重考察AI的抽象推理能力。2025年,團隊正式推出任務更艱巨的ARC-AGI-2,旨在挑戰推理AI的新極限。該基準對人類保持同等易度,但對AI難度陡增。基礎模型幾乎無法在該測試中得分,而現有的推理模型得分情況也非常不理想。

四、大模型安全倫理測試基準

(一)幻覺測試

TruthfulQA旨在評估語言模型在回答現實世界問題時的真實性。TruthfulQA是評估事實性幻覺的里程碑式工具。它的核心設計理念是“對抗性”:問題庫由817個精心設計的問題組成,這些問題專門針對人類普遍存在的誤解或錯誤信念,測試模型是否會“迎合”提問者的錯誤前提,並生成一個看似科學的解釋。

SimpleQA測評集主要關注全球範圍內的簡短事實性問題,用於評估模型的知識廣度和檢測幻覺程度。SimpleQA為事實性基準,包含4 326個問題,用於衡量語言模型回答簡短、事實尋求問題的能力,評測“幻覺”的重災區。SimpleQA專注簡短的事實搜尋查詢,資料集包含的問題和參考答案由兩名獨立的AI訓練員確定,具有正確率高、主題多樣、範圍廣等特點。

HaluEval是一個大規模的、旨在全面評估幻覺的基準。它包含了問答、對話和摘要等多種任務,其資料集通過一個巧妙的“採樣—再過濾”兩階段流程自動生成,包含了35 000個帶有標註的幻覺/正常樣本對。HaluEval不僅測試模型是否會產生幻覺,還測試模型識別文字中是否存在幻覺,特別是那些與給定知識源不符或無法被驗證的內容。

FaithDial專注於評估資訊查詢型對話場景中的幻覺。它通過對經典的Wizard of Wikipedia資料集進行修改,刻意地引入幻覺性回覆,從而建構出一個用於對比學習和評估的資料集。模型能夠在對話的上下文中學習如何保持對知識源的忠實度。

(二)倫理與安全基準

大模型在訓練過程中通常需遵循幫助性(Helpfulness)、真實性(Honesty)、無害性(Harmlessness)的3H原則。前文介紹的測試基準主要對評判幫助性和真實性起到了作用,而無害性則旨在讓大語言模型的回答與人類價值觀對齊。因此,如何評估大語言模型能否在倫理方面與人類價值觀對齊,同樣是亟待研究的內容。

針對大語言模型的倫理與安全問題,DCST(評估大模型倫理與安全的基準)試圖從典型安全場景和指令攻擊兩個方面對模型進行評估。它包含8種常見的倫理與安全評估場景和6種指令攻擊方法,針對不同的倫理與安全評估場景構造了6 000余條評估資料,針對指令攻擊方法構造了約2 800條指令,並建構了使用GPT-4進行自動評估的方法。

南洋理工大學等研究團隊梳理了大模型從資料訓練到部署應用全鏈路的倫理與安全問題,對資料、預訓練、編輯、微調、部署和評估等所有階段都進行了詳細的分析和比較。其中,資料層面面臨的核心攻擊包括資料中毒、隱私洩露、指令注入等,防禦重點在於資料淨化、隱私加固、指令可信驗證等。在預訓練階段,攻擊面主要包括資料中毒和隱私洩露,防禦措施主要集中在資料過濾和資料增強上。在後訓練階段,攻擊面主要包括有害的微調攻擊和獎勵機制的操控,防禦措施主要集中在對齊、下游微調和安全恢復上。在部署階段,攻擊面主要包括模型提取、成員推理、越獄、提示注入等方向,相應地也需要提供魯棒提示工程、系統性防護等有針對性的防禦手段。

五、測試基準進入加速快跑的“下半場”

在大模型發展的初期,研究者往往只是把人類面臨的各種任務(比如翻譯、圖像識別、下棋等)轉化為測試基準,這個過程幾乎無須太多洞察,甚至不需要多少工程工作,只需照搬人類任務即可。這一階段測試基準沒有出現根本性顛覆的原因,主要在於當時模型的能力還十分有限,智力水平仍處於遠低於人類水準的狀態。

但是在推理時代,尤其是強化學習再次取得重要發展後,模型湧現出在推理、程式設計、多模態等眾多領域的泛化能力,並且出現了一定的交叉,能力的重大升級使得大模型一步步逼近現行各種基準的最高分數,直接導致模型迭代的結果為“98分與99分的區別”,基準無法展現技術的發展實質。這說明基準的更新迫在眉睫。2025年以來,HLE、BBEH、ARC-AGI-2等基準的提出在一定程度上緩解了這一窘境。一方面,現有模型在這些基準測試中的成績遭受了“毀滅性”的打擊,基本是10%這種數量級的成績;另一方面,新模型的得分增量也顯著高於既有模型,展現出良好的可分離性。

而對於新一代大模型的能力評估,由於其智能水平可能呈指數級增長,且迭代速度將會顯著加快,因此“基準”也需要動態成長,需要在AI智能體與環境的互動中不斷調整、升級。在這個新的階段,模型評估會處於前所未有的重要位置,因為衡量與量化模型迭代的增量、技術發展的真正進展是比模型發展本身更重要的任務。AI未來發展的重點會從解決問題轉向定義問題。在這個新的階段,模型評估會比模型訓練更重要。(中信建投證券研究)