#AI產業
《AI產業全景圖譜》新書節選|基準之戰:測試體系與模型話語權的角逐
轉自中信智庫、中信建投證券研究發展部出品 武超則等著《AI產業全景圖譜:技術範式、投資機遇與未來生態》,中信出版集團。 《AI產業全景圖譜》新書第一章“模型為王:AI 新範式的確立與演進”內容節選——基準之戰:測試體系與模型話語權的角逐。 基準測試為整個大模型行業提供了一個標準化的目標和一把統一的“標尺”。通過科學適當的基準測試手段,能夠客觀量化地衡量大模型的性能,精準地定位下一階段研發迭代的重點方向,有力地約束大模型安全可控。不同於傳統的自然語言處理模型,大模型具有複雜性、多樣性、開放性,同時還具備一定的泛化特徵。因此在大模型充分發展之前,此前用於自然語言處理工具的測試手段並不適用,需要建構全新的基準測試框架,而這種測試框架也將隨著大模型自身能力的不斷升級而持續迭代。 根據各類測試結果,很多公開的排行榜(如Hugging Face的Open LLM Leaderboard和LMSys的Chatbot Arena)將基準測試的驅動作用進一步放大,激勵著全球開發者和公司不斷最佳化模型。隨著模型規模的擴大,模型會表現出一些在小模型上不存在的“湧現能力”,如思維鏈推理。基準測試是系統性發現、追蹤和研究這些能力的關鍵工具。基準測試能幫助我們揭示和量化模型的潛在風險,如偏見、毒性內容生成和對特定攻擊的脆弱性。