“拿下具身世界模型第一”“登頂具身智能榜單”“具身大模型登頂國際評測公開排行榜”……搜尋最近的具身大模型新聞,滿屏的“第一”和“登頂”躍入眼簾。在這個資本最密集的賽道,榜單已經變得不夠用了。
當幾乎所有頭部公司都手握至少一個“第一”時,這些榜單究竟在衡量什麼?記者調研發現,當前具身大模型榜單數量已超20個,但業內公認的權威標準尚未形成。模擬榜單刷分容易、真機測試成本高昂、榜單性質混雜——“第一”的含金量千差萬別。在這場“榜單狂歡”背後,真正值得追問的是:如何讓“榜單第一”經得起真實世界的檢驗?
人手一個“世界第一”
8月11日,越疆科技宣佈,在面向複雜遮擋機器人抓取的國際評測賽事UNOBench Challenge公開排行榜上,越疆空弈DobotWAM具身大模型在兩大賽道中同時登頂。越疆科技表示,這一成績展現出該具身大模型從語義理解到動作前置推理的領先實力。
而就在此前不到半個月,具身智能公司智元宣佈,其自研的具身原生全模態大模型WITA-Omni Preview在具身全模態理解權威榜單DailyOmni上,超過國內外眾多領先模型登上榜首。智元強調,DailyOmni榜單高度貼合人形機器人在真實物理空間開展人機互動所需的核心感知能力,登上榜首意味著該模型在物理世界視聽時序理解任務上具備獨特競爭力。
如果將時間軸拉長,會發現在令人眼花繚亂的具身大模型榜單中,機器人公司都曾榜上有名,幾乎人手一個“世界第一”。
證券時報記者根據公開資料不完全梳理,今年3月,極佳視界宣佈其自研的GigaWorld-1世界模型在權威評測基準WorldArena中登上全球榜首;4月,中科第五紀宣佈其研發的具身世界模型FlowWAM登頂WorldArena榜單;6月,千尋智能宣佈在全球具身智能實戰評測平台RoboArena中,其自研模型Spirit v1.6排名全球第一。
縱觀以上案例,涉及的榜單就有4個,每一個的形容詞都是“全球”“權威”。在層出不窮的“登頂榜單”新聞中,普通人很難分辨不同榜單之間有何區別、登頂到底意味著什麼,只是在同質化的宣傳話語中,留下“不明覺厲”的粗淺印象。
這與行業當前所處的階段有關。安邦智庫宏觀經濟研究中心助理研究員趙至江在接受證券時報記者採訪時表示,具身智能正處於技術探索與產業驗證的早期階段。“一方面,技術路線尚未完全收斂,還沒有形成統一的行業評價標準。另一方面,資本市場對具身智能保持高度關注,企業需要通過測試成績、演示視訊和技術指標證明自身領先優勢,客觀上推動了部分指標包裝和行銷放大現象。”趙至江說。
趙至江強調,不能簡單否定榜單的意義,但也要客觀看待其價值。“不同企業仍在探索差異化的技術路徑,在這種格局下,形成統一的行業評價標準並不容易。”趙至江說,當前榜單更多反映企業在某一單項能力上的突破,而非技術水平的全貌。
榜單含金量各不相同
首先,要釐清的概念是,機器人公司競相追逐的“榜單第一”究竟是什麼,與通用大模型的榜單有何區別?
近一兩年來,隨著供應鏈的成熟,造一台機器人已經不是難事,行業競爭從“拼本體”轉向“拼大腦”,而這個“大腦”就是具身大模型。
因此,機器人要真正變得聰明好用,就需要擁有自己的具身大模型,重新採集訓練機器人所需要的資料。通用大模型由於較為成熟,指標清晰,行業內已經形成了若幹個公認的權威榜單,但具身大模型領域還沒有。不同機構提出的榜單在評分維度與指標上差異較大,缺乏統一標準。
此外,天使投資人、資深人工智慧專家郭濤告訴證券時報記者,具身大模型榜單高度依賴配套進行評測的機器人本體、執行器與模擬環境,分數無法脫離硬體單獨成立。廠商可以通過調整機械參數、最佳化模擬環境定向提分,純技術參考價值弱於通用大模型榜單。
其次,當前有那些主流的具身大模型榜單,各自含金量如何?
據證券時報記者不完全梳理,當前各類具身大模型榜單數量已超20個,發起方包括清華大學、北京大學、普林斯頓大學、史丹佛大學等頂尖高校,美國艾倫AI研究院、上海AI實驗室等研究機構,以及輝達等企業。大多數榜單由幾個機構聯合發起。
按照不同類別,具身大模型榜單有不同的劃分方式。如果從考察能力範圍的全面性來看,可以分為綜合能力榜單和專項能力榜單。前者就像對模型能力的“全面體檢”;後者則側重專項測試,考察其特定能力或極端場景下的表現。如果按照評測環境與真實物理世界的距離來劃分,則主要分為模擬任務榜單與真機測試榜單,前者如同理論考試,後者則像實戰演習。
一名業內人士告訴記者,不同於通用大模型測評以數字形式輸入、數字結果輸出,可以線上進行,具身大模型真機評測需要匹配硬體和場地,耗時長,成本高,因此真機測試榜單十分稀缺。
“模擬任務榜單是目前數量最多的,比如LIBERO、RoboTwin、ManiSkill等,它們標準化、低成本、容易復現,特別適合做演算法橫向比較。”中國社會科學院大學數字中國研究院特聘研究員劉興亮在接受證券時報記者採訪時表示。在他看來,真機和真實場景評測是含金量最高的一類,目前一些榜單比賽已經開始採用“模擬初賽+真機決賽”形式,把模擬評測與實體機器人驗證結合起來。
當榜單足夠多、賽道足夠細分,機器人公司總能找到某個維度讓模型登頂。劉興亮表示,一個榜單有沒有含金量,應從四方面來判斷:題目是否公開透明,測試集是否與訓練集隔離,結果能否被第三方復現,能否經過真實世界的驗證。“科研評價關注的是能力問題,而產業評價關注的是技術能否形成穩定商業價值,兩者本身就是不同邏輯。”趙至江說,一些榜單是為行銷、融資而服務,但真正有能力有價值的企業,最終會由具體的應用而不是榜單排名篩選出來。
亟需從“做題”走向“實戰”
具身大模型榜單看似熱鬧,但一個尷尬的現實是,模擬環境中的“學霸”到了真實世界,往往變成“學渣”,“榜單上的高手,實踐中的矮子”是行業的普遍現象。
原因是多方面的。首先,郭濤指出,許多榜單不具備完整有效的評價能力,測試場景單一,任務邊界固定,無法覆蓋工業、家庭等多元化的真實工況。一家公司在某個榜單上得分高,可能只是在該榜單的特定任務上表現優異,而非整體技術實力領先。
其次,大多數榜單基於模擬環境,與真機實測存在不可忽視的差距。“在模擬環境裡,光照可以標準化,摩擦係數可以設定,攝影機不會突然被人擋住。但進入工廠、商場和家庭以後,桌子可能挪了兩釐米,袋子會變形,玻璃會反光,人可能突然伸手過來,網路還可能延遲。”劉興亮說,機器人面對的是一個開放、不確定並且持續變化的物理世界,模擬環境測試的結果更多是一種理想狀態。
以被譽為具身智能領域“珠峰級”評測的RoboDojo為例,該榜單採取“模擬+真機”雙榜單機制,設計了42個模擬任務和18個真實機器人任務,真實世界部分表現最好的模型總體成功率僅為12.8%,折射出機器人落地的巨大鴻溝。
最後,部分企業存在定向“刷榜”行為,人為抬高分數。郭濤表示,有的是針對模擬榜單的“題庫式刷分”,比如企業提前獲取測試任務樣本,針對榜單內固定物體、固定動作場景專項微調模型權重,刻意降低陌生場景權重分配。有的是針對真機榜單的硬體調優,鎖定專用測試樣機,偵錯關節阻尼、運動速度適配榜單任務,規避通用工況的嚴苛約束。此外,個別廠商還可能針對一些榜單挑戰賽的規則,利用自己註冊的評測帳號不斷測試、刷新評分。
劉興亮指出,破解榜單“虛假繁榮”,關鍵不是取消榜單,而是把考試從“做題”變成“實戰”。在他看來,具身大模型榜單需從以下幾個方面加以改進:一是評測標準要統一。現有的評測在環境設定、硬體配置、測試條件等方面都不同,不同模型間很難進行公平對比,唯有制定更統一的標準,才能提高結果的可復現性。二是需要引入盲測,測試任務不能全部提前公開,最終排名應由隱藏測試集、陌生物體、陌生場景決定,以此達到防“刷榜”,真正測試機器人泛化能力的目的。三是將模擬測試與真機測試結合起來,驗證機器人在物理世界的可靠性。
“目前,具身智能還處於發展的早期階段,評價更多圍繞單項能力、實驗性能、技術參數展開,目的在於證明技術路線是否成立。隨著產業進入應用階段,評價體系會逐漸轉向綜合能力,由技術展示驅動轉向產業價值驅動。”趙至江說,一個成熟的產業,通常不會依賴技術性的榜單作為評價標準,而是形成由行業標準、第三方測試和市場反饋共同構成的評價體系。“具身智能距離這一階段還有較長過程,三到五年甚至更長的時間都是有可能的。”趙至江表示。 (證券時報)
