“拿下具身世界模型第一”“登頂具身智能榜單”“具身大模型登頂國際評測公開排行榜”……搜尋最近的具身大模型新聞,滿屏的“第一”和“登頂”躍入眼簾。在這個資本最密集的賽道,榜單已經變得不夠用了。
當幾乎所有頭部公司都手握至少一個“第一”時,這些榜單究竟在衡量什麼?記者調研發現,當前具身大模型榜單數量已超20個,但業內公認的權威標準尚未形成。模擬榜單刷分容易、真機測試成本高昂、榜單性質混雜——“第一”的含金量千差萬別。在這場“榜單狂歡”背後,真正值得追問的是:如何讓“榜單第一”經得起真實世界的檢驗?
人手一個“世界第一”
8月11日,越疆科技宣佈,在面向複雜遮擋機器人抓取的國際評測賽事UNOBench Challenge公開排行榜上,越疆空弈DobotWAM具身大模型在兩大賽道中同時登頂。越疆科技表示,這一成績展現出該具身大模型從語義理解到動作前置推理的領先實力。