![]()
文 | 智能相對論
作者 | 陳泊丞
兩周前,千尋智能無疑是整個具身智能賽道當之無愧的明星企業。
一是千尋智能自研的具身基座模型Spirit v1.6,在RoboArena榜單上綜合得分全球第一,力壓英偉達Cosmos3和Physical Intelligence的Pi0.5,“打破硅谷霸榜魔咒”。
二是千尋智能再獲15億元A+輪融資,三個月內累計融資近50億元,刷新了具身智能賽道的紀錄。
![]()
這兩件事,信息量很大,都來自千尋智能公眾號于6月3日發了一篇推文:《雙線告捷!千尋智能Spirit v1.6橫掃北美「具身奧林匹克」奪冠,再獲15億元A+輪融資》。技術登頂,資本加碼,兩條主線在同一個時間節點交匯,一切都顯得順理成章。
在推文里,RoboArena甚至被賦予了極高的包裝——“北美具身智能奧林匹克”“世界級權威主榜單”“機器人領域的Chatbot Arena”。這些名頭堆在一起,給外界的感覺很顯著——這不是一次普通的上榜,這是一場國際賽場的登頂。
![]()
資本追逐榜單,榜單加持融資,邏輯環環相扣。
但僅僅幾天之后,事情開始不對勁了。
有人注意到RoboArena上Spirit 1.6的評測數據很異常。310次評測記錄中,72%的分數來自兩個賬號——ECUST Robot Lab(179次,勝率97%)和Robotics Lab(45次,勝率86.7%)。而NVIDIA用同樣模型測了21次,勝率0%。
![]()
![]()
更戲劇性的是,RoboArena官方很快發布了公告。回溯調查之后,他們移除了一批可疑評測數據,更新了榜單排名。Spirit 1.6的名字,從榜單上消失了。
從刷上榜、到發文宣發、到拉來融資、再到被踢出榜單,前后間隔短短數日。一切都發生得太快——但客觀而言,這已經不是一次普通的排名波動了,這是一個行業的信任被放在火上烤。
一場蓄謀已久的刷分,RoboArena是怎么被玩壞的?
先說清楚RoboArena的玩法是什么。
客觀而言,RoboArena在設計上并不是一場可以隨便操弄的游戲。它的核心邏輯借鑒了大模型領域的Chatbot Arena:評測者不知道自己測的是哪個模型(雙盲),對手通過ELO算法隨機匹配,評測數據來自全球不同機構的真實環境。
![]()
理論上,你想給自己刷分,門檻很高。你控制不了對手是誰,控制不了評測環境,也控制不了評測者的判斷。這套機制擺在那里,看起來確實不好作弊。
但“理論上”這三個字,往往是所有漏洞的起點。
首先,RoboArena是一個開放注冊的分布式評測框架。在這里,任何機構都可以注冊成為評測者(Evaluator),在自己部署的機器人硬件上執行評測任務。
當然,這個設計的初衷是讓評測去中心化、去單一化,但這同時也意味著一個很簡單的操作:如果你想刷分,先給自己注冊一個評測者賬號就行了。
ECUST Robot Lab、Robotics Lab,這兩個賬號在5月26日注冊進入系統。從這一天起,Spirit 1.6的評測記錄開始爆發式增長。
![]()
值得玩味的是,另一家具身公司X Square Robot(自變量)注冊評測賬號時,直接用了公司全名。這個操作有點意思,幾乎把行業的遮羞布都扯了下來——評測者不是“第三方獨立機構”,而是“自己人”。
![]()
其次,正常來說,一個評測者應該對榜單上的多個模型做相對均勻的評測。這是分布式框架的基本邏輯,數據分散在不同評測者手里,匯總之后才有統計意義。
但ECUST Robot Lab和Robotics Lab進來之后,幾乎只做一件事,那就是反復評測Spirit 1.6。ECUST Robot Lab累計評測276次,其中179次對象是Spirit 1.6,占比64.5%。Robotics Lab累計評測142次,45次是Spirit 1.6,占比31.7%。兩個賬號加在一起,貢獻了Spirit 1.6全部評測數據的72%。
72%的數據,來自兩個自己人。剩下的28%,來自其他真正獨立的評測者,而這些獨立評測者測出來的成績,和前面兩個賬號測出來的完全不同。
到這里,事情已經夠明顯了。
但還不止。
ELO天梯機制本來的作用,在于你只能跟排名相近的對手打,對手越強,贏了加分越多,輸了扣分也越狠。這個機制的初衷是防止有人刷低分對手來沖排名——你打弱隊效率太低,想上去必須干掉一個強者。
但Spirit 1.6的評測記錄表明,它找到了另一個取巧的辦法:不是挑弱的打,而是避開強的打,很“聰明”地避開了真正的強敵。
前期,Spirit 1.6和當時榜單第一的DreamZero交手了23次。成績是17負、4平、2勝——基本打不過。此后,Spirit 1.6不再跟DreamZero對戰。雙方最后一次PK記錄,停在了5月31日。
包括后來登頂的那個模型,Cosmos3-Nano-Policy,5月30日才加入測試。Spirit 1.6跟它,竟然連一次對戰記錄都沒有。
一個在榜單上沖到頂的模型,卻從來沒有跟真正的前兩名正經打過。這不是技術層面做不到公平對戰,而是評測策略層面選擇性地避開了所有可能輸的對手。
到這里,一場刷分操作的全貌已經清晰了:先注冊兩個自己人賬號進評測系統,用這兩個賬號給自己集中刷高分數據(占總量72%),同時以“隨機匹配”為名,繞開所有真正有威脅的對手。
技術上ELO機制還在運轉,實際上天梯排名的意義已經被架空了。
榜單狂歡背后,具身智能行業正在經歷什么?
當然,這件事最讓人不舒服的,不是刷分了,而是刷分和融資之間的時間線。
6月3日,千尋智能發布推文宣布Spirit 1.6登頂RoboArena。同一天,宣布完成15億元A+輪融資。三個月,累計近50億元。
在具身智能這個賽道里,技術路徑還沒收斂,商業化驗證還在早期,外部統一的評價體系少得可憐。RoboArena在這樣的環境里被迅速推到了前臺,成了最直觀、最容易被資本聽懂的那套“技術證據”。
要知道,榜單排名天然適合寫進投資人的盡調材料里。它不是學術論文,它是一串可以直接放進融資PPT里的數字和名次。因此,當排名本身可以直接影響估值和融資節奏的時候,刷榜的動力就不再是學術上的面子問題,而是真金白銀在驅動。
但是,RoboArena本身離“權威”還遠著。
根據公開資料,RoboArena目前仍是一個學術原型:首個版本在7所學術機構部署,針對7個通用策略完成約600次真機對比,評測硬件綁定在DROID平臺(Franka Panda機械臂)上,尚未擴展至其他機器人本體。論文作者也在文中指出,未來需要持續驗證其排名結果與真實世界表現的相關性。
也就是說,這個被描述為“世界級權威主榜單”的評測框架,在學術圈尚且屬于“有潛力的研究方向”,離行業公認標準還有距離。
但在千尋智能的語境里,這些限定條件全部消失了。RoboArena變成了一個已經封神的“奧林匹克”。很顯然,一個還在驗證中的學術原型被包裝成權威認證,融資故事才講得通。
時至今日,當刷分被揭穿之后,代價卻不只是千尋智能一家的事。
具身智能是中國AI里目前最熱的賽道,也是國際關注度最高的賽道之一。這次事件的信息已經傳到了海外。當中國具身智能企業的名字和“刷榜”兩個字被放在一起討論的時候,受到牽連的很有可能是整個行業的國際可信度。
更麻煩的是,它還會反向傷害真正在做事的公司。當一家公司靠刷榜拿到近50億融資之后,那些沒有這么做、老老實實在實驗室里磨技術的團隊,反而會被反復質疑、拷問:“你的排名是真的嗎?你怎么證明?”
劣幣驅逐良幣,就從這里悄然開始、蔓延開來。
如果有人覺得“反正榜單都會被刷,那投入技術有什么用”——這才是這件事最糟糕的后果。
當然,在這場風波里,也有值得說一說的一面。
在Spirit 1.6刷分的那段時間里,WALL-OSS也在全力沖擊榜單。它沒有找到“定向只測自己”的方法,只能在合規框架里正常打榜,最終被兩個刷分賬號擠出了競爭序列。作為一家真正遵守規則、按實力去打的團隊,卻被這個扭曲的評測生態攔在了門外,實屬唏噓。
此外,Cosmos3-Nano-Policy的登頂,是另一個硬核實力的證明。這次官方更新榜單之后,它還在榜上——可見,一個靠合法合規評測打上來的模型,是經得起回溯調查的。
誠然,榜單本身不是假的。有人刷,不代表這個評價體系應該被廢棄。但前提是,規則必須能攔住想鉆空子的人。
結語
根據最新消息,RoboArena已經出手了。回溯調查、排除了有利益關聯的評測數據、重置了評測者準入規則。這是對的,也是必要的。
![]()
但這場風波,不應該只以“榜單更新”為終點。
千尋智能的事件之所以值得被認真對待,不是因為它有多罕見,而是因為它可能不是孤例。當一個行業的評價標準本身還不夠成熟,而評價結果又可以直接撬動數十億級別的融資時,鉆空子的動力是系統性的,不是某一個人、某一個公司的問題。
靠一份榜單講故事融資的窗口,到今天還沒關上。但通過這件事,至少有了一個可以放在臺面上的共識:你拿給你的投資人看的那個“第一”,得是真的。
榜單可以更新,但信任重建,要難得多。
從今天開始,具身智能行業要走的路還很長。
*本文圖片均來源于網絡
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.