![]()
![]()
最大的競爭對手永遠還是我們自己。
![]()
北京大興,除夕夜,晚十一點的宇樹機器人訓練場。
程序員們飛速裝載著各種機器人器械的包裹,這些機器人要在當晚運回杭州宇樹總部。
王興興的桌子在靠墻的最里側,桌上堆滿了消炎藥。23:30分,他被記者們簇擁開始群訪。
訓練場里飄蕩起泡面的味道——程序員們開始了今天的晚餐。
這一天,宇樹剛剛完成了馬年春晚的表演節目《武BOT》。這是他們第三次登上中國春晚舞臺,從牛年的機器牛,到 2025 蛇年的機器人扭秧歌,再到2026——25 臺宇樹機器人組成一個集群,和中國最頂尖的武術學校,塔溝武校的人類小演員們,一起完成了一場震撼的表演。
這場表演被外媒稱為,展現了人形機器人運控的巔峰——不僅展現了全球最強的運控能力,也超越了宇樹自己。
自 2025 年蛇年春晚爆紅以后,宇樹站在行業之巔,承受了不小的壓力。
這次訪談,我們不僅聊到了春晚舞臺背后的技術進步,還有宇樹和王興興本人,這一年的成長和思考。
(?原版訪談的視頻版可前往微博、B 站、視頻號等平臺觀看;播客版可前往小宇宙等平臺搜索同名賬號《衛詩婕_漫談Light the Star》)
漫談Light the Star
PART ONE
三登春晚:
彩排和現場,用的是兩套機器人
「過去一年,如果沒有技術進步,
宇樹也會是一家非常平庸的公司」
衛詩婕:這是第三次登上春晚,和前兩次感覺有什么不同?
王興興:每次都是非常大的挑戰。尤其去年效果比較好的基礎上,這一次我們肯定要拿出更好的作品,心里壓力非常大。我們一直知道最大的對手是我們自己。
衛詩婕:我看到一個特別的橋段設計,這次的節目融入了人、 AI 、機器人的關系。(情節上)先是一個小演員想要挑戰機器人,機器人做了一個非常俏皮的動作,好像不太在意人。緊接著機器人開始打醉拳,倒在了地上。翻身起來的時候,周圍的人對他豎起大拇指,最后人機牽手一起走向大家。感覺在講述一個技術跟人的關系演進過程。
王興興:對,這也是導演組特別設計的。因為導演組也相信,機器人最終是為人服務的,人機互相學習、成長非常重要。這也是未來機器人真正走進生活,必將面臨的一個問題。另外還有一層:其實當下十歲左右的小朋友,跟人形機器人其實是共同成長和長大的。可能對我們這一代來說,機器人目前還不夠智能。但可能對 10 歲左右的小朋友來說,人形機器人的時代已經來臨了。
衛詩婕:節目似乎還有一個隱喻,現在機器人發展的技術階段,是不是跟一個 10 歲甚至更小的孩子(很接近)?
王興興:對。目前大家可以看到每年都有持續的技術進步,但離真正大規模的應用,去家里、工廠里干活,確實還需要一些時間。快的話可能 3 到 5 年,慢的話應該絕對不會超過 10 年。等現在 10 歲的孩子成年,可能整個機器人的技術已經有翻天覆地的變化。
衛詩婕:去年你們登上熱搜的其中一個話題是:宇樹機器人不穿褲子。今年 G1 還是沒穿,但是兩米高的 H1 (宇樹全尺寸機器人)最后登場,穿上了非常威武的服裝,這個是特別設計的嗎?
王興興:對,這個是根據節目效果以及導演組共同決定,服裝這塊我們參與的比較少。
衛詩婕:我以為穿褲子它(機器人)就不方便運動了。
王興興:(穿了)也可以運動的。但畢竟是機器人,還是看整個呈現效果。有時候穿了不太好看,有時候穿了會比較好看。
衛詩婕:我的一些投資人朋友不約而同地盛贊宇樹,覺得宇樹定義了技術的高度。你自己覺得,宇樹現在的運控水平,跟全球、海外比,是什么樣的狀態?
王興興:最近一年我們一直處于頭部水平,很多方面基本上是最好的。總體層面上我們取得了很好的成績,包括運動的靈活性、穩定性。
舉個最直接的例子。大家可能想象不到,臺上二十幾臺機器人,基本每次上春晚彩排的時候都沒有提前測試過,因為節目現場沒有那么多場地給我們做測試。在大興有,但不可能每次把機器人從大興運到舞臺現場。所以我們在春晚的現場和大興測試現場各放了幾十臺機器人,基本可以保證在我們大興測試好的機器人算法,在舞臺表演時候只要做個升級就可以,保證了算法的穩定性。
主要是算法的穩定性,對不同機型的適應性更強。我們去年出貨了 5, 500 臺機器人,寫一套算法基本上要給 5 千甚至 1 萬臺機器人來用,所以對算法的穩定性的要求其實非常高,我們目前的算法穩定性比全球別的廠家會好一些。
衛詩婕:行業里的反饋是,宇樹機器人可以做到開箱即用,極強的穩定性和兼容性,這種穩定性背后是什么?
王興興:這個其實更多還是時間,把硬件做得更可靠、更通用,這樣算法穩定性更好。我們的目標是哪怕硬件都已經換了,算法跑進去都要保持機器的穩定。這兩部分都非常重要。
衛詩婕:專家說做運控的護城河某種程度上就是時間。做的時間越久,碰到的 bug 越多,解 bug 就越多,就越有經驗,是這樣嗎?
王興興:這是其中一部分吧。最重要的還是保持技術本身的持續進步。像我們去年初的時候,算法適應性是比較差的,這臺機器人算法跑得效果不錯,稍微換一臺別的機器人可能效果就變得非常非常差,這說明軟件的適應能力不太夠。但是到了去年的中下旬,我們算法的穩定性就高了很多——各種奇奇怪怪的機器人,裝上我們的算法后,穩定性都高了很多,這樣才有機會實現大規集群機器人表演這件事情。
2026 年,最重要的還是要保持持續的技術進步。你不進步不行的,大家可以關注到,現在開源算法非常非常多——舉個例子,為什么去年中下旬以后,中國很多公司的機器人都可以跳舞、打功夫了?原因非常非常簡單——有人把 AI 算法開源了。
所以說整個行業會持續的進步,我們如果想做到比整個行業平均水平更高的水平。花的工作量和時間其實比大家想象的多很多。
衛詩婕:我知道的是 2024 年初,上海想搞一個機器人列隊方陣,但當時據說只有兩家公司的機器人能走得明白,其中一家是你們。后來僅僅半年過去,大家都能跑能跳了,背后就是 AI 本身的進步。
王興興:對,而且很多人愿意共享(AI 模型)。所以說,如果好幾個月不進步,那就變成一家平庸的公司。如果過去一年,我們公司沒有產品和技術上的進步,宇樹現在就是一家非常平庸、甚至落后的公司了。
漫談Light the Star
PART TWO
高處不勝寒?談宇樹的壓力:
「我們的對手永遠還是我們自己」
衛詩婕: coding agent (編程智能體)現在可以極大加速算法的迭代,我理解這件事情既可以幫助你們放大優勢,但同時也有可能讓宇樹更快地被別人趕超。
王興興:那是不可避免的一件事情。因為在新的技術浪潮面前,唯一不變的就是你要保持進步,保持迭代。能不能保持第一不好說,這還有點運氣成分在里面,但你至少要保持盡可能頭部水平,如果你一旦懈怠了,這個社會是非常現實的,可能幾個月、半年,你就處于落后水平。
衛詩婕:這也是我想問你的。2025 蛇年春晚之后,宇樹帶動了全行業爆火,行業涌入非常多的新玩家。中國人有句話叫「高處不勝寒」。當第一名的滋味如何?
王興興:其實壓力肯定還是非常非常大的,因為各種資源和資金進來,對整個行業肯定是是好事。但對于我們來說,壓力確實還比較大。但我過去這么多年總結下來,我們的對手永遠還是我們自己。
我們自己只要保持產品和技術迭代,基本上別人是追不上的;但是我們自己松懈了,那可能就不好說了。所以這次春晚,包括未來幾個月,包括今年。我們還在構想我們新的產品,構想新的技術,我們要努力把它做出來,做好了,我們就可以持續保持領先。
衛詩婕:以我有限的了解,機器人行業過去是按照兩分法的:做本體的被稱為 locomotion control (運動控制),宇樹是代表;做大腦的是 manipulation (精細操作)。過去一年,我們可以看到做大腦的公司估值非常的高,而且行業好像更看好做大腦,你有什么想說的嗎?
王興興:宇樹其實本體和大腦都在做,但因為我們本體確實賣的比較多,大家可能喜歡把宇樹當作一家本體公司。這也很正常吧。像蘋果,自己做操作系統、做軟件,也賣手機。但是在大家的印象中,蘋果就是個做硬件的公司。
雖然我們一直強調本體很重要,但我一直也承認,最重要的是具身智能大模型。但在當下,具身智能 AI 的不確定因素還非常多。做大腦風險也比較高,因為沒人能保證誰做的最好或誰做的最快, AI 領域變化非常非常快。
但是做硬件的公司,反而可能變化不會太大。今天是這家公司做得好,過幾年會發現基本上也還是這家公司。所以,我們要持續地把自己的技術、硬件和軟件都做的更好一些,產品也更加有競爭力。
衛詩婕:所以宇樹要守好自己的硬件?
王興興:硬件肯定是基本盤,但是我們一直還是希望把軟件做得更好。
衛詩婕:以前是 loco-motion 的做 loco-motion ;做 manipulation 的就做 manipulation 。現在好像有一個新的趨勢叫「 loco-manipulation (全身協同控制)」,你有留意到嗎?
王興興:這個倒不太注意。因為我們其實一直在做硬件、軟件和具身模型。而且宇樹已經開源了好幾個模型,比如說基于視頻生成的具身模型( UnifoLM-WMA-0 ),這個在全球是做得非常早了, 2024 年我們就做了一個版本。包括大家用的 VLA(Vision-Language-Action) 模型, VLA + RL (強化學習) 模型,也在推動。
在具身模型這塊我們一直比較開放,會探索各種新的方向——發現哪個效果比較不錯就多花點時間去做;發現第三方公司做的不錯,也會開放地合作一下。像國內的幾家大的具身模型公司大廠、互聯網大廠,我們也都有推動合作。我覺得具身模型目前是全世界共同的門檻和天花板,只要一家做出來,對整個行業都是巨大的推動作用,大家都應該感謝他。
衛詩婕:所以宇樹希望能做那個幫助大家、推動整個行業發展的人。
王興興:過去幾年我覺得最大的成就感就是宇樹推動了行業的進步,這比賣了多少臺機器人,或公司有多少估值更令人有成就感和高興。
衛詩婕:你剛剛提到蘋果,蘋果作為行業的領先者,它選擇的是閉源。但你宇樹會開源一些模型,而且你們致力于開源。
王興興:我們自己覺得比較重要的部分可能不開源,但有些東西值得開源。
衛詩婕:這次(春晚表演)有了那么大的飛躍,算法、算力、數據,這三方面都有突破嗎?背后的原因是什么?
王興興:肯定有。比如說(數據方面),大家看到我們機器人可以做更多動作,(是因為)我們采集了各種人的動作喂給模型,這樣(機器人)對各種動作的適應能力就更強了。對具身智能模型(來說),最根本的還是要把模型和數據做的更好,這兩部分相輔相成。不是有足夠的數據就一定會性能更好。跟語言模型一樣,運動模型的數據清洗也很重要。采集一些比較優秀的、有代表性的動作數據,效果會比較好。像這次《武 BOT 》,我們羅列了全球所有的武術動作。
衛詩婕:我是否可以這么理解,過去一年 AI 技術在飛速發展,帶動了具身智能底層技術的發展。
王興興:肯定的,我覺得全世界目前最大的驅動引擎就是 AI。它驅動了各行各業的發展,機器人行業肯定是離 AI 最近的一個行業,當然它本身也有些獨有的技術在里面,但很多技術跟 AI 行業完全是共生的關系。
衛詩婕:水平面(提升)是大家都得到了的優勢。但宇樹今天從效果上來看,提升幅度更大,這當中的代差是什么?
王興興:我們確實做了不少工作。可能看上去機器人都在打功夫(別人也能打),但真正要讓幾十臺機器人快速變隊形、保持隊形穩定,這都是全世界唯一一次。我們這次表演是先有個隊形、打功夫、再快速跑位變隊形——而且動作的劇烈程度都比較高。細節層面上是提升比較多,有些技術是目前別的廠家都做不了,有些技術是大家都能做,但我們比他們做的更好。
衛詩婕:變換隊形這件事情,靠的是一種 AI 融合算法?
王興興:對,為了快速變隊形,我們單獨開發了一個算法。
衛詩婕:外行人看,會覺得不就是跑了個隊形嗎?實際上難點是在于定位會飄嗎?
王興興:是的,跑隊形的時候軌跡都是任意的。某種意義上,要實現在任意情況下都能跑到一個位置去的效果,有很大的泛化性要求。
另外一個挑戰就是定位的穩定性問題。因為我們使用了激光雷達,跟一般的汽車激光雷達定位不太一樣的是,機器人在空翻的時候(定位可能會丟),各種劇烈情況下,定位都不能丟,或者丟了以后要快速找回來,劇烈動作的時候都要保持穩定。
這次我們硬件上還遇到一個非常大的挑戰是雷達壞得非常多。做空翻等劇烈動作的時候,直接能把雷達震壞。因為這種激光雷達并不是為劇烈動作設計的,一定高度落下來以后,腿部的鋁合金都直接斷掉。
衛詩婕:機器人 G1 跳起來能到幾米?
王興興:目前借助彈射器大概可以(到)三點幾米高。這個高度對硬件的要求很高。我們后面加了很多減震結構,讓激光雷達減少損壞。但激光雷達的壽命在機器人劇烈動作上依然非常低,所以會出現今天這臺激光雷達好,明天這臺機器人到舞臺上表演的時候突然壞了的情況。所以要靠算法去修正。
衛詩婕:所以你們上春晚很幸福,因為在舞臺上總能遇到很多實驗室里想象不到或沒碰到過的事情。
王興興:對,這也是對我們的一個大考,我一直覺得這(春晚)是一個很好的機會,讓我們有時間去集中攻破更尖端的技術。這些技術可能是很重要的,但是我們以前可能沒有時間去關注這類事情。
衛詩婕:問一個人文的問題,我曾經主持過機器人的發布會,發現機器人背后其實是無數個程序員。剛才我也看到你們團隊都在那收拾東西、吃泡面了。你跟你團隊那些程序員們,每一次上完春晚之后是怎么溝通的?
王興興:(笑)大家都是搞技術的,比較簡單。沒太多感性的部分。
衛詩婕:但你能感受到,每一次在春晚上大獲成功之后,大家精神氣會不一樣嗎?
王興興:我覺得這是個榮耀,屬于所有參與的人的榮耀。
衛詩婕:你能創業十年,一定是真的熱愛機器人,也一定會找同好。
王興興:還是希望大家目標是明確的,而且覺得為了這件事情是值得拼搏的,并不只是做一個工作而已。我希望大家是喜歡技術,喜歡機器人,愿意為這個事業奮斗一生的,這樣大家做任何事情都非常有成就感和開心。
漫談Light the Star
PART THREE
談技術突破:跑位、空翻、爆發力
「集群式的機器人功夫表演,
現場遠比電視上震撼」
衛詩婕:這次《武BOT》的訓練過程有多久?
王興興:大部分時間是花在細節微調上,為這個節目我們準備了幾十天時間。
衛詩婕:整個過程中有沒有最快樂的一剎那?
王興興:中間有幾次的技術突破,是非常高興的。不然呈現效果會比現在差挺多。
衛詩婕:哪幾次技術突破最開心?
王興興:第一次就是可以有任意跑位,跑得很快。因為去年我們表演機器人扭秧歌,只能慢吞吞的走到下一個位置。非常的不好看,也不實用。今年我們攻堅了這個技術。
另外就是借助彈射器實現更高的空翻。我們一開始做出來的時候,可能只比平地的空翻高了零點幾米,沒感覺,完全沒感覺(笑)。后來有一次真的能飛到天花板那么高的時候,如果你站在旁邊看,特別震撼。另外也給觀眾分享一下,這種集群式的功夫集成表演,現場看的震撼程度遠超電視,因為動作劇烈的時候,整個地面會震,氣場非常強大。
衛詩婕:我們以后可以去哪里看到這樣的表演?
王興興:因為這種大型表演確實比較花時間(笑),別的地方確實還是比較難看到,但是以后會有的。
衛詩婕:我今天都已經開始期待機器人舞臺劇了。
王興興:這個肯定未來會有的。
衛詩婕:武術動作講求爆發力。實現爆發力這件事情,對于機器人的硬件和算法有什么要求?
王興興:在大規模的爆發的時候,甚至會把腿桿、鋁合金或鋼全給搞壞了,因為力量實在太大了。尤其高空落地的時候,對整個電機甚至電池都有要求。
這里分享個點,高處落地的時候。電機會吸收能力反充電池。簡單來說,機器人里面的電流突然變得非常大。把電池給損壞。有點像一個人突然血壓高到非常多,導致休克了。我們在軟件和硬件上做了改進,把這種能量給吸收或釋放掉一些。
衛詩婕:所以之前如果機器人「犯高血壓」就直接倒了,不能用了?
王興興:對,可能大家想不到,功夫動作特別劇烈的時候,對電池,對整個供電系統的要求非常高,可能突然間電池供電不夠,又或者電流太大把電池給充壞了。
衛詩婕:你剛才講的(部分)其實對電機、電池都有很大的考驗。據我所知,宇樹是自研電機的,這件事情應該也會利好你們自己的技術?反過來說,如果不是自研電機的玩家,他可能也很難做到?
王興興:對,這個沒辦法,因為我們確實在電機程序上面直接改。
衛詩婕:這算是一個護城河嗎?
王興興:算是吧。
漫談Light the Star
PART FOUR
談靈巧手、硬件與強化學習:
「殘障人士也能出色地干活,
機器人的硬件是夠用的」
衛詩婕:武術的動作都是非常大開大合的,其實這對于關節的自由度要求也是極大的,是嗎?
王興興:對,我們這次上的就是頂配版本,腰部有三個自由度,每條手臂有七個自由度,是有手腕的,靈活性比較高。甚至我們其中有幾臺還裝了靈巧手,為了更好的抓棍子。
衛詩婕:對,我發現這次(表演)一共抓了四樣東西——棍子、雙節棍、葫蘆和劍。體現了靈巧手的能力。所以靈巧手現在能夠做到自由抓取嗎?我記得你之前說過一句話, “目前機器人的硬件是完全夠用的,我們缺的是模型。”
王興興:一般性的抓取還是可以的,但是不能抓太細的。根本性的問題還是 AI 模型。靈巧手目前其實某種意義上也夠用,但不夠好。我一直的觀念就是只要 AI 模型夠好,用一堆非常差的硬件照樣可以干活。舉個最簡單例子,有些殘疾人是沒有手的,照樣干活干的非常好,甚至可以雕塑。
衛詩婕:所以你覺得現在產業供應鏈的生態里,需求最強的環節是哪些?
王興興:這個就很難評價了。最重要的肯定是 AI 模型,硬件肯定要做的更好、更可靠,成本更低,更規模化。這肯定也有挑戰,哪怕硬件沒有根本上的技術問題,但要量產幾萬臺、幾十萬臺甚至幾百萬臺的機器人出來,工程量還是非常嚇人的。
衛詩婕:我看你們好像給強化學習重新做了一個框架,是嗎?
王興興:對,因為這次的動作數量非常多。我們設計的訓練動作可能超過 100 種。 100 種動作要快速訓練做篩選,并把這些動作拼接,對整個訓練要求更高一些。因為過去的很多訓練算法,只能單獨訓練一個動作,或者沒辦法拼接。效率是非常低的。
衛詩婕:你們沒有特別的強化學習的方法嗎?
王興興:我們有自己的模型結構。
衛詩婕:我留意到一個小細節,(《武 BOT 》里)有人和機器人一起舞棍子的動作,那個棍子好像是有一點彈性,軟軟的,是不是為了人跟機器人能夠更好的協作?
王興興:被你發現了。因為是要保護小朋友的。不然(萬一)棍子可能打到小朋友。棍子還是盡可能軟一些。
漫談Light the Star
PART FIVE
多模態訓練消耗算力太大,
純機器人公司可能訓不動模型
衛詩婕:從去年到今年,機器人進化這么快,底層最關鍵的要素有哪些?
王興興:軟件和硬件都挺重要的。硬件的可靠性的提升,不然劇烈動作做一個機器人就廢了。另外軟件的運動能力得提升,劇烈運動包括硬件的兼容能力要強,都是細節問題。
衛詩婕:軟件的挑戰能夠攻克,背后除了你們在細節和時間上面的積累之外,還有沒有底層技術,比如 AI 技術的飛躍?
王興興:肯定的,我們模型結構優化都挺多的。模型結構怎么搭建,怎么優化細節,這個工作量也挺大。
衛詩婕: 2026 年剛剛過去兩個月,Agent,尤其是 Coding Agent 的討論度非常大。
王興興:Coding Agent 現在在機器人的訓練非常有用,我編程大部分代碼全是讓 AI 寫的。這個行業都會有加速的。
衛詩婕: 2 月份熱議的話題是 Seedance 2.0 的發布,我采訪了一些專家朋友,他們認為 Seedance 2.0 可以做到生成一些符合物理規律的視頻。所以有一個問題想聽聽你的看法,這種符合物理規律的視頻生成,能夠幫助具身的訓練嗎?
王興興:肯定的,我們 2024 年開源了一個基于視頻生成的具身智能模型 UnifoLM-WMA-0,想法也比較簡單,既然我都可以生成一個機器人干活的視頻了,那當然可以用這個模型去控制一個機器人。只要把視頻生成的機器人邏輯映射到一臺實物機器人上,就可以干活了。我覺得這個想法是非常自然以及第一性原理的,所以一直非常重視這個方向。我們后續也會做。
衛詩婕:但有人質疑 Seedance 2.0 只是生成了看上去符合物理規律、實際上跟真實世界的精度差很多的(視頻),用來訓練肯定效果很差。
王興興:但我覺得只要做到足夠精細,甚至有可能突破(瓶頸)。因為如果抓一個東西的時候,(王興興用手抓起了礦泉水瓶)生成的視頻連物體的彈性都能仿真出來,說明它本身接觸仿真已經不錯了。
某種意義上,我覺得如果按這個路線做,數據機器人數據足夠多,用數據硬把具身智能模型給砸出來的概率還是挺大的。只是說當下沒人有機會、有大規模機器人實物數據去用。
目前我們自己也在做視頻生成的具身模型,最大挑戰是視頻生成的模型、動作,跟實物機器人沒法很好匹配。兩部分的數據本身無法對齊。可能視頻生成的時候已經抓到這個物體了,但實物機器人就差點。我覺得用海量數據沒準就可以把這個差距直接對齊掉。
衛詩婕:海量數據從哪里來呢?
王興興:目前只能(用)真實采集或仿真了。我們公司在想的辦法是,能不能在沒有海量數據情況下就能對齊;或者做一個新的模型做到閉環。
衛詩婕:所以現在很強調出貨,大家覺得如果能夠(把機器人)部署到一些真實場景里,邊用的時候就可以邊產生數據。
王興興:但是目前也知道,機器人自己產生的數據沒法用,很多情況需要人在仿真環境里做采集,而且這個數據量可能也不太夠。目前人類能掌握的 AI 核心原則只有一條,就是海量的數據,訓練出來的效果是好的。但機器人領域哪怕有 1 萬臺機器人每天采集數據,數據還不夠。而且最主要的問題是采集數據質量并不是很好。
衛詩婕:所以這就是你今天提醒大家要有耐心的原因,是吧?
王興興:對,但是說不好。因為相比過去一兩年,視頻生成模型的效果已經非常好了,但機器人領域比這個還要慢一些。
我個人比較看好視頻生成模型,但對于機器人公司有個很不好的地方,(就是多模態模型)對于算力的要求太高了。
衛詩婕:因為多模態模型消耗的算力是語言模型的很多倍。
王興興:對,非常夸張,全世界的一般純機器人公司可能都訓不動。真的訓不動。
衛詩婕:那怎么辦?
王興興:我也不知道(笑)。如果對數據需求更小的模型,可能做出來更好一些。
漫談Light the Star
PART SIX
談世界模型 & VLA:
宇樹都在嘗試,但我很看好世界模型
衛詩婕:你去年其實有小小的爭議,因為你是少數站出來說, VLA 可能會面臨瓶頸和問題,有很多質疑的聲音,你有聽到嗎?
王興興:我知道,但是您現在去問問別人,可能贊成我觀點的人更多一點。
衛詩婕:這也是我關注到 2026 年的趨勢,討論世界模型的多了,討論 VLA 少了。最近得到一個很有趣的信息跟你分享一下,我采了一個多模態領域的學者,他認為像 Seedance 2.0 這種視頻生成模型,本身已經是世界模型的一部分。
王興興:對,本身就是世界模型。視頻生成模型把很多語言、聲音、視頻加進去,是個多模態模型。在這種模型的基礎上,某種意義上只要把實物、機器人軌跡和感知加在一起訓練一下,就是萬能模型了。既可以生成視頻,也可以干活。肯定有大公司會這么做的,而且我覺得非常符合第一性原理,也非常正確的方向。
衛詩婕:所以 VLA 和世界模型,你是更偏向于世界模型這一派。
王興興:肯定的,目前我覺得世界模型的效果更好一點。當然 VLA 模型我們還在做,也會再優化。它現在肯定是有缺點的,但并不是說這個路線一定死掉了,因為大家也在改進,包括強化學習加進來。或者大家可能說 ,中間的 「L(語言模型)」 有沒有必要呢?要不要變成一個 VA(Vision- Action) 模型?大家都有各種各樣的想法。
衛詩婕:我理解不同的技術路線,可能最后帶來的是不同的方案,但在做一件事情的時候,也許所有的方案都用得到。
王興興:對,因為在目前的 AI 領域,沒有唯一正確的路線,變數還是非常多的。而且很多情況下以前做的 AI 模型即便成功了,但實際上還有更好的路線。
衛詩婕:這就是第一名很大的壓力了,像你說的, AI 創新現在有一些隨機性,很多你們都在試,但一定有你比較 believe 的方向,對嗎?
王興興:對,但這個說不好,經常改主意的。對于我們公司來說,還是一定要保持相對比較開放。
漫談Light the Star
PART SEVEN
每一天、每個月、每半年、每一年的
持續進步
「有價值的研究可能還埋在沙子里」
衛詩婕:過去一年你的時間是怎么分配的?
王興興:因為雜事比較多,所以真正在產品和技術上每天(用)的時間相對較少一點。但我覺得一定要保持對整個產品、對新技術的了解和認知,要跟上全世界的節奏。每天多看一些最新的論文、成果啊。
衛詩婕:現在海外的公司你最關注哪幾家?
王興興:所有做的好的公司都關注。一直非常廣,哪怕一個人做出好東西都值得關注。因為在 AI 目前的技術里,還是有些技術隨機性的。舉個最簡單例子, Transformer 這個結構目前大家都在用,最早是 17 年谷歌做出來的。但到 2022 年 OpenAI 才開始大規模用。
可能未來真正的大腦或者非常好的模型已經有人做出來了,但大家(現在還)沒有發現。大家可以多關注一下各種新的技術,可能現在看上去不太有用,但在未來會變成一個主流技術。
衛詩婕:你講的很關鍵的一點是, Transformer 源自谷歌,但是谷歌卻沒有拿它做第一場勝仗,當然現在谷歌又重回王座了。公司變大的時候,有可能讓機會悄悄溜走。
王興興:這個不可避免。有些技術可能被埋了十多年都有可能。
衛詩婕:宇樹現在在變大嗎?
王興興:對,我們公司人也多了,確實很多情況管理跟不上,效率反而更低了。或者說沒有更好發揮每個人的價值、聰明才智。沒有最優解,只能盡可能完善。
衛詩婕:我發現你還挺有節奏感的,會很客觀的講所有的事情,任之發生,但始終有非常堅定的目標。
王興興:對,我覺得還是要盡可能看到整個技術發展路線。我不能錯過最重要的技術發展,不然別人做出來,我們公司沒做,那真的是非常慘重的代價。
衛詩婕:宇樹這一年相比過去,是速度更快了嗎?
王興興:因為人也多了,整個迭代速度肯定比過去快一些。
衛詩婕:如果給 2026 年許一個小心愿的話,會是什么?
王興興:目前我們定的目標都非常簡單——每一天、每個月、每半年、每一年都有持續的產品和技術進步,這是最重要的一件事情。
衛詩婕:「每一天的技術進步」怎么看出來?
王興興:關注前沿領域,做測試,嘗試迭代。你總是可以獲得進步。
衛詩婕: 2026 年你最期待的行業突破是什么?
王興興:一直期待全球的具身智能模型有更多突破,誰做出來對整個行業都是好事。當然如果我們公司自己做出來,肯定是最好的一件事情。
衛詩婕:宇樹的位置有一個得天獨厚的地方,今天只要你保證自己不退步,一旦有更好的模型做出來,哪怕是別人做出來,你還是能夠保持領先。
王興興:對,保持頭部水平其實相對容易,但是要保持全球第一肯定是更難一些。
衛詩婕:你的夢想跟第一天有產生變化嗎?
王興興:我覺得沒有,因為我從小就非常喜歡科技,希望做一個非常好的科技產品來推動整個社會的進步,這是我最大的理念和夢想。當下我們做的這個行業非常值得做,真的是能讓人類文明邁到下一個臺階的。
漫談Light the Star
PART EIGHT
「如果技術和產品落后了,
所有市場,哪怕已占領的市場,
都是浮云」
衛詩婕:你之前覺得機器人的 RL (強化學習)并沒有做得特別好?
王興興:對,目前我覺得全世界的 RL 還沒有真正把價值發揮出來。目前的視頻生成模型、語言模型,用的 RL 相對比較少,包括它的規模也沒有上來, Scaling Law 還沒出現。
衛詩婕:機器人的 Scaling Law 怎樣才能夠出現?
王興興:沒人知道。只是期待它能出現。但我給Scaling Law 定了一個指標,如果未來哪天,一臺機器人到 80% 左右的陌生環境,給它發一個語音或者指令,它能實現 80% 左右的任務,我覺得就差不多達到了一個具身智能或者機器人的 ChatGPT 時刻,這非常重要。
現在的 AI 模型都是預訓練的,如果我用很多數據去訓練一個場景,它的成功率基本上可以做到 100%。但是我稍微換個場景,它的成功率就暴跌。所以目前機器人的泛化能力還不太夠。
衛詩婕:你剛才講,春晚舞臺上的機器人對于它要跑到什么位置、怎么跑已經有一定泛化性了?
王興興:這個泛化性已經實現,但是不夠,沒有真正讓它實現 80% 左右場景的干活。而且那個跑位也是提前先建圖了。并不是說隨便拎一臺機器人到任何場景上都可以達到這種效果。
衛詩婕:機器人行業現在非常飽和,有一個判斷是到 2026 年,機器人可能會「淤」——因為生產的機器人非常多,不一定有那么大的需求。在這個過程中,我發現大家需要跑馬圈地。據我所知,宇樹一直在 to Lab 非常強,在表演的 toC 層面也很強。在 toB 和工業這一塊,你們是怎么想的?
王興興:我覺得最核心還是要保持持續的技術和產品進步,別的都是虛的。無論在別的領域賣多少臺機器人,某種意義上都不頂用。
只要保持持續的技術和產品進步,哪怕一臺機器人都不賣,永遠都是全球最厲害的機器人和 AI 公司。但如果技術和產品落后了,那些市場,甚至包括已占領的市場,某種意義上都是浮云。因為真正的具身智能 AI 模型突破的那天,過往的東西跟它比起來都是沒有價值的。
衛詩婕:所以在宇樹的優先級里面,技術永遠優先于訂單。
王興興:肯定的,這是最重要的東西。
--End--
同期播客已經上線,歡迎前往小宇宙等平臺收聽
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.