![]()
對著攝像頭比了個手勢,桌上憑空多了只企鵝
作者|湯一濤
編輯|鄭玄
在屏幕上拖拽一只小貓的照片,它跟著你的手指跑了起來。
把手機攝像頭對準一起吃飯的同事,屏幕里的他變成了狐耳少年。
![]()
打開自由模式,輸入一句「我手上有個火球」,掌心真的燃起了火焰。
![]()
這些畫面沒有經過后期,也不是預渲染的特效,每一幀都是 AI 根據攝像頭捕捉的實時畫面和你的操作即時生成的。
實現這套技術方案的是本土團隊 Xmax AI,創始人史佳欣為清華計算機本博,博士就讀于清華 KEG 實驗室。團隊核心研發人員也大多出自清華大學 KEG 實驗室和 HCI 實驗室。智譜就誕生于 KEG 實驗室,是國內頂級的 AI Lab;HCI 實驗室則是國內人機交互研究的重鎮。
其實早在今年2月,Xmax AI就發布了世界首個虛實融合的實時交互視頻模型X1,盡管在海外社媒平臺關注度很高,但當時的能力還停留在技術層面突破的階段。而時隔 5 個月,Xmax AI 于今日凌晨在 X(Twitter)正式發布 X2.0 模型,并同步開放商用 API。
過去兩年,AI 視頻賽道最熱鬧的故事是生成質量的軍備競賽。從 Sora 到 Seedance、Kling、Veo,大家卷的是畫質、時長和逼真度。到 2026 年年中,頭部模型在基礎畫質上的差距已經很難用肉眼分辨。
與此同時,商業化路線也在逐漸分化。字節即夢和快手可靈把視頻生成嵌入自家內容生態,Runway 和 Pika 走專業創作工具路線,PixVerse 主攻海外社交媒體創作者市場。
方向各有不同,但底層邏輯一致:持續優化視頻生成畫質,面向創作者實現商業化變現。
在全民內卷畫質升級的行業趨勢下,AI 視頻也涌現出了另一條差異化的技術路線。重點不放在畫質上,而是從交互方式入手,讓視頻變成可以被實時操作的交互媒介。
海外進展最快的是以色列公司 Decart,今年 5 月剛完成 3 億美元融資,估值 40 億美元,總融資額超過 4.5 億美元。它的 Lucy 系列模型已經在直播和虛擬試穿等場景中開始測試應用。
在國內,這個方向基本空白,Xmax AI 是落地進度最快的團隊,也是目前國內唯一可商用規模化部署實時編輯和交互模型的公司。
01
從 X1 到 X2.0
今年 2 月,Xmax AI 發布了全球首個虛實融合的實時交互視頻模型 X1。它用四種玩法(次元互動、世界濾鏡、觸控動圖、表情捕手)第一次讓人直覺地理解了「玩視頻」是什么意思。
X2.0 在 X1 的基礎上完成了兩個關鍵升級。
第一個是畫質的改變。首先 X2.0 將畫質從 480p 提到 960p、24fps,對直播、社交、電商這些消費級場景來說,畫質已經可以覆蓋。
比畫質更重要的是延遲控制。X2.0 將視頻生成速度做到了毫秒級響應,幾乎 0 延遲。如果說畫質提升是體驗優化,那延遲從可感知降至毫秒級近乎無感,則是產品體驗的維度切換:用戶從「等待 AI 渲染結果」,轉變為「實時參與、實時操控畫面」,這也是持續沉浸式交互的核心前提。
X2.0 的實時性讓持續交互成為可能,底層是一套端到端的流式重渲染架構,模型以幀為單位做自回歸生成,每一幀的輸出不依賴前面整段視頻渲完。
然后是交互方式的進一步泛化。X2.0 搭建了一套統一的多模態交互架構,一個模型同時理解觸屏拖拽、手勢控制、攝像頭畫面和文字指令,并且這些方式可以自由組合。
在此基礎上,X2.0 開放了三大類五項能力:實時換人(CharX)、實時換裝(ClothX)、實時換風格(VibeX)、觸控交互(MoX)、次元互動(DimX),外加一個支持自定義 prompt 的 Free 模式。
![]()
這一套能力覆蓋面很廣,但要訓出這樣的模型,最難的環節不在架構設計,而在數據。虛實融合交互效果,高度依賴真人與虛擬元素自然聯動的實景素材,而這類高質量合成數據在公開互聯網中極度稀缺,無法通過通用數據集完成訓練。Xmax 團隊為此搭建了一條半自動化的數據合成管線來批量生產這類素材。
這也解釋了為什么全球做虛實融合實時交互的團隊這么少:模型架構的難度是一方面,訓練數據的稀缺是另一個同樣關鍵的瓶頸。
02
基礎設施就位
一項技術能走多遠,能力本身只是一半,另一半取決于落地條件,比如硬件適配、客戶接入門檻、部署成本這些工程問題。X2.0 在這一層有兩個關鍵進展。
第一個是端側推理。團隊通過混合精度量化、結構化剪枝和針對移動芯片的專屬優化,讓模型在 iPhone 上實現了實時流式推理。目前端側能實現的分辨率是 384p,離直接可用的消費級產品還有距離,但據團隊介紹,這已經是全球首個在移動設備上跑通實時交互視頻生成的模型。這意味著將來端側推理這條路徹底跑通之后,端側設備就不用再強綁定云端算力,理論上任何有攝像頭的終端設備都可以成為載體。
第二個是API 的開放。X2.0 的五項核心能力和 Free 模式,都已經通過商用 API 對外開放。對于想要在自己的產品中接入實時交互視頻能力的團隊來說,這一套能力就可以直接調用,團隊可以把精力放在自己的產品和場景上。
成本值得單獨說一下。Decart 目前的實時視頻編輯 API 定價是每秒 0.02 美元(720p),換算下來每小時 72 美元。而X2.0 的 API 調用成本在海外 6 美元/小時,約為 Decart 的十二分之一;國內則更低,為 20 元人民幣/小時。
![]()
用一個具體場景來算賬:按 Decart 的價格,一個電商用戶花 3 分鐘在線試穿,成本是 3.6 美元,對絕大多數零售商來說可能無法承受。如果這個數字降到十分之一,就進入了可以規模化部署的范圍。
端側能跑,云端用得起,這兩件事放在一起,意味著實時交互視頻這條路線第一次有了可供中小團隊和垂類企業低成本復用的標準化基礎設施。
03
誰會第一個用起來
從目前的能力成熟度和場景匹配度來看,直播和電商試穿是實時互動視頻兩個最接近商業化落地的方向。
中國直播行業的日活用戶早已突破 3 億,但互動方式從誕生至今沒有發生過結構性變化。打開任何一個直播間,觀眾和主播最常見的互動方式就是發彈幕、刷禮物、連麥。
這些互動方式有一個共同的局限:彈幕、禮物特效都屬于疊加在畫面表層的獨立圖層,和主播實景畫面相互割裂。即便送出火箭、豪車這類大額禮物,僅會懸浮彈出動畫特效,無法和主播本人、真實直播場景產生聯動交互,不能改變實景內的人物與環境狀態。
平臺和 MCN 一直在尋找提升互動深度的辦法。快手試過彈幕游戲,抖音做過直播間互動道具,但始終沒有跳出「評論區互動」的底層邏輯,核心瓶頸在于:傳統直播視頻流是單向、不可編輯的。
實時交互視頻能力接入之后,互動可以直接發生在畫面層。
比如說觀眾在彈幕里喊「變成早川秋」,主播的形象實時變成角色,動作、表情完全同步。
![]()
Free 模式讓觀眾用任意文字指令觸發畫面變化,例如「眼睛射激光」「召喚小貓互動」。
![]()
CharX 負責換人,ClothX 負責換裝,VibeX 可以連人帶背景一起換風格,Free 模式讓觀眾用任意文字指令觸發畫面變化。這些能力組合起來,直播間變成了一個觀眾可以實時操控的畫布。
對于直播平臺和 MCN 來說,這是把用戶互動從「文字反饋」升級到「視覺反饋」的結構性變化,觀眾的每一條指令都能直接改變內容本身。
![]()
直播解決的是互動深度的問題,而在電商領域,實時交互視頻瞄準的是一個更具體、也更容易算賬的痛點。
線上買衣服的核心痛點所有人都知道:模特穿著好看,買回來穿在自己身上是另一回事。中國女裝電商的退貨率長期在 40% 以上,部分品類甚至超過 60%,退貨帶來的逆向物流成本是每年千億級別的行業損耗。
圍繞這個問題,行業已經嘗試了很多方案。阿里、京東都做過基于 3D 建模的虛擬試穿功能,海外的 Zeekit(后被沃爾瑪收購)走的也是這條路。這些方案的共同問題是:效果是靜態的,把一件衣服貼到一個固定姿勢的人體模型上,用戶看到的是一張合成圖,不是自己真實穿著的樣子。
各家方案的成熟度和技術路徑不同,但行業共識已經形成:讓消費者在下單前看到「這件衣服穿在我身上」的效果,是降低退貨率最有效的手段。
X2.0 的 ClothX 做的就是這件事:打開手機攝像頭對著自己,衣服實時替換,你自己的體型、動態、光線環境全部保留。和靜態合成圖的體驗不同,你看到的就是「這件衣服穿在我身上、在當下這個環境」的真實效果。
![]()
電商詳情頁可以嵌入實時試穿功能;直播間里主播一邊講解一邊讓觀眾遠程試穿;甚至線下門店也能放一面接入了 API 的智能試衣鏡。
對于退貨率長期困擾的女裝電商來說,這是一個可以直接算賬的能力:如果實時試穿能把退貨率壓低哪怕幾個百分點,省下來的逆向物流成本就足以覆蓋 API 的調用費用。
直播和電商之外,虛擬陪伴和 AR 交互也是 X2.0 正在探索的另一個方向。
目前市面上的 AI 社交產品和虛擬陪伴應用,角色都困在屏幕里面。不管是文字聊天還是 Live2D 動態形象,交互方式都是打字和點擊,虛擬角色和你所處的現實環境沒有任何關系。
X2.0 的 DimX 能力試圖打破這層隔離。對著空桌面做一個手勢,虛擬角色憑空出現在桌上,它能感知你的手勢和位置,跟隨你的動作做出反應。
![]()
對于做虛擬陪伴、IP 潮玩、甚至類寶可夢 AR 游戲的團隊來說,DimX 提供了一條不同于傳統 AR 的技術路徑。不需要 SLAM 定位和 3D 建模,用 2D 視頻流直接輸出虛實融合畫面,技術門檻和接入成本低一個量級。
另外,端側推理意味著這套能力不綁定在某一類設備上。手機是最現成的載體:桌面壁紙上的小貓按一下就活了過來,看短劇時把演員換成自己的臉。
往外延伸,景區入口放一塊互動屏,游客對著鏡頭一秒換上古裝;智能眼鏡接入后,肉眼所見的世界可以實時切換視覺風格。同一個模型、同一套交互邏輯,適配的終端越多,長出來的產品形態就越多。
![]()
04
視頻的下一次躍遷
視頻這個媒介誕生一百多年,形態變過很多次,從膠片到數字,從錄播到直播,從專業制作到 UGC。但有一個屬性始終沒變:觀眾和畫面的關系是單向的。你可以選擇看什么,但你不能改變正在發生的事。
實時交互視頻正在嘗試改變這個屬性,把視頻從只能被觀看的內容,變成可以被操作的界面。
這個轉變讓人想起網頁的演化。早期的網頁只是電子版的印刷品,只能讀、不能動。當網頁變成可以被操作的界面之后,長出了電商、社交網絡、SaaS,幾乎整個互聯網經濟都建立在這個轉變之上。
![]()
1993 年底,Aliweb 上線。用戶可以輸入內容發給服務器并返回結果,是第早期真正實現 「輸入 - 反饋」 雙向交互的代表網頁(同時也是世界上第一個萬維網搜索引擎)|圖片來源:webdesignmuseum.org
當然,網頁成為交互界面的前提是 PC 的大規模普及、寬帶基礎設施的鋪設和一整代開發者的涌入。視頻要完成類似的躍遷需要的條件可能同樣復雜,但方向本身值得注意:當一種主流媒介從單向變成雙向,它能承載的商業形態和用戶行為會發生根本性的擴展。
Xmax X2.0 開放 API,做的是把交互視頻的基礎設施鋪好。至于這個界面上最終會長出什么樣的產品,還有太多未知。但這恰恰是開放平臺最有趣的地方。
*頭圖來源:Xmax
本文為極客公園原創文章,轉載請聯系極客君微信 geekparkGO
極客一問
你會想使用 Xmax AI 嗎?
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.