編輯|杜偉
剛剛結束的 2026 年世界人工智能大會(WAIC) ,具身智能與 AI 終端占據了最顯眼的位置,人形機器人、靈巧手和各類智能硬件吸引了大量目光。
展臺上的熱鬧之外,模型架構的演進構成了大會的另一條技術線。
在備受關注的多模態模型領域,行業長期陷入「搭積木」式的困境:理解、生成、編輯和行動往往分散在不同的專家模塊中。這種拼接架構帶來了嚴重的「信息衰減」—— 任務鏈越長,信息傳遞時的損耗和誤差就越大,最終演變成「聽懂了但畫不對」、「改了局部破壞全局」的行業痛點。
這類架構問題被擺上了臺面,業界急需新的解題思路。
近日,商湯科技在 WAIC 2026 發布了日日新SenseNova U1 Pro(以下簡稱 U1 Pro),這款面向長程任務的交付級原生多模態智能體基座模型,將理解、生成和行動納入統一的能力框架。
而在 WAIC 召開前夕,商湯還開源了日日新SenseNova-Vision視覺大模型,將目標檢測、圖像分割、深度預測和三維重建等經典計算機視覺任務,直接沉淀為通用大模型的原生能力。
這連續兩次出手,并非孤立的技術發布。如果說 U1 Pro 代表了商湯在「上層復雜視覺創作與交付」上的原生突破,那么 SenseNova-Vision 則回答了「底層物理世界感知與幾何物理表達」如何統一進通用大模型的終極命題。兩者的交匯,標志著商湯已率先卡位下一代原生統一多模態基座
「單次生成」到「長程創作」,探索視覺內容系統化交付
要實現商湯科技董事長兼 CEO 徐立提出的「Agentic Creation 智能體創作」范式,模型需要圍繞復雜目標持續理解、規劃、生成、檢查和修正,最終交付可以直接使用的結果。
這對模型底層架構提出了更高要求。U1 Pro 的技術基石 ——NEO-unify 原生統一架構,正是商湯給出的答案。
NEO-unify 讓理解、生成和編輯共享同一套表征空間:其核心設計包括支持輸入與輸出的近乎無損視覺接口,采用原生 Mixture-of-Transformer(MoT)架構協同視覺理解與生成,并在統一學習框架中,分別以自回歸交叉熵訓練文本、以像素流匹配訓練視覺。
![]()
SenseNova U1 Pro 官網:https://www.sensenova.cn/u1-pro
這套架構大幅降低了跨模態交互時的信息損耗。基于此,U1 Pro 展現出面向真實產業場景的交付能力
首先是設計美感的突破。對于商業海報、品牌視覺、知識信息圖這類真實創作任務,審美不只是錦上添花,它本身就是交付的一部分。U1 Pro 側重構圖、色彩、版式和視覺層級等更接近專業設計語言的維度,讓模型能夠理解「好看」背后的設計邏輯。
![]()
其次是8K 原生超清輸出。 超長畫幅和高信息密度圖片放大之后很容易出現文字變形、線條斷裂和模塊錯位等問題。U1 Pro 在大尺寸下依然能夠保持文字、圖標和版式關系的清晰穩定,提高了高密度視覺任務的工程可用性。
![]()
第三是圖文與細節控制能力。信息圖、科普圖解、PPT 頁面、裝配說明等任務,對模型的要求遠高于一般意義上的圖像生成,要組織視覺元素,還要梳理信息關系、維持版式秩序,并盡可能降低文字渲染錯誤。U1 Pro 在這部分強化的,本質上是圖像生成與信息表達之間的耦合能力。
![]()
最后是長程 Agentic 閉環思維。它支持圍繞復雜目標進行數十輪 Agentic Generation Loop,在圖文交錯的任務過程中思考、校驗和修正,并實現整體風格與局部文本的同步精準編輯。
就像在「預測美加墨世界杯」中,商湯展現出的從「一次性靈感工具」到「長程交付者」的進化:先通過 Skills 自動搜集和分析戰術數據,再將晉級路徑、球員對位、戰術體系、傳球網絡和觸球熱力圖等內容組織成可視化報告,自動組織成邏輯嚴密、排版精美的可視化報告,完美實現「搜集 — 推理 — 視覺交付」的全鏈路閉環。
U1 Pro 最核心的價值,在于它將行業對視覺模型的評價標準,從「抽卡式的單張畫面驚艷度」,拉升到了「復雜長程任務的穩定完成度」
視覺創作的競爭,也由單次結果的驚艷程度,延伸到一整條任務鏈的穩定運行。當然,系統級交付仍需接受更多開放環境檢驗,比如長程任務成功率、錯誤恢復能力、多輪運行成本以及跨場景穩定性。
重寫經典視覺底層范式,視覺任務即多模態生成
如果說 U1 Pro 關注的是如何把復雜信息圖轉化為直接交付成果, SenseNova-Vision 則在更底層的維度切入,解答了經典視覺任務如何融入通用多模態基座體系的問題。
過去數十載,經典計算機視覺一直依賴「專家分工」系統,檢測、分割、深度估計、三維重建各套模型擁有各自的預測頭(Task-Specific Heads)、損失函數、解碼規則與評測協議。這套體系非常成熟,也支撐了大量產業應用,但結構性代價同樣明顯。數據割裂在獨立管線中,能力無法跨任務復用,每增加一種新需求,系統就需要接入新的模型或專用模塊。任務越多,系統越重。
SenseNova-Vision 提出了顛覆性的解法:系統性地將多類異構視覺任務,表述為原生多模態生成問題
它徹底摒棄了繁復的 Task-Specific Heads,在同一個共享的表征空間內,對文本、像素、語義信息和幾何特征進行端到端統一建模:
- 類別、坐標、OCR 結果等符號化答案,通過文本生成表達;
- 分割掩碼、深度圖、表面法線等與空間對齊的密集預測,通過圖像生成表達;
- 復雜場景則直接采用圖文交錯混合輸出
所有視覺任務的輸出沒有強行被壓縮成單一格式,保留了文本和圖像各自擅長的表達空間
![]()
SenseNova-Vision 概覽。
技術報告:https://arxiv.org/pdf/2607.06560
為了支撐這一「大一統」范式,商湯對數據層面進行了系統性重組,構建并開源了 SN-VC-50M 數據集(包含 5000 萬個高質量視覺監督樣本),將檢測框、關鍵點、OCR、分割掩碼、深度圖、表面法線、點云圖和相機位姿等異構標注,統一轉換為「視覺輸入 + 自然語言指令 + 可解碼響應」的標準范式,為整個學術界與產業界打通通用視覺基座搭建了關鍵基礎設施。
![]()
SN-VC 的數據來源構成,以及模型訓練時實際使用的數據配比。
實驗數據表明,SenseNova-Vision 在實現四大類視覺任務(結構化理解、稠密幾何、圖像分割、多視角三維幾何)全面覆蓋的同時,其性能不僅在結構化視覺理解上刷新 SOTA,并在上述任務中比肩頂尖的專家模型。
對通用視覺模型而言,「任務做得多」與「專項能力足夠強」具備了同時成立的可能
![]()
SenseNova-Vision 在結構化視覺理解上達到 SOTA,在稠密幾何預測和分割任務上接近最強專用基線,多視角三維幾何表現也逼近領先專家模型。
更重要的變化,落在能力重組上。傳統專家模型的能力通常被封裝在預定義任務協議中,統一訓練使模型有能力處理顯式訓練協議之外的新任務組合,帶來「跨任務能力重組」的驚喜。比如,在面對未經訓練的復雜場景圖(如《黑神話:悟空》《我的世界》等游戲畫面)時,模型無需切換任何模塊,即可在單次交互中連續輸出表面法向估計、實例分割與角色關鍵點檢測。
![]()
變化的還有視覺模型的角色。商湯為經典視覺能力進入通用基座提供了一條可擴展路徑,標志著視覺 AI 正從「工具箱式的算法拼接」,邁向「全能型原生基座」的新時代。
U 系列的下一站,指向統一多模態大基座
落在多模態生成與經典視覺任務兩端的 SenseNova U1 Pro 和 SenseNova-Vision,我們看似承擔著不同任務,其本質上是商湯在原生統一架構上的「雙向奔赴」。
據商湯透露,其未來有計劃將 SenseNova-Vision 的物理世界感知與幾何三維重建能力,深度融入到日日新 U 系列大模型中。屆時,U 系列將演進為一個同時兼具長程創作交付、高密圖文理解、物理空間感知與三維幾何建模的「全感知 - 全生成」統一多模態基座
這種架構的演進,正在重新定義視覺 AI 的競爭壁壘。行業的關注點,正在從過去的「誰擁有的單點算法庫更多」,轉向「誰的基座模型能夠吸收更豐富的專業視覺數據、以更低工程成本復用跨任務知識」。
未來盡管高精度、低延遲的專家模型,仍然將在強約束的工業場景中發揮重要作用。但毫無疑問,能夠貫通理解、生成、感知與行動的原生大一統基座,正不可逆轉地成為下一代通用人工智能(AGI)的核心主干。 商湯連續打出的這兩張牌,無疑為這場架構換代潮劃下了鮮明的標桿。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.