![]()
作者|Yoky
微信| yokyliu617
都2026年了,AI能自己寫完一個復雜的軟件工程交付,卻還搞不定一張信息圖里的100個漢字。
這種戲劇性的落差,揭開了當下生圖模型的困境。之所以把二者放在一起比較,是因為它們起點相同:同樣的專業場景,同樣的模型驅動。但在過去兩年,兩邊走出了完全不同的技術體位。
寫代碼這一邊,Coding Agent接需求、寫工程、跑測試、改bug,循環到交付為止,用戶會不會編程已經不重要了。而設計這一邊,行業最頂尖的生圖模型仍然要你生成十張、挑出一張、再打開PS手動修四十分鐘。
為什么代碼能交付,設計不能?差距不在生成能力上。Coding Agent贏的不是代碼寫得更好,而在于通過不停的debug來保證最終的交付質量;反觀生圖模型,生成之后的一切錯亂,仍然只能靠人類設計師來兜底。
7月18日的WAIC上,商湯發布了最新日日新SenseNova U1 Pro(以下簡稱U1 Pro),來解決這層“最終交付”的問題。作為面向長程任務的、交付級原生多模態智能體基座,U1 Pro將理解、生成和行動在同一個模型里完成了深度統一。
它的工作邏輯和Coding Agent異曲同工:通過理解需求,規劃版式,生成內容,檢查問題,自主修正,直到輸出能直接使用的商業成品。
1
第一部分:U1 Pro:抽卡終結者?
生圖模型雖然已經火爆三年,但商業落地最核心的從來不是“圖不夠好看”,而是“出來的東西根本不能用”。
問題長期集中在三個死角:一是中文排版必崩:一張信息圖100個字,錯幾個,整張廢掉。二是復雜信息的空間布局:圖文關系和層級邏輯,出來全是堆砌。三是長文本對齊無力:prompt越長,模型越容易失控。
商湯董事長兼CEO徐立在WAIC演講中拎出了一個關鍵判斷:推理生成(如Nano Banana、GPT-Image-2這類模型)解決了“可控”,但沒解決“可交付”。局部修改會變成全局都在動,信息圖文字牛頭不對馬嘴,生成完了還得借傳統編輯工具去修。“可控不代表可交付。”
也就是說,整個設計AI行業走到了一個尷尬的中間態:面向的受眾依然是專業人士,你得懂專業工具,才能把AI出的東西修到能用。
這正是代碼領域三年前的狀態。如今代碼已經從“輔助專業人士”走到了“替普通人交付”,而設計還卡在半路。
回顧Coding Agent 的發展路徑,先走通了“從Copilot工具輔助,到Vibe Coding意圖驅動,再到Agentic Coding系統級交付”的演進。多模態產品正在走同一條路:第一階段解決真實感,第二階段能用自然語言交互并持續修改,第三階段才能直接在真實場景里完成交付級創作。
按這個劃分,市面上的生圖模型整體還停在第二階段,U1 Pro想做的是第一個跨進第三階段的。
那什么叫“能用”?商湯科技首席科學家林達華給了一個標尺。商湯內部有一支200位美院設計師組成的評審團隊,每張圖都要回答同一個問題“如果你是設計師,你愿不愿意把這張圖交給客戶?”只有當60%的圖能達到這個標準,才算是達到交付級。
按這個標尺來衡量,行業現狀很難看。林達華給了一組數字:“普通生圖模型的交付率都是個位數。近期更偏商業化的模型,包括Nano Banana,交付率也低于五成。真正能達到可交付的就兩個:U1 Pro和GPT-Image-2。”
從硅星人的實測看,我們給出了風格相對模糊的提示詞,但要求文字準確,層級清楚、排版有邏輯。不僅需要模型自己查攻略規劃路線更要將復雜的信息直接的展示出來。
![]()
據硅星人了解,WAIC現場那張鋪滿整面迎賓墻的長卷《智會世圖》,就是U1 Pro生成的:4:1超寬畫幅,宣紙水墨風,串起WAIC從2018到2026的九年歷程,放大之后小字和圖標依然清晰。
![]()
除了信息圖,商湯還在WAIC上展示了更復雜數據可視化的生成,先配合了小浣熊進行分析數據分析,再交給U1 Pro出圖,生成了「世界杯決賽對陣分析圖」。
![]()
出圖即用,視覺生成的Agent化,苗頭確實出現了。
1
第二部分:從U1到U1 Pro:兩個月,三次迭代
商湯并沒有一上來就做U1 Pro,而是用U1開源版,來驗證一條新的技術路線。
把語言和視覺塞進同一個Transformer里聯合學習,不再用傳統的“一套理解、一套生成”的拼接方案,能否保證最終效果?U1開源版本(包含集成U1的Skills)GitHub星數兩三個月漲到8000多,從某種程度來說,驗證了這條路線的可行性。
之后的兩個月,商湯拿信息圖當做“磨刀石”。因為信息圖同時考驗文字準確、空間布局、邏輯層級、圖文關系,是所有品類里最難的那個。兩個月內三次迭代,每次都解決一個具體問題:V1讓文字不再出錯,V2讓模型理解標題和正文的層級差異,V3讓它學會合理安排模塊和模塊之間的空間關系。
每次版本迭代,團隊都在回答同一個問題:這張圖為什么不能直接拿去商業印刷?
這三步,幾乎走完了人類設計師從實習生到成熟熟手的心路歷程。而磨礪出來的空間規劃和邏輯推理能力,反過來成了U1 Pro做“設計Agent”的底座。因為要能先自我檢查與自我修正,前提是模型得先能“看懂”自己出的圖哪里不對。
商湯首席科學家林達華這樣描述U1 Pro的工作方式:“它會從一個草圖出發,先規劃該用什么版式,把版式畫出來,看看是不是符合想象,然后再填入具體內容,最后進行整體調色或細節精修(refine)。”它不是賭一步出圖,而是像真人設計師一樣,草稿、填充、潤色,每一步都在自動檢查修正,循環到滿意為止。
技術上支撐這套循環的是三個選擇。
一是統一架構。 理解和生成在同一個模型內完成,不需要兩套系統之間來回“翻譯”。林達華打了個比喻:“如果生成走一套、理解走另一套,就像一個外國人跟中國人說話,always要用翻譯。我們直接讓他們說同一種語言。”
二是成本方面,極致的壓縮token消耗量來降低用戶的成本。 用32×32的大patch切圖,token量降到常規的四分之一,再用自適應噪聲控制補回細節。這是8K分辨率成本跑得起來的關鍵——否則推理成本會隨分辨率爆炸。
最后,也是最關鍵的能提升審美的部分,讓人類設計師在訓練回路里。 商湯邀請了200位美院設計師評審,他們還在訓練回路里持續為模型打分反饋,驅動強化學習。在冷啟動階段,由設計師提供思維鏈,先教會模型“一個好設計師接到需求后怎么一步步想”,之后通過RL不斷精進審美品味。
模型最后最后“自己有sense了”,看到不同畫面,也就知道下一步該做什么了。
1
第三部分:商湯的“大”視覺戰略
回到開頭那個問題:為什么代碼能交付,設計不能?
現在看,答案不是設計在本質上比代碼難,而是過去沒有人這真正把“交付”當成最終目標。已經有了十幾年視覺積累的商湯,從中看到了多模態統一交付的解法。
從CV時代的視覺識別,到感知智能時代的行業落地,再到今天的統一多模態架構,這家公司的核心技術一直都在圍繞“看懂世界”展開。
這些底蘊落到U1 Pro身上,最直接的體現就是NEO-unify架構:讓語言和視覺在同一個表征空間里聯合學習,僅用十分之一的數據量,就達到了同等SOTA水平。數據效率的提升,短期看是省錢,長期看是迭代速度,在這條需要反復試錯的路上,便宜就是快。
目前行業里做多模態的主流方案是拼接:VE負責理解、VAE負責生成、語言模型負責調度,出了問題再縫縫補補。
而商湯押的是“原生統一”,但這條路極難,要從零證明能不能實現,但是一旦跑通后,同一個技術母體可以向多個縱深方向延伸:比如面向設計的SenseNova U1和U1 Pro、面向世界模型的開悟、面向視覺理解的SenseNova-Vision以及具身智能,無需每個垂直方向都重新造一遍輪子。
別人在做一個產品,而商湯在打造一個通用底座。商湯押注的,是視覺+語言統一架構在未來的長期復利。
而這正是商湯視覺戰略的核心:看得懂世界,才談得上交付世界。
把視線再拉遠一層。語言模型的戰爭打了三年,牌局漸定,行業的下一個共識正在向視覺收攏——世界模型要理解物理世界,視頻生成要模擬物理世界,具身智能要進入物理世界,所有路線圖的終點,都指向了視覺。
一個真正屬于視覺的時代,正在路上。
![]()
點個“愛心”,再走 吧
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.