![]()
作者 | 博雯
編輯 | 賴捷
字節(jié)文生圖的大招終于來了。
7月8日,多模態(tài)圖像創(chuàng)作模型Seedream 5.0 Pro正式發(fā)布,官方強調(diào)其不止“生成”,更懂“設(shè)計”,在復雜信息可視化、交互式精準編輯、真實影像與人像質(zhì)感、原生多語種輸入與生成這四個方向,都有了核心能力上的突破。
![]()
鑒于字節(jié)在文生視頻方面一直相當驚艷的表現(xiàn),這次的生圖模型也在海內(nèi)外引發(fā)了廣泛討論,有不少人已經(jīng)將其冠上了“國產(chǎn)Image 2”的名頭。
“AI新榜”趕緊進行了一波實測。目前,Seedream 5.0 Pro可通過豆包、即夢,以及火山方舟體驗中心這三種渠道體驗,只不過基本都必須購買付費套餐才能使用。我們最終選擇了火山方舟進行體驗。
![]()
實測真實感:
相同提示詞哪家模型更強?
三個月前,GPT Image 2剛剛發(fā)布時,曾憑借生成充滿千禧年風格的老照片、社交平臺界面復刻、微信截圖生成等效果,帶火了一大批真假難辨的圖像生成案例,讓人直呼“無圖無真相”的時代已經(jīng)過去了。
而這次的Seedream 5.0 Pro,官方也特別強調(diào)了“真實的影像與人像質(zhì)感”,即能夠還原現(xiàn)實世界的光影、材質(zhì)與皮膚肌理,兼顧 CG 表現(xiàn)與攝影質(zhì)感,畫面更具生命力。
于是,我們也進行了案例一比一復刻。
首先,是這張流傳甚廣的GPT Image 2生成的老照片,當時在抖音獲得27萬點贊。
提示詞:幫我生成一張千禧年三四歲穿紅色短袖的女孩在紅磚房門口一個白天下午的照片。
![]()
完全相同的提示詞,下方Seedream 5.0 Pro生成的圖片也確實符合題意,很準確,但總給人感覺有點太“新”了,從背景圖到小孩,都有種站在畫報中的干凈感。
![]()
然后是這張流傳同樣很廣的GPT Image 2生成的圖片,提示詞為:
幫我生成一張千禧年中國的一一所普遍高中學生們在上晚自習的照片,拍攝角度為班級的后方。
![]()
而下方Seedream 5.0 Pro生成的畫面,各種元素也相對真實,中文也沒有出現(xiàn)以往一些模型的亂碼或模糊情況,不過相對比Image 2,總體感覺依然是太“新”了,沒有那種模糊的“老照片拍攝畫質(zhì)”。
![]()
繼續(xù)測試“微信截圖生成”。
提示詞:生成手機拍攝的照片,照片中有一個手機,內(nèi)容是微信聊天對話,對話中是工作相關(guān)內(nèi)容和轉(zhuǎn)賬記錄,要求手機屏幕有反光、指紋印等、手機殼是發(fā)黃的”。
GPT Image 2生成的是這樣的:
![]()
而下方Seedream 5.0 Pro生成的其它部分都相當真實,只有轉(zhuǎn)賬部分一下子“露了餡”,顯得很浮夸。當然,這完全可能是出自嚴格謹慎的安全考慮,照片太逼真,就會成為某些人利用的工具。
![]()
接下來是“社交平臺界面復刻”。
提示詞:生成一張真實的手機拍攝的圖片,手機型號是iPhone16,界面停留在抖音視頻,手機屏幕上有指紋印、反光、油漬等”。
GPT Image 2生成的結(jié)果是這樣的:
![]()
而這次Seedream 5.0 Pro生成的效果可以說是很驚艷了,屏幕上的清晰可見的指紋、星星點點的水漬,隱隱可見的窗戶倒影,還有手機側(cè)邊的油漬,都相當真實。
唯一有點漏洞的地方是,整個手機看上去沒有任何支撐,就這么直挺挺地垂直立在桌面上。
![]()
從測評結(jié)果來看,GPT Image 2在真實性這個維度上還原度非常高,有一種接近原始的真實,年代感圖片甚至有“臟亂感”。而Seedream 5.0 Pro的真實度也在提升,但有時過于干凈和清晰,在微觀細節(jié)真實性上有時還不夠,當然,這也有可能是出于安全考慮。
![]()
復雜信息可視化: 設(shè)計能力大幅增強,但部分文字模糊
“復雜信息可視化”,也是此次Seedream 5.0 Pro的核心突破,能將數(shù)據(jù)、概念與密集文字準確轉(zhuǎn)化為專業(yè)排版,直接用于高信息密度的內(nèi)容生產(chǎn)。
首先,我們嘗試生成一張《生成式AI技術(shù)棧全景圖》信息圖,看看模型在多卡片排版和概念歸類方面的能力。
提示詞:生成一張《生成式AI技術(shù)棧全景圖》信息圖,采用4×3網(wǎng)格卡片排版,展示12個核心技術(shù)類別:大語言模型、視覺語言模型、文生圖模型、視頻生成模型、語音模型、代碼模型、多模態(tài)模型、世界模型、VLA模型、AI Agent、RAG系統(tǒng)、推理模型。每個卡片需包含:中文名稱、英文簡稱、核心能力標簽(2-3個關(guān)鍵詞)、一個代表圖標。整體風格為極簡科技風,背景為深色,卡片為毛玻璃效果,網(wǎng)格對齊精準。
最后結(jié)果可以看到,Seedream 5.0 Pro基本完成了12個核心技術(shù)類別的體現(xiàn),網(wǎng)格形式?jīng)]有明顯錯亂,每個卡片也都能對應(yīng)到模型類型、能力說明和應(yīng)用場景。
![]()
接下來,看看Seedream 5.0 Pro在教育科普信息方面的表現(xiàn)。
提示詞:生成一張《為什么沙漠晝夜溫差極大?》的科普信息圖。采用三欄排版:左側(cè)解釋“沙石比熱容小”的原理;中間用示意圖展示“白天吸熱快、夜晚散熱快”的過程;右側(cè)列出“極端溫差對生物的影響”及數(shù)據(jù)。要求加入清晰的中文注釋、數(shù)據(jù)箭頭和對比圖表。
這張圖表現(xiàn)得相當不錯,既有對科學邏輯的可視化表達,圖文匹配度、版面清晰度也比較高。
![]()
再看商業(yè)海報場景。
提示詞:生成一張“雙11全球狂歡節(jié)”促銷海報。采用模塊化網(wǎng)格系統(tǒng)排版:左上區(qū)塊為主標題“11.11”(超大字號,帶金屬質(zhì)感);右上區(qū)塊為副標題“全球狂歡節(jié)·全年最低價”;中部主視覺區(qū)為3-4個核心品類(手機、家電、美妝、服飾)的產(chǎn)品圖+價格標簽;底部CTA區(qū)為“立即搶購”按鈕+二維碼占位+活動時間“11月1日-11月11日”。要求信息分層清晰,遵循“3秒法則”——觀眾3秒內(nèi)能抓取核心信息。
最終結(jié)果在產(chǎn)品圖的布局以及價格標簽的展示上是沒有問題的,但整體上感覺有些過于“規(guī)整”,缺少了一點刺激人眼球的設(shè)計感。
![]()
還有電影級視覺敘事海報。
提示詞:生成一張科幻電影《星際拓荒》的概念海報。畫面采用垂直三分法構(gòu)圖:頂部為深邃星空與飛船剪影(氛圍層);中部為宇航員背影望向星球(主體層);底部為電影標題“星際拓荒”+ 上映日期“2026.12.25”+ 演職員名單(信息層)。要求明暗對比強烈,光影具有電影級質(zhì)感,文字渲染清晰無錯。
可以說,海報對于氛圍的渲染還是相當不錯的,宇航員背影站在畫面中心,前方是地球和一望無際的宇宙,雖然老套,但足夠經(jīng)典。不過最下方的演職員名單等密集文字處仍出現(xiàn)了顯示模糊和錯誤。
![]()
最后,我們也結(jié)合“AI新榜”的實際工作進行了體驗。
把馬上召開的“2026新榜AI大會”和原海報宣傳圖丟給Seedream 5.0 Pro,看看它能否結(jié)合大量文字信息,重新做成更好的海報。
從最終生成結(jié)果來看,排版上還是有一定設(shè)計感的,但文字內(nèi)容的模糊是個比較大的問題:
![]()
而在要求輸出英文后,依然有文字不清晰、模糊,甚至亂碼的問題:
![]()
事實上,這也是不少用戶反映的問題。X上就有博主表示,圖像模型進步很大,但如果文字很多的話,就會有跟GPT-4o類似的問題,文字比較糊。
![]()
![]()
精準編輯能力: 依然無法完全替代PS
這次Seedream5.0更新后,“PS時代要被終結(jié)了”是一個被社交媒體高頻提起的描述,因為官方發(fā)布里表示,Seedream 5.0 Pro能基于對空間位置與區(qū)域語義的理解,支持點選、圈選、草圖渲染、色彩與材質(zhì)替換、圖層分離、多圖融合的自由組合,實現(xiàn)交互式精準編輯。
官方演示中最讓人感到驚艷的,就是Seedream 5.0 Pro模型能把一張完整海報拆分為文字、主體、背景以及環(huán)境裝飾等十余個獨立圖層,再進行進一步精準編輯。
不過遺憾的是,火山方舟中心上顯示“圖層分離”功能,仍處于“即將上線”的狀態(tài),所以無法在此次測評中展示。
![]()
所以我們還是從最基礎(chǔ)的功能試起。
首先生成一張客廳效果圖,包含一個棕色皮質(zhì)沙發(fā)。
![]()
其次,要求Seedream 5.0 Pro將指定區(qū)域的沙發(fā)材質(zhì),更換為深綠色天鵝絨,并保留原有的透視、光影和周圍環(huán)境。生成的結(jié)果還是相當不錯的。
![]()
接下來,再嘗試Seedream 5.0 Pro的精準編輯功能,在火山方舟體驗中心,用戶可直接在生成圖像右上角點選“圖片畫板編輯”,進行進一步操作,如點選、圈選、輸入文字等。
![]()
我們輸入一張“AI新榜”文末的原創(chuàng)文章貼片,將中間的文字框選,然后要求Seedream 5.0 Pro將其去掉,同時保持背景圖不變。
![]()
這個操作如果放在PS里,可能要費很大勁,但現(xiàn)在只需要通過自然語言,就能直接得到一張干凈的背景圖:
![]()
還可以要求它將圖片中某個人物的表情進行細微改變,比如由張嘴改為不漏齒的微笑:
![]()
只不過,當我們直接輸入一張完整的原創(chuàng)文章貼片,再要求其替換背景圖和標題,直接生成一張新貼片時,Seedream 5.0 Pro給出的結(jié)果就并沒那么好了:不僅字體上出現(xiàn)了錯誤,貼片尺寸也不對。
![]()
我繼續(xù)提出新要求后,還出現(xiàn)了上下文丟失的情況,生成了完全驢唇不對馬嘴的圖片:
![]()
只能說在涉及到具體的工作任務(wù),尤其是特別精細的元素控制上,大模型可能還無法徹底代替PS。
![]()
總結(jié):Seedream的野心,比“作圖”更大
最后再說說Seedream 5.0 Pro的價格問題。
在豆包和即夢上,目前分別需要訂閱69和79的會員,才能解鎖Seedream 5.0 Pro模型生圖功能,而在火山方舟體驗中心顯示,API調(diào)用時,Seedream 5.0 Pro輸出一張1K分辨率(像素≤236萬)的圖需要3毛錢,2K圖需要6毛錢,暫不支持直接輸出4K圖——這個價格與GPT Image 2 Medium的價格差不多。
![]()
綜合來看,Seedream 5.0 Pro在“攝影圖片”細節(jié)還原,材質(zhì)替換時的光影保持,以及基礎(chǔ)圖片編輯能力上,都展現(xiàn)了特定場景下的競爭力。圖層拆分等功能在消費端落地后,也會對實際工作有更大的價值。
但在現(xiàn)實世界的微觀真實性上,仍比不上GPT Image 2帶來的那種“以假亂真”的沖擊感。
不過Seedream 5.0這次的推出,也不能完全以“現(xiàn)實真實”這一個維度來評價。
從官方著重打造的“原生多語種輸入輸出”“交互式編輯”“復雜信息可視化”等功能來看,Seedream 5.0是要把圖片模型,從之前主要落地的“影視IP生成”“做劇情分鏡”等,升級到更多工業(yè)和商業(yè)化場景中,電商出海、廣告營銷、教育輔導、工業(yè)信息化等等等。
比如多語種功能,是為了方便商家把營銷圖,一鍵替換為不同國家消費者所習慣的語言,阿拉伯語是從右到左連貫書寫、西班牙語有重音符號等等。
簡單來說,Seedream的夢想就和它名字一樣,是能從功能中清晰看見的——不只做內(nèi)容,而是想成為各行各業(yè)的生產(chǎn)力工具。
AI如何重塑內(nèi)容?AI內(nèi)容賽道有哪些新趨勢和機會?,集結(jié)平臺負責人、頭部博主、短劇機構(gòu)大咖,共探AI容前沿趨勢。免費報名請掃下方海報二維碼,期待你來!
![]()
歡迎分享、點贊、推薦
一起研究AI
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.