![]()
作者 | Kino
編輯 | 賴捷
又是一年WAIC。
展館里依舊人山人海,宛如一場大型“科技廟會”。各大展臺都在秀肌肉,尤其是人形機器人、AI眼鏡等展臺,里三層外三層,排隊體驗的觀眾絡繹不絕。
不過,我卻被百度展臺的一段數字人視頻播客給硬控住了。一位量化分析師正和一位科技博主圍繞“扔掉舊地圖,AI見FUTURE”對談。
兩個數字人無論是說話時細微的表情變化,還是配合內容做出的肢體動作,以及兩人之間的互動節奏,都比我印象中的數字人自然了不少。
![]()
過去幾年,數字人賽道看起來一直很熱,擁有不少應用場景:直播帶貨、短視頻、企業宣傳……很多人都期待,它能夠代替真人出鏡、提高內容生產效率。
但現實卻有些尷尬,很多數字人一眼假。不過近兩年,技術的進步讓這種尷尬逐漸減少。
還記得之前刷屏的羅永浩數字人直播首秀嗎?去年618期間,羅永浩數字人在直播間里喝奶茶、展示產品、跟助播(朱蕭木數字人)互動。
兩個數字人配合自然,在直播間里互相調侃、異口同聲說話,并頻頻爆梗,刷新了行業對數字人表現力的認知。最終,這場長達6小時的直播吸引了1300萬人圍觀,創造了5500萬元的GMV。
![]()
今年世界杯期間,又有了“范志毅實時互動數字人”,作為世界杯的“AI看球搭子”。
AI范志毅的聲音和形象高度擬真,精準復刻了范志毅的上海口音、方言俚語(比如“儂曉得伐”),挑眉、喝可樂等微表情和動作豐富。而且能實時解答世界杯賽事的戰術分析、賽事復盤等專業足球問題,結合賽事熱點進行即興互動和幽默調侃。
![]()
而站在WAIC展區時,我更加覺得,數字人的商業價值到了被重估的節點。
我剛看到的數字人對談場景,其實是百度一鏡全新首發的“數字人視頻播客解決方案”。
簡單來說,百度一鏡是百度旗下的一個全場景數字人平臺,它的前身是“慧播星”電商直播工具,今年5月進行了戰略升級。
這次推出的視頻播客解決方案,把數字人和Agent能力進一步融合,試圖打通腳本策劃到成片的整個流程。如果這一方案能夠成熟落地,視頻播客等內容的生產方式,或許會朝著更加標準化、規模化的方向發展。
那么百度一鏡的數字人到底有什么不同呢?
![]()
傳統數字人 VS 微表情數字人,
差距不在“皮囊”在“演技”
目前,很多數字人產品都在追求越來越逼真的外觀,但真正影響觀感體驗的,其實是表達和演繹能力。
傳統數字人很多依然停留在照著腳本播報的階段,面對需要互動或表達復雜情緒的場景時,總會讓人覺得少了點“人味”。其中一個很重要的原因就是,數字人缺乏微表情,或是表情切換生硬,缺乏真人流暢自然的微妙變化。
要知道,真人在交流時,會有大量不易察覺的微表情,比如蹙眉、眼神的閃躲等,這些是情感交流的關鍵。傳統數字人技術很難模擬出這些細節,導致數字人看起來缺乏“活人感”,甚至會產生恐怖谷效應。?
那么,和傳統數字人相比,百度的微表情數字人有什么不同?數字人視頻播客的應用潛力又有多大?
來看一段百度一鏡生成的數字人視頻播客片段:
首先是播客布景、陳設的質感非常真實,完全是專業錄制棚既視感。
從視頻中可以觀察到,男嘉賓林深在表達時,眼神和眉毛會隨著語氣的抑揚頓挫流轉和挑動,手勢動作也和發言內容十分契合。
更讓人驚艷的是雙人對談的互動感。當男嘉賓侃侃而談時,左側的播客主持人始終保持著專注的傾聽神態,眼神注視著對方,并伴隨著自然、合乎邏輯的點頭和心領神會的微笑。
再來看這條長達5分鐘的數字人視頻播客,林深和財經女主播曉雯對談“馬斯克為什么AI輸了,估值卻贏麻了?”
這次對談的內容更深度,腳本更完整和精巧。開篇林深就通過制造懸念、打破大眾固有認知來吸引注意力:為什么虧損49個億的SpaceX卻能創下人類史上最大的IPO?其實無論是火箭、星鏈,還是xAI,都無法解釋它的估值神話。
然后把SpaceX比作“下一個英偉達”,只不過是在天上——估值高的真正原因是將航天與AI結合的“太空算力基建”故事。這種類比通俗易懂,大大降低了前沿科技商業模式的理解門檻。
兩個數字人角色定位清晰,分工明確。林深負責輸出專業洞察和數據論證,曉雯負責拋磚引玉,當觀眾嘴替和林深的捧哏。
比如她會代表觀眾提出質疑,并適時總結提煉,以及提供情緒價值(“閉環了”、“丟死人了”、“媽呀太牛了”)。
兩人一來一回,一唱一和,互動感很強,讓原本枯燥的財務和戰略分析,變得如同大公司軼聞一般生動有趣。對話中還使用了大量生活化的口語和互聯網梗,比如“鳥都不鳥”、“硬剛”、“吊打”、“吃老本”、“你太損了”、“跟老羅一樣”。
無論是內容價值還是視聽體驗,上面這兩個案例都代表了數字人在視頻播客中表現的較高水準。
現在我們將視線從臺前轉向幕后,來看看究竟是哪些關鍵技術的迭代,賦予了數字人這種級別的“真人感”。
百度一鏡的技術突破在于,它不再依賴于單一的“開心”或“悲傷”等簡單情緒標簽,來生成數字?的微表情。而是以文心大模型為大腦,像導演一樣,根據人物設定、劇情場景和對話內容,提前規劃好一整套表情表現。
它不僅會考慮人物當下的情緒、表情、動作和聲音等細節,也會結合角色的人設和所處場景,讓最終呈現更加符合人物狀態。
在更細的層面,系統還能做到把人的面部表情拆解成大量可單獨控制的微小動作,對眼神、眉毛、嘴角、面部肌肉等進行精細化控制,因此生成的微表情會更加自然、真實。
當然,文心大模型完成表情規劃后,還需要由數字人專精模型把這些規劃真正呈現出來。
這一步考驗的就是執行能力和速度了,包括:能否把復雜的微表情精準還原?能否在極短時間內完成不同表情之間的自然切換?又能同時表現出多少細節?
目前,百度數字人專精模型支持文本、圖片、語音等多模態輸入作為參考,可以協同控制數百個微表情單元,并把表情變化的時間控制到1秒以內,讓數字人的情緒表達更加實時、自然、流暢。
![]()
成本下降74%、效率提升785%, 數字人視頻播客有“錢景”嗎?
這兩年,視頻播客正在成為越來越多創作者和品牌嘗試的新內容形式。
相比圖文和短視頻,它能夠承載更多信息,也更容易建立創作者的人設,因此不少知識博主、財經賬號、品牌機構等都開始布局視頻播客。但與此同時,它也是目前內容生產門檻較高的形式之一。
要做一期高質量的視頻播客,從前期定位、內容策劃,到錄制執行、后期剪輯和包裝,每一個環節都需要投入大量時間和人力。
正式錄制之前,創作者往往需要提前規劃選題,梳理完整的大綱甚至逐字稿,設計好能夠吸引觀眾繼續看下去的鉤子和節奏。
進入拍攝階段之后,布景陳設、攝影設備、燈光、收音,以及多機位切換、現場調度,又會帶來一系列新的成本。錄制結束后,還要經歷剪輯、音效、字幕、包裝等后期流程。
百度一鏡發布的數字人視頻播客解決方案,讓我們看到了一種新的思路。
前面兩個視頻播客案例呈現出的專業視聽語言,背后其實是復刻了真人流水線的多智能體架構。
百度一鏡把編劇、導演、剪輯等環節交給多個AI智能體協同完成,把數字人真正放進一條完整的視頻生產流水線,而不只是負責出鏡。從展示效果來看,它已經能夠支持單人講學、雙人觀點對談等多種視頻播客形式。
根據百度官方實測數據,這套方案讓視頻播客制作成本下降了74%,制作效率提升了785%,而內容表現力的提升也讓平均播放時長上漲了29%。
當然,這些數據還有待更多實際項目持續驗證,但至少說明了一件事:數字人的價值,正在從替真人出鏡,逐漸轉向重構內容生產流程。
未來,隨著微表情、多模態統一、多智能體協同等能力進一步成熟,數字人會不會成為一種新的內容基礎設施?或許是數字人行業下一階段值得討論的話題。
百度一鏡這次升級,提供了一個值得觀察的樣本。它證明數字人已經不只是直播帶貨、新聞播報這樣的標準化應用,也開始具備支撐長效觀點輸出、知識分享、品牌內容生產等更復雜內容形態的能力。
歡迎分享、點贊、推薦
一起研究AI
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.