![]()
作者 | 博雯
編輯 | 張潔
泄密信息漫天飛了小半個(gè)月的Gemini Omni,終于在今天凌晨的谷歌I/O 2026大會(huì)正式亮相!
不同于傳言中的視頻生成專(zhuān)用模型,也不是跟著Veo 3命名的”Veo 4“,谷歌DeepMind CEO Hassabis親自登臺(tái)宣布:
“我們正邁出下一個(gè)重要的一步——Gemini Omni,這是一個(gè)可從任何輸入創(chuàng)建內(nèi)容的全新模型。”
![]()
也就是說(shuō),Gemini Omni是一個(gè)真正的“全能”大模型,可以接收任意形式的輸入,生成任意內(nèi)容,視頻生成只是其中一部分。
目前Gemini Omni已同步上線所有谷歌產(chǎn)品,AI Plus、Pro和Ultra訂閱用戶(hù)均可通過(guò)Gemini或谷歌AI視頻創(chuàng)作平臺(tái)Flow使用。
“AI新榜”第一時(shí)間訂閱了級(jí)別最高的谷歌Ultra會(huì)員,對(duì)Gemini Omni進(jìn)行了一手實(shí)測(cè)。
先說(shuō)結(jié)論,有點(diǎn)拉。
![]()
實(shí)測(cè)前后一致性:
基本保持到位
通過(guò)自然語(yǔ)言微調(diào)視頻,以及在這樣的多輪編輯后,仍能保持一致性,是此次Omni重點(diǎn)強(qiáng)調(diào)的亮點(diǎn)。
在官方放出的案例中,原始視頻是一位小提琴家在室內(nèi)演奏。分別改變背后環(huán)境,切換鏡頭,甚至完全去掉演奏主體的小提琴后,演奏者的神態(tài)、動(dòng)作、光影效果,細(xì)微的演奏手型,還有音樂(lè),都還是完美適配新環(huán)境。
不管是精細(xì)編輯的效果,還是畫(huà)面主體的一致性效果,看上去相當(dāng)驚艷。
![]()
![]()
![]()
左右滑動(dòng)查看
于是在實(shí)測(cè)中,我們也先來(lái)一次環(huán)境與氛圍上的替換。
先輸入提示詞:俯拍視角,兩輛車(chē)在一個(gè)十字路口相撞,其中是一輛藍(lán)色的跑車(chē),氛圍驚險(xiǎn)刺激。
再進(jìn)行一次精細(xì)的編輯和微調(diào),提示詞為:改為夕陽(yáng)西下的金色時(shí)刻,并將藍(lán)色的車(chē)改為紅色的,兩輛車(chē)相撞后噴射出彩帶和氣球,氛圍輕松夢(mèng)幻。
可以看到,車(chē)輛顏色和光線環(huán)境確實(shí)是如實(shí)改變了,視頻的整體結(jié)構(gòu)和動(dòng)態(tài)也基本保持了連貫,沒(méi)有出現(xiàn)畫(huà)面撕裂或失真。
但一個(gè)很微妙的點(diǎn)是,對(duì)于“撞車(chē)”這個(gè)瞬間動(dòng)作,Omni理解得并不好。
兩條視頻中的兩輛車(chē)都好像是在“故意”向?qū)Ψ介_(kāi)去,甚至在相撞的瞬間還刻意放緩了速度,調(diào)整了一下角度。
怎么說(shuō)呢,仿佛能看到Omni無(wú)形的大手在操控著兩輛車(chē)完成用戶(hù)的指令。
其次,我們來(lái)檢驗(yàn)Omni能否在動(dòng)態(tài)運(yùn)動(dòng)中達(dá)成一致。
標(biāo)準(zhǔn)是同一個(gè)角色在多角度切換中,其面部特征、衣服、道具乃至發(fā)型都理應(yīng)保持穩(wěn)定,不會(huì)出現(xiàn)“同一件衣服,換個(gè)角度顏色就變了”的Bug。
輸入提示詞:中景推軌鏡頭,一位穿紅色連衣裙的女舞者在老火車(chē)站跳現(xiàn)代舞,一個(gè)跳躍動(dòng)作后切換為廣角固定鏡頭,延續(xù)同一舞蹈動(dòng)作,保持紅裙和火車(chē)站背景的完全一致。
這條視頻的完成度還是比較讓人滿(mǎn)意的,舞者的動(dòng)作連貫連貫,身上那條絲質(zhì)紅色長(zhǎng)裙的物理效果真實(shí),鏡頭從中景切到廣角固定鏡頭也比較絲滑。
Omni還自動(dòng)加上了一段背景音樂(lè),雖然不算是非常具有藝術(shù)情緒,但也基本算是貼合舞蹈氛圍。
再進(jìn)行一次微調(diào),輸入提示詞:去掉背景音樂(lè),只保留環(huán)境音,比如舞蹈動(dòng)作同步的腳步聲和裙擺摩挲聲。
這一次就有點(diǎn)問(wèn)題了,視頻前半段是能聽(tīng)到輕微的裙擺飄動(dòng)和腳掌落地的聲音的,但到了后半段,之前的背景樂(lè)不知為何又響了起來(lái)。
接下來(lái),再測(cè)試其對(duì)于復(fù)雜人物關(guān)系和位置的理解能力。
標(biāo)準(zhǔn)是,在多個(gè)外貌、服飾各異的角色產(chǎn)生互動(dòng)時(shí),他們各自的特征并不會(huì)因?yàn)橐暯乔袚Q而錯(cuò)亂。
輸入提示詞:過(guò)肩鏡頭,四五位外貌打扮皆不相同的科學(xué)家在實(shí)驗(yàn)室討論全息投影,鏡頭慢慢旋轉(zhuǎn),注意保持所有人物的容貌和著裝不變。
也許是為了完美貼合提示詞的“四五位外貌打扮皆不相同的科學(xué)家”,Omni也是貼心將給四位科學(xué)家男女老少,各色人種一應(yīng)俱全。在旋轉(zhuǎn)的鏡頭里,幾位人物的外貌、服飾、聲音和相對(duì)位置關(guān)系也基本保持一致。
不過(guò)很可惜的是,視頻到了后半段突然進(jìn)行了一次相當(dāng)生硬的鏡頭切換。
![]()
精細(xì)控制?還得再練
編輯和微調(diào)也是此次官方放在最前面進(jìn)行案例宣傳的亮點(diǎn)之一。
話不多說(shuō),直接拿來(lái)最近在韓網(wǎng)爆火的AI生成棒球觀賽視頻,再丟給Omni一張二次元小姐姐圖片(來(lái)自谷歌官網(wǎng)演示),讓它用圖片替換原視頻中的人物。
最后的結(jié)果呢……只能說(shuō)是差強(qiáng)人意。
Omni替換上去的人物,只在相對(duì)位置上與原視頻保持了一致,但對(duì)于那種咬唇、眼神躲閃、發(fā)現(xiàn)被拍后抿嘴一笑的細(xì)微表情,幾乎都沒(méi)有表現(xiàn)出來(lái)。
![]()
![]()
這種在細(xì)節(jié)生成上的不如意并非個(gè)例。
我們通過(guò)提示詞,生成了一位中年男人在暗室內(nèi)對(duì)著鏡子輕聲說(shuō):“我知道是你做的,別裝了”的視頻。
原視頻的表現(xiàn)還是不錯(cuò)的,除了男人的中文口音稍微有點(diǎn)奇怪,他的口型與每個(gè)字基本上都是精確對(duì)應(yīng)的,至于是否表現(xiàn)出了人性化的情緒,這個(gè)見(jiàn)仁見(jiàn)智。
但接下來(lái),在我們?cè)噲D修改男人的臺(tái)詞時(shí),Omni的電子腦不知為何就過(guò)載了。
提示詞:一位中年男人在暗室內(nèi)對(duì)著鏡子輕聲說(shuō):“520又來(lái)了,節(jié)日快樂(lè)。”
一開(kāi)始是無(wú)法理解“修改臺(tái)詞”這樣的描述,直接把新的臺(tái)詞當(dāng)作字幕打在了視頻下方;之后又是一半說(shuō)原臺(tái)詞,一半說(shuō)新臺(tái)詞;到最后,更是直接開(kāi)始口胡了。
光影倒是明亮了一些,表情也變成了微笑,只是一個(gè)男人一臉微笑地說(shuō)“我知道是你做的,別裝了”,BGM還是剛才那股陰森色的味兒,簡(jiǎn)直比原版還要詭異好嗎!
只能說(shuō),精細(xì)控制這塊兒,Omni還得練練。
![]()
世界知識(shí)理解:物理學(xué)、世界史成績(jī)不錯(cuò),但還是有Bug
最后是對(duì)于世界的理解。
官方的說(shuō)法是,Omni基于Gemini旗艦大模型,對(duì)于引力、動(dòng)能和流體力學(xué)等物理規(guī)則的理解,以及對(duì)于世界歷史、科學(xué)和數(shù)學(xué)的理解都進(jìn)一步得到了提高。
話不多說(shuō),直接上提示詞:生成一條在連鎖反應(yīng)軌道上快速滾動(dòng)的彈珠。
這個(gè)效果還是比較驚艷的,Omni自己想了一套挺復(fù)雜的連鎖軌道,期間涉及到重力、彈力、離心力等等物理規(guī)則,看上去都相當(dāng)真實(shí)。
不過(guò)在視頻后半段出現(xiàn)了個(gè)Bug,一個(gè)小球冷不丁變成了兩個(gè)。
再來(lái)一個(gè):一個(gè)球沿著一個(gè)U形軌道內(nèi)壁來(lái)回滾動(dòng),最后停在了軌道最低點(diǎn)。
這個(gè)效果就有點(diǎn)奇怪了。
雖然確實(shí)是小球沿著U形管來(lái)回滾動(dòng)并停在了最低點(diǎn),但總覺(jué)得重力環(huán)境并不在地球,小球輕飄飄的,甚至好像還有點(diǎn)穿模。
最后,我又丟了一條相當(dāng)簡(jiǎn)潔有力的提示詞過(guò)去:生成一段李世民和他老哥“玄武門(mén)對(duì)掏”的視頻。
嗯……雖然背后的“玄武門(mén)”的漢字有點(diǎn)問(wèn)題,倆唐代人物的中文也似乎略帶口音,但還是理解了“玄武門(mén)對(duì)掏”這個(gè)中文梗,讓李世民李元吉哥倆進(jìn)行了一次劍拔弩張的會(huì)面。
這么看來(lái),Omni的世界歷史倒是還修得不錯(cuò)。
![]()
實(shí)測(cè)后感受:靜待Seedance 2.1
在今天這場(chǎng)大會(huì)之前,Omni的消息就傳了很久了。
最早是在5月初,有個(gè)用戶(hù)在Gemini的視頻生成頁(yè)面發(fā)現(xiàn)了一行不起眼的小字:"Powered by Omni",頓時(shí)一石激起千層浪。
海內(nèi)外技術(shù)圈都在討論:這個(gè)Omni到底是什么?是去年的谷歌 I/O 2025上的Veo 3的下一代Veo 4,還是一個(gè)全新的多模態(tài)大模型?
這也是為什么在前期的各路消息里,一會(huì)兒是Gemini Omni, 一會(huì)又是Veo 4。
而到了5月11日,一條“教授黑板推公式”的Omni內(nèi)測(cè)視頻又在X上瘋傳,瀏覽量在短短幾天內(nèi)就超過(guò)240萬(wàn)。
視頻在短短10秒內(nèi)連續(xù)切了數(shù)次鏡頭,有教授的背影,側(cè)臉,還有粉筆寫(xiě)公式的特寫(xiě),配合粉筆的沙沙聲,黑板上完全正確的公式,又將大家的期待值拉到了一個(gè)新的高度。
當(dāng)時(shí)的爆料是,Omni已經(jīng)完全把鏡頭語(yǔ)言和剪輯深度技能給內(nèi)化了,多視角鏡頭切換、自帶原生BGM,“直接就能出一條成片”。
![]()
但到了今天,Gemini Omni真的千呼萬(wàn)喚始出來(lái),效果卻是褒貶不一。
看來(lái)還是要期待一下Seedance 2.1了,雖然什么時(shí)候出還是個(gè)大大的問(wèn)號(hào)。
歡迎分享、點(diǎn)贊、推薦
一起研究AI
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.