經常在互聯(lián)網上被AI視頻假冒的黃仁勛決定出手了。
近日,英偉達宣布推出Synthetic Video Detector NIM,這套工具號稱可以逐幀分析視頻,通過生成模型留下的統(tǒng)計與頻域痕跡,分析出哪些內容是AI生成的視頻,準確率最高可達92%。
![]()
(圖源:英偉達)
沒辦法,誰讓現(xiàn)在生成假圖、做假視頻的門檻越來越低。
就拿我前陣子刷到的一個視頻為例,內容蠻簡單的,一只貓剛把花瓶碰碎,轉頭就溜得比誰都快,旁邊的狗子當場愣住,瘋狂揮爪解釋,表情像是在說:不是我,真的不是我。
![]()
(圖源:抖音)
挺好笑的對吧,如果不是AI視頻就更好了。
更麻煩的是,以前判斷假視頻,還能靠一些比較明顯的畫面破綻,比如說什么嘴型對不上、手指數(shù)量不對啊;現(xiàn)在視頻生成模型進步速度飛快,很多生成內容已經不會給我們留下這么明顯的漏洞,也難怪我家里的長輩能天天上鉤。
既然普通人不知道應該怎么辨別,那也是時候該輪到檢測工具上場了。
英偉達加入“用AI檢測AI視頻”大軍
先簡單介紹一下,英偉達在2024年3月公布了NVIDIA Inference Microservices,簡稱NIM,這玩意本質上就是把“模型+推理+API接口+運行環(huán)境”等打包成一個部署工具,算是一種讓開發(fā)者快速獲得AI服務的辦法。
而這次發(fā)布的Synthetic Video Detector NIM,可以理解成英偉達在NIM標準下打包的一套AI視頻檢測服務。
正因為這玩意主要面向的場景是本地部署,目前想要在線使用必須通過英偉達的媒體測試申請,而本地部署又需要Linux系統(tǒng)和兼容NVENC/NVDEC視頻編解碼的硬件,普通人想用上還挺困難的。
![]()
(圖源:英偉達)
不過用不上,不影響我們借著目前的資料和演示好好聊一聊。
根據(jù)官方介紹,視頻上傳后,SVD NIM會先把H.264編碼的MP4拆成畫面幀,再交給DINOv2和DINOv3組成的視覺模型分析,再給每一幀打分并匯總,告訴你整段視頻到底有多像AI生成。
重點是,它不會盯著六根手指、人物穿模或者水杯突然消失這種傳統(tǒng)藝能。
按照官方說法,SVD NIM識別的是生成和去噪過程中留下的底層統(tǒng)計特征、頻率異常,以及正常相機不太容易拍出來的像素規(guī)律,即便用戶將視頻進行壓縮和重新編碼,也依然能夠保證較高的識別概率。
![]()
(圖源:英偉達)
參考官方提供的案例,可以看到這個視頻本身并沒有出現(xiàn)早期AI視頻特有的各種畫面崩壞、前后不一的問題,但SVD NIM卻給出了高達99%的綜合得分。
當然這視頻確實一眼假...畢竟運鏡有點太平滑了。
![]()
(圖源:英偉達)
要我說,英偉達這套思路確實比盯著畫面里的破綻要靠譜些。
畢竟要在沒有前情提要的情況下,給大伙看下面這段視頻,我想至少有八成左右的人看不出這是完全由AI生成的,現(xiàn)在Seedance和Kling的視頻生成能力就是有這么恐怖。
![]()
(圖源:bilibili)
按照英偉達的說法,他們準備了超過4000個視頻的內部測試集,SVD NIM檢測的成功率居然高達85.64%,未壓縮視頻的準確率更是高達92%。
當然了,92%的準確率不能理解成一測一個準。
盡管在宣傳稿里沒說,但英偉達在說明文檔里還是有標注的,這么高的準確率是由偏嚴格的閾值采樣的,在真實環(huán)境中可能造成大量誤判,所以這玩意更適合給視頻網站做初篩,出現(xiàn)可疑素材的話,還是應該交給人工繼續(xù)核實。
而且這個準確率還是基于H.264編碼的MP4格式視頻得到的,任何轉碼和壓縮都會降低準確率,只能說老黃的免責聲明還是太專業(yè)了。
反AI實測:朱雀還行,反詐中心不穩(wěn)定
目前來說,英偉達這套SVD NIM確實離普通用戶還有點遠。
不過國內其實也有類似定位的檢測工具,直接打開就能用,其中一個是騰訊朱雀AI檢測助手,另一個是反詐中心App里的“AI內容鑒定”,兩款應用均支持文字/圖片/視頻檢測,每天也有一定次數(shù)的免費檢測。
為了看看AI抓AI到底靠不靠譜,我準備了一組混合測試:
幾張由主流模型直接生成的圖片、幾張手機實拍照片;一段精心挑選的AI視頻,再搭配Vlog題材的真實視頻,我還把部分素材發(fā)過微信、截過圖,準備看看它們應對二次壓縮的表現(xiàn)怎么樣。
第一輪,來點AI視頻。
![]()
(圖源:bilibili)
這段視頻本身我覺得是很不錯的,略顯模糊的分辨率、微微晃動的模擬鏡頭和角色的動作神態(tài)融合在一起,真的很有老電影的感覺,制作者手繪了大量的分鏡圖供模型參考,可以說完全發(fā)揮了Seedance的制作能力。
于是騰訊朱雀第一個就栽了。
![]()
(圖源:雷科技)
作為對比,我找一個通過了媒體申請的朋友借了騰訊朱雀的賬號,可以看到SVD NIM給出了高達93%的綜合得分,意味著這個視頻高概率是AI合成的,同時逐幀檢測的疑點也在坐標系上標注出來了。
就是這個檢測速度確實不快,13s的視頻檢測了兩分鐘。
![]()
(圖源:雷科技)
更牛的還是反詐中心內容檢測,我愣是試了半個小時沒能傳上去,最后只能作罷。
第二輪,換上真實視頻。
![]()
(圖源:雷科技)
當然了,不能是那種簡單的真實視頻,我選了一個很多視頻生成模型都喜歡模仿的Vlog視頻,制作者用的相機不錯,鏡頭過渡順滑自然,街頭光影也很有質感,屬于一眼真假莫辨的水平。
您猜怎么著,咱們騰訊朱雀又翻車了。
![]()
(圖源:雷科技)
英偉達這邊相對還是要強不少的,雖然也給出了34%的綜合得分,但這畢竟是個參考數(shù)值,這個意味著模型檢測到的合成內容證據(jù)不多。
![]()
(圖源:雷科技)
至于反詐中心,我還是沒有上傳成功,要是有老人家真的想用這功能那就受罪咯。
接下來換圖片,這個就不詳細介紹了,總之是同一個題材下的真實圖片,以及兩張由豆包、image 2制作的AI圖片,后面兩個均通過后期、壓縮抹除水印。
![]()
(圖源:雷科技,從左到右為豆包、image2和真實照片)
結果剛想夸朱雀這次認出AI圖了,它就整了一個真實照片也是AI的好活。
![]()
(圖源:雷科技)
相反,之前折騰了好幾次沒傳上視頻的內容檢測,這次倒是做到三題全對,看來反詐中心在算法上還是有些優(yōu)勢的。
(圖源:雷科技)
最后吐槽一點,這兩家給的免費次數(shù)都不多,真遇到啥事還不一定夠用咧。
AI識別很弱,但總比沒有要強一點
這一輪測下來,我對AI檢測工具的信心,只能說比沒有強一點。
視頻這塊,英偉達表現(xiàn)還行,騰訊朱雀完全靠不住,居然能得出相反的答案;圖片相對會好一些,但是騰訊朱雀依然能整出真圖當假圖的好活,而反詐中心內容檢測的服務器則大部分時候都是爆滿的,根本上傳不了內容。
這機器自己都拿不準,人就更別急著拿檢測截圖去評論區(qū)斷案了。
在我看來,相比事后猜一張圖有沒有AI味,生成時直接留下水印和來源記錄,顯然更加靠譜。
如今谷歌已經在用SynthID給生成內容加隱形標記,Adobe等公司也在推動C2PA,希望把文件從生成到修改的過程記錄下來。國內也在跟進,網信辦已明確要求AI內容添加標識,騰訊、阿里和字節(jié)也在檢測、數(shù)字簽名和平臺提示上積極補課。
![]()
(圖源:雷科技)
問題是,目前這套體系還沒有完全連起來。
我去部署一個開源模型,生成的內容必然也是沒有水印的;你的圖片、視頻轉發(fā)幾次,元數(shù)據(jù)可能就沒了;至于平臺之間能不能互相認出對方的水印,就目前國內各家廠商互相防范的情況來看,同樣也是個問題。
那在這些環(huán)節(jié)真正打通以前,普通人只能自己多長個心眼了。
7月31日,主題為“與AI同游”的ChinaJoy2026重磅啟幕。
騰訊、網易、索尼、高通、邁從、清閑等共計 900 家泛娛樂展商,聯(lián)袂呈現(xiàn)全球娛樂業(yè)饕餮盛宴;
AI加持下,終端、外設、機器人、顯示、芯片等硬科技品牌,如何與游戲內容業(yè)跨界呈現(xiàn)娛樂新體驗?
由創(chuàng)始人兼總編輯羅超領銜,雷科技 ChinaJoy 2026 報道團,即將空降上海灘重磅呈現(xiàn),敬請關注。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.