現有去噪(Denoising)擴散模型并非以經典意義上的方式“去噪”,即它們不直接預測干凈圖像。相反,神經網絡預測的是噪聲或含噪量。
在這項工作中,ResNet 之父、麻省理工學院(MIT)副教授何愷明團隊認為,預測干凈數據和預測含噪量有著根本性的不同。根據流形假設,自然數據應位于一個低維流形上,而含噪量則不在此流形上。
基于這一假設,他們提倡回歸到第一性原理,讓神經網絡直接預測干凈圖像。
這使得表觀容量不足的網絡能夠在高維空間中有效運行,一個簡單的 Vision Transformer(ViT)——直接作用于由原始像素組成的大尺寸圖像 patch——也可以有效地用于擴散建模。
[讓我看看]他們認為,在像素上使用簡單、大尺寸 patch 的 Transformer 可以成為強大的生成式模型,無需使用 tokenizer、無需預訓練、無需額外損失函數和表征對齊,并將這一方法定義為:Just image Transformers(JiT)。
研究表明,JiT(patch 尺寸為 16、32)在 256 和 512 分辨率 ImageNet 上取得了具有競爭力的結果,而在這種情況下,預測高維含噪量可能會導致災難性失敗。
通過將網絡映射到流形基礎,這項研究回歸本質,為在原始自然數據上基于 Transformer 的擴散模型構建了一個自洽的范式。
[強]研究團隊還表示,這項工作標志著在原生數據上實現自包含的“擴散 + Transformer”哲學邁出了重要一步。
[哇]除了計算機視覺之外,這種哲學在涉及自然數據(如蛋白質、分子或天氣)的其他領域中也是非常可取的,因為在這些領域中設計 tokenizer 是非常非常困難的。
通過最小化領域特定的設計,這一源自計算機視覺的通用“擴散 + Transformer”范式有望得到更廣泛的應用。
#大模型 #人工智能 #AI #擴散模型 #何愷明 #學術 #論文 #科技
![]()
![]()
![]()
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.