![]()
投稿作者:占方能(MIT研究員)
在 3D 視覺領(lǐng)域,如何從二維圖像快速、精準(zhǔn)地恢復(fù)三維世界,一直是計(jì)算機(jī)視覺與計(jì)算機(jī)圖形學(xué)最核心的問題之一。從早期的Structure-from-Motion (SfM) 到Neural Radiance Fields (NeRF),再到3D Gaussian Splatting (3DGS),技術(shù)的演進(jìn)讓我們離實(shí)時(shí)、通用的 3D 理解越來越近。
![]()
然而,以往的方法往往依賴于每個(gè)場景的反復(fù)優(yōu)化(per-scene optimization),既慢又缺乏泛化能力。在 AI 驅(qū)動(dòng)的新時(shí)代,一個(gè)全新的范式正在崛起 ——Feed-Forward 3D。
![]()
這篇由NTU、Caltech、Westlake、UCSD、Oxford、Harvard、MIT 等 12 所機(jī)構(gòu)聯(lián)合撰寫的綜述論文《Advances in Feed-Forward 3D Reconstruction and View Synthesis》,主要總結(jié)了過去五年(2021–2025)間涌現(xiàn)的數(shù)百項(xiàng)創(chuàng)新工作,首次建立了完整的Feed-Forward 3D 方法譜系與時(shí)間線。
![]()
論文鏈接:https://arxiv.org/abs/2507.14501
論文主頁:https://fnzhan.com/projects/Feed-Forward-3D/
五大代表性技術(shù)分支
綜述將所有 Feed-Forward 3D 方法劃分為五類主流架構(gòu),每一類都推動(dòng)了該領(lǐng)域的關(guān)鍵進(jìn)展:
1.NeRF-based Models
Neural Radiance Fields (NeRF) 提出了體積渲染的可微分框架,但其“每個(gè)場景都要優(yōu)化”的缺點(diǎn)導(dǎo)致效率低下。自 PixelNeRF [CVPR’21] 起,研究者們開始探索“條件式 NeRF”,讓網(wǎng)絡(luò)直接預(yù)測輻射場。這一方向發(fā)展出多個(gè)分支:
1D 特征方法(如 CodeNeRF、ShaRF)
2D 特征方法(如 GRF、IBRNet、GNT、MatchNeRF)
3D 特征方法(如 MVSNeRF、GeoNeRF、NeuRay)
![]()
2.PointMap Models
這一分支由 DUSt3R (CVPR’24) 引領(lǐng),直接在 Transformer 中預(yù)測像素對齊的 3D 點(diǎn)云(pointmap),無需相機(jī)姿態(tài)輸入。后續(xù)工作 MASt3R、Fast3R、CUT3R、SLAM3R、VGGT 等相繼提出更高效的多視整合,長序列記憶機(jī)制,以及大場景處理能力等。
![]()
3.3D Gaussian Splatting (3DGS)
3DGS 是近年來最具突破性的表示之一,將三維場景表示為高斯點(diǎn)云,兼顧了體積渲染的質(zhì)量與光柵化的速度。然而原始 3DGS 仍需優(yōu)化。Feed-Forward 研究者通過引入神經(jīng)預(yù)測器,實(shí)現(xiàn)了“直接輸出高斯參數(shù)”的能力,主要方法包括:
Image-based Gaussian Map:實(shí)現(xiàn)從單張圖像到高斯場的預(yù)測,如 PixelSplat、GS-LRM、LGM、FreeSplatter;
Volume-based Gaussian Representation:將場景嵌入可學(xué)習(xí)體素或三平面結(jié)構(gòu)中,如 LaRa、GaussianCube、QuickSplat、SCube。
![]()
4.Mesh / Occupancy / SDF Models
這一類方法延續(xù)了傳統(tǒng)幾何建模思路,并與 Transformer 與 Diffusion 模型結(jié)合:
MeshFormer、InstantMesh、MeshGPT、MeshXL 引入可自回歸或大模型結(jié)構(gòu);
SDF 方法(如 SparseNeuS、C2F2NeuS、UFORecon)結(jié)合體積感知與 Transformer 特征聚合,實(shí)現(xiàn)了高精度表面建模。
5.3D-Free Models
這類方法不再依賴顯式三維表示,而是直接學(xué)習(xí)從多視圖到新視角的映射。
Regression-based:如 SRT、OSRT、RePAST、LVSM,利用深度神經(jīng)網(wǎng)絡(luò)直接端到端擬合目標(biāo)結(jié)果;
Generative Diffusion-based:以 Zero-1-to-3、SyncDreamer、MVDream、CAT3D、CAT4D 為代表,將圖像或視頻擴(kuò)散模型遷移到三維生成領(lǐng)域。這些模型讓“一張圖生成整個(gè)場景”成為可能。
![]()
![]()
多樣化任務(wù)與應(yīng)用場景
論文系統(tǒng)總結(jié)了 Feed-Forward 模型在多個(gè)方向的應(yīng)用:
Pose-Free Reconstruction & View Synthesis(PF3Plat、NoPoSplat)
Dynamic 4D Reconstruction & Video Diffusion(MonST3R、4D-LRM、Aether)
SLAM 與視覺定位(SLAM3R、VGGT-SLAM、Reloc3R)
3D-Aware 圖像與視頻生成(DiffSplat、Bolt3D)
數(shù)字人建模(Avat3R、GaussianHeads、GIGA)
機(jī)器人操作與世界模型(ManiGaussian、ManiGaussian++)
Benchmark 與評測指標(biāo)
論文收錄了超過 30 個(gè)常用 3D 數(shù)據(jù)集(見第 13 頁表 1),涵蓋對象級、室內(nèi)、室外、靜態(tài)與動(dòng)態(tài)場景,標(biāo)注模態(tài)包括 RGB、深度、LiDAR、語義與光流等。
同時(shí)總結(jié)了 PSNR / SSIM / LPIPS(圖像質(zhì)量),Chamfer Distance(幾何精度),AUC / RTE / RRA(相機(jī)姿態(tài))等標(biāo)準(zhǔn)指標(biāo)體系,為未來的模型比較提供統(tǒng)一基線。
![]()
評測結(jié)果: Feed-Forward 3D 的量化進(jìn)展
根據(jù) Table 2–5 的結(jié)果,本綜述對多項(xiàng)任務(wù)進(jìn)行了系統(tǒng)對比:
1. 相機(jī)姿態(tài)估計(jì)(Camera Pose Estimation)
![]()
2. 點(diǎn)圖重建(Point Map Estimation)
![]()
3 .視頻深度估計(jì)(Video Depth Estimation)
![]()
4. 單圖新視角合成(Single-Image NVS)
![]()
未來挑戰(zhàn)與趨勢
論文在第 5 章提出四大開放問題:
1.多模態(tài)數(shù)據(jù)不足:RGB-only 仍占主流,缺乏統(tǒng)一的深度/LiDAR/語義對齊數(shù)據(jù);
2.重建精度待提升:尚未全面超越 MVS 在細(xì)節(jié)層面的表現(xiàn);
3.自由視角渲染難度高:遮擋與光照建模仍受限;
4.長上下文推理瓶頸:處理 100+ 幀序列需 40 GB 以上顯存。
未來方向包括:
Diffusion Transformers 與長程注意力結(jié)構(gòu);
可擴(kuò)展的4D 記憶機(jī)制;
多模態(tài)大規(guī)模數(shù)據(jù)集構(gòu)建(RGB + Depth + LiDAR + 語義);
同時(shí)具有生成和重建能力的 Feed-Forward 模型。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.