![]()
南洋理工大學S-Lab聯合Ropedia提出S-Agent,把空間理解從一次性回答改寫為一條可執行的行動鏈:VLM 負責讀懂問題、規劃下一步,DA3 等專用模型負責深度、位姿和 3D 對齊,空間專家再把幾何輸出轉化為可用證據。論文結果顯示,S-Agent 在 zero-shot 設置下取得 MMSI-Bench 46.4%、ViewSpatial-Bench 60.0% 的成績;通過 S-300K 軌跡蒸餾,8B 模型進一步在 MMSI / ViewSpatial 上達到 41.6 / 46.8。
![]()
- 論文標題:S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
- 項目頁:https://ropedia.github.io/S-Agent
- 論文:https://arxiv.org/abs/2606.20515
- 演示視頻:https://youtu.be/f89D0ZCJWKo
![]()
視頻鏈接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA
“站在耳機旁,背對入口門,相機在你的哪個方向?”
開場視頻給出的,是一個典型的動態空間推理問題。對人類來說,它像一次短暫的心理旋轉;對視覺語言模型來說,它要求模型同時完成實體定位、跨幀對齊、三維理解和自我中心坐標轉換。模型拿到的不是一張線索完整的全景圖,而是一段視頻中抽取的 64 幀:耳機、入口門和相機分散在不同觀察里,“左、右、前、后” 還必須以人的站位與朝向重新定義。
圖 1 展開了這條行動鏈。S-Agent 沒有直接猜答案,而是先定位三個實體,再把離散的 2D 線索提升到共享 3D 場景,隨后以耳機為原點、以 “背對入口門” 為朝向建立自我中心坐標系,最終判斷相機位于右后方,提交 D(back-right)。整條軌跡包含 3 輪規劃與 6 次工具調用,每一步行動本身就是推理的一部分。
這段不到一分鐘的演示,濃縮了 S-Agent 的核心主張:空間智能不應只是 “看完視頻后給出一個答案”,而應進入 Agent 式行動循環 —— 持續追問 “下一步該看哪里、測什么、驗證什么”,并把每一次行動得到的證據累積成可追蹤的世界狀態。
![]()
視頻鏈接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA
圖 1|案例視頻中的完整行動鏈:定位實體、3D 對齊、建立自我中心坐標系,再解析相機象限。
空間智能邁入 Agent 時代:
讓 VLM 理解任務,讓專用模型處理幾何
S-Agent 的切入點并不是否定 VLM,而是重新安排 VLM 在空間系統中的位置。VLM 的長處是理解:它能讀懂問題意圖,識別場景中的實體和關系,并把自然語言指令轉化為可執行的判斷目標。但在真實三維空間里,僅有語義理解還不夠。深度估計、相機位姿、三維對齊、物體尺度與朝向,本質上更接近幾何感知與空間計算,往往不是通用 VLM 最擅長的部分。
因此,S-Agent 的最初想法是:不要讓 VLM 在一個模型里硬扛所有事情。對于 “圖中有什么、問題在問什么、下一步該驗證什么”,VLM 很強;但對于 “這個點到底有多遠、相機如何運動、兩個視角如何對齊”,DA3 等專用深度 / 三維模型通常更可靠。空間智能的關鍵,不是讓 VLM 變成萬能幾何模型,而是讓它學會把合適的問題交給合適的工具。
在這個基礎上,S-Agent 把空間推理重新表述為時空證據累積(spatio-temporal evidence accumulation):VLM 不必一次性在參數內部完成識別、幾何恢復、坐標變換和關系判斷,而是作為 Agent 圍繞當前問題發起一連串行動,調用 2D 感知、3D 幾何和空間專家模型逐步補齊證據,并把已經獲得的場景狀態保留下來。
從回答器到行動規劃器:
框架圖里的三層分工
圖 2 對應的是 S-Agent 的系統結構。VLM 在這里不再是被動回答器,而是語義規劃器:每一步,它都會查看問題、原始觀察、當前場景記憶和此前行動歷史,再決定下一步需要哪類證據、應該調用哪個工具,以及現有證據是否已經足夠。
工具體系按空間理解的層次被組織為三層。Level 1 負責 2D 視覺證據獲取,包括從長視頻或多視圖輸入中挑選關鍵幀、定位問題涉及的實體,以及借助開放詞匯檢測補齊遺漏目標;Level 2 把這些局部線索提升到三維空間,通過度量深度、相機位姿和鳥瞰圖/新視角,把分散觀察對齊到共享坐標系;Level 3 再由計數、測量、相對位置、視覺朝向和物體視角等空間專家,把密集且可能帶噪聲的幾何輸出轉化為規劃器可以直接使用的高層空間事實。
這種分工的關鍵,不只是 “給 VLM 加幾個工具”。S-Agent 把語義決策、幾何證據與狀態維護拆成彼此可協作的行動模塊:模型負責提出下一步行動,工具負責返回可驗證的證據,記憶負責讓證據在后續行動中繼續生效。
論文中的消融實驗也說明,進入 Agent 時代并不等于把所有 3D 輸出原樣塞給模型。原始深度、相機位姿和點云往往包含密集數值與噪聲,規劃器未必能直接讀懂;真正拉開差距的是 Level 3 空間專家把這些幾何輸出過濾成任務相關的測量、相對位置和方向判斷,再由雙記憶把它們接入后續行動。也就是說,S-Agent 的關鍵不是 “工具更多”,而是 “每一步行動都能產生可用證據”。
![]()
圖 2|S-Agent 框架示意:語義規劃器、三層空間工具與雙記憶協同工作。
結果:zero-shot 領先,
蒸餾后 8B 模型繼續逼近前沿模型
論文首先驗證了 training-free 的使用方式:無需對底座模型進行空間微調,只要把 S-Agent 的行動規劃、空間工具與記憶機制接入現有 VLM,就能在多視圖和視頻空間推理任務上獲得明顯提升。論文表 1 展示了 MMSI-Bench 的 zero-shot 結果,S-Agent 在平均分上達到 46.4%,高于 Gemini 3 Pro 的 45.2% 和 GPT-5.4 的 41.9%。
![]()
論文表 1|MMSI-Bench zero-shot 結果表,截圖自論文正文。
更重要的是,提升并不只體現在平均分上。相較所用 InternVL3.5-8B 底座,S-Agent 在 MMSI-Bench 上提升 17.4 個百分點,其中相機運動子任務提升 31.1 個百分點。在 ViewSpatial-Bench 上,S-Agent 達到 60.0%,人物視角相對方向(P-RD)得分為 81.1%;在 ReVSI 上,其平均成績為 58.8%。
圖 3 進一步把 zero-shot 和 SFT 兩條結果線并排呈現。更值得關注的是蒸餾后的 S-Agent-8B:研究團隊用約 29.2 萬條 S-Agent 軌跡對 Qwen3-VL-8B 進行監督微調,模型在 MMSI-Bench 上從 31.1% 提升到 41.6%,在 ViewSpatial-Bench 上從 42.2% 提升到 46.8%。對照 GPT-5.4 的 41.9% 和 45.6%,這個 8B 模型在前一項幾乎持平,在后一項高出 1.2 個百分點。
論文表 4 則給出蒸餾結果的完整對照:S-Agent-8B 同時超過 Qwen3-VL-8B-Instruct 和使用同一 8B planner 的 training-free S-Agent。這說明,緊湊模型未必需要把全部空間知識 “壓進參數”;當它學會何時行動、如何解釋工具結果,以及怎樣跨步驟整合證據時,系統級能力可以顯著超越底座模型本身。
![]()
圖 3|論文項目視頻中的性能對比頁。S-Agent 在 zero-shot 與 SFT 設置下均獲得顯著提升。
![]()
論文表 4|S-Agent-8B 在 MMSI、ViewSpatial 與 ReVSI 上的蒸餾結果,截圖自論文正文。
S-300K:把強 Agent 的行動過程,
變成小模型的課程
性能提升背后,是 S-300K 這套行動數據。S-Agent 不只是一個推理框架,也是一臺行動軌跡數據生成器。研究團隊使用強模型驅動的 S-Agent 生成空間推理軌跡,過濾掉執行失敗或答案不正確的樣本,并將有效過程整理為 S-300K。最終用于監督微調的樣本約為 29.2 萬條。
與只提供 “問題 — 答案” 的傳統指令數據不同,S-300K 把監督信號拆成多種粒度:完整軌跡教模型如何從問題走到結論;輪次級樣本教模型在當前上下文中選擇下一步動作;專家/工具級樣本則專門訓練某一類工具的調用與結果解釋。
這相當于把強 Agent 的行動方法拆成一套可學習的課程。學生模型學習的不只是最終標簽,還包括如何發現證據缺口、如何修正失敗的定位,以及何時停止繼續調用工具。圖 4 展示的多類案例也說明,距離、計數、路線、尺寸和方向判斷都可以被組織成可追蹤的行動過程;對空間智能而言,行動過程由此成為比單一答案更重要的訓練資產。
![]()
視頻鏈接:https://mp.weixin.qq.com/s/3P_oyOJwRMkq_RaXbl7bUA
圖 4|項目展示的多類真實推理案例,覆蓋距離、計數、路線、尺寸與方向等任務。
從 “更大的模型” 轉向 “更會行動的系統”
把這些素材串起來看,S-Agent 展示的是一條不同于單純擴展參數規模的路線:讓通用 VLM 專注于行動規劃,把幾何恢復交給專用工具,把跨幀一致性交給記憶,再用可檢查的推理軌跡把能力蒸餾回更小的模型。
這套思路可以自然延伸到機器人導航與操作、AR/VR 空間助手、長視頻問答、自動駕駛場景理解等任務。它們共同需要的,不只是看見物體,而是主動選擇下一步觀察、測量和驗證,并持續維護物體在三維世界中的位置、朝向與變化。
從這個角度看,S-Agent 把空間智能的評價重點從 “模型有多大” 推向 “系統是否會行動”:能否判斷證據缺口、調用可靠工具、沉淀場景狀態,并把成功的行動鏈反哺給更小模型。
S-Agent 給出的方向已經相當明確:當一次猜測被改寫為可追蹤、可復用、可蒸餾的行動鏈,視覺模型就從 “看懂一幀” 走向 “理解一個空間”;空間智能也由此從靜態問答邁入可執行、可積累、可遷移的 Agent 時代。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.