![]()
對外部刺激與內部神經表征之間相互作用的建模,是腦機接口(BCI)領域的核心研究方向之一。現有工作的主要局限在于:普遍采用針對單一任務的"專家模型"范式,既限制了模型的通用性,也忽視了不同任務之間潛在的協同效應。
為解決上述問題,中科院自動化所神經計算與腦機交互團隊提出了Mind-Omni——首個在離散擴散范式下統一七項編碼與解碼任務的通用框架。其核心創新在于一種腦信號分詞器(Brain Tokenizer),能夠將異質的連續腦信號轉化為標準化的離散Token,從而在共享語義空間內實現任意兩種或多種模態之間的直接Token級交互與生成。為進一步激活框架的高級推理能力,本研究還構建了一個專門的腦信號問答(BQA)指令微調數據集。Mind-Omni不僅在多任務統一框架中實現了最先進水平,也從實驗上觀察到了多任務協同效應的存在,另外在部分任務上追平甚至超越了參數規模更大的專用模型,為神經活動的基礎模型研究開辟了新范式。
![]()
圖1:Mind-Omni與專用SOTA模型的整體性能對比(各指標max歸一化,1.0=SOTA性能)。Mind-Omni在多任務統一框架中全面領先,并在多個語義與推理任務上媲美乃至超越更大規模專用模型。
本研究的主要貢獻如下:
范式突破:提出Mind-Omni,在單一離散擴散架構中首次統一了跨腦信號、圖像和文本的七項編解碼任務,突破了領域內長期以來專用模型主導的格局。
跨模態融合機制:提出Brain Tokenizer,彌合神經信號與視覺-文本數據之間的模態鴻溝,在共享語義空間內實現直接的Token級交互。
多任務協同增益:實驗表明,聯合神經建模存在一定的協同效應——Mind-Omni不僅在統一框架中建立了新SOTA,在關鍵語義與推理任務上還具備與更大規模專用模型競爭的能力。
1. 研究背景與論文簡介
認知神經科學與人工智能的交叉領域,近年來因大腦活動的視覺解碼與語言解碼技術的突破性進展而備受關注。這一領域的核心研究范式——神經編碼(Neural Encoding)和神經解碼(Neural Decoding)——致力于建立外部視覺/語言刺激與大腦功能性磁共振成像(fMRI)信號之間的雙向映射關系。
![]()
![]()
圖2:Mind-Omni與現有專用模型任務能力對比。不同于僅支持單方向或單任務的先前方法,Mind-Omni在單一框架內涵蓋全部七項編解碼任務。
然而,如圖2所示,現有最先進的研究幾乎清一色采用專家模型——高度優化的單任務模型,如僅做圖像重建或僅做神經編碼。這一專業化范式天然限制了模型的通用性,也忽視了不同神經任務之間深層的協同潛力。構建統一的多任務神經編解碼模型,不僅是突破現有局限的迫切需求,更是邁向大腦基礎模型的關鍵一步。
這一統一建模目標面臨三重核心挑戰:
輸入異質性:受試者間解剖結構差異導致腦信號維度不一致,現有對齊方法要么難以隨受試者規模擴展,要么以犧牲信息保真度為代價。
模態差異:連續腦信號與離散視覺/文本Token之間存在巨大的語義鴻溝,直接的跨模態融合往往效果欠佳。
任務互依性:不同編解碼任務之間的關系尚不明晰。專用模型假設任務相互獨立,但我們假設共享神經表征可以在相關任務間產生正向遷移——而驗證這一假設需要統一架構的支撐。
2. 研究方法
2.1 整體框架
Mind-Omni由兩個核心組件構成:一是將三種模態(圖像、文本、腦信號)的連續信號離散化的分詞器體系;二是在離散擴散范式下統一所有七項任務的生成主干網絡。
![]()
圖3:Mind-Omni訓練流程。(a)Brain Tokenizer將連續fMRI信號離散化為Token序列;(b)離散擴散模型在掩碼預測目標下統一訓練所有七項編解碼任務。
對于圖像模態,本研究采用預訓練的VQ-VAE;對于文本模態,采用CLIP分詞器;對于腦信號模態,則訓練了一個與共享語義空間對齊的Brain Tokenizer。在此基礎上,以Muddit雙模態骨干網絡為初始化,擴展引入腦信號響應的第三分支,通過離散擴散建模統一所有七項任務的訓練與采樣過程。
2.2 腦信號分詞器(Brain Tokenizer)
Brain Tokenizer是將連續fMRI信號離散化為對擴散模型有意義的Token的核心模塊。其架構以VQ-VAE風格的骨干為基礎,并引入三重對齊策略,以彌合腦信號與視覺-文本表征之間的模態鴻溝:
粗粒度對齊(Coarse-grained Alignment):在CLIP-H共享語義空間中進行三模態對比學習,并輔以特征蒸餾損失,將全局fMRI特征拉近至對應的圖像和文本CLIP特征。
細粒度對齊(Fine-grained Alignment):利用CLIP文本編碼器的Token級隱狀態,通過隨機掩碼與交叉注意力解碼器,在Token粒度上實現fMRI與文本的精細對齊。
感知對齊(Perceptual Alignment):引入預訓練的fMRI預測器,確保重建的fMRI信號在CLIP特征空間中保持語義可解碼性,而非僅停留于結構相似性。
消融實驗表明:語義對齊損失是最為關鍵的組件,可將檢索性能從隨機水平(0.05)大幅提升至0.58,同時大幅度改善自重建精度(rPCC從0.43提升至0.64);感知對齊損失則進一步提升了碼本的多樣性與利用率。
2.3 統一離散擴散框架
獲得三種模態的離散Token后,Mind-Omni將每項任務統一建模為“條件掩碼Token預測”問題。其核心思想在于:通過策略性地定義目標模態集合(T)和條件模態集合(C),單一目標函數即可驅動所有七項任務的訓練。
該框架選擇離散擴散而非自回歸模型的關鍵原因在于:擴散模型的置換不變性使其對模態生成順序不敏感,為無偏地觀測跨任務協同效應提供了理想的實驗平臺,避免了自回歸模型固定因果結構所引入的混淆偏差。
![]()
圖4:Mind-Omni推理流程。針對不同任務,通過調整目標模態的初始掩碼方式來實現任務切換。在執行圖像重建任務時,為了提高生成圖像的質量,可以選擇性的將解碼出的caption和圖像輸入SDXL或者VersatileDiffusion(d)。
在推理階段,所有七項任務共享同一迭代去噪流程。具體任務的切換,僅需調整初始Token序列的準備方式——將目標模態初始化為全掩碼序列,以條件模態的真值Token為輸入即可。
2.4 BQA數據集構建與漸進式訓練
BQA數據集基于Qwen2-VL(7B)和LLaVA-Instruct-150K構建,涵蓋簡潔描述、詳細描述和推理問答三類任務,并經過人工篩選(約20人時),過濾掉視覺依據薄弱的問題,確保問答與視覺內容具有強依賴性。
為在多樣任務上穩定訓練,本研究采用漸進式課程策略:階段1首先凍結預訓練的Muddit骨干,僅訓練新引入的腦信號分支參數;隨后解凍進行全六項單/雙模態任務的聯合訓練,建立全面的跨模態轉換能力。階段2則借助DoRA微調骨干,并引入BQA數據集以激活高級推理能力。
3. 實驗結果
3.1 整體性能評估
如圖1所示,本研究在七項神經編解碼任務上,將Mind-Omni與MindEye2、MindSimulator等專用SOTA進行了全面評估。結果表明:
Mind-Omni在部分細粒度像素級解碼任務與體素級編碼任務(如B→I、B→T)上與對應專用模型尚存較大的差距,但這些專用模型各自僅能完成單一任務;
在多任務統一框架的直接對比中(BraVL、MoPoE等),Mind-Omni以更少的可訓練參數、單一模型、七項任務的高效配置,全面刷新SOTA;
在粗粒度語義級別的語言解碼(詳細描述、推理問答)任務上,Mind-Omni在不依賴外部大語言模型的前提下,追平了OneLLM和UMBRAE。
![]()
![]()
![]()
圖5:神經解碼實驗結果。圖像重建和語言解碼定性結果(上),圖像重建定量評估(中),語言解碼定量評估(下)。
3.2 視覺重建
在視覺重建任務上,聯合解碼(B→I&T)相比單獨圖像解碼(B→I)在多項高級指標上取得大幅提升:AlexNet(2)從67.1%提升至72.5%,AlexNet(5)從72.8%提升至84.9%。這一“圖文聯合解碼增益”本身即是多任務協同效應的有力證明。
3.3 語言解碼與推理
在語言解碼任務上,Mind-Omni支持從腦信號直接生成簡潔描述、詳細描述和推理問答三類輸出,覆蓋了從感知到理解的多個層次。如表所示,在詳細描述和推理問答任務上,Mind-Omni取得了有競爭力的結果。值得注意的是,UMBRAE和OneLLM均借助了外部大語言模型(分別為Vicuna-13B和LLaMA2-7B)來完成語言輸出,而Mind-Omni整個框架基于Muddit-1B,不引入額外的語言模型。在這一約束下仍能取得相近的表現,一定程度上說明聯合建模框架有助于從腦信號中提取更豐富的語義信息。
3.4 神經編碼
在神經編碼(圖像/文本→腦信號預測)任務上,Mind-Omni在體素級和語義級指標上均全面超越多任務基線BraVL與MoPoE。聯合編碼(I&T→B)在所有指標上均優于單模態編碼,體現出視覺與語言信息的互補協同效應——這與大腦在視覺感知過程中自發調用語義先驗的認知機制高度吻合。
![]()
圖7:神經編碼中的跨模態協同效應。圖像-only編碼激活早期和高級視覺區域,文本-only編碼主要激活語義區域,而聯合編碼在整個視覺皮層均實現高準確率,呈現"1+1>2"的協同增益。
4.核心發現
4.1 多任務協同效應
Mind-Omni的實驗揭示了兩種層面的協同效應:
模態間互補性(編碼任務):聯合圖像-文本編碼(I&T→B)在全部voxel級和語義級指標上均優于任意單模態編碼。圖7中的皮層激活可視化表明:image-only編碼主要激活早期視覺區域和高級視覺區域,text-only編碼主要激活語義區域,而聯合模型在整個視覺皮層實現高精度預測,反映了大腦對視覺與語義信息的自然整合機制。
任務間協同性(解碼任務):聯合解碼(B→I&T)相比各自獨立的解碼任務,在圖像重建和文本生成兩方面均有所提升,定量結果見上表。圖8展示了一個定性案例:單獨進行文本解碼(B→T)時,生成的描述在語義細節上存在明顯缺失;引入圖像聯合解碼后,文本中對顏色、數量等視覺屬性的描述有所改善。此處呈現的是從測試集中選取的示例,定量表現已在上表中呈現。
![]()
圖8:解碼協同效應定性示例。聯合解碼(B→I&T)相比單獨文本解碼(B→T)在該案例中生成了更準確的描述,可結合上表定量結果一并參考。
4.2 Mind-Omni作為神經科學計算測試臺的初步探索
利用訓練好的Mind-Omni,我們嘗試將其用于神經科學層面的定性分析,初步探索其作為計算測試臺的潛力。需要指出的是,模型目前在語義級編碼上性能相對較好,但在體素級預測精度上與專用編碼模型仍有較大差距。
類別選擇性驗證:將NSD測試集中的身體、面孔、場景三類圖像輸入模型,預測的fMRI響應在皮層投影上呈現出與已知功能區(EBA、OFA/FFA、PPA/OPA)大致對應的激活分布,與神經科學領域的既有發現方向一致。這一結果說明模型可能在語義層面捕獲了部分視覺皮層的功能組織結構。
新概念皮層表征探索:借助CLIP零樣本分類從MSCOCO中篩選概念特定圖像,合成對應的預測fMRI響應,所得皮層激活圖與MindSimulator的結果在趨勢上較為相近。這表明模型對概念級別的語義信息有一定的響應能力,激活模式也呈現出與分布式神經處理理論相符的分布特征。以上均為定性展示,準確度和穩定性有待后續定量研究進一步驗證。
![]()
圖9:皮層激活定性分析。(上)身體、面孔、場景三類刺激的預測激活與已知功能區大致吻合;(下)"沖浪者"等新穎概念的皮層激活趨勢與MindSimulator相近。以上均為定性展示,供參考。
4.3 消融實驗
論文對Brain Tokenizer的架構設計和整體訓練策略分別進行了消融分析,主要結論如下:
Brain Tokenizer架構設計
與自然圖像的分詞器不同,fMRI信號的內在維度較低,碼本容量過大或特征維度過高時容易出現碼本坍塌,導致碼本利用率極低。語義對齊損失是其中最為關鍵的組件:引入后,跨模態檢索性能從隨機水平(0.05)大幅提升至0.58,自重建精度(rPCC)和碼本利用率也同步改善。感知對齊損失在此基礎上進一步提升了碼本的多樣性與利用率,對粗粒度和細粒度對齊損失各自貢獻的細化分析見論文附錄。
訓練策略
漸進式課程訓練相比直接聯合訓練效果更好——后者在多任務同時優化時容易出現明顯的性能下滑,說明在fMRI數據有限的情況下,先建立穩定的跨模態對齊、再逐步擴展任務范圍是必要的。從頭訓練的效果明顯差于以預訓練Muddit參數初始化,進一步說明在數據規模受限的神經影像領域,借助已有的視覺-語言預訓練知識至關重要。在訓練數據方面,使用Qwen2-VL增強的圖像描述替代原始COCO標注后,語言解碼各項指標均有一致性提升,表明訓練文本的質量對最終性能有實質影響。
5. 總結
Mind-Omni首次嘗試在單一離散擴散框架內統一七項神經編解碼任務,驗證了這一路線的可行性。實驗表明,統一建模并非簡單的任務堆疊,而是能夠在任務之間產生實質性的協同效應——聯合模態編碼對視覺皮層的預測覆蓋更全面,聯合解碼在圖像質量和文本質量兩方面均有所提升。在語義級編碼和語言解碼等任務上,模型取得了有競爭力的結果,為后續統一框架的研究提供了一定的參考。同時,模型在體素級預測精度上與專用編碼模型仍存在差距,高保真圖像重建與專用解碼模型相比也有提升空間,這些局限性也不可忽視。
在后續工作中,有幾個方向值得進一步探索:一是提升Brain Tokenizer的重建保真度,減少向量量化步驟帶來的體素級信息損耗,從而改善神經編碼的精細預測能力;二是引入神經生物學上更友好的圖像和文本編碼器,以同時兼顧編碼與解碼兩側的性能;三是進一步優化BQA指令數據的質量與規模,提升模型在復雜視覺推理任務上的表現;四是探索更有效的跨受試者泛化方案,降低對大量單被試數據的依賴。
6. 主要作者介紹
![]()
第一作者:盧一卓,中國科學院自動化研究所三年級直博生,以第一作者在ICML,ICLR,ACM MM等會議發表論文。個人主頁:https://reedonepeck.github.io/Luyizhuo.github.io/
![]()
共同第一作者:杜長德,主要從事腦認知與人工智能方面的交叉課題研究,在神經編解碼、多模態神經計算、大模型機理解析、腦機融合智能等方面發表了50多篇高水平論文,包括 Nature Machine Intelligence、IEEE TPAMI、ICLR、ICML等。主持國自然面上等項目。曾獲得“小米青年學者”、IEEE ICME最佳論文獎(亞軍),擔任《The Innovation Informatics》青年編委,研究成果被《MIT Technology Review》報道。個人主頁:https://changdedu.github.io/
![]()
通訊作者:何暉光,中國科學院自動化研究所研究員,博士生導師,國家高層次人才,中國科學院大學崗位教授,上海科技大學特聘教授。先后主持多項國家自然科學基金、863項目、國家重點研發計劃課題等多個重要項目。獲得國家科技進步二等獎兩項(排二、排三),北京市科技進步獎兩項,教育部科技進步一等獎等獎項。入選北京市科技新星,中科院“盧嘉錫青年人才獎”,中科院青年創新促進會優秀會員等。其研究領域為腦-機接口、類腦智能、醫學影像分析等,在CNS子刊, IEEE TPAMI/TNNLS/TCYB/TMI,ICML,ICLR,MICCAI等發表文章200余篇。自動化學報編委,CCF/CSIG杰出會員。建國七十周年紀念章獲得者。
本研究得到國家重點研發計劃、國家自然科學基金以及中國科學院戰略性先導科技專項的資助。
參考來源:
論文:https://arxiv.org/pdf/2605.29591
代碼:https://github.com/ReedOnePeck/Mind-Omni
![]()
腦機接口社區是國內首家腦機接口(BCI)產業服務平臺。主要為企業、科研團隊、投資機構和從業者提供以下服務:
宣傳報道:圖文、短視頻、直播形式報道企業動態、技術解讀、產品介紹等內容,提升曝光和行業影響力。
資源對接:根據需求匹配資本、供應鏈、臨床機構、渠道方等資源,完成真實對接,促進合作。
成果轉化:協助技術團隊尋找產業方、投資人及落地場景,推動技術到產品的轉化。
活動策劃執行:承接線上線下路演、沙龍、論壇等活動的策劃與執行。
其他定制需求:包括報告定制、市場調研、人才招聘支持等個性化服務。
合作洽談,請聯系微信:ZuoLeiLeiya
(備注:姓名-單位-合作)
投稿丨成為創作者,請聯系微信:RoseBCI
不錯過每一條腦機前沿進展
一鍵三連「分享」、「點贊」和「在看」
歡迎在評論區聊聊
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.