![]()
近日,生命科學(xué)與技術(shù)學(xué)院陳華富院長團(tuán)隊(duì)在人工智能權(quán)威期刊《Information Fusion》發(fā)表了大腦視覺信息解碼研究成果。青年教師黃偉、碩士生李恒江為該論文共同第一作者,陳華富教授和程凱文副教授為共同通訊作者,電子科技大學(xué)為第一單位。Information Fusion是人工智能Top期刊,2025年影響因子為15.5。
將圖像和文本等多模態(tài)語義特征融合以增強(qiáng)視覺神經(jīng)表示,在大腦視覺解碼中已被證明有效。為了克服先前研究中未解決的對(duì)齊歧義問題,我們提出了多模態(tài)融合對(duì)齊神經(jīng)表示模型(MFA-NRM)。該模型通過變分自編碼器(VAE)和自注意力機(jī)制,將圖像和文本特征整合到統(tǒng)一的潛在空間,促進(jìn)與神經(jīng)活動(dòng)的穩(wěn)健對(duì)齊。此外,引入提示技術(shù)提升了跨個(gè)體的泛化能力。實(shí)驗(yàn)結(jié)果表明,MFA-NRM在識(shí)別和分類任務(wù)中均表現(xiàn)優(yōu)異,尤其在多模態(tài)對(duì)齊方面顯著優(yōu)于單模態(tài)方法和其他多模態(tài)對(duì)齊方法,能夠從大腦對(duì)多模態(tài)視覺刺激的反應(yīng)中提取更豐富的語義,為視覺神經(jīng)解碼提供了新的思路。
![]()
圖1解決視覺神經(jīng)對(duì)齊模糊問題
MFA-NRM模型由五個(gè)模塊組成,包括圖像編碼器、文本編碼器、提示編碼器、多模態(tài)融合模塊和大腦編碼器。圖像編碼器提取視覺特征,文本編碼器提取文本特征,提示編碼器提取被試的先驗(yàn)提示特征。多模態(tài)融合模塊將圖像和文本特征融合,為解碼過程提供更豐富的語義輸入。圖2展示了MFA-NRM模型的整體結(jié)構(gòu)。
![]()
圖2表征學(xué)習(xí)模型圖
表1和表2展示了不同策略和框架在識(shí)別和分類任務(wù)中的表現(xiàn)。多模態(tài)方法相比單模態(tài)方法提高了準(zhǔn)確率,其中MFA-NRM方法表現(xiàn)最佳,優(yōu)于其他方法。MFA-NRM在單模態(tài)對(duì)齊方法中也表現(xiàn)優(yōu)異,并在結(jié)合10個(gè)額外預(yù)訓(xùn)練模型后進(jìn)一步提升了準(zhǔn)確率,顯示了其在分類任務(wù)中的顯著優(yōu)勢。
表1與其他模型框架的對(duì)比(識(shí)別任務(wù))
![]()
表2與其他對(duì)齊方法的對(duì)比(分類任務(wù))
![]()
圖3展示了不同方法在四個(gè)被試上的解碼性能。引入融合模塊后,MA-CLIP-FM和MA-TEN-FM的準(zhǔn)確率分別提高了4.27%和2.10%,驗(yàn)證了我們方法的有效性。實(shí)驗(yàn)結(jié)果表明,融合模塊顯著提升了多模態(tài)方法的性能,進(jìn)一步證明了我們方法的優(yōu)勢。
![]()
圖3不同預(yù)訓(xùn)練模型的對(duì)齊分類表現(xiàn)
該表征工作的價(jià)值體現(xiàn)在以下幾個(gè)方面:
(1)增強(qiáng)視覺神經(jīng)解碼:通過多模態(tài)融合方法,提升了視覺神經(jīng)解碼的準(zhǔn)確性。
(2)跨模態(tài)信息整合:有效融合圖像和文本等模態(tài)數(shù)據(jù),提升神經(jīng)表示的語義豐富性。
(3)提高腦機(jī)接口性能:為腦機(jī)接口提供更精確的神經(jīng)表示,改善智能輔助設(shè)備的控制能力。
(4)促進(jìn)神經(jīng)科學(xué)研究:優(yōu)化神經(jīng)表示學(xué)習(xí)方法,幫助深入理解大腦信息處理機(jī)制。
![]()
黃偉,講師。中國圖象圖形學(xué)會(huì)類腦視覺專委會(huì)委員、計(jì)算視覺專委會(huì)委員。針對(duì)類腦智能、腦信息編解碼、生成式語言模型、多模態(tài)模型等領(lǐng)域難題,開展人工智能和腦科學(xué)的交叉研究。近年來,在腦科學(xué)和人工智能領(lǐng)域Information Fusion (2篇), Neural Networks, International Journal of Neural Systems和Computer Methods and Programs in Biomedicine等期刊發(fā)表SCI論文30余篇,以第一或通訊作者(共同)發(fā)表SCI論文15篇;授權(quán)/受理國家發(fā)明專利12項(xiàng)。主持國家級(jí)或省部級(jí)等科研項(xiàng)目4項(xiàng),參與國防科技、國自然和省部級(jí)項(xiàng)目5項(xiàng)。此外,曾在華為工作兩年,獲得《算法創(chuàng)新優(yōu)秀新人獎(jiǎng)》、《算法技術(shù)攻關(guān)獎(jiǎng)》、《業(yè)務(wù)服務(wù)優(yōu)秀獎(jiǎng)》等多個(gè)獎(jiǎng)項(xiàng);入職電子科技大學(xué)后,指導(dǎo)本科生/碩士生獲得2024/2025年生物醫(yī)學(xué)工程競賽國家級(jí)/省級(jí)/校級(jí)12項(xiàng)。
![]()
李恒江,電子科技大學(xué)生物醫(yī)學(xué)工程2023級(jí)碩士研究生在讀,本科畢業(yè)于西南科技大學(xué)信息安全專業(yè)。研究方向是大腦視覺信息解碼。近年來,對(duì)視覺神經(jīng)解碼較為系統(tǒng)的研究,已經(jīng)以共同一作在Information Fusion 和International Journal of Neural Systems發(fā)表2篇SCI與4項(xiàng)相關(guān)專利成果。
![]()
程凱文,電子科技大學(xué)生物醫(yī)學(xué)工程博士,四川外國語大學(xué)語言智能學(xué)院副教授,嘉陵青年學(xué)者,碩士生導(dǎo)師。現(xiàn)為《心理科學(xué)》, Brain Sciences 等期刊匿名外審專家,重慶神經(jīng)科學(xué)學(xué)會(huì)理事,中國神經(jīng)科學(xué)學(xué)會(huì)認(rèn)知神經(jīng)生物學(xué)分會(huì)會(huì)員、中國神經(jīng)語言學(xué)研究會(huì)會(huì)員。主要從事認(rèn)知神經(jīng)科學(xué)、心理語言學(xué)和語言智能等方面的研究,已在Language and Cognition, Lingua,Information Fusion, Brain research bulletin, Frontiers in human neuroscience, Human brain mapping, Neural networks, Peerj,《心理科學(xué)進(jìn)展》《外國語文》等期刊發(fā)表論文30余篇;獲四川省社會(huì)科學(xué)優(yōu)秀成果獎(jiǎng)三等獎(jiǎng)1次;主持重慶市社科項(xiàng)目1項(xiàng)和第二輪重慶市一流學(xué)科外國語言文學(xué)重點(diǎn)項(xiàng)目1項(xiàng),完成廳級(jí)和校級(jí)項(xiàng)目6項(xiàng), 參與國家社科基金和自科基金項(xiàng)目3項(xiàng)。
![]()
陳華富,教授,博導(dǎo)。國家杰出青年基金獲得者,天府創(chuàng)新領(lǐng)軍人才,四川省教書育人名師。致力于磁共振腦影像方向研究,并組建“腦成像與模式識(shí)別”研究團(tuán)隊(duì),主要從事磁共振腦影像數(shù)據(jù)模式識(shí)別的人工智能與機(jī)器學(xué)習(xí)方法研究、神經(jīng)與精神疾病影像機(jī)制研究,探測疾病的典型影像學(xué)特征,為臨床診斷和評(píng)估提供影像學(xué)依據(jù)。主持科技部863、重點(diǎn)研發(fā)人工智能2030項(xiàng)目、國家自然基金重點(diǎn)、杰青和面上等科研項(xiàng)目。團(tuán)隊(duì)在Science Advances,Nature Communications,PNAS,Information Fusion,Biological Psychiatry,Molecular Psychiatry,Brain,PLoS Biology,Neurology,IEEE Trans MI/BME等期刊發(fā)表SCI論文300余篇。獲教育部自然科學(xué)一等獎(jiǎng)1項(xiàng)和教育部科技進(jìn)步一等獎(jiǎng)和二等獎(jiǎng)各1項(xiàng),獲四川省科技進(jìn)步自然科學(xué)類一等獎(jiǎng)1項(xiàng)。
該論文的第一作者為電子科技大學(xué)·生命科學(xué)與技術(shù)學(xué)院青年教師黃偉與碩士生李恒江。電子科技大學(xué)·生命科學(xué)與技術(shù)學(xué)院陳華富院長,以及四川外國語大學(xué)程凱文副教授為共同通訊作者,該研究得到了STI 2030-重大項(xiàng)目(2022ZD0208900)、科技部重點(diǎn)項(xiàng)目(2024YFC2510203)國家自然科學(xué)基金項(xiàng)目 (62406058, 62333003, 62036003, 82121003, 62276051)、電子科技大學(xué)醫(yī)工結(jié)合基金 (ZYGX2021YGLH201)、四川省自然科學(xué)基金 (2023NSFSC0640)和重慶市一流學(xué)科外國語言文學(xué)第二輪研究項(xiàng)目 (SISUWYJY202305)的資助。
論文鏈接:
https://www.sciencedirect.com/science/article/pii/S1566253525007766
Huang W, Li H, Qin F, et al. MFA-NRM: A Novel Framework for Multimodal Fusion and Semantic Alignment in Visual Neural Decoding[J]. Information Fusion, 2025: 103717.
僅用于學(xué)術(shù)分享,若侵權(quán)請(qǐng)留言,即時(shí)刪侵!
歡迎加入腦機(jī)接口AI星球
獲取更多腦機(jī)接口+AI等領(lǐng)域的知識(shí)和資源。
歡迎來稿
1.歡迎來稿。投稿咨詢,請(qǐng)聯(lián)系微信:RoseBCI
點(diǎn)擊投稿:
2.加入社區(qū)成為兼職創(chuàng)作者,請(qǐng)聯(lián)系微信:RoseBCI
一鍵三連「分享」、「點(diǎn)贊」和「在看」
不錯(cuò)過每一條腦機(jī)前沿進(jìn)展
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.