![]()
語(yǔ)言是學(xué)習(xí)、社會(huì)交往、個(gè)性發(fā)育中的重要能力,言語(yǔ)障礙的早期發(fā)現(xiàn)、早期診斷和及時(shí)治療尤為關(guān)鍵。
根據(jù)美國(guó)國(guó)立衛(wèi)生研究院(NIH)的數(shù)據(jù),美國(guó)存在 340 萬(wàn)需要臨床干預(yù)的言語(yǔ)障礙(speech disorders)兒童,這些孩子可能出現(xiàn)口吃、舌齒不清、發(fā)音困難,或音節(jié)遺漏與插入現(xiàn)象,還可能伴隨認(rèn)知、聽(tīng)覺(jué)或吞咽問(wèn)題,在學(xué)業(yè)、社交和情感方面面臨著困境。
然而,兒童護(hù)理領(lǐng)域的臨床醫(yī)生存在著巨大的缺口。在美國(guó),言語(yǔ)語(yǔ)言病理學(xué)家的數(shù)量?jī)H為患病兒童數(shù)量的 1/20,亟需技術(shù)支持來(lái)提升臨床醫(yī)生的工作效率。
人工智能(AI)技術(shù),特別是多模態(tài)語(yǔ)言模型(MLM)的發(fā)展,為這一問(wèn)題的解決帶來(lái)了更大的想象力。
日前,來(lái)自斯坦福大學(xué)、新加坡國(guó)立大學(xué)的研究團(tuán)隊(duì)及其合作者針對(duì)這一問(wèn)題進(jìn)行了探索。
研究發(fā)現(xiàn),包括GPT-4、Whisper、Gemini 在內(nèi)的 15 種主流模型,對(duì)言語(yǔ)障礙的識(shí)別準(zhǔn)確度尚未達(dá)到臨床標(biāo)準(zhǔn),但微調(diào)技術(shù)有望改變這一情況。
該研究成果展現(xiàn)出多模態(tài)語(yǔ)言模型在臨床實(shí)踐中的發(fā)展?jié)摿Γ瑸檠哉Z(yǔ)病理學(xué)領(lǐng)域的 AI 應(yīng)用指明了技術(shù)發(fā)展路徑。
![]()
論文鏈接:https://arxiv.org/abs/2509.16765
AI 能判斷“異常”語(yǔ)音嗎?
本研究基于 4 個(gè)公開(kāi)兒童語(yǔ)音數(shù)據(jù)集,合計(jì)樣本量約 3 萬(wàn)條,涵蓋了典型與非典型兒童語(yǔ)音。研究團(tuán)隊(duì)與言語(yǔ)語(yǔ)言病理學(xué)家合作,推出了言語(yǔ)病理學(xué)領(lǐng)域首個(gè)多模態(tài)語(yǔ)言模型的基準(zhǔn)測(cè)試,該基準(zhǔn)包括多種環(huán)境下的穩(wěn)健性與敏感性測(cè)試,以及不同語(yǔ)言、性別、年齡、噪音條件。
接著,他們讓包括 GPT-4o、Gemini、Qwen 在內(nèi)的 15 個(gè)語(yǔ)言模型扮演言語(yǔ)語(yǔ)言病理學(xué)家,對(duì)兒童語(yǔ)音樣本進(jìn)行評(píng)估,具體包括以下5 大核心任務(wù):
障礙診斷(區(qū)分正常與異常發(fā)音的基本分診步驟)
障礙類型診斷(構(gòu)音障礙與音系障礙)
癥狀診斷(口吃、音節(jié)省略、音節(jié)替代、音節(jié)添加)
基于轉(zhuǎn)錄的診斷(比對(duì)兒童轉(zhuǎn)錄詞與要求發(fā)音詞)
純轉(zhuǎn)錄評(píng)估(語(yǔ)言模型轉(zhuǎn)錄兒童障礙性言語(yǔ)的準(zhǔn)確度)
值得一提的是,研究采用了兩種主要的語(yǔ)言模型樣式:一種是具備多模態(tài)能力的可直接處理音頻的模型,另一種則是通過(guò)自動(dòng)語(yǔ)音識(shí)別(ASR)系統(tǒng)先轉(zhuǎn)錄音頻后再進(jìn)行分析的模型。
![]()
研究結(jié)果表明,當(dāng)前模型雖然“聰明”,但不夠“臨床可靠”。該論文的共同一作、斯坦福大學(xué)計(jì)算機(jī)科學(xué)博士 Sang T. Truong 表示,美國(guó)食品藥品監(jiān)督管理局(FDA)要求臨床應(yīng)用工具準(zhǔn)確率需達(dá) 80-85%,而本次測(cè)試的 15 種語(yǔ)言模型中,表現(xiàn)最佳的模型準(zhǔn)確率僅 55%,多數(shù)模型錯(cuò)誤率超過(guò) 50%,均未達(dá)到臨床可用的標(biāo)準(zhǔn)。
此外,在些模型中,沒(méi)有模型在所有任務(wù)上始終保持領(lǐng)先,不同模型在不同任務(wù)上呈現(xiàn)互補(bǔ)性與家族性優(yōu)勢(shì);直接進(jìn)行語(yǔ)音分析的模型在更精細(xì)的言語(yǔ)病理學(xué)任務(wù)(如癥狀診斷)上普遍優(yōu)于依賴自動(dòng)語(yǔ)音識(shí)別轉(zhuǎn)錄的模型。
![]()
與此同時(shí),微調(diào)成為突破口。盡管模型在未經(jīng)過(guò)任何訓(xùn)練的情況下表現(xiàn)欠佳,但研究團(tuán)隊(duì)利用兒童語(yǔ)音的小型數(shù)據(jù)集對(duì)模型進(jìn)行微調(diào)后,其性能準(zhǔn)確率提升了 10%。這表明,多模態(tài)語(yǔ)言模型在言語(yǔ)病理學(xué)的應(yīng)用中具備較大的潛力。
![]()
還有多遠(yuǎn)?
盡管研究成果亮眼,但 AI 在聽(tīng)覺(jué)理解上仍然存在明顯短板。
第一,存在性別、年齡和語(yǔ)言偏見(jiàn)。研究團(tuán)隊(duì)發(fā)現(xiàn),這些模型對(duì)男性語(yǔ)音的識(shí)別能力表現(xiàn)優(yōu)于女性語(yǔ)音;在英語(yǔ)使用者中的表現(xiàn)優(yōu)于其他語(yǔ)言使用者;在年長(zhǎng)兒童中的表現(xiàn)優(yōu)于幼齡兒童。解決模型中觀察到的偏見(jiàn)同樣需要進(jìn)一步探索。
![]()
第二,兒童語(yǔ)音樣本數(shù)據(jù)集難以獲取。雖然微調(diào)技術(shù)前景可期,但微調(diào)依賴高質(zhì)量數(shù)據(jù),而兒童語(yǔ)音數(shù)據(jù)的收集面臨重大隱私問(wèn)題。對(duì)此,Truong 提出一種可能的解決方案:即生成模擬不同語(yǔ)言障礙兒童發(fā)聲方式的合成數(shù)據(jù),以此為基礎(chǔ)提升語(yǔ)言模型的性能。
第三,當(dāng)前的多模態(tài)語(yǔ)言模型主要針對(duì)英語(yǔ)和法語(yǔ)等高資源語(yǔ)言訓(xùn)練,難以準(zhǔn)確識(shí)別非英語(yǔ)的語(yǔ)音障礙特征。
研究團(tuán)隊(duì)表述,未來(lái)的發(fā)展方向包括以下幾點(diǎn):
拓展低資源語(yǔ)言與多文化語(yǔ)境,評(píng)估臨床可靠性;
引入性別平衡微調(diào)與定向數(shù)據(jù)增強(qiáng)策略,減少潛在偏見(jiàn);
構(gòu)建隱私保護(hù)微調(diào)范式,確保敏感信息數(shù)據(jù)安全。
目前,研究團(tuán)隊(duì)針對(duì)言語(yǔ)病理學(xué)任務(wù)建立的大語(yǔ)言模型(LLM)性能基準(zhǔn)已集成至 HELM 基準(zhǔn)測(cè)試框架,這是推動(dòng)臨床有效工具研發(fā)進(jìn)程的關(guān)鍵一步。
Truong 表示,下一步將在真實(shí)醫(yī)療環(huán)境中部署 AI 輔助的言語(yǔ)治療工具,配合臨床醫(yī)生使用以驗(yàn)證其能否實(shí)現(xiàn)常規(guī)工作流程簡(jiǎn)化。
整理:江江
如需轉(zhuǎn)載或投稿,請(qǐng)直接在本文章評(píng)論區(qū)內(nèi)留言
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.