近日,Soul App AI 團(tuán)隊(Soul AI Lab)聯(lián)合西北工業(yè)大學(xué)音頻語音與語言處理研究組 ASLP@NPU 團(tuán)隊及Moonstep AI,正式開源端到端多人對話轉(zhuǎn)錄模型SoulX-Transcriber。
作為一款面向長音頻、多說話人場景設(shè)計的語音理解模型,SoulX-Transcriber 能夠直接從多人對話音頻中生成包含時間戳、說話人身份和轉(zhuǎn)錄文本的結(jié)構(gòu)化結(jié)果,實現(xiàn)對“誰在什么時候說了什么”的統(tǒng)一理解與建模。
針對當(dāng)前端到端語音大模型在多人多輪對話場景中普遍存在的說話人區(qū)分能力不足、快速輪次切換下身份追蹤不穩(wěn)定,以及多人語音重疊場景性能下降等問題,SoulX-Transcriber設(shè)計了涵蓋說話人輪次切換預(yù)測、目標(biāo)說話人提取、說話人驗證、說話人日志等在內(nèi)的多個與說話人屬性相關(guān)的多任務(wù)預(yù)訓(xùn)練框架,顯著提升了模型對說話人特征的建模能力和復(fù)雜對話場景下的轉(zhuǎn)錄準(zhǔn)確性。
多人對話識別轉(zhuǎn)錄是語音領(lǐng)域的重要能力要求之一。在擁有強(qiáng)“語音”標(biāo)簽的Soul,語音生成、語音對話等語音能力是團(tuán)隊推進(jìn)AI社交技術(shù)基建的核心布局,也擁有了一定的能力積累。
此次開源SoulX-Transcriber,是團(tuán)隊面向行業(yè)輸出的全新解決方案。在公開基準(zhǔn)測試中,SoulX-Transcriber在AISHELL-4、AliMeeting等多人會議數(shù)據(jù)集上,取得了領(lǐng)先Gemini-3.1-Pro等模型對應(yīng)功能的表現(xiàn)(具體測試結(jié)果可見下文),歡迎點擊下方鏈接體驗。
Demo Page:
https://soul-ailab.github.io/soulx-transcriber/
Technical Report:
http://arxiv.org/abs/2606.02400
Source Code:
https://github.com/Soul-AILab/SoulX-Transcriber
HuggingFace:
https://huggingface.co/Soul-AILab/SoulX-Transcriber
![]()
效果展示
SoulX-Transcriber效果,音頻內(nèi)容源自開源數(shù)據(jù)測試集
行業(yè)痛點:
為什么多人對話轉(zhuǎn)錄如此困難?
近年來,語音識別技術(shù)已經(jīng)取得顯著進(jìn)步,但真實世界中的多人對話理解仍然面臨巨大挑戰(zhàn)。
與傳統(tǒng)單人語音識別不同,真實長對話往往同時包含:多人交替說話、重疊語音(Overlap Speech)、長時間上下文依賴 、噪聲與混響 、情緒變化 、非標(biāo)準(zhǔn)口語表達(dá)、音色相似等主要問題,并且還具有:打斷、停頓、插話、遠(yuǎn)場語音、多說話人快速切換等復(fù)雜交互行為。傳統(tǒng)多說話人ASR系統(tǒng)通常僅關(guān)注依賴VAD切分結(jié)果的“逐句轉(zhuǎn)寫”,缺乏:
長上下文建模能力
多說話人一致性建模
結(jié)構(gòu)化音頻理解能力
因此在真實會議、播客、訪談、直播等場景中,往往會出現(xiàn)說話人混亂、時間軸錯位、文本斷裂、長程語義丟等問題。而一個合格的識別系統(tǒng),不僅需要識別“說了什么”,還需要準(zhǔn)確判斷“是誰說的”和“什么時候說的”。
SoulX-Transcriber:
統(tǒng)一建模“誰、何時、說了什么”
![]()
傳統(tǒng)多人語音識別系統(tǒng)通常采用多階段級聯(lián)方案,需要依次完成語音檢測、說話人分離、說話人聚類和語音識別等多個步驟。這種方式雖然易于實現(xiàn),但容易產(chǎn)生誤差累積,一旦前面環(huán)節(jié)出現(xiàn)錯誤,后續(xù)結(jié)果也會受到影響。
SoulX-Transcriber采用統(tǒng)一的端到端框架,將說話人身份、時間邊界和轉(zhuǎn)錄文本納入同一模型進(jìn)行聯(lián)合建模,實現(xiàn)從原始音頻到結(jié)構(gòu)化結(jié)果的直接生成。
面對復(fù)雜多人對話,系統(tǒng)能夠同時完成:
誰在說(Who)
什么時候說(When)
說了什么(What)
從而獲得更加穩(wěn)定和一致的轉(zhuǎn)錄結(jié)果。
讓模型真正學(xué)會區(qū)分不同說話人
多人對話識別的核心難點之一,在于模型是否具備足夠強(qiáng)的說話人辨別能力。為此,SoulX-Transcriber 設(shè)計了專門面向說話人建模的兩階段訓(xùn)練方案。
第一階段通過多任務(wù)聯(lián)合訓(xùn)練,讓模型同時學(xué)習(xí)說話人切換預(yù)測、目標(biāo)說話人提取、說話人驗證、多說話人轉(zhuǎn)錄以及通用語音識別等任務(wù),從多個角度強(qiáng)化對說話人特征的理解能力。相關(guān)任務(wù)的具體定義如下:
Speaker Turn prediction:說話人輪次切換預(yù)測,該任務(wù)在多人對話數(shù)據(jù)中預(yù)測說話人語音對應(yīng)的文本邊界,在訓(xùn)練數(shù)據(jù)中,以符號""作為邊界預(yù)測的目標(biāo)。
Target Speaker Extraction and Recognition:目標(biāo)說話人提取與識別,該任務(wù)旨在已知目標(biāo)說話人的參考語音后,到目標(biāo)多說話人數(shù)據(jù)中提取所有屬于該目標(biāo)說話人的語音并進(jìn)行語音識別,在訓(xùn)練的時候也將目標(biāo)說話人的時間戳邊界作為訓(xùn)練的目標(biāo)。
Speaker Verification:說話人驗證,該任務(wù)旨在給定了,兩個說話人的語音片段,讓模型判斷是否屬于同一個說話人,強(qiáng)化模型對說話人音色的辨別能力;
Speaker Diarization and Automatic Speech Recognition:說話人分割與識別,該任務(wù)旨在給定多說話人對話音頻片段,直接生成時間戳邊界、說話人標(biāo)簽以及轉(zhuǎn)錄文本的結(jié)構(gòu)化輸出;
Automatic Speech Recognition:自動語音識別,通過引入多領(lǐng)域數(shù)據(jù)維持識別能力并提升泛化性,為第二階段的訓(xùn)練打下基礎(chǔ);
第二階段則利用高質(zhì)量標(biāo)注數(shù)據(jù)進(jìn)行監(jiān)督微調(diào),進(jìn)一步提升模型在真實多人對話場景中的穩(wěn)定性和泛化能力。這種訓(xùn)練方式無需修改底層模型架構(gòu),即可顯著增強(qiáng)模型對相似音色說話人、快速輪次切換以及復(fù)雜多人交互場景的處理能力。
構(gòu)建更真實的多人對話訓(xùn)練數(shù)據(jù)
除了模型訓(xùn)練策略之外,SoulX-Transcriber還構(gòu)建了一個基于多人多輪語音合成的多說話人對話語音數(shù)據(jù)生成體系。與偽標(biāo)簽對話數(shù)據(jù)相比,基于生成的對話語音數(shù)據(jù)在說話人身份、對話結(jié)構(gòu)和對話組成方面具有更好的可控性。
它還能夠可擴(kuò)展地構(gòu)建涉及聲學(xué)相似說話人和復(fù)雜多說話人交互的困難訓(xùn)練樣本,而僅通過自動標(biāo)注系統(tǒng)很難獲得這些樣本。整個構(gòu)建系統(tǒng)包括四個階段:對話文本構(gòu)建、參考音頻構(gòu)建、說話人參考匹配和對話音頻生成。具體見下圖所示:
![]()
多項公開基準(zhǔn)測試達(dá)到領(lǐng)先水平
![]()
在公開基準(zhǔn)測試中,SoulX-Transcriber在 AISHELL-4、AliMeeting 等多人會議數(shù)據(jù)集上取得了領(lǐng)先表現(xiàn)。除了常規(guī)測試集外,團(tuán)隊還進(jìn)一步構(gòu)建了5分鐘長音頻測試集,以驗證模型在長時間上下文中的穩(wěn)定性。
結(jié)果表明,SoulX-Transcriber在長音頻場景下依然能夠保持準(zhǔn)確的說話人追蹤能力和轉(zhuǎn)錄質(zhì)量,有效降低長對話中常見的身份漂移和歸屬錯誤問題。與此同時,在覆蓋日常對話、影視內(nèi)容和播客等不同領(lǐng)域的內(nèi)部測試集中,SoulX-Transcriber同樣展現(xiàn)出良好的泛化能力。值得注意的是,雖然模型訓(xùn)練數(shù)據(jù)以中文為主,但在英文多人對話場景中依然保持了較強(qiáng)的識別和說話人歸屬能力。
依托模型表現(xiàn),未來,SoulX-Transcriber將能夠在多人會議、在線教育等領(lǐng)域應(yīng)用落地。
SoulX-Transcriber之外,此前,Soul AI團(tuán)隊在語音領(lǐng)域還開源了播客語音合成模型SoulX-Podcast、歌聲合成模型 SoulX-Singer、全雙工語音對話控制模塊SoulX-Duplug,團(tuán)隊持續(xù)圍繞語音方向夯實技術(shù)基建,面向核心垂類方向,為行業(yè)提供更專精的具體解決方案。
同時,在實時數(shù)字人生成方向,團(tuán)隊還陸續(xù)開源了SoulX-LiveAct、SoulX-FlashTalk、SoulX-FlashHead等模型,受到了AI開發(fā)者的廣泛關(guān)注。
在思考AI社交核心能力的過程中,聚焦實時AI交互的多模態(tài)方案,Soul以清晰的技術(shù)路線探索和應(yīng)用落地,推進(jìn)自身基礎(chǔ)設(shè)施升級,也攜手開發(fā)者社區(qū),共同推動智能交互時代的發(fā)展和技術(shù)產(chǎn)業(yè)化落地新階段的到來。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.