![]()
智東西
作者 楊京麗
編輯 李水青
智東西7月20日報道,今天,千問大模型發布語音合成大模型Qwen-Audio-3.0-TTS,包含面向實時交互的Flash版本(首包延時300ms級別)和面向高質量生成的Plus版本。
模型在細粒度標簽控制、freestyle指令遵循、多語種與方言覆蓋以及復雜聲學魯棒性等方面實現系統性提升。目前,Qwen-Audio-3.0-TTS-Plus在第三方評測機構Artificial Analysis的Speech Arena語音合成榜單中居于第一,Elo得分為1237。
![]()
▲Qwen-Audio-3.0-TTS-Plus在語音合成榜單中排名第一(圖源:Artificial Analysis)
阿里還將陸續上線指令風格音色、20種方言音色、細粒度控制音色及14種以上小語種音色,供開發者直接調用。在輸出規格方面,Qwen-Audio-3.0-TTS將音頻采樣率從24kHz提高至48kHz,單次語音合成最長可達3分鐘。
目前,Qwen-Audio-3.0-TTS-Plus和Flash版本均已在阿里云百煉開放。
![]()
Qwen-Audio-3.0-TTS-Plus:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china
Qwen-Audio-3.0-TTS-Flash:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china
一、文本里插入標簽,模型可調節語氣、情緒、呼吸等
細粒度標簽控制是Qwen-Audio-3.0-TTS此次升級的重點之一。用戶可以在文本中直接插入結構化標簽,嵌入[gasp](抽氣)、[giggles](輕笑)、[angry](憤怒)等這類標記,可以調節語氣、情緒和呼吸等細節。
官方也給出了相關的案例,在一段飛船事故相關臺詞前加入[angry]標簽后,模型會以憤怒語氣合成后續內容。
合成文本:[angry]你們竟然私自切斷了主控系統的能源!知不知道防護罩一旦失效,整艘飛船的人都會化為灰燼?這就是你們所謂的‘為了大局’嗎!簡直是不可理喻!
參考音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7a6e2862_6a5df7a6df376_6a5df7a6df347_1.mp3
合成音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7a95e1b8_6a5df7a959e24_6a5df7a959df0_02.mp3
根據文本提示,模型在生成的音頻中加入了憤怒的語氣,角色的質問感和緊迫感隨臺詞逐步增強。
此外,用戶也可以通過輸入指令,要求模型在說話過程中笑出聲。
指令:說到一半忍不住撲哧笑出聲
合成文本:你說的這個事啊,我都聽過好幾遍了,撲哧——還是覺得好笑。
合成音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7aa5a583_6a5df7aa56dd7_6a5df7aa56dad_03.mp3二、自由指令控制,可直接用自然語言描述
除結構化標簽外,Qwen-Audio-3.0-TTS還支持Free-style自然語言指令控制。用戶可以直接用自然語言描述角色、情緒、場景和語速,不需要單獨調整專業音頻參數。
官方給出了下面這幾個案例:
指令:你是一位年輕女性小學老師,正在課堂上耐心地給一年級學生復述拼音規則。語速很慢,每一個發音都示范一遍,語調上揚帶笑意。
合成文本:我們再來讀一次,j、q、x這三個聲母后面如果跟著u,那個u上的兩點要去掉。你跟老師一起讀,j——u——ju。
參考音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7b047763_6a5df7b043e16_6a5df7b043deb_05.mp3
合成音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7b300305_6a5df7b2efd27_6a5df7b2efcfa_06.mp3
模型會按照這段指令合成對應的課堂講解錄音。類似方式也可以用于旁白、角色配音、有聲內容和語音助手等場景。
指令:你是懸疑劇旁白,屏住呼吸把緊張感一層層疊上去。
合成文本:那天夜里下著大雨,林晚一個人坐在書房里。窗外的雷聲一陣接一陣,燈光忽明忽暗。她忽然聽見樓下傳來了腳步聲——緩慢、沉重,像是有人在故意壓低聲響。她屏住呼吸,手指緊緊抓住椅子的扶手。腳步聲越來越近,最終停在了書房門口。門把手輕輕地,轉動了一下。
合成音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7ac48ee7_6a5df7ac45300_6a5df7ac452d8_04.mp3
從合成效果來看,旁白語速較為急促,營造出明顯的緊張感,讓人仿佛置身故事場景之中。如果有聲小說采用這種能夠隨情節調整節奏和情緒的配音,聽眾的沉浸感和代入感也會更強。
三、覆蓋16種語言,10種語言字詞錯誤率最低
Qwen-Audio-3.0-TTS-Plus覆蓋中文、英語、日語、韓語、德語等16種語言,新增了阿拉伯語、越南語、馬來語和菲律賓語。
根據官方公布的CV3-Eval多語種測試結果,目前,Qwen-Audio-3.0-TTS在16種語言的詞或字錯誤率評測中,Qwen-Audio-3.0-TTS系列在10種語言中排名第一,其中韓語和馬來語的領先幅度較大。
在16種語言的說話人相似度評測中,Qwen-Audio-3.0-TTS-Plus取得全部16項最優成績,Flash版本取得其中15項第二。馬來語、西班牙語和阿拉伯語的提升較為明顯。
![]()
四、支持20種中文方言,強化韻律和聲調訓練
中文方言方面,Qwen-Audio-3.0-TTS目前支持廣東話、重慶話、東北話、陜西話、上海話、四川話和云南話等20種方言。千問稱,新模型使用了更多方言數據,并增加了方言強化訓練階段,讓模型在韻律、聲調與口語表達上接近母語者,減少通用語音強化學習過程中可能出現的方言特征減弱問題。
用戶可以通過自然語言指令指定輸出方言。例如,輸入“輸出上海話”,模型即可根據后續文本合成上海話語音。
指令:
輸出上海話:屋里向裝修真個是煩人,天天敲墻壁,聲音響得來!灰塵落得一塌糊涂,真想快點弄清爽。
合成音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7b988f87_6a5df7b98456e_6a5df7b984538_08.mp3五、噪聲和混響環境下,仍具備較強聲音復刻能力
聲音復刻通常需要使用較為清晰的參考錄音,但實際獲得的音頻中可能包含背景噪聲或混響。
Qwen-Audio-3.0-TTS加入了真實聲學環境仿真訓練,將語音增強能力用于聲音復刻流程。官方稱,在參考音頻存在較高噪聲或混響的情況下,模型可以過濾部分環境干擾,并提取說話人的音色。
合成文本:聽到這首歌的時候,突然想起很多年前的夏天。
參考音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7baa4948_6a5df7baa0ef8_6a5df7baa0ece_09.mp3
合成音頻:
//oss.zhidx.com/uploads/2026/07/6a5df7bcc77e7_6a5df7bcc2839_6a5df7bcc280e_10.mp3結語:語音合成增強語氣、情緒等控制能力
從此次升級來看,Qwen-Audio-3.0-TTS提高了對于語氣、情緒、呼吸和角色風格的控制能力。結構化標簽適合調節具體位置的表達效果,自然語言指令則能對角色、場景和語速進行整體描述,多語種、方言及復雜聲學環境下的聲音復刻能力也得到擴展。
隨著Plus和Flash版本在阿里云百煉開放,這些能力將進入更多實際應用場景,為旁白、角色配音、有聲內容和語音助手提供更多配音方案。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.