Qwen-Audio-3.0-TTS:自然语言指令驱动高保真语音合成

近期,一款全新的实时语音合成模型正式发布,实现了从“能说话”到“会表达”的关键升级,不仅在全球第三方权威语音评测榜单中斩获冠军,还针对开发者在生产场景中的实际需求完成了多项核心优化。
该模型推出了两个针对性版本:面向实时交互场景的Flash版本,首包延迟仅约300ms,能够满足低延迟的互动需求;而Plus版本则聚焦高质量语音生成,在自然度和音色还原度上表现更为出色。
本次更新围绕开发者在生产环境中最常遇到的四大痛点展开,分别是更广的语言覆盖范围、更自然的指令控制能力、更精细的细节标签调控,以及在参考音频质量不佳时的鲁棒性表现。
核心亮点一:多语种与方言全面升级
模型针对全球多语种场景进行了专项优化,支持包括中文、英文、日语、韩语、德语在内的16种语言。在多语言可懂度方面,该系列模型展现出最强的整体表现,在16种语言中有10种取得了最佳的WER/CER表现:Flash版本的平均WER/CER低至3.87,Plus版本也达到3.96,两者的平均表现均优于其他同类系统。
在说话人相似度方面,Plus版本在全部16种语言中均排名第一,平均得分82.75;Flash版本同样表现优异,得分80.44,展现出极强且稳定的音色还原能力。
针对国内方言场景,模型通过更高质量的方言数据、更丰富的品类覆盖以及专门的方言强化训练,有效解决了通用语音合成中容易出现的“方言特色弱化”问题。目前模型支持20种高质量方言,覆盖国内多个地区的本土语言特色,让合成语音在韵律、声调和口语化表达上更贴近母语使用者的真实表达。
核心亮点二:Free-style 自由指令,用自然语言“导演”声音
不同的业务场景对语音风格有着截然不同的需求:客服场景需要温和耐心的语气,直播场景需要热情有感染力的表达,有声书场景则需要精准的角色代入感。这款模型支持Free-style自然语言指令控制,开发者无需掌握专业的声学标注知识,仅通过日常自然语言就能灵活定义语音的情绪、角色、场景、语速等多个维度,让合成的语音结果与预期高度匹配。
核心亮点三:细粒度标签控制,精确到呼吸和情绪
除了自由文本指令之外,模型还支持在文本中直接嵌入结构化标签,比如[gasp]、[giggles]、[angry]等,能够精准调控语音的语气、情绪以及呼吸类细节。这种方式特别适合叙事、游戏、影视配音等需要精确控制非语言细节的场景,标签可以和语音自然融合,灵活组合构建出复杂的情感表达。
核心亮点四:复杂声学鲁棒性,无惧嘈杂环境的音色复刻
在实际业务场景中,参考音频往往来自复杂的环境,比如嘈杂的会议室、混响较强的房间等。这款模型针对这一问题进行了专项优化,通过针对性的真实声学仿真训练,将语音增强能力原生注入到音色复刻流程中,能够在嘈杂环境中自动过滤干扰、保留核心音色,让复杂场景下的合成语音清晰度和感知质量显著提升,即使参考音频质量不佳,最终的合成结果依然能够保持较高的品质。
- 高混响场景:有效抑制混响干扰,合成更干净清晰的语音内容。
- 高噪声场景:抗噪能力更强,语音质量相比前代产品有显著提升。
精品音色库与音质升级
该模型还配套了精品音色库,将多语种、多方言、指令控制和细粒度表达的能力沉淀为开箱即用的音色资源,覆盖指令风格音色、20种方言音色以及14款以上的小语种音色,帮助业务方快速上线不同场景的语音解决方案。
同时,面向严肃创作场景,模型将音频输出品质从24kHz提升到了48K,单次语音合成支持长达3分钟的文本内容,轻松满足长文本播报的需求。需要注意的是,部分方言、小语种精品音色以及48K高清音频输出功能目前正在陆续上线,其中48K功能预计于7月24日正式开放,具体以实际平台展示为准。
目前这款实时语音合成模型已经全面开放,从“能说话”到“会表达”,语音合成技术的边界正在被不断拓宽。我们诚邀广大开发者接入体验,共同探索语音合成的更多可能性。如果在应用落地过程中有任何反馈或建议,欢迎通过官方技术交流渠道进行探讨。


