阿里巴巴Qwen-Audio-3.0-TTS发布 细粒度语音合成再升级

7月20日,国内知名科技企业正式发布全新一代语音合成大模型Qwen-Audio-3.0-TTS,该模型在细粒度情绪控制、自由指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等多个核心维度实现了系统性升级。本次推出的产品包含两个针对性版本:面向实时交互场景的Flash版本,首包延时仅300毫秒级别,能够满足低延迟的互动需求;主打高质量生成的Plus版本,让合成语音从基础的“能发声”升级到能够精准表达情绪的“会表达”。根据全球第三方权威评测榜单Artificial Analysis的数据,Qwen-Audio-3.0-TTS-Plus目前斩获该榜单冠军,其此前推出的预览版Fun-Realtime-TTS也在一个月前登顶同一榜单。
相较于上一代版本仅支持通过“资深客服”“足球解说员”这类角色提示词来控制整段语音的情绪、场景和语速,新一代模型进一步将控制精度提升到了细粒度级别。用户可以直接在生成文本中嵌入结构化标记,比如[gasp]对应抽气音效、[giggles]对应轻笑、[angry]对应愤怒情绪,能够精准控制到“某个字后面需要倒吸一口气”这类细节,非常适合需要精细化音效把控的叙事、游戏配音、影视后期等创作场景。
为适配全球多语种的使用场景,该模型进行了专项优化,目前已覆盖中、英、日、韩、德等16种主流语言,还新增了阿拉伯语、越南语、马来语以及菲律宾语四个语种。根据CV3-Eval的多语种基准测试结果,在16种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS家族在10种语言中达到当前最优水平,其中韩语和马来语的领先幅度最为显著;在“说话人相似度”评测环节,Plus版本实现全胜,包揽全部语种的最优成绩,Flash版本则拿下15项第二,在马来语、西班牙语和阿拉伯语上的领先优势尤为明显。
针对大模型训练中常见的方言发音偏移问题——当模型规模扩大、训练数据复杂度提升时,方言发音容易不自觉地滑向通用普通话腔调,研发团队专门设计了方言强化训练方案,通过针对性的海量方言训练数据,让模型的韵律、声调与口语表达更贴近母语使用者的习惯,目前该模型已覆盖广东话、重庆话、东北话、陕西话、上海话、四川话、云南话等20种国内方言。
在语音克隆功能上,该模型也实现了重要突破。传统语音克隆产品往往要求原始参考音频必须在安静环境下录制,而Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中内置了语音增强能力,即使在高噪声、高混响的复杂环境下,也能有效过滤干扰信号,完整保留目标音色。针对专业创作场景,模型还配备了开箱即用的精品音色库,同时将音频输出采样率从24kHz提升至48kHz,将视频配音、有声书的音质标准提升到专业录音棚、影视配音的级别,单次语音合成的最长时长可达3分钟。
即日起,Qwen-Audio-3.0-TTS的Flash和Plus两个版本已正式在阿里云百炼平台开放调用,相关用户可直接接入使用。


