文章摘要
Qwen-Audio 3.1系列语音大模型正式发布,本次升级覆盖语音识别、语音合成、实时交互三大核心方向,推出多款不同定位的模型,构建了完整的“理解-生成-交互-创作”音频能力栈;全线模型大幅降价,降幅在70%到95%之间,目前多数模型API已上线专业AI服务平台,降低了用户使用门槛。

Qwen-Audio 3.1系列语音大模型正式发布,本次升级覆盖语音识别、语音合成、实时交互三大核心方向,同时推出两款全新专项模型,形成一套完整的“理解-生成-交互-创作”音频能力栈。为降低用户使用门槛,全线语音模型均调整了定价,其中语音合成服务降价约70%,实时交互服务降幅达85%,语音识别服务降价幅度更是达到95%。

目前系列模型的API已上线专业AI服务平台,其中Qwen-Audio-3.1-ASR-Next的API将于近期上线。

Qwen-Audio-3.1-ASR:强化上下文理解与转写优化

作为新一代语音识别大模型,Qwen-Audio-3.1-ASR进一步提升了多语种、方言识别能力与上下文理解效果,新增原生转写润色功能,可以自动去除语气词、重复表达并重组语义,让输出的转写文本更流畅通顺。同时,全新的分角色转写方案可以完整呈现“谁在什么时候说了什么”,为会议记录、访谈整理、对话分析提供可追溯的结构化内容。

核心能力亮点包括:

  • 结构化输出:采用端到端方案,同步输出说话人标签、时间戳与识别文本,可以处理轮流发言、短插话与重叠语音,清晰还原每位发言者的内容。
  • 覆盖广泛:单模型支持30种语言与16种中文方言,适配多语言交流、方言对话等复杂语音场景。
  • 识别精准:支持行业专业词汇、实体与分级热词识别,可以参考长音频历史上下文,确保人名、缩写与专业术语的识别一致性。
  • 响应快速:支持低延迟流式识别,边说话边转写,首字响应时间约160毫秒。
  • 处理清晰:原生完成去语气词、去重复、自我纠正与语义重组,自动区分不同说话人,实现长音频的角色一致、时间对齐与结构化输出。

性能表现方面:

在开源方言数据集的转写与翻译测试中,模型平均字符错误率(CER)为4.55%,在6个子集上取得最优结果;在中文方言自建测试集的原文转写测试中,模型在11个方言子集上全部取得最优结果,平均CER为10.38%,其中温州话等难度较高的方言识别效果提升尤为明显。在方言转普通话的翻译测试中,模型在11个方言子集的10个上表现最优,平均语义句准率达到82.10%。

Qwen-Audio-3.1-ASR-Next:泛音频理解能力升级

基于下一代架构打造的音频理解模型Qwen-Audio-3.1-ASR-Next,可以识别并理解人物情绪、环境声与机械声,完成声音描述、事件定位、音频问答与推理任务。例如面对一段包含人物对话、背景音乐与环境声的音频,模型不仅可以输出对话文本,还能描述音频中包含的所有声音类型、事件发生的时间节点,并回答与整段音频内容相关的问题。

这一模型让语音识别的处理范围从“语音中的文字”扩展到了“完整的音频信息”。在分角色语音识别的测试中,Qwen-Audio-3.1-ASR-Flash-Next与Qwen-Audio-3.1-ASR-Flash版本分别取得了五项与三项最优结果,整体表现全面优于此前的Fun-ASR级联系统。

Qwen-Audio-3.1-TTS:自然的跨语言音色合成

Qwen-Audio-3.1-TTS是新一代语音合成大模型,支持多语种与方言合成,可以实现同一音色在跨语言合成时的自然迁移,让用户可以轻松实现多语言语音输出。相较于传统仅关注字音正确的合成方案,该模型更注重真实表达,可以通过指令控制语音的情绪、语速与表达方式,让合成的声音更贴合内容与使用场景。

典型应用场景包括:使用同一种音色生成普通话、广东话、河南话、英语、日语等多语言多方言的语音,例如以统一音色合成“欢迎来到行业峰会,很高兴在这里见到你”的多语言版本;或是为同一段文本调整情绪与语速,比如用开心、伤心等不同状态演绎“你终于来了,我一直在等你。我们现在就出发吧,前面还有很多事情等着我们一起完成”这段内容。

Qwen-Audio-3.1-TTS-Next:一体化音频创作工具

基于下一代架构的音频创作模型Qwen-Audio-3.1-TTS-Next正式发布,改变了传统音频制作需要主播、音效师、混音师、剪辑师多环节协作的模式。该模型不再局限于单一的语音合成,可以围绕文本、时间戳与参考音频等输入,统一生成人声、音效与环境音,直接创作完整的音频内容。

核心能力亮点包括:

  • 一体化生成:支持生成包含语音与完整环境声场的音频,比如播客可以同时包含多位说话人的对话与背景音效,影视或游戏音频可以包含台词、环境声、动作音与配乐。
  • 角色一致性:支持多人音色复刻与多轮对话生成,可以在连续内容中保持各角色的音色特征,按照脚本演绎情绪与节奏,避免多轮生成中出现角色“变声”的问题,自然呈现停顿、接话、附和与情绪转折等细节。
  • 多声音融合:可以融合生成人声、音效与环境音,并还原声音的材质、远近变化与空间层次,比如在有声书场景中,同时处理旁白、角色对话,还能生成城市低鸣、晚风、易拉罐碰撞声等环境音效,让对话更贴合故事场景。
  • 自然语言控制:可以通过自然语言指定说话人的语气、语速、音量,描述音乐风格、配器方式与声音事件的先后顺序,还支持细粒度时间戳控制、声音复刻与48kHz高音质输出,满足播客、有声书、影视剧、游戏、广告等专业音频创作的需求。

Qwen-Audio-3.1-Realtime:自然的实时交互体验

实时语音交互并非简单将语音识别、语言模型与语音合成串联起来,人类交流中说话与倾听往往同时进行,用户可能中途补充内容、插话,同一句话的含义也会随情绪、关系与语气变化而改变。全新升级的Qwen-Audio-3.1-Realtime可以更好地理解对话内容,更自然地接话与共情,还能主动调用Agent工具完成任务。

该模型支持全双工实时交互,告别了以往模型只能单向听或说的局限,可以同时接收与输出语音,用户可以随时插话、打断,交流体验更接近真人通话。

核心能力亮点包括:

  • 情绪与意图理解:模型不仅识别语音中的文字,还能理解声音背后的情绪与交流意图。当识别到用户语气低落时,不会机械回应,而是调整语速与措辞;面对紧张、开心、失落等不同情绪,也能结合上下文选择合适的表达方式,在角色扮演场景中,角色设定会体现在连续的语音表达中。
  • 多语言实时切换:对话中切换语言时,模型可以保持此前的上下文、语气与交流节奏,跨语言对话无需因语言变化重新开始。
  • 强化安全与事实可靠性:面对不确定信息时,会减少缺乏事实依据的回答;面对敏感或高风险内容,可以更准确地识别边界并给出安全回应,更谨慎地处理未经确认的结论。
  • 实时工具调用:当需求涉及外部信息或业务系统时,模型可以在对话中调用工具,连接API、知识库与业务系统完成搜索、查询或任务执行,并将结果自然融入对话。

基于多教师蒸馏架构,该模型在保持低延迟的同时,提升了理解、推理、表达与安全能力,解决的问题从“如何实时回答用户”扩展到“如何在持续对话中理解变化的需求并完成任务”。

典型应用案例包括多语言实时交流,比如用户先以中文提出旅行规划需求,再切换为日语、韩语继续提问,模型可以保持上下文与交流节奏自然回应;还可以适配多人对话场景,适时等待、插入并回应,或是实现角色扮演,通过音色克隆与对话模型调用还原特定人设的语音表达。

落地场景与生态扩展

Qwen-Audio-3.1-Realtime正在与多款Agent工具、智能硬件结合,包括Qoder、千问办公等Agent平台,以及QwenNote、A2、Eva、AI眼镜等硬件设备。在这些场景中,用户无需始终打开电脑或手机,可以直接通过语音发起任务,并在实时对话中随时新增条件、修改需求或了解任务执行情况。

技术升级总结

Qwen-Audio 3.1系列的升级并非单一语音指标的局部优化,而是沿着五条明确的技术路径推进:

  • Qwen-Audio-3.1-ASR:升级多语种方言识别、上下文理解能力,新增原生转写润色功能
  • Qwen-Audio-3.1-ASR-Next:将音频理解从语音文字扩展到泛音频内容,更好地识别人物情绪、环境声与机械声
  • Qwen-Audio-3.1-TTS:实现跨语言音色的自然合成,让同一音色适配多语言多场景
  • Qwen-Audio-3.1-TTS-Next:从单一语音合成升级为通用音频生成系统,一次生成包含人声、音效与环境音的完整音频
  • Qwen-Audio-3.1-Realtime:打造更贴近真人通话的实时交互体验,支持情绪理解、多语言切换与工具调用

能听懂、能创作、能聊天,Qwen-Audio 3.1正在让语音成为连接人、内容与AI的自然入口。

以上内容不代表本平台立场,仅供读者参考