阿里Qwen-Audio-3.0-Realtime:四大能力升级实现“又快又聪明”

这款新一代实时语音交互对话模型的核心升级,依托于On-Policy Distillation(在线策略蒸馏)技术框架。研发团队将文本大模型的完整推理能力蒸馏至语音模型,让语音模型在生成回答的同时,由文本大模型实时纠正推理过程,同时引入多教师蒸馏策略,从四个维度保障模型能力均衡。
具体来看,该模型首先解决了实时语音交互的核心矛盾:传统实时语音模型为压低时延往往牺牲推理深度,导致问答准确性下降。这款新模型针对日常对话、简单问答等时延敏感场景,可实现毫秒级响应,同时保持出色的问答准确性。在VoiceBench语音问答基准测试中,Plus版本在书面化和口语化prompt下得分分别为92.5和90.5,仅相差2.0;在难度更高的AudioMultiChallenge多轮音频对话测试中,Flash版本的对应得分分别为43.6和38.1,差距仅5.5,展现出极强的口语适配能力。
在工具调用能力上,该模型打破了传统语音助手“能聊天不能办事”的局限。传统语音助手需要用户明确发出“帮我打开XX”类指令才能触发工具,且切换闲聊后易出现上下文断裂。而这款模型无需明确指令即可自主调用外部工具,调用结果还会自动融入对话记忆,一次检索结果可支撑后续多轮追问。比如用户先问“附近有什么川菜馆”,再追问“评分4.5以上的哪家最近”,模型会自动衔接上一次地图工具的返回结果继续检索。该模型基于FunctionCall标准协议,可顺利接入MCP、API及各类知识库。
共情对话体验也是本次升级的核心亮点。模型摆脱了传统语音助手的机械感,可根据对话语境动态调整语气、节奏、音调与情感。在辩论场景中,它能精准抓取对方论点并快速组织反驳,同时保持恰当的语气强度;在情感陪伴场景中,则会通过语调变化、节奏调整以及笑声、叹息、犹豫等副语言信号做出共情回应。在S2S语音指令遵循基准VStyle测试中,该模型取得了当前最优成绩。
双工交互流畅度方面,模型内置“多模态感知的双工控制”子模型,可通过分析音频信号、语义内容与说话人声纹特征,实现边说边听的自然交互。它不会被餐厅、开放工区的背景噪音误打断,能在多人讨论中锁定主对话对象、忽略旁听内容,在多说话人切换时也能自然过渡对话流程。此外,模型API预留了audio_prompt字段,用户可上传提前录制的音频样本锁定声纹,实现精准对话聚焦。
7月15日,该模型正式对外发布,推出了推理能力更强的Plus版本和速度更快的Flash版本,可应用于智能客服、教育培训、娱乐互动与情感陪伴等多个场景。早在今年5月,该模型的Preview版本就曾在全球权威AI评测榜单中斩获两项冠军,超越GPT-Realtime-2;其Preview版本Fun-Realtime-Audiochat还在“语音推理能力”和“对话流畅度”两项指标中均以97.6%的成绩登顶榜单。

