千问发布Qwen3.8-LiveTranslate 实时同传性能全面提升

实时同声传译不仅需要高效的速度,更要听清语义细节、译准核心内容。我们全新推出Qwen3.8-LiveTranslate实时同传大模型,通过Interleave架构重构了实时同传的整体流程,让翻译的准确度、流畅度与简洁度都实现了全面升级,字均延迟(LAAL)从上代的2.8秒优化至2.3秒。
这款模型在支持60种语言的基础上,新增了三大核心功能,进一步拓宽了真实场景的应用边界:第一是实时说话人分离功能,可以清晰区分每一句发言的归属主体,让音色复刻的效果更稳定;第二是原文译文同步呈现功能,实现双语同屏展示;第三是长上下文消歧能力,可以结合前文语境理解当前内容,让人名、术语的翻译更精准。
用户可以通过官方体验渠道试用这款模型,相关API也已上线专业AI服务平台。
核心优势
- Interleave架构:实现音频与文本交织处理,兼顾高质量与低延迟。本代模型将实时同传流程重构为音频与文本交织的单一流转模式,已识别的音频片段和已生成的译文都可以被缓存复用,相比上代模型翻译质量有明显提升,同时字均延迟降低至2.3秒。
- 实时说话人分离:让内容归属更清晰,音色复刻更稳定。在多人交替发言的场景中,可以精准区分不同说话人及其发言内容,帮助译文语音更准确、稳定地保留发言人的音色特征。
- 原文译文同帧同出:实现原文与译文同步呈现。在同传过程中保持双语对齐,既可以满足即时理解的需求,也方便进行原文核对,为字幕展示、内容整理、信息检索等后续功能提供了基础,拓展了更多应用场景。
- 长上下文消歧:关联历史语境提升翻译精准度。结合前文和历史交流语境,减少仅凭单句判断专有名词、指代内容带来的歧义,帮助保持表达的一致性。
技术底层设计
Qwen3.8-LiveTranslate采用基于混合专家模型(Hybrid MoE)的Thinker-Talker双模块设计,通过Interleave方式实现流式理解、文本输出与语音生成的无缝衔接。其中,Thinker模块会将视频、音频、源文本与译文整合到同一条因果序列中,按照时序交替排列并实现端到端产出,让语言理解和翻译在单一序列内完成;Talker模块则结合译文和源音频,将翻译内容合成为保留原说话人音色的语音输出。
实测表现
多说话人长音频翻译
在覆盖14个语向的多说话人长音频评测集Omnilingua-MSpeaker上,Qwen3.8-LiveTranslate在翻译忠实度、流畅度、简洁度以及说话人识别错误率(DER)四个核心维度上,均优于当前行业主流的实时同传系统。
多语言表现
我们在公开的FLEURS音频测试集上完成了70个语言方向的实时同传评测,结果显示这款模型在翻译质量、字均延迟、语音识别准确率以及语音合成质量四个维度上,都领先于上代模型和当前主流的实时同传方案。
案例演示
我们通过《西游记》中的两段对话以及一组同音词示例,展示了这款模型在说话人归属识别与音色克隆、双语同步输出,以及上下文和视觉信息消歧方面的出色能力。
支持语种
Qwen3.8-LiveTranslate目前支持60种语言的实时同传服务,能够满足大部分跨语言交流场景的需求。
未来发展方向
实时同声传译技术仍有很大的升级空间,我们将围绕「听得更全、传得更真、用得更广」三个核心方向持续优化:
- 逼近同传延迟极限:持续压缩端到端时延,把「听到」与「译出」之间的间隔推向极限,实现更流畅的实时交流体验。
- 跨会话的长期记忆:实现跨会话记忆能力,让同传模型可以在同一项目、同一交流群体的后续对话中持续优化表现,越用越贴合用户的交流习惯。
- 覆盖更多语种:持续拓展覆盖语种的范围,将服务延伸到更多长尾语种和区域方言,让实时同传能够服务全球更多人群。

