腾讯混元Hy ASR 3.0 preview:多语种WER低至3%,场景适配升级

8月4日,腾讯混元正式推出新一代语音识别模型Hy ASR 3.0 preview。这款新模型依托最新一代大语言模型Hy3的语言理解能力,将高精度语音识别与深度语义理解能力深度融合,在通用识别准确度、上下文感知能力、多场景鲁棒性以及方言覆盖范围等核心维度实现了全面升级。它能够在复杂的真实使用场景中,输出准确、连贯且更贴合用户真实意图的转写结果,实现了从“逐字转写、单点优化”到“理解语境、兼容场景、一键直出”的关键转变。
Hy ASR 3.0 preview在多个开源评测集和自建评测集上都展现出了领先的整体表现。在开源评测场景中,这款模型的多语种词错误率(WER)都控制在3%左右,其中中文普通话WER为3.34%、英语WER为2.62%、粤语WER为3.12%,综合性能优于同类竞品。而在自建的场景化评测体系中,Hy ASR 3.0 preview在通用识别、方言识别、上下文理解以及高噪、耳语等复杂声学场景下,同样保持了较低的WER数值,整体表现领先市场同类产品。
从用户实际使用需求出发,Hy ASR 3.0 preview重点优化了四类核心能力:
- 通用识别更准确:针对通用语音、各类方言以及中英混说等常见场景提升识别准确性,有效减少错字、漏字问题。
- 更能理解用户意图:结合上下文语境精准捕捉用户表达的核心含义,智能纠正同音词错误,消除语义歧义。
- 更容易适配专业场景:支持热词快速注入增强功能,帮助模型快速识别品牌产品名称、人名及行业专业术语,大幅降低业务接入和后续持续维护的成本。
- 复杂环境下更稳定:针对高噪音环境、耳语、悄悄话等特殊声学场景进行专项优化,即便在复杂条件下也能保持稳定的转写表现。
Hy ASR 3.0 preview的性能提升并非依赖单一模块的优化,而是通过模型架构升级、数据规模化处理与后训练优化三大维度共同作用实现的。在架构层面,这款模型采用了兼顾运行效率与综合性能的MoE架构,并将基座模型升级至Hy3版本,进一步强化了语言理解、上下文建模以及语义推理能力。在语音处理侧,研发团队自研了无监督语音Encoder,通过数千万小时级的无监督语音数据进行训练,使其能够从复杂音频片段中提取高质量的声学表征信息。
为了持续提升模型的语音建模与语义理解能力,混元团队对语音Encoder和大语言模型进行了联合训练,引入了数千万小时级、多来源的语音数据,覆盖了多种方言、不同口音以及多样的声学环境,并通过高标准的数据管线完成了精细化标注。在大规模联合预训练的基础上,Hy ASR 3.0 preview通过多阶段的能力注入步骤,逐步获得了上下文感知、复杂场景适应以及方言识别等核心能力。
围绕通用识别准确性、上下文理解能力和复杂场景鲁棒性,研发团队构建了高质量的SFT训练方案,覆盖了上下文语境、专业名词、不同声学环境以及多样人群的语音数据。针对方言识别能力,这套SFT数据体系进一步覆盖了10大方言片区和20余个二级小片区,确保方言转写的准确性。在此基础上,团队还引入了多阶段强化学习机制,分别针对通用转写准确性、Any-context上下文理解能力以及复杂长尾场景进行定向优化,有效降低了模型在复杂声学环境中的误识别和漏识别问题。
目前,Hy ASR 3.0 preview已经正式上线腾讯云官网,对外提供API接口服务,可以广泛应用于智能客服、内容理解、语音搜索等多个业务场景。其中,元宝产品深度参与了模型的联合研发并已完成首发上线,用户只需打开元宝应用并按住说话按钮,就能体验到方言识别、上下文智能纠错以及复杂环境稳定转写等升级后的能力,语音输入不仅更准确更稳定,还全程免费开放。此外,WorkBuddy等多款产品也正在陆续接入这款新模型。
体验地址:
腾讯混元:
https://aistudio.tencent.com/visual
腾讯云:
https://cloud.tencent.com/document/product/1093/135476


