Hy ASR 3.0 preview发布:语音识别精度与场景适配能力升级

我们正式推出新一代语音识别模型Hy ASR 3.0 preview,这款模型依托最新一代大语言模型的语言理解能力,将高精度语音识别与深度语义解读深度结合,实现了全方位的能力跃升。相较于过往“逐字转写、单点优化”的模式,新模型已经进化为“理解语境、兼容场景、一键直出”的智能转写方案,可以在更复杂的真实使用场景中,输出准确连贯且贴合用户真实意图的转写结果。
Hy ASR 3.0 preview在多套开源评测集与自建评测集上都展现出了领先的整体表现。在开源评测场景中,该模型的词错误率(WER)控制在3%左右,其中中文普通话版本为3.34%,英语版本为2.62%,粤语版本为3.12%。在自建的场景化评测体系中,其在通用识别、方言识别、上下文理解、专业词汇识别以及高噪、耳语等复杂声学场景下,同样保持了极低的词错误率水平。
从用户体验出发的四大核心升级
1. 通用识别更精准:针对通用语音、多地方言、中英混合讲话等场景进行了针对性优化,有效减少了错字、漏字问题,同时避免了长音频转写过程中的错误累积。
2. 语义理解更到位:可以结合上下文精准捕捉用户的表达语境,智能纠正同音字词,消除语义层面的歧义,让转写结果更贴合真实表达意图。
3. 专业场景适配更便捷:支持快速注入热词,可以帮助模型快速识别品牌名称、人名以及行业专业术语,大幅降低业务接入和后续持续维护的成本。
4. 复杂环境稳定性更强:针对高噪音环境、耳语、轻声讲话等特殊声学场景做了专项优化,即便在非理想的录音条件下,依然可以保持稳定可靠的转写表现。
多维度技术加持,提升识别能力上限
Hy ASR 3.0 preview的能力提升并非单一模块优化的结果,而是模型架构、数据规模化训练与后训练优化共同作用的成果。
在架构层面,该模型采用了兼顾运行效率与性能表现的MoE架构,并将基座模型升级至Hy3,进一步强化了语言理解、上下文建模与语义推理能力。在语音处理侧,研发团队自研了无监督语音编码器,通过数千万小时级的无监督语音数据完成训练,可以从复杂音频中提取高质量的声学特征表征。
为了持续提升模型的语音建模与理解能力,研发团队对语音编码器与大语言模型进行了联合训练,引入了数千万小时级多来源的语音数据,覆盖了多种方言、口音与声学环境,并通过高标准的数据管线完成了精细化标注。在大规模联合预训练的基础上,模型通过多阶段的能力注入,逐步具备了上下文感知、复杂场景适应与方言识别等核心能力。
围绕通用识别准确性、上下文理解能力与复杂场景鲁棒性,团队构建了高质量的监督微调(SFT)体系,覆盖了上下文语境、专业名词、不同声学环境以及多样化人群的语音数据。针对方言识别能力,该SFT数据体系进一步覆盖了10大方言片区与20余个二级小片区。在此基础上,团队还引入了多阶段强化学习,分别针对通用转写精度、上下文理解能力与复杂长尾场景进行定向优化,进一步降低了复杂声学环境下的误识别与漏识别问题。
目前Hy ASR 3.0 preview已经对外提供API服务,可以广泛应用于智能客服、内容理解、语音搜索等多个场景。多款合作产品已经完成首发上线,用户可以直接体验方言识别、上下文智能纠错与复杂环境稳定转写等升级能力,相关功能免费开放,后续还有更多产品将陆续接入该模型能力。


