文章摘要
2026年8月4日,腾讯混元发布新一代语音识别模型HyASR3.0 preview。该模型基于Hy3大语言模型,采用MoE架构与自研无监督语音Encoder,实现语音Encoder与大语言模型联合训练。多语种WER控制在3%左右,在通用识别、上下文感知等多方面有升级。已上线腾讯云API服务,腾讯元宝首发接入并免费开放。

2026年8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。该模型基于最新大语言模型Hy3的语义理解能力,融合高精度语音识别与深度语义理解,在通用识别、上下文感知、多场景鲁棒性及方言覆盖等维度实现全面提升。开源评测集数据显示,Hy ASR 3.0 preview的中文普通话词错误率(WER)为3.34%、英语2.62%、粤语3.12%,整体控制在3%左右。目前该模型已上线腾讯云API服务,腾讯元宝已完成首发接入并免费开放。

腾讯混元Hy ASR 3.0 preview正式发布

Hy ASR 3.0 preview发布背景与核心定位

语音识别技术的演进拐点

语音识别技术经历了从模板匹配到深度学习、从端到端模型到大语言模型融合的多次技术迭代。传统的语音识别系统本质上完成的是“语音到文字”的线性映射——将音频信号转化为文本符号,缺乏对语言背后语义和语境的理解能力。Hy ASR 3.0 preview的发布标志着语音识别从“逐字转写、单点优化”向“理解语境、兼容场景、一键直出”的范式跃迁。

发布时间与产品定位

2026年8月4日,腾讯混元正式向外界发布Hy ASR 3.0 preview。作为腾讯混元大模型生态的重要组成部分,Hy ASR 3.0 preview并非一次简单的版本号递增,而是基于最新一代大语言模型Hy3的语言理解能力进行全面重构的新一代语音识别模型。

在产品定位上,Hy ASR 3.0 preview融合了高精度语音识别与深度语义理解能力,旨在解决传统语音识别系统在复杂真实输入场景中“听不清、听不懂、不理解”的三大痛点。模型能够在嘈杂环境、方言口音、中英混说、同音词歧义等复杂条件下,给出准确、连贯且更接近用户真实意图的转写结果。

Hy ASR 3.0 preview核心技术架构

基座模型升级:Hy3大语言模型

Hy ASR 3.0 preview的核心能力升级首先来自基座模型的全面换代。模型将基座从上一代升级至Hy3——腾讯混元于2026年7月6日发布的最新大语言模型。Hy3采用MoE(混合专家)架构,总参数达到2950亿,激活参数为210亿,支持256K超长上下文,并采用Apache 2.0开源协议。

Hy3的“快慢思考融合”机制为Hy ASR 3.0 preview提供了关键的语义理解基础。在处理简单语音指令时,模型可以快速响应;而当遇到存在歧义、需要结合上下文的复杂语音输入时,Hy3则进入深度推理模式——这正是Hy ASR 3.0 preview实现上下文纠错和语义消歧能力的技术根源。

MoE架构:效率与性能的平衡

在模型架构层面,Hy ASR 3.0 preview采用兼顾效率与性能的MoE架构。MoE(Mixture of Experts,混合专家)架构的核心思想是在模型中部署多个“专家”子网络,每次推理时仅激活与当前任务最相关的部分专家,从而在保持大模型参数规模优势的同时控制计算成本。

对于Hy ASR 3.0 preview而言,MoE架构使其能够在2.95亿总参数的规模下,仅激活210亿参数参与每次推理。这一设计确保了模型在语音识别任务中的响应速度,同时为深度语义理解保留了充足的模型容量。

自研无监督语音Encoder

在语音信号处理前端,Hy ASR 3.0 preview搭载了腾讯混元团队自研的无监督语音Encoder。该Encoder通过数千万小时级的无监督语音数据进行训练,能够从各种复杂音频中提取高质量的声学表征。

这一自研Encoder的核心价值在于:传统的语音Encoder通常依赖大量人工标注的语音数据进行监督训练,成本高昂且覆盖场景有限。而Hy ASR 3.0 preview的无监督语音Encoder可以在无需标注的情况下,从海量原始语音中自主学习声学特征的表征方法。训练数据覆盖多种方言、口音和声学环境,使Encoder具备了极强的泛化能力。

语音Encoder与大语言模型的联合训练

Hy ASR 3.0 preview的另一项关键技术突破在于实现了语音Encoder与大语言模型的联合训练。传统的语音识别系统通常将语音Encoder和语言模型作为两个独立模块进行先后训练,这导致两者之间的信息传递存在损耗。

Hy ASR 3.0 preview采用端到端的联合训练策略:在预训练阶段,语音Encoder和Hy3大语言模型同时进行训练,引入数千万小时级、多来源的语音数据。这种联合训练方式使得语音Encoder提取的声学特征能够更好地适配大语言模型的语义理解需求,而大语言模型的语言知识也能够反向指导Encoder优化声学特征提取的方向。

Hy ASR 3.0 preview性能评测数据

开源评测集表现

Hy ASR 3.0 preview在多个开源评测集上进行了全面评估,核心指标为WER(Word Error Rate,词错误率)——即识别结果中错误词数占总词数的比例。数值越低,识别准确率越高。

在开源评测集中,Hy ASR 3.0 preview的多语种WER全部控制在3%左右:

  • 中文普通话:WER为3.34%,评测数据集包括WenetSpeechMeeting、WenetSpeechNet、Fleurs_zh等
  • 英语:WER为2.62%,评测数据集包括Librispeech_clean、Librispeech_other、Fleurs_en、MLS_en等
  • 粤语:WER为3.12%,评测数据集包括Fleurs_yue、CommonVoice_yue等

作为参照,当前行业主流中文语音识别系统的WER普遍在4%至6%区间。Hy ASR 3.0 preview将普通话WER压至3.34%,意味着每100个词中仅错误3个——这一水平已接近人类专业速记员的识别精度。

自建评测集表现

除开源评测集外,Hy ASR 3.0 preview还在腾讯混元团队自建的综合评测集上进行了场景化评估。评测维度覆盖了四大核心场景:

  • 通用识别:普通话、方言及中英混说等日常语音场景的识别准确率
  • 方言识别:覆盖10大方言片区和20余个二级小片区的方言语音识别
  • 上下文Context理解:结合对话语境进行同音词纠错与语义歧义消除的能力
  • 复杂声学场景:高噪环境、耳语、悄悄话等极端声学条件下的稳定转写能力

在上述所有评测维度中,Hy ASR 3.0 preview的WER均保持在较低水平,整体领先竞品。

Hy ASR 3.0 preview四大核心能力升级

通用识别更准确

Hy ASR 3.0 preview在通用语音识别场景下实现了全面升级。模型能够显著提升普通话、各地方言以及中英混说场景下的识别准确率,有效减少错字、漏字及长音频中的错误累积问题。

这一能力的提升得益于三个层面的技术支撑:自研无监督语音Encoder提供的优质声学表征、Hy3大语言模型的强大语言理解能力、以及多阶段强化学习对通用转写准确性的专项优化。

上下文感知与意图理解

Hy ASR 3.0 preview最核心的能力突破在于“理解语境”——模型能够结合上下文Context精准捕捉用户的说话语境,智能纠错同音词,消除语义歧义。

这一能力解决了传统语音识别系统长期存在的痛点。例如,当用户说“把会议改到下周三——不,周四”时,传统系统会一字不差地记录下包括修正过程在内的全部内容;而Hy ASR 3.0 preview能够理解用户的真实意图是“将会议改到周四”,直接输出最终的正确结果。从“逐字转写”到“意图直出”,这是语音识别体验的本质跃升。

专业场景适配与热词注入

Hy ASR 3.0 preview支持热词注入增强功能,能够帮助模型快速识别品牌产品名称、人名及行业术语。这一特性对于企业级应用尤为关键——不同行业拥有各自独特的术语体系,传统语音识别模型在面对这些专业词汇时往往识别率偏低。

通过热词注入,Hy ASR 3.0 preview可以在不重新训练模型的情况下,动态增强对特定词汇的识别权重。这大幅降低了企业将语音识别能力接入业务系统的成本和持续维护的难度。

复杂声学环境稳定性

Hy ASR 3.0 preview针对高噪、耳语、悄悄话等多种复杂声学场景进行了专项优化。在传统语音识别系统中,背景噪声、音量过低或非标准发声方式往往导致识别准确率急剧下降。

Hy ASR 3.0 preview通过数千万小时级多场景语音数据的训练覆盖,以及多阶段强化学习对复杂长尾场景的针对性优化,有效降低了模型在复杂声学环境中的误识别和漏识别问题。

Hy ASR 3.0 preview训练流程与技术细节

预训练阶段:大规模联合训练

Hy ASR 3.0 preview的预训练阶段实现了语音Encoder与大语言模型的联合训练。训练数据规模达到数千万小时级别,覆盖多种方言、口音和声学环境。

这一大规模联合预训练的核心价值在于:语音Encoder在训练过程中不仅学习如何从音频中提取声学特征,还学习如何提取对大语言模型语义理解最有价值的特征。与此同时,大语言模型也在训练过程中学习如何更好地理解和处理语音Encoder输出的声学表征。

监督微调(SFT)阶段

在预训练基础上,Hy ASR 3.0 preview通过多阶段监督微调逐步获得上下文感知、复杂场景适应和方言识别等专项能力。

团队围绕通用识别、上下文理解和复杂场景鲁棒性三大方向,构建了高质量的SFT数据集。数据覆盖了Context上下文场景、专业名词场景、不同声学环境以及多样人群语音。针对方言识别能力,SFT数据体系进一步覆盖了10大方言片区和20余个二级小片区。

多阶段强化学习优化

在后训练环节,Hy ASR 3.0 preview引入了多阶段强化学习。强化学习分别针对三个方向进行优化:

  • 通用转写准确性:提升模型在标准语音场景下的基础识别精度
  • Any-context上下文能力:增强模型在各种上下文语境中的语义理解与纠错能力
  • 复杂长尾场景:降低模型在高噪、耳语等极端声学条件下的误识别和漏识别问题

通过这一多阶段强化学习框架,Hy ASR 3.0 preview能够在保持通用识别高水准的同时,持续优化边缘场景的表现。

Hy ASR 3.0 preview产品化与生态接入

腾讯云API服务

Hy ASR 3.0 preview已正式上线腾讯云官网,对外提供API服务。开发者可以通过腾讯云API将新一代语音识别能力集成到各类应用场景中。

官方披露的典型应用场景包括:

  • 智能客服:实时转写用户语音咨询,结合语义理解提升客服响应效率
  • 内容理解:对音视频内容进行语音转写与语义分析
  • 语音搜索:支持用户通过语音进行信息检索

腾讯元宝首发上线

腾讯旗下AI助手“元宝”深度参与了Hy ASR 3.0 preview的共研工作,并已完成首发上线。用户打开元宝按住说话,即可体验方言识别、上下文智能纠错与复杂环境稳定转写等能力提升。

值得注意的是,元宝中的Hy ASR 3.0 preview语音输入功能目前免费向所有用户开放。这一策略使得普通用户能够在第一时间体验到新一代语音识别技术带来的交互升级。

WorkBuddy等产品陆续接入

除元宝外,WorkBuddy等腾讯旗下产品也在陆续接入Hy ASR 3.0 preview。随着更多产品的接入,Hy ASR 3.0 preview的语义理解式语音识别能力将逐步渗透到办公协作、内容创作、信息检索等多个场景。

Hy ASR 3.0 preview横向对比:与主流语音识别系统的全面比较

为帮助读者更直观地理解Hy ASR 3.0 preview在行业中的技术定位,以下从多个核心维度将其与当前主流语音识别系统进行横向对比。

对比维度 Hy ASR 3.0 preview(腾讯混元) 讯飞语音识别 Whisper Large v3(OpenAI) Qwen-Audio-3.0-ASR-Flash(阿里)
发布时间 2026年8月4日 持续迭代 2023年 2026年7月
中文普通话WER 3.34% 行业主流4%-6% 约4%-5% 待实测验证
英语WER 2.62% 领先水平
粤语WER 3.12% 较高 一般
方言覆盖 10大方言片区、20余个二级小片区 较广 有限 有限
基座模型 Hy3大语言模型(2950亿总参数) 专用ASR模型 专用ASR模型 专用ASR模型
架构特点 MoE架构 + 自研无监督语音Encoder + 联合训练 深度全序列卷积神经网络 Encoder-Decoder Transformer Encoder-Decoder
上下文理解 深度语义理解与上下文感知 有限 有限 专业词汇优化
热词注入 支持 支持 不支持 支持
复杂声学场景 高噪、耳语专项优化 较好 一般 一般
API服务 腾讯云已上线 讯飞开放平台 开源模型 阿里云
首发产品 腾讯元宝(免费开放) 讯飞听见等

从上述对比可以看出,Hy ASR 3.0 preview在中文语音识别精度(WER 3.34%)、方言覆盖广度(10大方言片区+20余个二级小片区)以及上下文语义理解能力等维度均处于行业领先水平。其核心差异化优势在于将大语言模型Hy3的深度语义理解能力融入语音识别流程,实现了从“听清”到“听懂”的能力跃迁。

常见问题(FAQ)

问:Hy ASR 3.0 preview是什么时候发布的?

Hy ASR 3.0 preview于2026年8月4日由腾讯混元正式发布。

问:Hy ASR 3.0 preview的识别准确率如何?

在开源评测集中,Hy ASR 3.0 preview的中文普通话词错误率(WER)为3.34%,英语为2.62%,粤语为3.12%,多语种WER整体控制在3%左右。

问:Hy ASR 3.0 preview和之前的版本有什么区别?

Hy ASR 3.0 preview的核心升级在于将基座模型升级至Hy3大语言模型,实现了语音Encoder与大语言模型的联合训练,并引入了多阶段强化学习优化。模型从“逐字转写”演进为“理解语境、兼容场景、一键直出”。

问:Hy ASR 3.0 preview支持哪些方言?

Hy ASR 3.0 preview的SFT数据体系覆盖10大方言片区和20余个二级小片区,包括粤语、吴语、东北话、四川话、河南话、陕西话、成都话、武汉话、长沙话、合肥话等。

问:Hy ASR 3.0 preview在哪里可以体验?

Hy ASR 3.0 preview已上线腾讯云官网提供API服务。腾讯元宝已完成首发上线,用户打开元宝按住说话即可免费体验。WorkBuddy等产品也在陆续接入中。

问:Hy ASR 3.0 preview的技术架构是怎样的?

Hy ASR 3.0 preview采用MoE架构,基座升级至Hy3大语言模型(2950亿总参数),搭载自研无监督语音Encoder,通过数千万小时级语音数据训练,并实现语音Encoder与大语言模型的联合训练。

问:Hy ASR 3.0 preview能处理嘈杂环境下的语音吗?

可以。Hy ASR 3.0 preview针对高噪、耳语、悄悄话等多种复杂声学场景进行了专项优化。在自建评测集的复杂声学场景评测中,WER保持较低水平。

问:Hy ASR 3.0 preview如何实现同音词纠错?

Hy ASR 3.0 preview基于Hy3大语言模型的语义理解能力,结合上下文Context精准捕捉用户说话语境,智能纠错同音词并消除语义歧义。

问:Hy ASR 3.0 preview支持热词注入吗?

支持。Hy ASR 3.0 preview支持热词注入增强功能,可帮助模型快速识别品牌产品名称、人名及行业术语。

问:Hy ASR 3.0 preview的API服务如何获取?

Hy ASR 3.0 preview已上线腾讯云官网对外提供API服务,开发者可通过腾讯云平台接入。

以上内容不代表本平台立场,仅供读者参考