Qwen-Audio-3.0-ASR-Flash:语音识别+多语种+实时润色全能升级

近期推出了全新的语音识别大模型Qwen-Audio-3.0-ASR-Flash,这款模型的核心目标是让AI能够更精准地识别各类专业词汇,解决语音识别在行业落地中的关键痛点。本次升级围绕上下文连贯性、专业词汇识别、热词定制三个核心维度进行了系统性优化,同时新增了语音自动润色能力,可直接输出结构化的规范文本。
此前的Qwen-Audio-ASR-Flash系列已经在会议纪要整理、实时字幕、教育录播、智能客服等多个场景得到了广泛验证,曾在全球权威AI评测机构的赛事中以1.7%的错字率拿下全球第一。对于语音识别技术来说,能否准确识别专业词汇,往往是其真正落地行业场景的最后一公里,这也是本次升级重点解决的核心问题。
Qwen-Audio-3.0-ASR系列现已通过专业AI服务平台开放调用,提供三个适配不同需求的版本:
Qwen-Audio-3.0-ASR-Flash:支持最长5分钟的语音识别服务
Qwen-Audio-3.0-ASR-Filetrans:离线文件转写专用版本
Qwen-Audio-3.0-ASR-Streaming:实时语音识别专用版本
上下文不“断片”
在会议、访谈、课程、直播这类长音频场景中,很多专业术语、英文词汇仅靠当下几秒的语音片段很难准确判断——同一个发音可能对应十几个同音词,模型必须记住前文的内容才能在当前片段中准确识别。
Qwen-Audio-3.0-ASR-Flash新增了长上下文识别能力:在转写当前语音时,它能参考近期已经识别出的内容,顺着同一话题的关键词和语义进行识别,有效减少同音词误判,让术语、中英文混说等容易出错的内容识别更精准。哪怕是长达数小时的会议录音,同一位发言人的名字、同一个技术概念,也不会因为跨了多个片段就被遗忘或认错。更便捷的是,这些上下文记忆直接来自音频本身,会随着对话自动更新。
听得准行业词
“记得住上下文”解决了重复出现词汇的识别问题,但还有大量专业词汇在整场对话中仅会出现一次,模型需要在从未预先配置的情况下也能一次识别准确。传统做法通常需要人工维护专业词表,不仅耗时耗力,还很难覆盖所有冷门术语。
Qwen-Audio-3.0-ASR-Flash将多行业的专业词汇内化为模型自身的识别能力,无需逐一配置也能持续准确识别。研发团队持续从医疗、IT编程、金融、社会名人等领域挖掘专业词汇,构建了覆盖多行业的高质量词库,在最新的内部行业词汇评测中,新模型对各行业专业词的识别准确率有了明显提升,其中医疗场景的识别准确率突破了95.36%。
热词加多也不乱
通用行业词库覆盖的是通用场景,但每家企业还有自己的专属专有名词。让模型识别企业专属热词是语音识别落地企业场景的刚需,传统的热词配置方案长期存在两难问题:添加的热词越多,越容易出现误触发,反而影响整体识别准确率。
Qwen-Audio-3.0-ASR-Flash升级了分级热词定制机制,企业可以根据自身需求随时配置专属热词。实测数据显示,配置热词后的识别“听中率”在所有测试集都达到90%以上,多数场景更是突破99%,不会出现“提了这项、掉了那项”的问题。用户可以随时将最新的品牌名、人名、专属术语配置为热词,实时融入识别过程中,无需等待模型更新就能精准命中业务中的每一个关键词。
边识别边润色
Qwen-Audio-3.0-ASR-Flash在识别环节直接集成了语音润色能力,可以输出去除口语化口头禅、条理清晰的规范书面文本,无需再调用下游的文本大模型进行二次处理。
模型会自动删除口语中的“那个”“嗯”这类无意义语气词,修正说话时的自我纠正内容,比如将“我们下周三评审,不对,是周四”简化为“我们下周四评审”,还会整理结结巴巴的重复、零散的口述内容,将其转化为简洁的书面表达。
在实测中,经过该模型润色后的文本可读性和忠实度,与“先识别再用专业文本大模型润色”的两步方案基本持平:所有测试子集的可读性平均分从未经润色的2.55提升到3.43,优秀可读率从30.75%提升到59.27%。
去除无意义语气词
润色前:那同时因为其实您日常我们再去用一些AI的AI的一个产品和模型的话,我们其实大部分都是在用一些像这种DeepSeek或者是千问,或者是这个Kimi这样的一个通用模型。
润色后:同时,因为日常使用AI产品和模型时,我们大部分都在用DeepSeek、千问或Kimi这类通用模型。
清理口吃与重复
润色前:那也是通过,比如说把相关的一些,就是就电动车的一些,就是它的一些产品手册啊,还有像是一些问题集啊,然后产品说明啊这种投喂进去之后,那用户他有车需求的,车辆可以行驶到喇叭不响就可以去定位,比如说喇叭啊喇叭不响会有什么问题,然后他文档里面可能给到的一些参考图片。
润色后:那也是通过把电动车的产品手册、问题集和产品说明等投喂进去。用户有车辆需求时,比如车辆可以行驶但喇叭不响,就可以去定位“喇叭不响会有什么问题”。文档里可能给到的一些参考图片。
处理自我纠正
润色前:这个这个,搜一下那个遇果香源的红富士苹果,啊不是,是烟台栖霞红富士,对,要3斤装的,还带“脆”字的那个。
润色后:搜一下烟台栖霞红富士,要3斤装、带“脆”字的那个。
语义重组
润色前:对比我们的奔驰C级的汽车和宝马的,宝,奔驰C级和宝马三系。那我们再结合我们前期已经了解到的客户画像,她是一位女性啊,夫妻两个人的每天工作的场景就是上下班的代步。那在这种场景下还有客户可能比较关注性价比啊,关注它的可靠性啊。会就会有这个销售话术的引导会给出来。
润色后:对比奔驰C级和宝马3系,结合前期了解到的客户画像:她是一位女性,夫妻两人每天的工作场景就是上下班代步。在这种场景下,客户可能比较关注性价比和可靠性,销售话术的引导会随之给出。
一套模型覆盖多语种
如今越来越多企业开展海外业务,语音识别需要面对的不再仅仅是中文和英文:跨境客服需要回应不同国家和地区的咨询,国际会议中经常会混合多种语言,海外的音视频内容也在持续增长。相较于资料丰富的主流语言,小语种普遍存在训练素材少、口音差异大、口语表达更随意的问题,往往是最容易识别错误的环节。
Qwen-Audio-3.0-ASR-Flash将多语种识别能力集成在同一套模型中,支持中文、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语、英语、法语、德语、西班牙语、葡萄牙语、俄语等多种语言的识别,无需针对不同市场频繁切换模型。
使用时只需要告知模型本次场景涉及的语言种类,就可以自动开启多语言混合识别模式,以中文、英文、日语为主语言,自由搭配其他小语种,轻松应对“中文+英文+日语”“英文+印尼语”这类跨国会议、多语客服的场景。在七个语种的实测中,该模型的平均语义错误率仅为17.09%,优于多款主流同类产品以及上一代模型。
低延迟场景也听得准
Qwen-Audio-3.0-ASR-Streaming版本面向客服通话、会议实时转写、直播字幕这类对速度要求极高的场景,在保证几乎不卡顿的实时出字的同时,进一步提升了复杂工业场景下的识别准确率。
该版本的理论出字延迟仅为300毫秒,中文工业场景的平均错字率仅为7.8%,明显领先同类产品;英文工业场景的平均错字率为11.52%,同样优于其他主流模型。
从上下文记忆、专业词汇识别、热词定制到语音自动润色,Qwen-Audio-3.0-ASR-Flash的目标是在复杂对话场景中持续准确识别,在专业领域精准命中关键词,最终输出规范清晰的文本内容。目前该系列模型已通过专业AI服务平台开放调用,期待在会议整理、教育服务、智能客服、出海业务等真实场景中得到广泛应用。

