阿里新语音大模型发布:专业词听中率95%+热词定制与多语言识别

阿里千问大模型团队近日推出全新语音识别大模型Qwen-Audio-3.0-ASR-Flash,这款模型从上下文一致性、行业专业词识别、热词定制化三个核心维度完成升级,同时优化了语音润色与多语言识别能力,能够为用户输出更精准、流畅的结构化转写文本。
根据官方披露的数据,该模型在医疗场景的专业词“听中率”达到95.36%,工业、IT编程、畜牧业等垂直场景的识别准确率同样超过90%;在热词识别测试中,全测试集的“听中率”均达到90%以上,多数场景下突破99%。此前的Qwen-Audio-ASR-Flash系列模型,曾在全球权威AI评测机构以1.7%的错字率拿下全球第一。
三大核心优化,破解专业场景识别难题
针对长音频转写的连贯性问题,Qwen-Audio-3.0-ASR-Flash新增了长音频Context能力,在识别当前语音片段时,可以参考前文已经完成的转写内容,保持跨片段的语义连贯,避免出现遗漏或认错的情况。对于长音频中的专业术语、中英文混合词汇,模型可以通过上下文理解提升识别准确性,减少同音词误判,而且模型的“记忆”直接来自当前音频内容,会随着对话自动更新。
在专业词汇识别方面,模型内置了覆盖多行业的高质量词库,涵盖医疗、IT编程、金融、社会名人等领域的专业术语,无需人工配置词表就能准确识别冷门或单次出现的专业词汇。官方内部评测显示,新模型对各行业专业词的“听中率”有明显提升,医疗场景的指标突破95.36%。
针对企业专属词汇的识别需求,模型支持分级热词机制,企业可以按需配置专属词汇且不会出现误触发的问题。在接入热词的测试中,该模型的热词“听中率”在所有测试集都达到90%以上,多数场景突破99%,解决了传统热词扩容导致通用识别精度下降的痛点。
自动优化转写文本,输出流畅书面内容
日常口语中常伴随口头禅、重复表述或自我纠正的内容,Qwen-Audio-3.0-ASR-Flash可以在识别过程中直接去除这些冗余内容,生成条理清晰的书面文本。官方评测数据显示,该模型去口头禅、清理重复后的可读性和忠实度,和“先识别+再用Qwen3.6-Plus润色”的两步走方案基本持平,所有子集的可读性平均分从2.55提升到3.43,优秀可读率从30.75%提升至59.27%。
去除无意义语气词:润色前为“那同时因为其实您日常我们再去用一些AI的AI的一个产品和模型的话,我们其实大部分都是在用一些像这种DeepSeek或者是千问,或者是这个Kimi这样的一个通用模型。”,润色后为“同时,因为日常使用AI产品和模型时,我们大部分都在用DeepSeek、千问或Kimi这类通用模型。”
清理口吃与重复:润色前为“那也是通过,比如说把相关的一些,就是就电动车的一些,就是它的一些产品手册啊,还有像是一些问题集啊,然后产品说明啊这种投喂进去之后,那用户他有车需求的,车辆可以行驶到喇叭不响就可以去定位,比如说喇叭啊喇叭不响会有什么问题,然后他文档里面可能给到的一些参考图片。”,润色后为“那也是通过把电动车的产品手册、问题集和产品说明等投喂进去。用户有车辆需求时,比如车辆可以行驶但喇叭不响,就可以去定位‘喇叭不响会有什么问题’。文档里可能给到的一些参考图片。”
处理自我纠正:润色前为“这个这个,搜一下那个遇果香源的红富士苹果,啊不是,是烟台栖霞红富士,对,要3斤装的,还带‘脆’字的那个。”,润色后为“搜一下烟台栖霞红富士,要3斤装、带‘脆’字的那个。”
支持多语言混合识别,适配全球化场景
Qwen-Audio-3.0-ASR-Flash支持中文、日语、韩语、印地语、阿拉伯语等30种语言,用户仅需提前告知模型会议涉及的语言类型,即可自动开启多语言混合识别模式。官方评测数据显示,在七个语种的测试中,该模型的平均语义错误率为17.09%,优于多款同类竞品以及上一代模型。
在识别准确率方面,该模型在保持理论出字延迟300毫秒的同时,大幅提升了复杂工业场景下的识别表现:中文工业场景的平均错字率仅7.8%,英文工业场景的平均错字率为11.52%。
目前,Qwen-Audio-3.0-ASR系列已通过国内主流AI服务平台开放调用,提供三个不同的版本以适配不同的使用场景:最长5分钟的语音识别版本、离线文件转写版本以及实时语音识别版本。
长期以来,语音识别行业的竞争多集中在标准普通话的基础错字率比拼,但真实商业化落地的核心瓶颈始终是专业场景的适配难题:医疗术语、编程变量、工业设备型号、金融标的等小众词汇极易出现同音混淆,企业需要投入大量人力维护专属词表,而热词扩容又会反向拉低通用识别精度。
Qwen-Audio-3.0-ASR-Flash的升级,证明新一代语音识别模型正在从通用工具向真正的生产力工具转型。当前国内AI语音识别的市场集中度持续走高,主流玩家的竞争赛道已经从单纯的准确率比拼,转向垂直行业的落地效率优化。

