文章摘要
针对传统语音转写无法灵活修正、现有大模型纠错易引入新错误的痛点,多机构研究团队推出结合自动语音识别引擎与大模型的Agentic ASR,通过拆分三步流程实现交互式纠错。测试显示该系统可大幅降低转写错误率,其设计思路还可推广至其他交互式任务。

很多用户都有过语音转文字出错的困扰,传统的语音转写系统大多采用一次性转写逻辑,生成结果后无法灵活修正,很容易出现细节错误影响使用体验。针对这一痛点,多所高校和科技企业的研究团队开发了一款支持交互式纠错的语音转写系统,名为Agentic ASR,通过结合自动语音识别引擎与大型语言模型,实现了边转写边优化的完整流程。

核心设计思路

以往结合大语言模型的语音纠错方案,大多会让模型直接重写整段转写内容,但这种方式很容易引入新的错误,尤其是当语音内容包含独特专有名词时,比如把“Megan”误识别为“Morgan”后,直接重写反而可能搞错细节。本次研究跳出了这个思路,将纠错流程拆分为三个清晰步骤:先定位转写中的错误片段,再准确理解用户的修正需求,最后精准应用修改,让大模型扮演编辑角色而非完全改写的工具,大幅提升了纠错的准确性。

系统工作流程

Agentic ASR将整个转写过程视为多轮优化的交互过程,用户可以先完成语音口述,之后随时对转写结果进行确认或修正。具体运行逻辑分为三步:首先,基础语音转写引擎会生成初步的转写结果;随后搭载的大语言模型会基于已有的转写内容对该结果进行优化;最后,大模型会对用户的后续输入进行意图分类,主要分为确认当前结果、继续添加新内容、提出修正需求三种类型。

如果用户选择确认或新增内容,转写结果不会发生变化;如果用户提出修正请求,大模型就会执行完整的纠错流程:定位需要编辑的片段、理解具体的修改要求、精准完成内容替换,比如用户说“不对,我想说的是Megan,不是Morgan”,系统就能快速完成对应人名的修正。

测试与验证结果

研究团队通过多语言语音转写基准数据集对这套系统进行了全面评估,由于这类基准数据集本身不包含纠错示例,他们使用大语言模型和文本转语音引擎模拟了用户先口述再修正的交互过程。研究团队还提出了S²ER指标,用于衡量转写结果未能保留说话者真实意图的比例,由大模型基于真实转录文本进行判断。

测试中,团队对比了初始转写(0轮交互)和模拟用户进行10轮交互后的结果,发现多轮交互可以在所有基准数据集上持续降低语义错误,且大部分优化效果都出现在前几轮交互中。

具体来看,在GigaSpeech基准上,S²ER从初始的21.5%下降到10轮交互后的3.5%,同时词错误率也从11.9%小幅改善至10.4%;在AISHELL-NER数据集上,由于该数据集包含大量姓名、日期等专有信息,新方案的S²ER从19.9%大幅降至2.0%,命名实体错误率也从2.4%下降到1.2%;在混合了英语和普通话的ASRU2019数据集上,S²ER从28.6%降至1.4%,混合错误率也从6.6%优化到3.3%。

应用场景与价值

当前很多依赖语音输入的系统更需要准确理解用户的核心意图,而非逐字逐句的完美转写,Agentic ASR在这类场景中表现出色;即使在对逐字准确性要求极高的场景中,这套交互式纠错方案也能自然地提升语音转写的鲁棒性。随着语音输入界面的使用范围不断扩大,这种支持交互式纠错的能力的重要性也在日益提升。

延伸思考

这种将交互任务拆解为定位问题、理解需求、执行修改的三步骤流程,或许可以成为更多交互式任务的通用蓝图,比如文档编辑、代码审查、设计方案迭代等场景,都可以借鉴这种思路来优化交互体验。

以上内容不代表本平台立场,仅供读者参考