Meta推出顶尖实时语音转写模型 支持多说话人长音频

当下,语音转写技术正从单一的转录工具,进化为AI系统不可或缺的实时感知核心层。近期,一款全新的实时音频感知模型正式发布,为多场景下的语音交互带来了全新的可能性。
这款由研发团队推出的Muse Voice Transcribe模型,具备多项突破性能力。它支持实时流式自动语音识别,能够同时处理超过20位说话人的语音分割,还自带端点控制功能;不仅覆盖多语言场景,可处理时长超1小时的长音频,还能实现无缝的语码切换,同时通过语言偏好、关键词识别和上下文理解进一步提升识别准确率。
根据公开测试数据,截至2026年9月1日,该模型在Artificial Analysis流式语音转文本和公开语音分割基准测试中排名第一。无论是标准中文、带口音的中式英语,还是中英文混合表达,其转写速度和识别效果都表现出色。
目前,用户可以通过Meta Model API、Mac版Meta AI以及Muse Code来使用这款模型。其API定价为每1000分钟3美元,换算下来每小时使用成本约为0.18美元。
适配复杂真实场景的转录能力
Muse Voice Transcribe基于70多种语言的数据训练而成,其中25种语言完成了全面验证,初始版本中官方推荐优先使用这25种语言,同时也兼容更多其他语言。在语言切换方面,模型原生支持任意形式的语码转换,无论是句子内部还是句子之间的语言切换,都能借助上下文信息优化识别准确率,轻松应对混合语言的交流场景。
这款模型原生支持时长超1小时的长音频输入,同时可同时处理超过20位说话人的语音,无需额外的后处理步骤即可完成语音分割。用户只需点击一下,就能在Meta AI和Muse Code中启用该模型的语音听写功能,它还能与任意应用程序配合使用,配合Meta AI或是屏幕上的其他窗口完成各类任务,操作方式仅需按住“Fn”键即可尝试。
基于流式ASR的动态延迟优化
Muse Voice Transcribe属于Muse Spark系列的自回归多模态模型。音频数据以80毫秒为一个处理单元,也就是12.5Hz的采样频率,每个音频片段会被转换为软token。针对每个音频片段,模型会自主判断是继续监听下一段音频,还是输出对应的文本token。
当模型选择继续监听时,会预测一个<|next_audio|>特殊token,用于替换后续输入的实际音频片段;当音频流停止时,系统会插入<|empty_audio|>特殊token,告知模型没有后续音频输入,此时模型会直接输出所有剩余的文本token,不再生成额外的监听token。
由于模型可以自主控制监听时机,因此它会在转写单词前决定需要收集多少音频上下文信息,也就是所谓的“延迟”。准确率和延迟之间存在天然的权衡:模型等待预测的时间越长,转写结果的准确率越高,但对应的延迟也会增加。
Muse Voice Transcribe搭载了自适应延迟功能,可以根据每个单词的识别难度动态调整延迟时长,这一功能通过强化学习实现,将词错误率奖励和延迟奖励以乘法方式结合,最终在转写速度和准确性的权衡上实现了最优的帕累托前沿表现。
基于ASR的语音分区与端点控制
依托流式ASR技术,该模型可以通过引入额外的特殊token轻松支持其他音频感知任务。为了实现说话人分割,模型引入了<|start_of_turn|>token来标记潜在的说话人切换,同时使用<|speaker_{A-Z}|>标签来区分不同的说话人。当出现说话人切换时,<|start_of_turn|>会被立即预测,而说话人标签的预测则会延迟到当前音频块的末尾。来自同一说话人的音频可以通过该标记切分为多个片段,且这些片段的说话人标签保持一致。
<|start_of_turn|>Hello, how are you doing?<|speaker_A|><|start_of_turn|> Did anything fun over the weekend?<|speaker_A|><|start_of_turn|> Hey I'm good!<|speaker_B|>
(为简化演示,示例中省略了<|next_audio|>token)
针对语音端点检测,模型引入了<|speech_onset|>token来标记语音的开始,同时使用<|speech_endpoint|>token来标记说话结束。对应的token序列示例为:<|speech_onset|>Hey Meta, what's the weather in Menlo Park?<|speech_endpoint|> [silence] <|speech_onset|>What should I wear today?<|speech_endpoint|>(同样省略了<|next_audio|>token)。
<|speech_onset|>Hey Meta, what's the weather in Menlo Park?<|speech_endpoint|> [silence] <|speech_onset|>What should I wear today?<|speech_endpoint|>
官方通过流式ASR同时训练这两项任务,并在ASR奖励信号的基础上,分别为说话人分离和语音端点检测任务增加了额外的奖励机制。
行业展望:语音识别进化为持续在线的“实时耳朵”
在真实的交流场景中,人们的对话往往非常复杂:多语言交杂、有人不时插话、多人声音重叠,甚至可能持续数十分钟甚至数小时。Muse Voice Transcribe本次展示的能力,正是针对这些真实场景的痛点进行了针对性优化。
语音转写技术正在从独立的“语音转文字”工具,逐步演变为AI系统的实时感知层。下一阶段的行业竞争,将会同时聚焦于低延迟、长上下文处理、多说话人支持、多语言适配以及语境理解能力,并最终与大模型的推理、记忆和工具调用能力深度融合。届时,“听见”只是系统的入口,后续还需要准确识别说话人身份、判断说话结束时机、理解语句与上下文的关联,最终完成对应的任务。

