VoxMem基准:音频大模型语音记忆准确率不足四成

在家庭语音助手、多用户共享的智能助理这类长期对话场景中,模型需要跨越多次会话记住用户的个性化信息,但当前的评测体系存在两大核心短板。
其一,语音中的关键信息不止于文字内容:说话人身份、语气语调、背景环境声都只存在于原始音频信号中,经过语音转写后就会完全丢失,而现有主流评测基准大多仅考察词汇语义层面的内容;其二,真实的语音交互分布在相隔数天甚至数周的多轮会话中,但现有评测往往局限于单段录音或连续对话,且不同历史长度下使用不同题目,无法单独分离出历史长度本身对模型记忆的影响。
为突破这两道关卡,来自墨尔本大学与新南威尔士大学的联合研究团队推出了多会话语音记忆基准VoxMem。这套基准采用「声学证据×记忆操作」的二维分类法覆盖15种考察组合,并且让每一道评测题在8K到64K token的历史长度下保持完全一致。VoxMem总共包含3196个评测实例、34743个语音会话,总时长约177小时。针对15款音频大模型的实测结果显示,在32K上下文长度下,没有任何一款模型的整体准确率超过40%,追踪语气变化和背景声变化的平均准确率仅为3.4%与1.2%。
论文链接:https://arxiv.org/abs/2609.32607
代码链接:https://github.com/swagshaw/voxmem
我们可以用一个日常场景理解这类声学信息的价值:当你向家庭语音助手询问「我之前说的灯具更换那件事后来怎么样了」,助手首先需要分辨提问者的身份——几天前另一位家庭成员也聊过同样的话题,当时对方说的是「已经批准」,而你当时给出的回复是「先暂停」。这一步仅凭文字记录是无法完成的。
会议纪要可以记下每个人说了什么,但无法记录说话时的犹豫、惊讶,也无法捕捉窗外的施工声或是厨房的家电噪音。语音转写同样存在这个问题:当一句话被转换成文字后,说话人是谁、用什么语气表达、背景中能听到什么环境音,这些关键信息都会随之消失,而它们恰恰可能是后续提问的核心答案。比如「上次聊入住的时候我听起来是不是有点不情愿?」「那两次聊喂猫计划的对话,背景里是不是同一台洗衣机的声音?」这类问题,在纯文字记录中根本找不到答案。
如今的音频大模型上下文窗口不断拉长,单次可以容纳数十分钟的音频内容,直觉上似乎只要把所有历史对话都塞进去,模型就能记住一切。但能容纳历史内容,和能在需要时准确取回并正确使用其中的信息,完全是两回事。
要准确衡量模型的语音记忆能力,首先需要一套合适的评测标尺。研究团队梳理了现有的长音频理解基准和语音对话基准后发现,现有体系在三个核心维度上都存在明显缺陷:第一,大多仅考察「说了什么」,仅零星涉及少量声学线索,很少系统地考察说话人身份、表达语气和背景环境音;第二,记忆操作的考察没有统一框架,有的仅考察信息检索,有的仅考察内容整合,当模型答错时,无法判断问题出在信息类型、记忆操作还是两者的组合;第三,所有评测都基于单段长录音或连续对话,而真实交互是跨多会话的,同一个人反复出现、话题不断切换,早期的计划还会被后续内容更新;此外,分析历史长度影响的评测往往在不同长度档使用不同题目,就像用两套不同的试卷比较成绩,无法确定分数下降是因为内容变多还是题目变难。
VoxMem的第一步是为语音记忆构建了一套完整的分类体系,通过两个维度刻画每一道评测题。
第一个维度是声学证据,即需要从历史语音中记住的信息类型,分为四类:
- 语音语义:即对话的字面内容,比如计划安排、具体数量、个人偏好,这类信息可以通过文字转写恢复,作为评测的参照组;
- 说话人身份:即发言者是谁,需要将具体内容与对应的声音特征绑定;
- 副语言线索:即表达的语气和方式,比如犹豫、惊讶、强调、语速变化或是笑声;
- 环境声:即说话时的背景噪音,比如交通声、警报声或是家电运行声。
第二个维度是记忆操作,即模型需要如何使用记忆中的信息,同样分为四类:
- 信息抽取(IE):从某一次过去的会话中直接取回所需信息;
- 多会话推理(MSR):结合多次会话的证据进行整合,比如计数、匹配或是对比不同会话的内容;
- 时序演变追踪(TET):跟踪某个状态随会话的变化过程,比如最近一次提及某件事时的语气;
- 拒答(AR):当历史信息不足以给出唯一答案时,能够正确判断并回复「无法确定」。
两个维度交叉后可以得到一张4×4的考点矩阵,其中「语义×信息抽取」的组合被刻意移除——如果检索线索和答案都来自文字,题目就退化成了纯文本检索,无法体现音频与内容的关联。最终剩下的15个交叉组合,构成了VoxMem的全部评测考点。
在具体的题目设计上,研究团队做了多重细节优化,确保评测题必须依赖音频信息才能作答,并且分数变化可以被准确归因。
首先是干扰会话的设置:每一段对话历史由三类会话组成,包含正确答案的证据会话、话题相近但不提供答案或提供不同取值的干扰会话,以及与问题无关的日常填充会话。这相当于升级版的「大海捞针」:「针」不再是一句话,而是声音特征、语气或是背景音,同时还加入了大量高度相似的「假针」。研究团队测试过干扰会话的难度,仅依赖文本的分类器区分证据会话和干扰会话的准确率仅为51%–56%,与随机打乱标签时的47%–49%相差无几。
其次是配对版本的设计:用户语音通过TTS合成,每位用户在所有会话中使用固定音色,语气通过风格控制调整,环境声按照固定信噪比混入。每个带有声学线索的对话轮次,都会同时保留一个「配对版本」:文字内容和音色完全相同,仅移除对应的声学线索。这相当于为每条声学线索准备了一组对照实验,可以在质检阶段确认答案确实由声学线索决定,而非文字内容。
最后是固定题目,仅调整历史长度:每一道评测题都会被放入8K、16K、32K、64K四种不同长度的历史上下文,对应的音频时长大约从2.5分钟到20分钟。长历史会严格包含短历史的全部会话,仅额外增加干扰和填充会话。问题、答案和核心证据在四个长度下完全一致,分数的变化只能归因于历史长度的增加。证据会话和干扰会话在历史中均匀分布,位置和时间戳都不会泄露答案的位置。
为了确认VoxMem的「音频原生」属性,研究团队还做了一项直接验证:将每个用户轮次替换为精确的文字转写,其余设置不变,再让模型作答。结果显示,音频原生题的准确率从46.2%骤降到4.4%,而语义类题目仅从75.9%降到71.0%。这说明即使提供完美的转写文本,这类音频原生题也几乎无法作答,证明评测确实依赖原始音频信息。每道题还经过两级质量控制:会话级检查转写准确性、说话人一致性和线索可识别性,题目级检查答案唯一性、所需记忆操作和音频信息的必要性,以及是否存在答案泄露。最终VoxMem包含799道核心题目,覆盖20类日常对话话题。
研究团队评测了15款音频大模型,其中5款为闭源模型(3款Gemini、2款Qwen),10款为开源模型,覆盖音频专用架构和全模态架构两类。所有模型使用完全相同的输入和指令,回答由LLM裁判按照答案类型判分,换用另一款模型复判的一致性κ值达到0.95,保证了评测的可靠性。
第一个核心结论非常直观:在32K上下文长度下,没有任何一款模型的整体准确率超过40%。排名第一的Qwen3.8-Omni-Flash准确率为38.5%,闭源模型平均准确率为33.0%,开源模型平均准确率为21.9%,低分现象并非集中在少数模型,而是普遍存在于所有参评模型中。
按照证据类型拆分评测结果,可以看到更明显的差距:在32K长度下,闭源模型在语义类题目上的平均准确率为55.6%,而在说话人身份、副语言线索和环境声类题目上的准确率分别仅为32.7%、20.0%和21.9%;开源模型的对应数据分别为31.6%、26.7%、14.5%和15.5%。这说明模型在「说了什么」上的优异成绩,掩盖了它们在声学信息处理上的大量失败。
不同记忆操作的评测结果也呈现出鲜明的结构差异。一个反直觉的发现是,跨多会话推理并不一定比从单次会话中抽取信息更难:多会话推理在语义和说话人身份类题目上的准确率分别达到41.8%和43.1%,在副语言和环境声类题目上也有26.7%和25.2%的准确率,明显高于对应的单次信息抽取任务(8.8%和13.5%)。
反差最大的是时序演变追踪任务:如果状态变化是通过语言明确表达的,比如「入住时间改到周二了」,15款模型的平均准确率可以达到44.5%;但如果变化仅体现在声音特征上,比如语气变化或是背景声更换,准确率几乎归零——语气变化的平均准确率仅为3.4%,背景声变化仅为1.2%。研究团队认为,问题不在于模型不会做时间推理,而在于它们很难维护和更新由语气或环境声承载的「状态」,这反映出当前音频大模型在状态建模上的明显不足。
VoxMem还专门设计了「证据不足、应当拒答」的评测题,这类题目由可答题派生而来,比如删除关键的证据会话,或是保留文字内容但移除能锁定答案的声学线索。有意思的是,模型在副语言和环境声类题目上的拒答准确率(34.3%和34.2%),反而高于语义和说话人类题目(19.9%和16.2%),这与可答题的规律恰好相反。研究团队解释,这并非说明模型在声学问题上更「谨慎」,而是因为即使证据就在历史中,模型也难以识别和使用声学信息,所以只能随机选择拒答。
由于每道题的核心内容和证据完全固定,VoxMem可以干净地观察「历史长度增加」这一单一因素的影响。从8K到32K上下文长度,闭源模型的平均准确率从40.1%降到33.0%,开源模型从26.6%降到21.9%。在能够处理完整64K上下文的10款模型上,四类证据的准确率都呈现持续下降的趋势。到64K长度时,模型在语义类题目上保留了8K时70.3%的准确率,副语言类为69.8%,说话人身份类为66.5%,环境声类仅为63.2%。值得注意的是,副语言类题目的绝对准确率最低,但衰减速度与语义类大致相当;而说话人身份和环境声类题目的衰减速度更快。这说明「基线准确率低」和「对长度敏感」是两种不同的失败模式:模型在任何长度下都很难处理语气信息,而说话人身份和环境声的记忆,则会随着历史长度的增加被逐渐侵蚀。
研究团队还对64K长度下的错误回答做了分类分析,按照记忆查询失败的先后顺序,将错误分为四类:没找到证据(识别或定位失败)、找到了但挂错了人或会话(绑定错误)、找到并绑定正确但操作执行错误、给出历史中不存在的无依据答案。结果显示,三类声学信息的「病因」各不相同:说话人类题目有48%的错误属于绑定错误,即内容记对了但挂错了说话人或是会话;副语言类题目有63%的错误属于定位失败,即所需的语气线索根本没有被模型找回;环境声类题目的错误则分布在定位失败(41%)和无依据答案(39%)之间。从记忆操作来看,时序追踪任务有55%的错误属于定位失败,操作执行错误仅占5%。在全部可归因的错误中,「证据找到且绑定正确,仅操作出错」的情况仅占8.4%。这意味着,当前音频大模型在语音记忆上的瓶颈,大多不在「推理」,而在「听进去并记住」的环节。
过去几年,音频大模型的进步有目共睹:能够听懂指令、流畅对话,也能处理越来越长的音频内容。但当语音助手从一问一答的单次交互,走向长期陪伴的多会话场景,它面对的不再是一段孤立的录音,而是跨越数天乃至数周的交互历史。
VoxMem的评测结果表明,仅仅拉长上下文窗口,并不足以带来真正的长期记忆能力。模型对「说了什么」的记忆远好于对「谁说的、怎么说的、听到了什么」的记忆;只有当变化通过语言明确表达时,模型才能较可靠地追踪;历史越长,已有的记忆证据越难被准确取回。
研究团队指出,未来的智能语音系统需要能够保留文字之外的声学信息,并在时间维度上维护这些信息与说话人、事件和会话之间的关联。VoxMem希望为衡量和推动这一方向的进展,提供一套系统化的评测基础。

