文章摘要
当前实时语音AI存在无法建立持续用户认知、交互体验割裂的痛点,VoiceMem是针对该问题推出的语音AI记忆技术方案。它采用流式双脑架构分类存储事实与人格情感记忆,将记忆检索前移至用户说话及VAD等待时段,测试显示其仅需134毫秒即可完成检索,准确率、Token效率优于多数主流记忆系统,支持多模态音频记忆,目前已开源,填补了语音智能体的长期记忆缺口。

现在的实时语音交互已经越来越流畅,能够听懂用户的每一句话,但却始终存在一个尴尬的短板:它可以理解当下的对话内容,却无法记住用户是谁,无法建立持续的用户认知。很多语音助手在第二次对话时,依然会像第一次见面一样询问用户的基本信息,这种割裂的体验让智能交互始终停留在单次体验层面,无法形成长期的陪伴感。

这类痛点正是VoiceMem想要解决的核心问题。这款技术方案将记忆检索的流程前移到用户说话和语音停顿等待的时段,让实时语音交互不必在对话中途停下来“回忆”历史信息,真正实现了持续认识用户的能力。根据项目公开的测试数据,它可以在134毫秒内完成记忆检索,Top-5检索准确率超过Mem0的Top-200表现,不仅填补了语音智能体的长期记忆缺口,还重新定义了实时语音场景下的记忆交互逻辑。

在进入实时语音场景之前,传统的记忆系统思路相对简单:将历史对话转化为标准化的记忆条目,在新的用户提问到来时进行相似度检索,再将相关内容放回大模型的上下文窗口中完成回复。但这套成熟的文本记忆方案,在实时语音场景下会遇到三个难以绕开的核心难题。

第一个是架构层面的问题:现实中的“记住一个人”,绝不仅仅是记录姓名、工作和过往经历这类事实信息,还需要理解用户对特定对象的态度、特定场景下的情绪变化,以及经过多轮交互后逐渐显现的性格偏好和行为习惯。如果将事实和情感信息全部塞进同一个记忆库,系统很容易将单次临时的情绪反应误判为稳定的人格特征,也可能记住“用户当时不开心”,却无法关联到引发情绪的具体事件和对象。

第二个是延迟问题:根据公开的研究数据,传统记忆流水线的检索和处理流程通常需要2到3秒的时间,但实时语音交互为了保持自然的对话轮次衔接,通常只能容忍100到200毫秒的额外延迟。与此同时,常见的语音活动检测(VAD)模块会在检测到静音后等待约500毫秒,再确认用户是否已经结束当前话轮。这意味着VoiceMem需要解决的核心问题,不是能不能存储记忆,而是如何在极短的时间窗口内完成高效的记忆检索,并且将大部分检索工作前移到用户说话和VAD等待的时段中完成。

第三个是上下文成本问题:文本类的智能代理可以一次取回Top-100甚至更多的记忆条目,但语音模型的上下文窗口容量更加有限。如果检索返回的内容过多,不仅会增加Token消耗,还可能让真正重要的核心信息被大量无关的记忆内容淹没,反而降低回复的准确性和相关性。

针对这些痛点,VoiceMem提出了一套“流式双脑”的整体架构,将记忆管理拆分为两个独立又相互关联的模块。左脑负责处理事实类信息,右脑则专注于理解用户的人格特征、情感倾向和人际关系。两套记忆系统分别维护,同时通过跨脑关联机制实现联合检索,让智能体既能清晰记录发生过的事件,又能理解这些事件对用户的具体意义。

VoiceMem的左脑通过Schema和Entity两级结构来组织事实记忆。Schema可以理解为较大的语义主题分类,比如工作、健康、人际关系和日常生活等;Entity则对应具体的个人、事件或概念。底层的记忆存储依然可以复用成熟的记忆引擎,左脑的核心作用是负责上层的记忆组织、路由和候选空间压缩。当用户提出问题时,系统会先判断当前问题与哪些Schema和Entity相关,再沿着一跳关系找到邻近的关联实体,最后只在缩小后的候选集合中进行精准检索。这种设计让VoiceMem提升准确率的方式不是“检索更多内容”,而是让进入Top-5候选的每一条记忆都具备更高的相关性。

此外,左脑还加入了“聚类涌现”机制,系统不会永远依赖预设的分类框架,而是会持续观察哪些实体经常被共同检索,当一组实体长期稳定地同时出现时,系统会自动判断是否需要形成新的记忆主题。在公开的测试案例中,两个主题并非人工预设,而是从长期使用过程中自然形成的,覆盖了近五成的存储内容,说明这套机制可以随着用户的交互习惯动态调整记忆结构。

右脑则负责维护两类人格相关的记忆节点。第一类是独立节点,用于记录用户相对稳定的性格特征、行为习惯和长期情感倾向;第二类是跨实体节点,用于记录用户对特定个人、事件或概念的具体态度和即时情绪。这种区分非常关键:“用户容易焦虑”是一种长期的性格倾向,而“用户因为这次面试感到焦虑”则是带有明确对象和原因的即时情绪。如果将这两类信息混在一起存储,语音智能体很容易将单次的临时反应当成永久的人格特征;如果只保留简单的情绪标签,又会丢失情绪背后的现实原因。

为此,VoiceMem使用了长短期两种情感归因逻辑:短期归因专注于当前对话中的情绪状态和对应的触发对象,而长期归因则会在多轮、多次会话后寻找反复出现的行为模式,将稳定出现的证据沉淀为长期的人格记忆。这样的设计让左脑负责回答“发生了什么”,而右脑则帮助模型理解“这件事与用户有什么具体关系”。

双脑架构解决了“记忆什么内容”的问题,但实时语音系统还需要解决“什么时候完成检索”的时间窗口问题。VoiceMem并没有等到用户完全说完话之后才启动记忆检索,而是从用户开始说话的瞬间就同步启动准备流程。

根据研究划分,用户停顿后的检索窗口可以进一步分为三个阶段:首先是语音尾部阶段(0-200毫秒),系统在检测到静音后不会立刻判定话轮结束,而是继续等待,并持续更新流式语音转写结果、实体与Schema匹配结果、说话人识别和情绪分析等信息;其次是预判阶段(200-400毫秒),当静音时长达到约200毫秒后,系统会预判用户的回复即将开始,提前计算查询向量,并扩展左右脑的上层候选关联图;最后是检索阶段(400-500毫秒),系统完成左右脑底层的记忆检索和结果合并,进一步进行Top-K排序和上下文构建,为模型生成回复准备好相关的记忆信息。

在正式的编号阶段之前,系统其实已经处于持续的“聆听”状态:只要用户还在说话,流式语音识别和记忆信息提取就会同步进行。公开测试数据显示,VoiceMem的双脑密集检索耗时仅为134毫秒,刚好可以落在常见VAD模块保留的静音等待窗口内。这里需要特别说明的是,VoiceMem并没有取消或替换VAD模块,而是将接口设计得像一个持续处理音频的VAD系统,充分利用了VAD原本就要等待的静音时段来完成记忆检索,因此所谓的“几乎没有额外延迟”,准确含义是检索过程被隐藏在原有语音轮次的等待时段中,而非整个语音智能体从输入到输出只需要134毫秒。端到端的实际体验仍然会受到语音识别、回复模型、语音合成和硬件环境等多种因素的影响。

除了文本和结构化记忆之外,VoiceMem还将记忆范围从纯文本扩展到了音频维度。当开启多模态记忆功能后,系统可以选择性地保留说话人的声纹特征、声音嵌入向量或原始音频片段,并将这些音频信息与对应的实体进行关联。这种设计让语音智能体可以处理一些纯文本记忆系统无法回答的问题,比如:用户今天说“我没事”,但声音状态是否与平时难过时相似;用户对公开批评和私下沟通分别有什么情绪反应;用户一周前提到的重要面试,今天是否已经结束;用户昨天在咖啡馆听到的是哪一段音乐;一段对话中究竟是哪位家庭成员说了某句话。这些能力的核心不是简单增加一个音频输入模块,而是让声音特征、人物信息、事件记录、情绪状态和长期历史能够被整合进同一个关联记忆结构中。

研究团队在信息记忆、人格记忆和长时语音记忆三类任务上对VoiceMem进行了全面评测,对照的记忆系统共有10个,包括Full-Context基线,以及9套主流记忆系统。在实验设置中,对照系统统一使用GPT-4o-mini作为回复模型、text-embedding-3-small作为嵌入模型,温度参数设置为0。VoiceMem测试了六种不同的检索预算,并将K=5作为默认运行点,除了微调模型结果外,其他结果均使用GPT-4o-mini生成回复。

在K=5的默认设置下,VoiceMem在LoCoMo评测集上的准确率达到91.2%,平均仅注入430个记忆Token,检索耗时仅为134毫秒。作为对比,另一款记忆系统的准确率为83.13%,平均使用1899个记忆Token,VoiceMem的准确率高出约8.1个百分点,同时将记忆Token用量降低到了约四分之一。在后端迁移实验中,基础记忆引擎的得分为61.68,加入VoiceMem的上层索引后得分提升到91.20,整体提升了29.52个百分点。

研究团队还发现,当VoiceMem的检索预算从K=5提升到K=10时,准确率仅增加1.3分,提升到K=100时也仅增加2.3分,但却需要大约8倍的Token消耗。这说明VoiceMem的核心收益不是无限提高准确率的上限,而是用极小的检索预算就可以接近最优的准确率表现。在信息记忆的综合评测中,VoiceMem的平均得分为76.39,另一款主流记忆系统的得分为52.27,整体提升了24.12分;相比直接将完整对话历史交给模型的方式,VoiceMem的得分也高出15.90分。

这组结果还揭示了一个容易被忽略的问题:将全部对话历史直接放入大模型上下文,并不一定等于模型能够正确完成记忆归因,即使信息确实出现在上下文中,模型仍可能无法判断该信息属于哪个人、哪个时间或哪段关系,右脑的设计确实带来了纯事实存储无法覆盖的额外价值。在人格记忆的对比实验中,在统一使用GPT-4o-mini作为回复模型的可比设置下,VoiceMem在11个人格记忆任务上的平均得分为74.16,超过此前表现最好的系统1.89分。当采用微调后的回复模型时,VoiceMem的得分进一步达到76.56,不过这一组结果使用了不同的回复模型,更适合作为系统性能上限的参考,不能与基线结果进行完全等价的横向比较。

消融实验进一步显示,移除上层索引后,VoiceMem在LoCoMo评测集上的得分下降了9.9分,移除右脑模块后得分下降了6.3分,类似的得分下降也出现在其他评测集上。这说明右脑模块并非只是一个便于传播的拟人化概念,情感、人格以及它们与现实实体之间的关联,确实提供了纯事实存储无法覆盖的关键信息。

现有的记忆评测大多基于纯文本数据,难以覆盖语音智能体实际面对的声音环境、多人对话和情感归因等真实场景。为此,研究团队构建了专门的训练数据集和评测集,数据生成过程包括记忆世界构建、经过语音语言模型验证的在线在策略蒸馏,以及人工筛选和完善流程。

该评测集包含53小时的对话音频、15314轮对话、316个评测问题,覆盖信息记忆、人格记忆、情感归因、伴随语言与环境四个维度,共14个细分任务。在这套专门针对语音场景的评测中,VoiceMem的平均得分达到68.73,领先14个评测类别中的11个。表现差距最明显的是背景声音回忆、声学场景推理和多人对话记忆等任务:纯文本记忆系统在这些类别上的得分仅为3.23至26.92,而VoiceMem的得分达到45.16至53.84,这一结果并不令人意外——对于“昨天咖啡馆里播放了什么音乐”这类问题,单纯保存语音转写文本本身就无法给出准确答案,必须依赖原始音频或声纹特征才能完成检索。

VoiceMem的另一个重要特点是将上层记忆组织逻辑与底层存储引擎进行了解耦。双脑结构、Schema-Entity路由、情绪归因和流式检索等核心功能都运行在上层,底层则可以灵活使用不同的记忆存储引擎。目前的开源实现默认采用一款主流记忆引擎,研究团队也在其他多款引擎上进行了迁移实验。在没有重新调整阈值的情况下,VoiceMem的上层索引为多个底层引擎带来了明显的性能提升,这说明它的收益并不完全绑定某一个特定的数据库或存储后端,但底层引擎本身的能力仍然会限制最终的整体效果。

该项目已经开放了安装包、基础用法文档、流式接口、Web Demo、模型微调和评测代码,并采用宽松的开源许可证。开发者可以通过少量代码将VoiceMem接入自己的语音智能模型,完成记忆的写入和检索流程。根据当前的项目说明,记忆检索环节可以在本地运行,但事实提取等写入环节仍可能需要使用外部的模型API。截至2026年9月8日,项目的代码仓库已经从首个公开版本更新至最新版本,加入了多项功能调整和bug修复。

VoiceMem将实时语音交互、事实记忆、人格建模和情感归因整合进了同一套框架中,但这项工作仍然存在几个需要注意的边界。首先,目前公开的成果只是一篇预印本,尚未经过同行评审的正式发表,相关结论仍需要更多独立的第三方复现验证。其次,论文的主要实验结果采用特定的评分方式,而自建的评测集细节将留待后续报告发布,因此当前的评测结论仍需要更多的验证,以检验评分的稳定性以及该方案在不同语言、文化环境和真实用户群体中的适用程度。第三,公开的检索耗时是在特定实验环境下测得的结果,并不代表所有设备、记忆规模和底层模型都能获得相同的性能表现。此外,VoiceMem主要解决了记忆架构、准确率和延迟问题,实际的产品落地还需要补充更加完整的隐私与安全机制,确保用户的对话历史和个人信息得到妥善保护。

团队将该项目称为“The Soul of Voice AI”,背后体现了一种更具前瞻性的产品判断:如果一个语音智能体永远只能理解当前的对话轮次,那么无论它的回复多么流畅自然,都很难与用户建立起持续的情感连接和关系认知。记忆将一次次孤立的交流串联起来,让智能体能够参考用户的过往经历、偏好习惯、声音特征和情绪状态,真正实现从单次交互到长期陪伴的升级。

但严格来说,VoiceMem证明的只是一套面向实时语音交互、兼顾事实与情感信息的记忆框架,而非机器已经获得了真正的意识。它真正值得关注的价值,是重新定义了语音智能体的记忆问题:记忆不能只是一个对话结束后才更新的外部数据库,也不能只是将更多的历史文本塞回模型的上下文窗口。它必须在用户说话的同时就同步运行,在极小的时间和Token预算内找到真正重要的信息,并准确理解这些信息与用户之间的具体关系。

如果说语言模型让语音智能体学会了如何流畅地“说话”,那么VoiceMem想要补上的,正是让智能体能够“记得你”的核心能力,以及它能否在下一次对话时,比上一次更懂你。

相关技术资料可参考:

以上内容不代表本平台立场,仅供读者参考