文章摘要
针对实时语音AI交互对记忆低延迟、高精准度的特殊要求,VoiceMem推出流式双脑记忆架构:信息左脑负责事实记忆的组织与精准检索,情感右脑负责维护用户人格与情绪,配合流式提前检索实现近零延迟,多项评测显示其准确率与效率优于现有方案,目前已开源。

当AI从工具进化为能够长期陪伴人类的伙伴,自然流畅的交互体验成为核心追求,而实时记忆正是实现这种沉浸式交互的关键一环。不同于文本场景下的记忆方案,实时语音交互对延迟和信息密度有着截然不同的要求。

传统的记忆检索流程往往需要2到3秒的时间,这在文本任务中或许只是一次稍慢的调用,但在自然的语音对话里,额外增加100到200毫秒就足以打断轮次衔接,几秒的停顿更会直接破坏交流节奏。同时语音场景的token预算有限,无法像文本Agent那样加载大量记忆,而且还需要兼顾情绪和人格的理解,不能只记录干巴巴的事实信息。

双脑协同的记忆架构

VoiceMem没有将事实、人格和情感全部塞进同一个记忆库,而是采用了“流式双脑”的架构,将记忆任务拆分为两个并行协作的部分。信息左脑负责记录用户的经历、事实、事件和概念,通过Schema和Entity的层级结构组织记忆:Schema负责将查询引向相关主题,Entity进一步定位具体的人物、事件或概念,底层记忆则记录与之相关的事实和关系。情感右脑则负责维护用户的人格特质、情绪状态及其归因,分别记录相对稳定的人格特征,以及用户对特定人物、事件或概念的态度和情感,再通过短期与长期归因区分一时的情绪反应和反复出现的行为模式。

当系统需要检索记忆时,左右脑会协同工作。当左脑找到与当前问题相关的人物、事件或概念后,这些Entity会继续为右脑缩小搜索范围,这样当用户再次提到某个项目时,系统找回的不只是与项目有关的事实,还包括用户长期对它表现出的态度,以及这种情感与哪些对象相关,真正实现“知道发生了什么,也理解这件事对眼前这个人意味着什么”。

信息左脑:精准控制信息密度

日常的记忆检索最容易出现“搜得到,但搜不对”的问题,比如用户询问“上次体检结果怎么样”,系统如果按照语义相似度捞回记忆,往往会有大量只是沾了“体检”边的无关内容,真正的检查结果反而被挤出去。尤其是在Top-5的小检索预算下,每一个记忆位置都格外珍贵,简单截断Top-100的结果只会让真正重要的信息被淹没。

VoiceMem的左脑采用两级Schema-Entity索引来组织事实记忆,先通过Schema将问题路由到粗粒度主题,再通过Entity定位具体的人、事件或概念,系统不会直接搜索完整记忆库,而是只在已经缩小的候选池里寻找Top-5的结果,先把范围找对,再在小范围里排序,有效提升了检索的精准度。

左脑的记忆更新也采用异步方式,每轮对话结束后,异步更新器会提取新的事实,并结合附近的已有记忆执行ADD、UPDATE、DELETE或KEEP操作,对应的Schema、Entity和关系在对话主流程之外更新,不会占用用户等待回复的时间。

随着记忆持续增加,固定的分类规则可能会失效,一个簇越长越大,内部信息密度会下降;如果频繁按固定规则拆分,又可能把相关记忆割裂。VoiceMem因此引入了Cluster Emergence簇涌现机制,系统观察哪些Entity会在真实查询中反复被共同唤起,并根据共同检索模式形成候选子图,再由大模型从相关性、重要性和完整性三个方面判断,只有满足条件的子结构才会被提升为新的记忆簇,让新的组织方式从长期使用中逐渐生长出来。实验中,左脑存储包含510条记忆和6个预设类别,运行后又有两个并未预设的新类别从语义图中涌现,共覆盖254条记忆,占整个存储的49.8%。

在LoCoMo评测中,VoiceMem只检索5条记忆就取得91.2分,比返回200条记忆的Mem0高出29.52分,展现了极高的信息密度和检索精准度。

情感右脑:真正理解用户的情绪与人格

实时陪伴并不只需要知道“发生过什么”,同一句“我没事”,可能意味着事实层面的否认,也可能包含迟疑、疲惫和回避;用户可能对所有会议都紧张,也可能只在面对某个项目、某个人时紧张。如果系统只保存转写文本,情绪针对谁、由什么引起,以及它是否构成长期模式,都会在记忆中消失。

VoiceMem因此设置了两种人格节点,Independent persona nodes记录用户自身相对稳定的特征,包括长期性格、行为规律和情感倾向;Cross-entity persona nodes记录与具体对象有关的情感,并连接到左脑中的人物、事件或概念。在此基础上,右脑同时进行短期和长期情感归因:短期归因处理“此刻发生了什么”,保留当前情绪、情绪针对的对象及其原因;长期归因处理“这种反应是否反复出现”,一段会话结束后,系统联合分析多轮情绪证据,将持续出现的情感和行为模式沉淀成相对稳定的人格认识。

实验数据很好地证明了右脑的价值,在ES-MemEval评测中,Full-Context基线虽然可以看到完整对话,但在冲突检测和用户建模上的得分分别只有12.10和21.70;而VoiceMem对应的得分达到69.10和74.00。如果将右脑移除,LoCoMo、ES-MemEval、ChatMem-Bench和Memora的评测分数分别下降6.3、4.3、5.4和4.4分,充分证明了情感记忆对于理解用户的重要性。

流式检索:实现近零延迟的交互体验

记忆越丰富,检索通常越慢,但在实时语音场景中,用户不会接受AI每次想起过去都先沉默两三秒。VoiceMem的核心设计之一就是让检索更早开始,将整个交互过程拆分为四个阶段:listening、speech tail、anticipation和searching。

当用户仍在说话时,系统会持续完成ASR和说话人识别,同时匹配左脑的Schema与Entity,以及右脑的两类persona nodes。进入speech tail阶段(0到200毫秒)后,流式结果继续积累;当静音达到200毫秒,系统进入anticipation阶段(200到400毫秒),提前计算查询Embedding,并展开左右脑的上层图;到了searching阶段(400到500毫秒),只剩下底层记忆搜索与双脑结果合并。

常用的VAD阈值约为500毫秒,这意味着可以在回复开始前留下约400毫秒的处理窗口,而VoiceMem的密集双脑检索只需要134毫秒,完全可以被容纳在这个窗口里。当VAD正式确认用户说完,记忆已经基本准备好,不会再给对话增加明显可感知的等待。相关代码仓库将流式接口设计成类似持续处理音频的VAD接口,用户还没说完,后台检索已经开始,一轮语音结束时,系统可以直接取得左右脑的结果。

实测表现:兼顾准确率与效率

除了在经典Benchmark上取得优异成绩,团队还构建了ChatMem-Bench来测试VoiceMem在真实长期语音场景中的表现。该评测包含316个问题、15314轮对话和约53小时音频,覆盖信息记忆、人格理解、情感归因,以及副语言与环境声音四个维度共14类能力。VoiceMem在其中11类能力上取得领先,尤其在文字无法直接提供答案的三个声学类别中,文本系统只有3.23到26.92分,而VoiceMem达到45.16到53.84分。

在LoCoMo评测、K=5的条件下,VoiceMem以430个记忆token和134毫秒检索时间取得91.2分;而最强基线EverMemOS得到83.13分,却需要1899个token,展现了VoiceMem在效率和准确率上的双重优势。在信息和人格记忆评测中,VoiceMem分别取得76.39分和74.16分:前者比Mem0高24.12分,后者比最强基线MemOS高1.89分。

开源与未来方向

目前,VoiceMem的开源项目已经提供了框架、模型、数据集和评测入口,开发者可以通过可安装的voicemem包、流式调用示例与交互式Demo,接入和体验这套记忆能力。相关音频Agent框架也已提供可选接入方案,让用户偏好与长期事实能够在新的语音会话中继续被调用。

记忆是探索AI自我意识的重要起点,VoiceMem已经迈出了关键一步,让长期记忆能够用于实时对话。接下来,团队将继续扩展多模态记忆能力,完善遗忘、强化和整理机制,同时降低成本与时延,让更多实时Agent和智能硬件能够稳定使用。我们期待,未来的AI伙伴能在长期陪伴中越来越懂你,而VoiceMem这套可靠的记忆系统,将成为实现这一目标的重要基础。

以上内容不代表本平台立场,仅供读者参考