文章摘要
针对多模态智能体长期记忆处理现有方法开销高、难以组合互补证据的缺陷,北大等国内高校与人工智能企业联合推出GraphMemix方案,将记忆选择转化为查询感知的证据森林组合优化问题,经四项权威基准测试,其平均准确率较当前最强公开基线提升11.75个百分点,兼具性能与效率优势。
在多模态智能体的长期交互场景中,需要处理的信息类型远超单纯的文本对话,涵盖相册、视频、邮件、日历以及跨会话的完整交互记录。随着交互历史的不断拉长,能够支撑有效回答的关键证据,很容易被海量冗余信息所掩盖。
近期,由国内高校与人工智能企业联合组成的研究团队推出了GraphMemix方案,该方法不再对记忆进行逐条独立排序,而是将证据选择转化为一个与查询高度匹配的“证据森林”组合优化问题。
在四项权威长期多模态记忆基准测试中,GraphMemix将四项榜单的平均Judge Accuracy提升至61.55%,相比当前最强的公开基线模型提升了11.75个百分点。

论文题目:GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory
机构:国内高校计算机研究所、人工智能企业
论文链接:https://arxiv.org/pdf/2608.26983

一、长期多模态记忆的技术困境

在长程交互场景中,智能体需要处理的用户历史数据呈现出海量性和异构性两大特点。当前主流的长期记忆处理方法大致分为两大路线,但都存在明显的技术瓶颈。

第一种路线是问题无关的离线预处理,比如A-MEM、MIRIX、SGM等方案,会在用户发起提问前就对全部历史数据进行摘要、结构化处理或者建立链接关系。这类方法的缺陷十分突出:首先,对全量历史进行生成式处理会带来极高的冷启动成本和持续更新开销;其次,在尚未明确未来用户问题的前提下压缩记忆,很容易丢失局部视觉属性、状态变化等细粒度上下文信息;最后,如果早期的摘要环节遗漏了关键细节,后续的检索流程将无法再恢复这些内容。

第二种路线是基于多模态RAG的向量相似度检索,比如MuRAG、Pensieve等方法,通过Embedding相似度匹配来寻找与用户问题最接近的历史记录。这种方式虽然具备较高的执行效率,但它更擅长找到“表面相似”的内容,却无法有效识别那些需要组合起来才能构成完整答案的证据。举个常见的例子,当用户询问某门课程修改后的截止日期时,相似度检索可能会优先返回最初的通知内容,却漏掉措辞不同、排序靠后的更新邮件;甚至会反复召回多条内容高度相似的旧通知,浪费了有限的上下文窗口资源。真正的难点不在于找到单条最相似的记忆,而是如何在有限的证据预算内,选出一组彼此互补、能够共同支撑完整答案的记忆集合。

二、GraphMemix的核心突破:从独立排序到证据森林

GraphMemix的核心创新在于,将记忆选择的问题从传统的逐条打分排序,转化为一个与查询高度匹配的组合图优化问题。

该方案通过三个核心概念构建了全新的记忆选择框架:

  • 节点(Node):代表单条记忆对当前问题的直接支持能力;
  • 边(Edge):表示在已知锚点证据的前提下,另一条记忆能够补充的新回答信息;
  • 森林(Forest):代表最终筛选出的若干条互补证据链集合。

与传统方法不同,GraphMemix不会对完整历史数据进行昂贵的生成式预摘要处理。当用户问题到来时,它只会围绕高相关的种子记忆构建一个有界的局部图,再联合判断哪些节点值得保留,以及哪些关系能够真正带来增量的回答信息。

三、GraphMemix的完整工作流程

1. 构建有界候选图

单条多模态记忆通常包含原图、Caption、OCR识别结果、视频帧和文本字段等多种形式。GraphMemix首先执行多视图召回流程,取各视图与问题的相似度最大值作为该记忆的初始检索分数,并选出Top-L的种子记忆。

随后,系统会利用两类关系进行有限跳数的扩展:一是Schema关系,比如同一会话、同一轮交互、同一邮件链等可观察的结构关系;二是Mutual-kNN语义关系,用于发现向量空间中互为近邻的相关记忆。这种扩展仅用于增加候选覆盖率,最终会将候选规模限制在M以内,既能覆盖种子记忆周围的局部上下文,又不会将完整的历史图全部交给大模型处理,避免了不必要的计算开销。

2. 分别估计节点效用与关系增量

GraphMemix采用两个职责明确且可并行执行的验证模块:

首先是节点验证器(Node Verifier),它会以Listwise的方式阅读用户问题和全部候选记忆,评估每条记忆独立支撑回答的程度。该分数会与原始的检索相似度进行融合,最终得到节点的效用值。

其次是证据链验证器(Evidence-Chain Verifier,ECV),它负责回答另一个关键问题:在已经掌握锚点证据的前提下,这条候选记忆是否能够提供新的回答信息?ECV会将候选关系划分为六种角色:正向增量包括new_fact、clarification、corroboration三类;无效或负向则包括redundant、conflict、irrelevant三类。只有被判定为正向增量且增量支持分数大于零的Schema边,才会被纳入最终的可信图中。这意味着,单纯的“主题相似”或“位置相邻”并不足以获得结构上的收益。

3. 求解最大权重证据森林

GraphMemix在求解证据森林时,会联合考虑三类关键因素:节点的直接效用、关系边的不确定性成本,以及开启一条独立证据链的成本。用直观的公式表达就是:证据森林得分 = 节点直接效用 − 独立证据链成本 + 可信边带来的结构收益。

在固定节点集合的前提下,系统通过Kruskal算法精确求解出最大权重的无环森林。在节点选择层面,系统采用确定性的两阶段求解方法:首先通过1-Swap局部搜索生成固定K个节点的候选方案;随后在冻结的候选方案子集上执行变基数精确提炼,自动删除无法证明自身价值的孤立记忆。

最终得到的结果并非一个简单的Top-K列表,而是一组经过结构化组织的证据树。系统会按照组件和树内顺序将其序列化,再交给冻结的多模态Reader生成最终的回答内容。

四、实验结果:四项基准全面领先

研究团队在ATM-Bench、Mem-Gallery、MemEye、H2HMem四项权威的长期多模态Agent记忆基准上进行了全面评估,并保证所有对比方法使用相同的Reader模型和评测协议,确保实验结果的公平性。

61.55%:使用Qwen3-VL-8B Reader时,四项榜单的平均Judge Accuracy
+11.75个百分点:相比当前最强公开基线UniversalRAG的宏平均提升幅度
4/4:GraphMemix在全部四项基准测试中均取得了更高的Judge Accuracy

具体来看各项基准的提升情况:

  • ATM-Bench:准确率达到55.27%,相比该基准的最强公开基线提升6.80个百分点;
  • Mem-Gallery:准确率达到76.33%,提升12.57个百分点;
  • MemEye:准确率达到53.64%,提升5.66个百分点;
  • H2HMem:准确率达到60.96%,提升16.60个百分点;
  • 四项榜单宏平均:61.55%,相比UniversalRAG的49.80%提升11.75个百分点。

这组实验结果覆盖了严格短答案匹配、开放式回答、多项选择和参考信息覆盖等多种不同的任务形态,说明GraphMemix的性能提升并不局限于某一种特定的数据格式,具备广泛的适用性。

为了验证该方法是否依赖特定的基础模型,研究团队进一步将Reader替换为Gemma 4 12B Unified。在这一设置下,GraphMemix的四项榜单平均Judge Accuracy达到67.42%,相比该设置下的最强基线提升了12.33个百分点。这一结果表明,GraphMemix优化的是Reader所接收的证据结构,而非针对某个特定的回答模型进行特化,具备良好的通用性。

五、效率优势:准确率提升的同时保持低开销

长期记忆系统的整体成本不能仅计算单次问答的耗时,还需要考虑两个关键阶段:一是消化并组织全部历史记忆的预处理成本,二是回答整个评测集中全部问题的执行成本。

在ATM-Bench的完整生命周期对比中,GraphMemix展现出了出色的性能:

  • 相比A-MEM,总耗时缩短约1.78倍;
  • 相比VimRAG,总耗时缩短约4.27倍;
  • 相比LightMem,总耗时缩短约4.74倍。

GraphMemix并非所有对比方法中绝对耗时最低的方案,但它在显著提升准确率的同时,仍然保持了较低的生命周期成本,并位于经验Pareto前沿。这意味着,现有的对比方法无法在更短的时间内达到相同或更高的准确率。其核心原因在于,GraphMemix的语义推理仅发生在与查询相关的有界候选图上,而非对完整历史持续执行生成式处理,有效控制了整体的计算开销。

六、实际案例:组合选择相比相似度排序的优势

我们以Mem-Gallery中的一道典型问题为例,直观展示GraphMemix的优势:

问题:对话中提到的两只“聪明且学习很快”的狗,分别叫什么名字?

这道题的正确答案需要同时恢复两组分散在不同对话中的信息:一是Lena的马尔济斯犬Lumi,二是Lucy的玩具贵宾犬Coco。

传统方法在这一案例中暴露出了不同形式的不完整性:

  • A-MEM会重复返回Lumi与“马尔济斯犬”的关联信息,却无法恢复第二只狗的名字;
  • MemGuide和LightMem虽然能够给出犬种信息,但无法回答问题要求的两只狗的具体名字;
  • 独立相似度排序虽然能够找到部分关键词证据,但无法完整配对“名字—犬种—学习能力”的关联关系。

GraphMemix的初始候选集合同样存在不完整的问题,但经过5次有效的1-Swap局部搜索和可信森林重组后,最终实现了目标函数从1.340到2.133的单调提升,保留了6条经过ECV验证的关系边,并换入了能够补全Coco身份与属性关系的低排名证据。最终,Reader能够正确回答:Lumi the Maltese and Coco the Toy Poodle。

这一案例揭示了GraphMemix的关键价值:低相似度的证据不一定是无关的,它可能只有在与另一条记忆建立关联之后,才会显现出真正的回答价值。

七、总结:长期记忆需要“组织”而非仅“召回”

GraphMemix带来的核心启示可以概括为三点:

  • 查询触发、局部构建:避免昂贵的全历史生成式预总结,仅在用户问题到来后处理有界的候选图,有效控制计算开销;
  • 节点与关系职责分离:分别建模“单条记忆是否具备独立价值”和“该记忆相对于锚点证据能够增加哪些新信息”,实现更精准的证据筛选;
  • 从排序升级为组合优化:通过最大权重证据森林的求解方式,在固定的Reader预算下保留互补证据,同时抑制冗余和冲突的信息。

实验结果表明,面向长期多模态智能体的应用场景,检索的终点不应仅仅是一个基于相似度的Top-K列表。只有将相关记忆组织成完整、可信且预算可控的证据结构,Reader才能真正有效利用长程历史数据,输出准确的回答内容。

📌 论文、代码与更多实验细节将持续更新。欢迎关注项目主页,并阅读原论文,了解完整数学推导、实现配置与Prompt模板。

论文链接:https://arxiv.org/pdf/2608.26983

以上内容不代表本平台立场,仅供读者参考