文章摘要
新加坡国立大学研究团队开发MRAgent框架,解决AI智能体长周期推理任务难题。它摒弃传统“先检索再推理”模式,采用主动记忆重建机制,在行业基准测试中表现显著优于基线方案,能降低令牌消耗和运行成本。代码已发布,开发流程较简便。

在处理长周期推理任务时,AI智能体普遍面临一个核心痛点:上下文窗口会快速被填满,而传统的检索流程往往返回大量噪音而非有效信息。为解决这一难题,新加坡国立大学的研究团队开发了MRAgent框架,该框架摒弃了静态的“先检索再推理”模式,转而通过动态构建记忆的机制,让智能体能够基于不断积累的证据来完善自身的记忆库。

这种多步骤的记忆重建流程被集成到大语言模型的推理过程中。尽管当前同类记忆管理框架并不少见,但与其他方案相比,MRAgent能够显著降低令牌消耗和运行时成本。

传统被动检索在长周期任务中的局限

传统的检索流程是先通过向量搜索或图遍历获取文档,再将其传入大语言模型进行推理,但这种被动方式无法将推理和内存访问结合起来,存在三大核心瓶颈:

  • 这类系统无法在推理过程中调整检索策略,如果智能体在获取文档后发现缺少关键线索,比如特定日期或人物,它无法基于新发现的信息发起新的查询。

  • 固定的相似度评分和预定义的图扩展规则只能返回表面匹配的内容,会让大语言模型的上下文窗口被无关信息填满,降低推理质量。

  • 当前系统高度依赖预构建的结构,比如固定的Top-K结果和静态的相关性函数,无法灵活适配不可预测的长周期用户交互。

研究团队指出,要突破这些限制,开发者需要转向“主动关联式重建流程”,这一概念的灵感来自认知神经科学。

在这种新范式下,记忆召回不再是静态数据库的被动读取,而是按顺序逐步展开的过程。系统从用户提示中的小型具体触发点开始,比如人物姓名、动作或地点,这些初始提示会指向关联的概念或类别,而非大块的文本内容。智能体通过这些元数据的“垫脚石”逐步收集证据,并用每一条新信息指导下一步操作,直到拼凑出完整准确的信息。

MRAgent的主动记忆重建实现逻辑

MRAgent的全称是Memory Reasoning Architecture for LLM Agents,它并没有将记忆视为静态数据库,而是将其当作一个交互式环境。在处理复杂查询时,智能体会借助底层大语言模型的推理能力,在结构化的记忆图中探索多条候选检索路径。

在每一个步骤中,大语言模型都会评估已收集到的中间证据,并用这些信息迭代优化搜索流程:推断新的搜索约束条件,聚焦最有价值的信息路径,同时裁剪无关的分支。这种机制让MRAgent能够挖掘深层信息,同时避免让大语言模型的上下文被噪音占据。

为了让这种主动探索在计算上高效且可扩展,MRAgent使用“线索-标签-内容”机制来组织数据库,形成一个多层关联图,包含三种节点类型:

  • 线索(Cues):即从用户交互中提取的细粒度关键词,比如实体或上下文属性。

  • 内容(Content):即实际存储的记忆单元,按照多粒度分层,比如用于记录具体事件的情景记忆,以及用于存储稳定事实和用户偏好的语义记忆。

  • 标签(Tags):即连接特定线索和内容的语义桥梁,用于总结两者之间的关联关系。

这种结构支持高效的两阶段检索流程:大语言模型首先从线索导航到候选标签,由于标签明确展示了数据的语义关联和结构联系,智能体可以通过这些简短的摘要判断相关性,识别出有前景的遍历路径并裁剪无关分支,再花费计算资源和提示令牌访问详细的记忆内容。

我们可以通过一个具体场景来理解这套流程:假设用户向AI智能体提问“内特第三次赢得电子游戏锦标赛后,是如何使用奖金的?”,MRAgent的处理步骤如下:

  • 首先从提示中提取细粒度的初始线索,比如“内特”“电子游戏锦标赛”和“获胜”。

  • 接着将这些初始线索映射到记忆图中,查看与之关联的关联标签,比如“锦标赛胜利”和“锦标赛参与”,由于查询关注的是获胜后的行为,智能体将舍弃“锦标赛参与”标签,转而聚焦“锦标赛胜利”标签。

  • 随后获取与所选线索-标签对关联的情景记忆,找到内特三次赢得锦标赛的相关记录。

  • 对比这三条记忆,筛选出与当前查询最相关的一条,舍弃另外两条。

  • 基于这条筛选后的记忆,智能体更新线索库,比如加入“锦标赛奖金”,再通过新的线索遍历更多标签,进一步聚焦相关记忆,重复这个过程直到收集到足够回答问题的信息,最终得出类似“内特将奖金存了起来”的结论。

MRAgent在行业基准测试中的表现

目前有多个框架都在解决智能体的记忆构建问题,比如基于图的智能体记忆框架A-MEM、分层记忆框架MemoryOS,还有LangMem和Mem0等持久化记忆框架。研究团队在LoCoMo和LongMemEval这两个行业基准测试中对MRAgent进行了验证,这两个测试用于评估智能体在长周期任务和多轮对话中解决查询的能力,测试覆盖了数十个会话和数百轮对话,底层模型使用了Gemini 2.5 Flash和Claude Sonnet 4.5,并将MRAgent与标准RAG、A-MEM、MemoryOS、LangMem以及Mem0进行了对比。

测试结果显示,在两种模型和所有题型中,MRAgent的表现都显著优于所有基线方案。

对于企业开发者来说,计算成本往往是最关键的指标。在LongMemEval测试中,MRAgent将每个样本的提示令牌消耗量降至仅118k,相比之下,A-MEM的消耗量为632k,LangMem更是达到了326万令牌每次查询。同时,MRAgent的运行时间相比A-MEM缩减了近一半,从1122秒降至586秒。

MRAgent的高效性源于其按需处理的特性:在检索前先评估标签并裁剪无关路径,既节省了成本也节省了上下文空间,此外,系统能够自动评估已积累的上下文,自主判断何时停止搜索,完全避免了冗余的数据探索。

开发与落地的注意事项

尽管MRAgent的表现十分出色,但在智能体使用该框架前,需要先构建好“线索-标签-内容”的结构。开发者需要设计底层记忆数据库的架构,让大语言模型能够高效导航关联内容并裁剪无关路径,同时避免计算成本激增。

值得庆幸的是,开发者无需手动标记或构建数据,研究团队为MRAgent设计了自动化的提炼流程,通过大语言模型处理原始的交互历史,自动填充记忆图。开发者的工作仅需实现并协调这套自动化的导入流程,而非手动标记数据。

具体来说,需要搭建后台任务或流式管道,将原始用户交互通过提示模板提取元数据,再存储到图数据库中。不过研究团队强调,这一构建阶段十分轻量化,MRAgent特意简化了数据导入流程。

目前,研究团队已将代码发布在GitHub平台上。


塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/

AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

以上内容不代表本平台立场,仅供读者参考