MemSlides:让PPT多轮修改更懂用户偏好

很多人用AI生成PPT时都有过这样的尴尬:不是初稿生成失败,而是当你指着第8页右下角说「把这块改成更标准的流程图」时,系统却悄悄打乱了全局——第3页的标题层级乱了,第12页的配色跑偏,之前反复调整的整体风格也被彻底打散。这才是真实PPT工作流里最常见的痛点:第一版只是草稿,反复修改才是真正的主战场。
过去几年,自动幻灯片生成技术已经取得了长足进步,不少工具可以从论文、产品说明或是一句简单的主题出发,生成结构完整、视觉效果也不算粗糙的初稿。但在实际使用中,初稿的核心价值早已不止「有没有生成出来」,而是它是否贴合了特定用户的表达习惯。
同一篇关于Transformer的学术论文,既可以被整理成面向新手的基础教学课件,也可以作为组会汇报、论文精读或是技术培训的材料。不同的使用者对页面角色、内容密度、证据呈现方式和机制展开逻辑有着完全不同的偏好:有人习惯先抛出核心结论和关键要点,有人则更倾向于先拆解定义、核心机制再逐步展开边界条件。
由北京邮电大学、清华大学、上海交通大学联合研发的MemSlides,正是瞄准了这一痛点。它没有等到用户反复修改后再去「记忆」偏好,而是在首轮生成阶段就会根据当前任务意图检索用户画像,将匹配的长期偏好整合到当前工作记忆中,以此影响幻灯片的页面组织和表达方式。
该项目相关资源包括:论文链接<https://arxiv.org/abs/2606.17162>、项目主页<https://memslides.github.io/>、在线演示站点<https://memslides.com/>、代码仓库<https://github.com/huohua325/Memslides>以及Hugging Face论文页面<https://huggingface.co/papers/2606.17162>。
这项工作曾登顶Hugging Face Daily Papers #1 Paper of the Day,GitHub仓库目前已获得400+星标,演示站点上线后也吸引了超100名验证用户试用。
MemSlides的首轮生成并非泛泛的通用效果图,而是会根据用户偏好,将源材料拆分为定义、核心机制、实验依据、常见误区和边界条件等不同页面。这些页面的组织逻辑、内容密度和证据呈现方式,都对应着用户画像中的表达偏好。
项目提供了完整的在线Demo,用户可以上传源材料、选择记忆档案或模板生成初稿,之后进入修订环节,最终可以下载PPTX、HTML或PDF格式的文件。也就是说,MemSlides覆盖了从个性化初稿生成到后续持续修改的完整工作流。
当初稿已经初步贴合用户需求后,新的问题就会浮现:系统能否在多轮修改中保留这些个性化偏好?临时提出的修改要求会不会几轮后就失效?当用户只想修改局部区域时,系统会不会破坏已经调整好的页面状态?
分层记忆的设计思路
不少人听到「Agent记忆」时,第一反应是把历史对话塞进更长的上下文窗口里,但MemSlides并没有采用这种思路。
原因很简单:历史对话越长,其中的冲突就越多。今天用户说「这份报告用蓝色标题」,不代表他之后所有PPT都要用蓝色标题;用户在某次编辑中遇到的工具错误,也不应该和「用户的审美偏好」混为一谈。
因此,MemSlides将个性化幻灯片生成建模为一个带状态的创作流程:系统先根据源材料、用户画像记忆和可选模板生成round-0初稿;之后每一轮用户反馈都会更新当前会话状态,再围绕当前幻灯片集进行局部编辑。
它的记忆组织可以从两个维度划分:
从生命周期来看,分为长期记忆和工作记忆:长期记忆保存跨任务稳定的信息,工作记忆保存当前幻灯片集仍有效的临时约束、修改目标和执行状态。
从功能角色来看,分为用户画像记忆和工具记忆:前者负责回答「这份幻灯片应该体现哪些偏好」,后者负责回答「智能体应该如何更稳定地完成修改」。
简单来说,MemSlides没有让智能体记住更多无关信息,而是帮它理清了哪些信息需要长期保留、哪些只在当前任务生效,哪些属于用户偏好、哪些属于工具使用经验。
用户偏好的长期存储
真正的个性化从来不是靠一句简单的角色提示词就能解决的。同样是学术汇报,有人喜欢每页只放一个核心结论,有人则会保留完整的公式和实验细节;同样是商业路演,有人偏好高密度的表格数据,有人更依赖趋势图和对比图表。这些差异并非单次提示中的标签,而是用户在长期创作和修改过程中逐渐暴露的习惯。
MemSlides通过用户画像记忆来保存这类跨任务偏好。它不会直接把用户档案整块插入提示词,而是在任务开始时根据当前意图检索相关偏好,再与本轮用户请求进行协调。如果长期偏好和当前明确指令兼容,两者会一同进入工作记忆;如果出现冲突,当前幻灯片的明确要求会优先执行。
这一步设计非常关键,否则系统很容易把「这次临时想要蓝色标题」误判为「用户永远偏好蓝色标题」。任务结束后,MemSlides也不会把每一句反馈都写入长期画像,只会沉淀稳定、可迁移的交互信号,让下一次生成更贴合用户,而非变得更加混乱。
当前任务的临时状态管理
多轮修改中还有一类信息更加微妙:它们不属于长期偏好,却必须在当前幻灯片集中持续生效。
比如用户在第二轮修改时说:「之后如果新增summary/tip box,就用浅灰色背景」,当时系统还没有添加这类元素,这条要求暂时没有执行对象。但几轮之后,当用户要求插入带有summary box的页面时,这条规则应该被自动触发。如果智能体只看当前轮的输入,就很容易遗忘这类延迟生效的约束。
MemSlides的工作记忆就相当于当前写作任务的状态板:活跃的临时偏好、延续性指令、已解决的目标和覆盖状态都被集中存储在这里。规划阶段读取这些状态来确定修改范围,执行阶段据此执行受限编辑,校验阶段再更新并检查结果。
这让多轮修改不再是彼此孤立的单次提示,而是围绕同一套幻灯片持续推进的连贯编辑过程。
局部编辑的边界控制
对人类编辑来说,「只修改这一处」是非常自然的要求,但对生成式系统来说却很难实现。很多系统在处理反馈时会重新读取或重写大范围内容,结果是目标区域改对了,但非目标页面也发生了意料之外的变化——用户只是提了一个小要求,系统却把整套PPT的状态彻底打乱。
MemSlides通过范围限定的局部幻灯片修订来解决这个问题。每次反馈都会先被映射到最小有效修改区域,再进入规划-执行-校验的流程:
规划阶段:将自然语言请求转换为执行契约,明确目标幻灯片、作用范围、选择器提示和覆盖要求。
执行阶段:根据页面结构选择合适的编辑工具,在受限范围内执行最小有效操作。
校验阶段:将「完成」变为需要验证的状态:目标未覆盖不能草率收尾,快照过期需要重新绑定,局部请求不应被扩展为整套幻灯片的重写。
这一步将「智能体认为自己改完了」的主观判断,转变为「系统能够检查修改是否真正覆盖目标、是否越界」的客观验证。
工具调用的经验复用
幻灯片编辑并非单纯的文本改写,一次局部修改可能涉及页面结构、选择器、样式规则、布局快照和验证逻辑。即使智能体理解了用户的需求,也可能在工具调用时读错区域、重复试错、扩大修改范围,或是在目标未完全覆盖时就提前结束操作。
因此,MemSlides引入了工具记忆。与用户画像记忆不同,工具记忆不记录「用户喜欢什么」,而是记录「在类似的编辑任务中,哪些执行路径更有效,哪些错误应该避免」。
论文中将工具记忆分为两种粒度:轮次范围的任务经验,记录一轮修改中的经验、错误总结和可迁移模式;操作范围的工具链经验,保存更细粒度的推理-工具调用-观察片段,在相似的工具调用前被检索出来作为参考。
这种设计将目标和执行路径分开:用户画像决定幻灯片应该朝哪个方向调整,而工具记忆则让智能体少走弯路,减少无效探索和执行不确定性。
性能验证与效果
MemSlides的评估并没有只给出一个笼统的生成分数,而是将不同记忆组件对应的能力拆开单独验证:用户画像记忆对应首轮生成的角色对齐度,工作记忆对应多轮会话中的延迟偏好延续性,工具记忆则在配对诊断修改场景中进行隔离验证。
在个性化生成任务中,用户画像记忆提升了多角色、多意图场景下的角色对齐效果。论文指出,这种提升不仅体现在「更贴合某个模板」,还体现在内容重点、页面角色、证据组织和角色区分等规划层面的选择上。
在局部修改的配对诊断测试中,工具记忆带来的变化更加直观:核心工具调用时间占比降至0.327x。需要说明的是,这些数据来自诊断性的配对修改场景,不能被解读为在所有场景下都能稳定领先。更准确的结论是,当工具记忆提供可复用的执行经验时,智能体在闭环完成、严格校验和首次找到正确编辑路径上更容易收敛。
跨场景的长期协作前景
MemSlides虽然聚焦于PPT制作,但它背后的问题并不局限于幻灯片领域。当智能体进入文档生成、代码修改、数据分析、企业知识系统等长周期任务时,都会遇到类似的挑战:哪些信息应该长期保留,哪些状态只属于当前任务,哪些执行经验可以复用,哪些内容在局部修改时必须保持不变。
如果说一键生成解决的是从0到1的问题,那么多轮修改考验的就是从1到可用的过程。未来的幻灯片智能体,不仅要能生成更美观的第一版初稿,还要能在反复改稿中持续理解用户、保持编辑边界,让整套幻灯片稳定地向用户真正想要的版本靠拢。


