更好的PPT创作Agent来了!开源MemSlides,引入分层记忆,局部修改效率提升60%
我爱计算机视觉
2026年07月02日 05:29
收录于文集
共39篇

今天介绍一篇近期非常受关注的PPT创作的新工作,曾登上Hugging Face Daily Papers榜首。

制作一份精美的演示文稿(PPT)往往需要耗费数小时甚至数天的时间。尽管近年来基于LLM的自动生成工具层出不穷,但它们在实际应用中依然存在两个难以忽视的痛点:一是缺乏持久的个性化能力,无法记住不同用户的排版偏好和习惯;二是多轮修改极其脆弱,往往用户只要求修改一个小地方,智能体(Agent)却把整页甚至整份 PPT “推倒重来”,导致之前已经调整好的内容付诸东流。

为了解决这些痛点,来自北京邮电大学、清华大学和上海交通大学的研究团队共同提出了一个全新的分层记忆驱动的个性化幻灯片生成与多轮局部修改 Agent 框架——MemSlides。

  • 论文标题: MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision

  • 论文地址: https://arxiv.org/abs/2606.17162View on alphaXivView onalphaXiv

  • 项目主页: https://memslides.github.io

  • 代码仓库: https://github.com/huohua325/Memslides(已开源)

  • 主要机构: 北京邮电大学、清华大学、上海交通大学

MemSlides 框架演示

背景与动机

为什么现有的 PPT 生成工具不够好用?

现有的 PPT 生成系统(如 PPTAgent、DeepPresenter 等)虽然能够生成结构完整、视觉精美的幻灯片,但它们通常将个性化视为 Prompt 调优的副产品,而没有将其作为一种由记忆系统直接支撑的服务。

在实际的人机协作中,用户的个性化偏好往往不是在生成前一次性给出的,而是在多轮的修改反馈中逐渐显露出来的。然而,现有的 Agent 在面对修改意见时,通常需要重新读取或重新生成整份 PPT。这种“全局重绘”的方式带来了极大的上下文压力,不仅容易引入不必要的漂移,还会覆盖掉用户原本已经满意的设计。

因此,一个实用的个性化 PPT 助手需要满足两个核心条件:

  1. 局部修改能力:能够将修改请求精准投影到最小受影响区域,在保留已有成果的同时进行微调。

  2. 分层记忆系统:能够区分长期用户画像、短期会话约束以及可复用的工具执行经验,让 AI 越用越聪明。

方法详解

问题形式化定义

研究团队将个性化 PPT 生成重新定义为一个状态化的多轮协作问题。

Figure 1: MemSlides 整体框架概述

Figure 1 展示了 MemSlides 的整体架构。它将记忆系统划分为长期记忆(Long-Term Memory, LTM)和工作记忆(Working Memory, WM)。长期记忆存储用户画像记忆(User Profile Memory, UPM)和工具记忆(Tool Memory, TM),而工作记忆则承载当前会话的状态 ,并引导修改执行器(Modify Exec)完成多轮局部修改。

局部修改执行:Plan-Act-Guard 管道

为了避免全局重写带来的内容漂移,MemSlides 提出了 Plan-Act-Guard 局部修改管道。

Figure 2: MemSlides 中的局部修改执行流程

如 Figure 2 所示,该管道包含以下三个阶段:

  • Plan(规划):将用户的修改请求转化为明确的“执行契约”,锁定受影响的幻灯片路径、活跃的样式规则和选择器提示,防止无谓的范围扩大。

  • Act(执行):根据执行契约选择最轻量、最精准的编辑工具。例如,优先使用批量 CSS 更新或语义样式调整,仅对局部应用补丁(Patch)。

  • Guard(校验):在当前轮次结束前,利用快照哈希绑定(Snapshot Hash Binding)进行局部校验。如果修改未完全覆盖目标区域,系统会拦截 finalize 操作,直到确认修改完整且未破坏其他页面。

个性化用户画像记忆

用户画像记忆决定了 PPT “应该长成什么样”。在 MemSlides 中,它被表示为长期画像与活跃临时记忆的组合:

Figure 3: 用户画像记忆的生命周期

Figure 3 详细描绘了画像记忆的生命周期:

可靠编辑的工具记忆

工具记忆则决定了修改操作“应该如何高效执行”。即使目标偏好正确,Agent 在调用工具时也常常会犯错或陷入死循环。

Figure 4: 工具记忆的数据流向

Figure 4 展示了工具记忆的流动过程。它在两个粒度上为 Agent 提供支持:

  • 轮次级任务经验(Round-scope Task Experience):在任务启动时载入工作记忆,记录 Agent 在多轮修改中的教训和自动提取的模式。

  • 操作级工具链经验(Operation-scope Tool Chain Experience):将原始的“推理-工具-观测”链条切片成紧凑的片段,在遇到相似的未来工具调用时动态检索并注入到 Prompt 中,指导 Agent 避免重复犯错。

实验与结果

研究团队构建了一个包含 10 种职业角色、30 个“角色-意图”条目的用户画像库(Profile Bank),并在 GPT-5、GLM-5 和 Gemini 3.1 Pro 等主流大模型上对 MemSlides 进行了全面评估。

首轮个性化对齐

在首轮生成中,研究人员通过盲测(Blind Vote)评估了生成 PPT 与目标角色偏好的对齐度。

使用 GLM-5 时,MemSlides 在各项指标上均取得了显著的优势:内容对齐度达到 9.00,结构合理度达到 8.78,视觉 tone 达到 8.56,角色特异性达到 8.89。即使在使用 GPT-5 时,MemSlides 也在内容(7.11 vs 6.78)和特异性(6.67 vs 6.33)上超越了 SlideTailor 等强基线。

在附录的 10 角色平均评测中,MemSlides 相比于无记忆注入的 DeepPresenter,在整体对齐度上实现了 +2.42 的大幅提升,其中内容对齐度提升了 +3.30,视觉效果提升了 +3.17。

局部修改的效率与可靠性

在 9 个诊断性配对修改任务中,研究团队对工具记忆的引入进行了消融实验。

实验结果表明,注入工具记忆后:

  • 整体闭环完成率(Closed-Loop Completion)从 0.815 提升至 0.963。

  • 严格校验率(Strict Verify)从 0.310 提升至 0.534。

  • 首次正确编辑时间(First Correct Edit)从 609.5 秒 缩短至 242.5 秒(缩短了约 60%)。

  • 核心工具耗时比例(Core Tool Time Ratio)大幅降至 0.327,显著减少了无谓的尝试和回溯。

定性案例分析

为了更直观地展现 MemSlides 的优势,我们来看几个论文中给出的定性对比案例。

Figure 5: 局部修改执行的定性对比

Figure 5 对比了 DeepPresenter 与 MemSlides 的修改表现。面对“将第 5 页底部的 4 groups 改为 8 heads”这一局部修改请求,DeepPresenter 倾向于重写整张幻灯片,导致原本的公式块丢失、版面被重构、甚至配色发生改变。而 MemSlides 能够精准定位目标元素,仅应用局部补丁,完美保留了其他已对齐的内容。

Figure 6: 跨任务画像固化定性案例

Figure 6 展示了跨任务画像固化的过程。随着用户在多次任务中提出局部的反馈(如要求添加问题-所有者-时间轴表格、模块输入输出职责图等),这些局部线索逐渐固化为可复用的画像偏好,并在后续的新任务中自动作为默认的幻灯片组织模式出现。

Figure 9: 工作记忆中的延迟偏好结转案例

Figure 9 展示了工作记忆如何处理延迟生效的规则。例如,用户在第 1 轮提出“如果以后添加新幻灯片,标题应该用蓝色”,由于此时没有新幻灯片,该规则被暂存在工作记忆中。直到第 N 轮真正添加新幻灯片时,MemSlides 成功检索并应用了这一结转指令,而无记忆版本则只能依赖默认模板。

一点思考

MemSlides 没有试图让一个大模型在一次 Prompt 中解决所有问题,而是将个性化(What to generate)与执行经验(How to edit)分离开,并为多轮修改设计了专门的局部沙盒(Plan-Act-Guard)。清晰的状态表示和执行边界对于Agent系统的设计非常重要。

作者已经完全开源了代码,并提供了试用页面:https://memslides.com/。

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向