Agent Memory 每日追踪 · 2026-07-29
Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents
一句话定位:把长期记忆与短期记忆的管理统一收编进 agent 自身的策略,用三阶段渐进式强化学习端到端训练出「什么时候存、存什么、什么时候删、什么时候压缩」的记忆行为——记忆不再是围绕模型搭建的外部系统,而是模型自己的一部分行为。
| 项目 | 链接 |
|---|---|
| 会议主页 | aclanthology.org/2026.acl-long.981 |
| 会议 PDF | 2026.acl-long.981.pdf |
| arXiv | arxiv.org/abs/2601.01885(v2, 2026-04-30) |
| DOI | 10.18653/v1/2026.acl-long.981 |
| 代码 / 数据 | 论文正文与附录均未给出公开仓库地址;实现基于 AgentScope + Trinity-RFT |
| 依赖框架 | AgentScope · Trinity-RFT |
作者:Yi Yu, Liuyi Yao, Yuexiang Xie, Qingquan Tan, Jiaqi Feng, Yaliang Li, Libing Wu | 单位:武汉大学国家网络安全学院;阿里巴巴集团
| # | 工作 | 会议 / 状态 | 论文 | 代码 |
|---|---|---|---|---|
| R1 | MemGPT Towards LLMs as Operating Systems |
arXiv 2023-10 Letta 前身 |
2310.08560 | letta-ai/letta research.memgpt.ai |
| R2 | A-MEM Agentic Memory for LLM Agents |
NeurIPS 2025 | 2502.12110 NeurIPS proceedings |
agiresearch/A-mem A-mem-sys |
| R3 | Mem0 Production-Ready AI Agents with Scalable Long-Term Memory |
arXiv 2025-04 产业事实标准 |
2504.19413 | mem0ai/mem0 评测集 LOCOMO |
| R4 | Memory-R1 Manage and Utilize Memories via RL |
arXiv 2025-08 v5 → 2026-01 |
2508.19828 | yansikuan/memory-r1 |
| R5 | MemAct Memory as Action: Autonomous Context Curation |
ACL 2026 Findings pp. 19149–19164 |
2026.findings-acl.956 2510.12635 |
ADaM-BJTU/MemAct |
常用评测基准:ALFWorld · SciWorld · BabyAI · PDDL(AgentBoard) · HotpotQA · LOCOMO · LongMemEval · MSC
大语言模型 agent 在长程推理中受制于有限的上下文窗口,因此记忆管理至关重要。现有方法通常把长期记忆(LTM)与短期记忆(STM)当作两个分离的组件,依赖启发式规则或额外的控制器,这限制了自适应性和端到端优化的可能。本文提出 AgeMem,一个把 LTM 与 STM 管理直接内嵌进 agent 策略的统一框架。AgeMem 将记忆操作暴露为工具式动作,让 agent 自主决定何时以及存储、检索、更新、摘要或丢弃哪些信息。为训练这种统一行为,作者提出三阶段渐进式强化学习策略,并设计 step-wise GRPO 应对记忆操作带来的稀疏且不连续的奖励。五个长程基准上的实验表明,AgeMem 在多个 backbone 上持续超越强记忆增强基线,同时获得更好的任务表现、更高质量的长期记忆和更高效的上下文利用。
AgeMem 的叙事是一条清晰的三段式:先拆解现状的割裂,再论证割裂无法通过打补丁弥合,最后给出统一策略化方案。
短期记忆一侧(本质是 RAG 与上下文压缩)依赖「预定义的调度或启发式规则」,后果是双向的——既可能让「不频繁但关键的细节被忽略」,又会「引入不必要的噪声」。长期记忆一侧被归纳为两类,各有硬伤:触发式在预设时刻执行固定的记忆操作,僵化;智能体式依赖手工规则或额外专家模型,「限制了自适应性并增加了系统复杂度」。
关键论断是:LTM 与 STM「通常被当作分离且松耦合的模块」,结果是「记忆构建碎片化、长程推理任务上表现次优」。这里的洞察在于——决定「这条信息要不要写进长期库」和决定「当前上下文要不要压掉这一段」,本质上是同一个信息价值判断在两个时间尺度上的投影。把它们交给两套互不通气的启发式,必然出现「短期扔掉了长期没存的东西」这类不可恢复的信息损失。
时刻 t 的状态定义为 s_t = (C_t, M_t, T):C_t 是短期上下文(消息列表);M_t 是长期记忆库,每条含内容、嵌入向量与元数据;T 是任务规格(查询 q、上下文信息 I_q、期望答案 A_q)。
这是全文最核心的抽象:LTM 与 STM 的操作被放进同一张工具表,由同一个策略调用。
| 工具 | 归属 | 语义 |
|---|---|---|
ADD | LTM 写 | 向持久库插入新条目(内容 + 嵌入 + 元数据) |
UPDATE | LTM 写 | 按 memory_id 修改已有条目的内容与时间戳 |
DELETE | LTM 写 | 删除过时条目,防止陈旧知识堆积 |
RETRIEVE | STM 读 | 按余弦相似度取 top-k 记忆注入上下文 |
SUMMARY | STM 控制 | LLM 压缩对话跨度,支持 all 或最近 N 轮 |
FILTER | STM 控制 | 移除语义相似度超过阈值 θ_f(默认 0.6)的冗余消息 |
值得注意 FILTER 的方向性:它删的是相似度过高的消息,即压制重复冗余,而非删掉「不相关」内容——这是一个防止误删关键低频信息的保守设计。
每条轨迹 τ = (τ⁽¹⁾, τ⁽²⁾, τ⁽³⁾),总长 T = T₁+T₂+T₃。三阶段之间的上下文重置 + 长期记忆保留是整个课程设计的机关所在。
| 阶段 | 做什么 | 关键机制 |
|---|---|---|
| ① LTM 构建 | 在闲聊式对话中接触上下文信息 I_q,识别显著信息并用 ADD/UPDATE/DELETE 写入 M_t | 中间步骤奖励为零;M_t 向后传递 |
| ② 干扰下的 STM 控制 | 接收 DISTRACTORGEN 生成的无关干扰消息,用 FILTER / SUMMARY 主动清理上下文 | C_t 被重置切断信息泄漏,M_t 保留 → 强制依赖真实检索 |
| ③ 整合推理 | 收到正式查询 q,协调检索 + 上下文管理 + 生成答案 | 终局奖励 R(τ) 在轨迹末尾给出 |
| 分量 | 构成 | 意图 |
|---|---|---|
R_task | LLM 裁判分 S_judge(A_pred, A_q) ∈ [0,1];无答案则惩罚 | 任务完成度 |
R_context等权 α=1/3 | R_compression = max(0, 1 − T_used/T_max) | token 效率 |
R_preventive = 1[溢出前调用了工具] | 奖励「撞墙前就转向」,把上下文管理从事后补救变成前瞻行为 | |
R_preservation = 1_preserve | 任务关键 token 必须保留 | |
R_memory等权 β=1/3 | R_storage = N_high_quality / max(1, N_total) | 高质量存储占比 |
R_maintenance = 1[执行了 update 或 delete] | 鼓励主动维护,反制「只增不删」 | |
R_relevance = S_LLM(R, q) | 检索结果与查询的语义相关性 | |
P_penalty | 超轮数 −1;上下文溢出 −0.5 | 硬约束 |
把终局优势均匀广播到所有前置时间步,实现长程信用分配——最终任务结果因此得以监督横跨三个阶段的每一个中间记忆决策。这个设计的取舍很直白:广播放弃了步级信用分配的精度,换取在极稀疏奖励下的可训练性。
五个长程基准(覆盖具身、科学、符号规划、导航、多跳问答五类异构任务):ALFWorld(家务任务)、SciWorld(交互式科学实验)、PDDL(符号规划)、BabyAI(组合指令网格导航)、HotpotQA(维基百科多跳问答)。
Backbone:Qwen2.5-7B-Instruct、Qwen3-4B-Instruct | 基线:LangMem、A-Mem、Mem0、Mem0ᵍ、AgeMem-noRL、No-Memory
指标:成功率 SR(ALFWorld/SciWorld/BabyAI)、进度率 PR(PDDL)、LLM-as-a-Judge(HotpotQA);记忆质量 MQ(0–1);平均 prompt token 数与工具调用次数。
五基准平均分:AgeMem vs. 记忆增强基线
两个 backbone 上的五基准平均性能(越高越好)。数值来自论文 Table 2。
| 方法 | ALFWorld | SciWorld | PDDL | BabyAI | HotpotQA | 平均 |
|---|---|---|---|---|---|---|
| No-Memory | 27.16 | 13.80 | 10.15 | 50.80 | 38.36 | 28.05 |
| LangMem | 38.27 | 28.29 | 15.85 | 51.34 | 37.43 | 34.23 |
| A-Mem | 34.68 | 28.06 | 18.39 | 58.82 | 43.95 | 36.78 |
| Mem0 | 37.49 | 26.99 | 13.96 | 60.58 | 46.66 | 37.14 |
| Mem0ᵍ | 35.34 | 30.50 | 14.86 | 58.78 | 42.06 | 36.31 |
| AgeMem | 41.07 | 35.55 | 17.31 | 61.42 | 54.44 | 41.96 |
| 方法 | ALFWorld | SciWorld | PDDL | BabyAI | HotpotQA | 平均 |
|---|---|---|---|---|---|---|
| No-Memory | 38.51 | 47.89 | 30.14 | 55.83 | 47.48 | 43.97 |
| LangMem | 40.89 | 50.42 | 28.42 | 53.80 | 42.70 | 43.25 |
| A-Mem | 34.31 | 50.14 | 34.41 | 61.35 | 48.48 | 45.74 |
| Mem0 | 41.17 | 51.38 | 31.72 | 60.05 | 39.16 | 44.70 |
| Mem0ᵍ | 36.69 | 47.76 | 29.61 | 57.59 | 38.12 | 41.95 |
| AgeMem | 48.97 | 59.48 | 35.07 | 72.56 | 55.49 | 54.31 |
Qwen2.5-7B 上相对 No-Memory 提升 49.59%、超最强基线 Mem0 达 4.82pp;Qwen3-4B 上相对提升 23.52%、超最强基线 A-Mem 达 8.57pp。RL 训练本身贡献 8.53pp / 8.72pp。
| 工具 | RL 训练前 | RL 训练后 | 解读 |
|---|---|---|---|
ADD | 0.92 | 1.64 | 存储更积极 |
UPDATE | 0.00 | 0.13 | 未经训练的 LLM 从不主动维护记忆,只会往里堆 |
DELETE | 0.00 | 0.08 | |
RETRIEVE | 2.31 | 1.95 ↓ | 存储质量提升 → 不再需要反复的被动检索补救 |
SUMMARY | 1.08 | 0.82 ↓ | 更少的事后压缩 |
FILTER | 0.02 | 0.31 ↑ | 前瞻式上下文控制 |
这张表是全文最有说服力的定性证据:UPDATE/DELETE 训练前严格为零,训练后被激活;同时 RETRIEVE 反而下降。这是一个从「反应式」到「前瞻式」记忆行为的相变。
| 基准 | Base | +LTM | +LTM/RL | +LTM/STM/RL |
|---|---|---|---|---|
| ALFWorld | 27.16 | 37.73 | 38.88 | 41.07 |
| SciWorld | 13.80 | 27.98 | 32.49 | 35.55 |
| HotpotQA | 38.36 | 45.76 | 52.04 | 54.44 |
奖励消融(HotpotQA · Qwen2.5-7B):Answer-Only 得 J=0.509 / MQ=0.479 / 2,078 tokens / 3.93 次调用;All-Returns 得 J=0.544 / MQ=0.533 / 2,117 tokens / 4.92 次调用。完整奖励收敛更快、记忆质量更高,代价是略多的 token。
FILTER 阈值敏感性:θ_f ∈ [0.4, 0.8] 内稳定,0.5 最佳(J=0.551);0.4 过度过滤、0.7 过于宽松。方法对超参不敏感。
UPDATE/DELETE 从 0 到非 0 的跃迁,是对这一主张的直接实证。ADD 从 0.92 涨到 1.64 是否全是有效存储,论文缺乏剖析。Charles Packer, Sarah Wooders, Kevin Lin, Vivian Fang, Shishir G. Patil, Ion Stoica, Joseph E. Gonzalez(UC Berkeley)
解决的问题:首次系统性地把操作系统的虚拟内存层级类比引入 LLM——主上下文(≈RAM)与外部存储(≈磁盘)之间通过分页机制交换数据,由 LLM 自己通过函数调用发起换入换出,并用「中断」控制流让 agent 处理完记忆操作后继续原任务。它证明了 LLM 可以自主管理自己的记忆,是「记忆即工具」范式的起点。
遗留的问题:记忆管理策略完全由 prompt 工程驱动——什么时候翻页、存什么,写在系统提示里,模型只是照做。后果有三:策略无法从经验中改进;对 prompt 措辞高度敏感;在小模型上几乎失效(需 GPT-4 级指令遵循能力)。此外 MemGPT 只关心「上下文放不下了怎么办」,未区分「哪些信息值得长期保留」这一独立问题。
AgeMem 的回应:继承工具化记忆动作空间这一核心抽象,但把决策逻辑从 prompt 移进可训练的策略参数。AgeMem 能在 4B/7B 开源模型上取得增益,正因为记忆行为不再依赖模型天生的指令遵循能力。
Wujiang Xu, Zujie Liang, Kai Mei, Hang Gao, Juntao Tan, Yongfeng Zhang(Rutgers 等)
解决的问题:MemGPT 之后的记忆系统大多是扁平的条目集合,检索靠语义相似度,记忆之间没有结构。A-MEM 引入 Zettelkasten(卡片盒笔记法)原则:新记忆写入时生成含「上下文描述、关键词、标签」的结构化笔记,系统自动识别与已有记忆的链接,并支持记忆演化——新条目加入会触发旧条目更新。记忆库从静态存储变成自组织的知识网络,在六个基础模型上超越当时 SOTA。
遗留的问题:链接生成与演化决策依然由 LLM 提示驱动,没有优化目标——系统无法知道自己建立的链接是否真的有助于下游任务。演化机制还引入新风险:错误更新会级联污染整个网络(这一风险随后被 ACL 2026 的 How Memory Management Impacts LLM Agents 实证为「错误传播」现象)。此外 A-MEM 只管长期记忆,短期上下文仍交给外部 RAG。
AgeMem 的回应:把 A-MEM 列为主要基线并整体超越(Qwen3-4B 上 45.74 → 54.31)。用任务奖励替代提示式启发,使记忆维护行为有了正确性信号。但 PDDL 上 AgeMem 反而输给 A-MEM,说明 A-MEM 的结构化链接在强结构化任务上仍有 AgeMem 扁平表示所不具备的优势——这是一个尚未被合并的技术分支。
Prateek Chhikara, Dev Khant, Saket Aryan, Taranjeet Singh, Deshraj Yadav(Mem0 团队)
解决的问题:把记忆从研究原型推向生产可用。提出以记忆为中心的架构做对话中的动态信息抽取与检索(extract–update 管道),并提供图结构变体 Mem0ᵍ。在 LOCOMO 上相对六类基线全面领先,关键工程成果是相对全上下文方法实现 p95 延迟降低 91%、token 成本节省超 90%,相对 OpenAI 方案有 26% 相对提升。目前产业界事实上的开源记忆层标准。
遗留的问题:extract–update 管道的每一步阈值与规则都是手工调优的产物,跨领域迁移需重新调参。更根本的是,抽取器优化的是「信息是否被正确抽取」这一代理目标,而非「agent 是否因此完成了任务」——两者并不总是一致。Mem0 还需独立 LLM 调用执行抽取与更新决策,即 AgeMem 的 C3。
AgeMem 的回应:在两个 backbone 上都超越 Mem0 与 Mem0ᵍ,并把抽取决策折叠进主策略消除辅助调用,同时把优化目标从代理指标换成真实任务奖励。但需指出:Mem0 的评测场景(LOCOMO,多轮长期对话)与 AgeMem 的(agentic 任务基准)并不重合,AgeMem 没有在对话记忆场景上验证——这正是它自述局限 2 的具体所指。
Sikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding 等(LMU Munich / TU Darmstadt / Edinburgh;Hinrich Schütze, Volker Tresp)
解决的问题:首次把 RL 引入记忆管理。设置两个专门化 agent——Memory Manager(决定 ADD/UPDATE/DELETE/NOOP)与 Answer Agent(从检索结果中做「记忆蒸馏」后回答),分别用 PPO 与 GRPO 训练,奖励来自下游问答正确性。最惊人的是数据效率:仅用 152 个训练 QA 对就超越强基线,并在 LoCoMo、MSC、LongMemEval 三个基准与 3B–14B 多个规模上泛化。
遗留的问题:双 agent 架构本身就是 AgeMem 要消除的「分离」。Memory Manager 与 Answer Agent 是两个独立优化的策略,管理器不知道回答者实际需要什么,回答者也无法反向影响存储决策——两者只能通过奖励信号间接耦合。此外 Memory-R1 只覆盖长期记忆的写侧,完全没有处理短期上下文管理(压缩、过滤、溢出),并需维护两套模型参数。
AgeMem 的回应:这是 AgeMem 最直接的前驱,也是「统一」主张最直接的靶子——AgeMem 用单一策略同时承担管理与求解,并把 STM 工具纳入同一动作空间。遗憾的是 AgeMem 并未把 Memory-R1 列入基线做实证对比,使「统一优于双 agent」缺少直接证据。
Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang(北京交通大学 ADaM Lab)
解决的问题:与 Memory-R1 恰好互补——把短期上下文管理形式化为可学习的策略动作。核心观察是「长上下文 LLM 尽管容量扩大,仍需精心的工作记忆管理以缓解长程任务中的注意力稀释」。MemAct 用删除与插入两类操作对上下文做主动策展,由 RL 训练。结果是用显著更小的模型达到有竞争力的准确率,同时上下文长度减少约一半。
遗留的问题:MemAct 只做上下文内的增删,没有持久化的外部记忆库——被删除的内容永久丢失,无法在后续会话中恢复。这在单次长程任务中可接受,但在跨会话的持续交互中是致命的。它也不处理「哪些信息值得跨任务保留」的问题。
AgeMem 的回应:FILTER 与 SUMMARY 承担了 MemAct 的职能,但关键差异在于——AgeMem 的上下文清理动作与 LTM 的 ADD 处在同一动作空间,因此策略可以学会「先存进长期库、再从上下文里删掉」这一安全的组合操作,而 MemAct 只能选择删或不删。这是「统一」在架构层面就成立的能力增益。不过 MemAct 报告的上下文减半远超 AgeMem 的 3–5%,说明 AgeMem 在纯效率维度上并未压过专门化方法。
这条脉络的内在逻辑是一个逐步内化的过程:记忆管理的决策权从「写在 prompt 里」→「写在代码规则里」→「交给一个专门训练的辅助模型」→「折叠进 agent 自身的策略」。每一步都在减少人工先验、增加从经验中学习的成分。AgeMem 代表这条路径目前的终点,而它自身的局限(固定工具集、扁平记忆表示)指向了下一步该内化什么。
LINK/MERGE 工具——是自然的下一步,但会显著扩大动作空间并加剧信用分配困难。| 工作 | 链接 | 一句话 |
|---|---|---|
| Supersede: Diagnosing and Training the Memory-Update Gap | 2606.27472 | 提出 supersession gap,前沿模型在有界记忆下准确率掉 15pp |
| Agent-Memory-Paper-List(配套综述 Memory in the Age of AI Agents) | GitHub | 本方向最活跃的论文追踪仓库 |
| ICLR 2026 Workshop MemAgents | 官网 | 首个专门针对 agent 记忆的顶会 workshop |
| MAGMA: Multi-Graph based Agentic Memory Architecture | 2601.03236 | 多图记忆架构 |
| EverMemOS: Self-Organizing Memory Operating System | 2601.02163 | 自组织记忆操作系统 |
| MemRL: Self-Evolving Agents via Runtime RL on Episodic Memory | 2601.03192 | 运行时 RL + 情景记忆 |
| How Memory Management Impacts LLM Agents | ACL 2026 | 实证「经验跟随」与错误传播现象 |