ACL 2026 · Agent Memory · 每日文献追踪

记忆不是资产,是一条会自我放大的回路

How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior

ACL 2026 主会长文 2026-08-06 2026.acl-long.27 · pp. 623–645 arXiv:2505.16067 写入闸门 / 遗忘 / 记忆治理

一句话定位:记忆不是"越多越好"的资产,而是一条会自我放大的反馈回路——Agent 会亦步亦趋地复现被检索到的经验,因此写入门槛的质量、而不是记忆的规模,决定了长期性能的正负号。

0. 当日检索情况说明

本期检索覆盖 ACL Anthology 2026(acl-long / findings-acl / eacl-long)、ICLR 2026 virtual 与 MemAgents Workshop、ICML 2026 论文页、OpenReview,以及 arXiv 2601–2608 的 cs.CL / cs.AI 记忆相关条目,共扫读 28 篇候选(含 4 篇综述、6 篇 2607 新预印本),覆盖记忆架构、检索、压缩与遗忘、RL 训练记忆策略、评测基准、安全治理、多智能体共享记忆等子方向。

按"顶会主会长文 > Findings/Workshop > arXiv"的优先级,最终选定 ACL 2026 主会长文 2026.acl-long.27 作为核心工作。它不在首期已覆盖名单(MemGPT / A-MEM / Mem0 / Memory-R1 / MemAct / AgeMem)之内,且恰好是"学习式记忆管理"路线的问题来源

坦诚说明:本报告定量内容来自 ACL Anthology 正式版 PDF 的表 1 与表 2 及正文;论文图 3–7、图 17–18 中的逐点数值无法从 PDF 文本层完整提取,凡涉及图的部分只复述论文自己的文字描述并标注来源。所有"相对提升 %"均由本报告在表 1 / 表 2 绝对值上重新计算,非论文原文数字。

一、核心工作深度解析

1.1 书目与核心定位

内容
标题How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior
作者Zidi Xiong, Yuping Lin, Wenya Xie, Pengfei He, Zirui Liu, Jiliang Tang, Himabindu Lakkaraju, Zhen Xiang
出处Proceedings of ACL 2026 (Vol. 1: Long Papers), San Diego, July 2026, pp. 623–645
标识2026.acl-long.27 | DOI 10.18653/v1/2026.acl-long.27 | arXiv:2505.16067(v1 2025-05-21,v2 已更新)

论文自述贡献是"通过两个最基本的记忆操作——添加与删除——对 Agent 记忆动力学做系统性、定量的分析",据此揭示 experience-following property"当前任务查询与被检索记录中查询之间的高'输入相似度',往往产生二者执行结果之间的高'输出相似度'"(p. 623)。由此衍生两个挑战——error propagationmisaligned experience replay

核心创新的一句话:把"检索增强的经验记忆"从一个检索质量问题重新定义为一个闭环控制稳定性问题——因为 Agent 会跟随经验,任何被写入的错误都会通过"写入 → 检索 → 复现 → 再写入"的回路被复利放大。

1.2 Motivation:把"更多经验 ≥ 更少经验"按在数据上打掉

2023 年以来的经验型记忆(Generative Agents 的 memory stream、Voyager 的 skill library、ExpeL 的 experience pool、AWM 的 workflow induction)几乎一致采用加法式设计——执行完就写回,隐含假设"更多经验不会更差"。论文第一件事就是打掉这个假设。

AgentFixed(不写入)Add all(全写入)绝对差相对差记忆规模膨胀
RegAgent (SR)67.5355.48−12.05 pp−17.8%41.0×
EHRAgent (ACC)16.7513.05−3.70 pp−22.1%24.1×
AgentDriver (SR)40.1132.32−7.79 pp−19.4%11.8×
CIC-IoT (ACC)71.5059.90−11.60 pp−16.2%21.0×
四个 Agent、四种任务形态、11.8×–41.0× 的记忆增长,换来一致为负的性能变化(−16.2% 到 −22.1%)。这不是"边际收益递减",而是符号翻转。此前的讨论多停留在"检索到不相关记录会引入噪声"(检索侧);本文指出的是写入侧问题:噪声不是被检索出来的,而是被系统自己生产并存进去的——而且由于 experience-following,它不是被稀释,是被跟随并复现

图 1 · 写入闸门决定符号:Add-all 在全部四个 Agent 上都劣于"什么都不写"

数据来源:论文表 1。纵轴为各 Agent 自身指标(RegAgent / AgentDriver 为 SR,EHRAgent / CIC-IoT 为 ACC,均为百分数)。悬停查看数值。

Fixed(不写入,100–180 条固定记忆) Add all(全部写回) Strict(真值比对后写入)
02040 6080100 RegAgent EHRAgent AgentDriver CIC-IoT 来源:论文表 1(Anthology 版 pp. 623–645)

1.3 论文的故事线(论证结构)

论文的论证不是"提出方法 → 打榜",而是一条诊断链

观察 A:Agent 输出高度跟随被检索的示范 (RegAgent 上 输入相似度 vs 输出相似度 Pearson r ≈ 1,图 3) ↓ 推论 如果被跟随的示范本身是错的,错误就会被复现 → error propagation ↓ 实验验证(图 4) 把 Agent 输出与「无错误变体」对比:add-all 与 coarse 选择性添加都会 「加剧这一性能差距」;而 strict 选择性添加「逐渐逼近 ground-truth 基线,并在约 2000 次执行后反超它」(p. 628) ↓ 但错误不是唯一的坏记忆 观察 B:有些记录并不"错",只是与当前任务错位,一旦被检索必然导致 糟糕执行 → misaligned experience replay ↓ 实验验证(图 6) 对「被保留」与「被删除」的示范做核密度估计,存在「清晰的质量落差: 被保留的示范其 error score 低于被删除的」(p. 629) ↓ 推论 仅靠"写入闸门"不够,还需要"事后回收"——删除必须以历史效用为依据 ↓ 实验验证(表 2) history-based 删除在 strict 评估器下于 EHR / IoT / Driver 均带来正增益; combined 删除以 1/4 记忆量取得更高精度 ↓ 收束 结论:evaluator reliability is critical;把环境反馈接进记忆管理是必需项
关键转折点:论文最重要的一步假设跳跃发生在"观察 A → 推论"之间——它把一个相关性证据(输入相似 ⇒ 输出相似,r ≈ 1)当作因果机制(示范驱动输出)来用。这一步在 RegAgent 这样的合成回归任务上很容易成立(见 §1.7 批判 5)。

1.4 方法论与机制解剖

论文不提出新架构,而是构造了一个双轴实验设计:添加策略(写入闸门质量)× 删除策略(回收机制)。

1.4.1 添加策略的形式化

Fixed(不写入): π_fixed(q, e) = 0 Add-all(全写入): π_all(q, e) = 1 Coarse(LLM 判别器): π_coarse(q, e) = Judge_θ(q, e) Strict(真值比对): π_human(q, e) = Human(q, e)
档位RegAgent 实例化其他三个 Agent 的实例化
Coarse C1误差阈值 1.6GPT-4o-mini 作判别器
Coarse C2误差阈值 1.4GPT-4.1-mini 作判别器
Coarse C3误差阈值 1.2GPT-4.1-mini + 300 条正确判别数据微调
Strict与真值比对与真值比对(π_human)

1.4.2 删除策略的形式化

周期性删除(Periodic): φ_per(q_i, e_i, t, t′) = 1[ fr_t(q_i,e_i) − fr_t′(q_i,e_i) ≤ α ] 历史效用删除(History-based): φ_hist(q_i, e_i, t) = δ(q_i,e_i,t) if fr_t(q_i,e_i) > n = 0 otherwise 其中 δ(q_i,e_i,t) = 1[ (1/fr_t(q_i,e_i)) · Σ_m Φ(q_m, e_m) ≤ β ] 组合删除(Combined): φ_comb = φ_per ∨ φ_hist
最值得单独摘出来复用的一点:φ_hist 把"记忆记录的价值"定义为它作为示范时下游任务的平均表现Φ),而不是它自身的正确性。这是把 credit assignment 引入记忆治理的最小可用形式——不需要 RL、不需要额外 LLM 调用,只需要一个能给完成的任务打分的评估器。它可以被移植到任何有 retrieve() / store() 接口的记忆后端上。

1.4.3 实验设置

Agent任务域数据集初始记忆测试规模检索 top-k
RegAgent合成一维回归合成10040006
EHRAgent医疗代码生成MIMIC-III10023924
AgentDriver自动驾驶轨迹nuScenes18020001
CIC-IoT AgentIoT 流量分类CIC-IoT10010003

主干模型:GPT-4o-mini(绝大多数实验);鲁棒性复核在 GPT-4o / DeepSeek-V3 / Qwen 上(附录 B.2)。RegAgent 的输出相似度用 RBF 核 exp(−γ|x₁ − x₂|²),γ = 1.0(附录 A.1);输入相似度统一为文本编码器特征的余弦相似度(p. 625)。

1.5 实验设计与定量结果

表 1 · 添加策略完整矩阵(论文表 1)

策略RegAgent SR↑MemEHRAgent ACC↑MemAgentDriver SR↑MemCIC-IoT ACC↑Mem
Fixed(不写入)67.5310016.7510040.1118071.5050
Add all55.48410013.05241132.32212559.901050
Coarse C163.18351126.19144736.92116174.001030
Coarse C265.78334732.21146740.01111968.80936
Coarse C367.35313934.66109447.37128579.50952
Strict70.95293838.50101251.00117885.40904

由上表派生的关键量(本报告计算)

对比RegAgentEHRAgentAgentDriverCIC-IoT
Strict − Add all(绝对)+15.47 pp+25.45 pp+18.68 pp+25.50 pp
Strict / Add all(相对)+27.9%+195.0%+57.8%+42.6%
Strict − Fixed(绝对)+3.42 pp+21.75 pp+10.89 pp+13.90 pp
Strict 相对 Add all 的记忆节省−28.3%−58.0%−44.6%−13.9%
可部署最优(C3)− Fixed−0.18 pp+17.91 pp+7.26 pp+8.00 pp

图 2 · 评估器质量阶梯与"净收益零点"

数据来源:论文表 1。虚线为 RegAgent 的 Fixed 基线(67.53,仅 100 条记忆)——只有 Strict 越过了它。悬停查看数值。

RegAgent SR(合成回归) EHRAgent ACC(MIMIC-III 代码生成) RegAgent Fixed 基线 = 67.53
02040 6080 RegAgent Fixed 基线 67.53 · 净收益零点 Add all Coarse C1 Coarse C2 Coarse C3 Strict 横轴:写入闸门(评估器)质量由低到高 | 来源:论文表 1

相变现象 · 全文最有说服力的定性证据

在 EHRAgent 上,性能沿评估器质量呈严格单调阶梯,且增量明显边际递减

Add all 13.05 →(+13.14) C1 26.19 →(+6.02) C2 32.21 →(+2.45) C3 34.66 →(+3.84) Strict 38.50

但真正的相变在 RegAgent 上:

Fixed 基线 = 67.53(仅 100 条记忆) Add all 55.48 ─┐ C1 63.18 ─┤ 低于「什么都不做」 C2 65.78 ─┘ ─────────────── 67.53 ────────── 净收益零点 ─────────────── C3 67.35 ← 微弱地仍在线下(−0.18 pp),代价是 31.4× 的记忆 Strict 70.95 ← 唯一越过零点的方案(+3.42 pp),但依赖 ground truth
这是全文最有说服力的一张图景:在一个完全可控的合成任务上,存在一个明确的"评估器质量阈值",低于它则记忆积累是净负收益;而这个阈值高到连"微调过的 GPT-4.1-mini 判别器"都恰好没有跨过。换言之,论文用自己的实验证明了:在写入闸门达到近乎完美之前,做经验记忆不如不做。这比摘要里"selective addition 有效"的表述尖锐得多。

表 2 · 删除策略完整矩阵(论文表 2)

评估器删除策略RegAgent SR↑MemEHRAgent ACC↑MemAgentDriver SR↑MemCIC-IoT ACC↑Mem
Coarse C1No deletion63.18351125.91144736.92116174.001030
Coarse C1Periodic60.88101226.6533836.3842678.10355
Coarse C1History-based62.10320533.55100434.00101973.70952
Coarse C1Combined59.3295131.4727935.6237268.80352
StrictNo deletion70.95293838.67101251.00117885.40904
StrictPeriodic67.6594938.5930250.9446780.80310
StrictHistory-based69.80228642.0678451.8184689.60788
StrictCombined66.5889042.3424849.9732385.50188

由上表派生的关键量(本报告计算,均相对同评估器下的 No deletion)

对比RegAgentEHRAgentAgentDriverCIC-IoT
Strict + History:性能变化−1.15 pp+3.39 pp+0.81 pp+4.20 pp
Strict + History:记忆变化−22.2%−22.5%−28.2%−12.8%
Strict + Combined:性能变化−4.37 pp+3.67 pp−1.03 pp+0.10 pp
Strict + Combined:记忆变化−69.7%−75.5%−72.6%−79.2%
两个必须单独点出的数据点:EHRAgent + Strict + Combined = 42.34 ACC / 248 条记忆——相对 no-deletion(38.67 / 1012),用 24.5% 的记忆量拿到 +3.67 pp 精度,是全表最强的帕累托改进。② CIC-IoT + Strict + Combined = 85.50 ACC / 188 条记忆——相对 no-deletion(85.40 / 904)是 −79.2% 记忆、+0.10 pp 精度,几乎无损地砍掉五分之四。

一个论文没有明说、但数据支持的设计原则

Agent(Periodic 相对 No deletion)Coarse C1 下的 ΔStrict 下的 Δ方向
CIC-IoT+4.10 pp−4.60 pp反转(摆幅 8.70 pp)
EHRAgent+0.74 pp−0.08 pp反转
RegAgent−2.30 pp−3.30 pp同向,Strict 下更差
AgentDriver−0.54 pp−0.06 pp反例(两侧均 < 0.6 pp,近噪声)
推论:删除的激进程度应当与写入闸门的质量成反比。评估器不可靠时,激进的周期性遗忘起"纠错"作用(CIC-IoT +4.10 pp);评估器可靠时,同样的遗忘变成"毁掉好资产"(CIC-IoT −4.60 pp)。四个 Agent 中三个支持这一方向。论文把添加与删除当作两个独立轴呈现,没有把这个交互效应提炼成结论——这是它留在桌上的一块钱。

分布漂移与容量约束(仅论文文字描述,图中无可提取数值)

1.6 价值分析

它真正的贡献不是"证明了选择性添加有用"(这是直觉),而是三件更硬的事:

  1. 把记忆管理从"检索工程"重新定位为"闭环控制"。experience-following 是枢纽:一旦 Agent 会跟随记忆,记忆库就从被动数据存储变成系统的状态变量,写入策略就是控制律。此后所有"学习记忆策略"的工作(Memory-R1、AgeMem、MemCon)都只有在这个框架里才有意义。
  2. 给出一个可移植的价值定义:记录的价值 = 它作为示范时下游任务的平均得分(Φ)。不依赖特定后端、不需要 LLM 调用、不需要梯度,是目前把 credit assignment 引入记忆治理的最低成本形式。
  3. 量化了"评估器"这个此前被当作免费资源的组件的价格。C1/C2/C3/Strict 阶梯把"你有多好的评估器"变成一个可以直接读出性能后果的旋钮——如果你手上只有 GPT-4o-mini 级别的判别器,本文数据告诉你在 RegAgent 类任务上你会亏 4.35 pp。

可脱离本文单独复用的部分:φ_hist 的效用回填机制;"评估器质量作为一等实验变量"的实验设计范式;以及"删除激进度 ∝ 1/评估器质量"这条由数据推出、论文未言明的耦合原则。

1.7 局限性

论文自述的限制(直接引用)

  1. "本工作的一个局限在于所考虑的记忆管理范围。……本研究聚焦于两个基础且任务无关的操作——记忆添加与记忆删除——而略去了更复杂的机制,如结构变换、合并、摘要与反思。"
  2. "另一个局限在于缺乏理论保证。我们的发现主要基于大量的实证分析,尽管这些分析是全面的,但并未提供形式化的理论证明。鉴于 Agent 系统固有的复杂性,推导此类保证往往是不可行的。"

补充批判(本报告的独立观察)

  1. "评估器质量"被折叠成一维阶梯,但表 1 自己反驳了这一点。CIC-IoT 上 C2(GPT-4.1-mini,68.80)反而低于 C1(GPT-4o-mini,74.00),差 5.20 pp;而 EHRAgent 上 C2(32.21)高于 C1(26.19)6.02 pp。同一组判别器在两个任务上给出相反的序关系,说明 C1 < C2 < C3 不是评估器能力的内在属性,而是"判别器—任务"匹配度的产物。论文的命名与叙事暗示单调阶梯,与自身数据不一致。
  2. "是质量而非规模"这一核心归因存在控制变量缺口。Add-all 相对 Fixed 同时改变了记录质量与记忆规模(11.8×–41.0×)。要判定质量是主因,需要"把 Add-all 随机下采样到与 Strict 同等规模(如 4100 → 2938)"的对照组。论文未报告,因此无法排除"检索池过大导致 top-k 精度下降"这一竞争解释。
  3. 真正可部署的最优方法在 RegAgent 上不优于什么都不做。C3(67.35,3139 条)对 Fixed(67.53,100 条)是 −0.18 pp / 31.4× 记忆。论文用 Strict(+3.42 pp)支撑"选择性添加有效",但 Strict = π_human,即与 ground truth 比对——真实部署中恰恰不可得。论文没有正面处理"当 ground truth 不可得时结论是否成立"。
  4. 缺少与"学习式记忆管理"竞品的 head-to-head。表 2 中所有删除策略都是手工规则。同届 ACL 2026 的 Memory-R1(2026.acl-long.583)用 PPO/GRPO 学 ADD/UPDATE/DELETE/NOOP,仅 152 条训练 QA 就在 LoCoMo / MSC / LongMemEval 上超越启发式基线(3B–14B 全尺度)。本文未纳入任何学习式管理器作对照,因此"瓶颈是 evaluator 信号"还是"瓶颈是策略被写死"无法从本文数据判决。这是判决性实验的空白,而非补充实验的空白。
  5. experience-following 的主证据来自最容易成立的场景。r ≈ 1 主要来自 RegAgent(图 3),而 RegAgent 是一维合成回归任务,其输出相似度直接定义为 exp(−γ|x₁−x₂|²)。在连续、低维、光滑的输出空间上,"相似输入 → 相似输出"几乎是任务本身的性质,而非 Agent 行为的性质。图 9 的补充在指标口径上(SR vs ACC、离散代码 vs 连续轨迹)不可比。
  6. 删除策略的超参敏感性完全缺位。φ_per 依赖窗口与阈值 α,φ_hist 依赖 β 与最小检索次数 n。表 2 只给单点,但同一 Periodic 策略在 CIC-IoT 上跨两档评估器从 +4.10 pp 摆到 −4.60 pp(摆幅 8.70 pp),说明极度敏感。没有 α/β 扫描曲线,无法判断表 2 的数字是否落在各自最优点,也就无法判断策略排序是否稳健。
  7. "删除有益"的结论分布不均,摘要口径偏乐观。Strict + History-based 相对 no-deletion:EHRAgent +3.39 pp、CIC-IoT +4.20 pp、AgentDriver +0.81 pp、RegAgent −1.15 pp。四个 Agent 中一个明确变差、一个基本持平;概括为"notable improvements"掩盖了 2 : 1 : 1 的分布。合成任务是唯一变差的那个,原因很可能是回归任务中每条示范都携带信号、不存在真正"有害"的记录——这个反例本身很有价值,论文未展开。
  8. 统计显著性报告缺失。CIC-IoT 仅 1000 例,1 pp ≈ 10 个样本;表 2 中 Combined(85.50)与 No deletion(85.40)的 0.10 pp 差异对应 1 个样本。论文未报告任何置信区间、多次运行方差或显著性检验。作为对照,同期 Supersede(arXiv 2606.27472)在类似规模实验上明确给出 p = 0.0033。在"经验记忆收益本来就在几个 pp 量级"的背景下,这削弱了细粒度排序的可信度。
  9. 本报告自身的不完备之处:无法从 ACL Anthology PDF 文本层提取图 3–7、图 17–18 的逐点数值,因此错误传播曲线("约 2000 次执行后反超 ground-truth 基线")、KDE 质量落差、分布漂移与容量约束部分只能复述论文文字描述,量级未能独立核算。核心工作的官方代码仓库在本次检索中亦未定位,故 α、β、n 的具体取值无法核实。

二、相关工作回溯:一条"加法式记忆"如何走到自我中毒

2.1 Generative Agents — Park et al., UIST 2023(arXiv:2304.03442

解决了什么问题。第一次把"长期记忆"做成 LLM Agent 的一等组件。memory stream + recency × importance × relevance 三项加权检索,让 Agent 在几十天的模拟社会里保持行为连贯。它确立了"记忆 = 可检索的经验流"这一至今仍是默认的范式。

遗留了什么问题。三项打分全是手工启发式,且只描述"值不值得被取出",不描述"值不值得被存进去"。memory stream 是纯追加的——没有写入闸门,也没有删除。它默认记录本身可信,因为在模拟社会里"观察"确实不会出错;一旦搬到真实任务(观察 = Agent 自己的执行结果),这个前提就崩了。

核心工作如何回应。核心工作直接把它列为 named baseline,并用 Add-all 把"纯追加"的代价钉死:四个 Agent 上全部为负,−16.2% 到 −22.1%。它保留了检索侧启发式(仍用余弦相似度 top-k),但在上游插入写入闸门 π、下游插入回收算子 φ

关键设计的传递。recency 演化为 φ_per(窗口内检索次数 ≤ α 则删除)——从"旧的排后面"变成"冷的被清掉",从软打分变成硬回收。

2.2 Voyager — Wang et al., 2023(arXiv:2305.16291 · TMLR)

解决了什么问题。技能库范式:把验证通过的可执行程序存库并复用。它是第一个把"写入闸门"做对了的系统——只有通过环境自验证的技能才被写入。

遗留了什么问题。这个闸门之所以完美,是因为 Minecraft 提供了免费、确定、零成本的验证器。绝大多数真实任务域没有这种东西:EHR 代码生成没有 oracle,驾驶轨迹没有即时真值。Voyager 因此把"如何在没有验证器的地方获得验证器"完整地留给了后人。

核心工作如何回应。核心工作正是在回答这个问题。C1/C2/C3/Strict 阶梯本质上是在问"当你只有近似验证器时你损失多少"。Strict(π_human)就是 Voyager 式完美验证器在通用任务上的理想化上界,C1–C3 是现实中能买到的替代品。核心工作的贡献可以完全重述为:给 Voyager 的自验证机制标了价。

关键设计的传递。"验证后写入"被抽象为一般化的指示函数 π(q, e),并从二值的"能跑通/不能"松弛为"由一个可能出错的评估器给出"。

2.3 ExpeL — Zhao et al., AAAI 2024arXiv:2308.10144

解决了什么问题。把成功与失败轨迹都纳入经验池,并用 LLM 从跨任务对比中抽取自然语言 insight。它把经验从"可复用的解"升级为"可迁移的规则",并第一个明确主张失败经验也有价值。

遗留了什么问题。insight 抽取是单向追加式的——会被 ADD / UPVOTE,但没有基于下游效果的回收;而"失败经验有价值"与"失败经验会被 experience-following 复现"之间存在直接张力。ExpeL 假设 LLM 能从失败中抽出正确教训;核心工作的 error-propagation 实验说明,当抽取本身不可靠时,被存下来的是错误本身而非教训。

核心工作如何回应。这是对抗性回应。图 4 显示 add-all 与 coarse 选择性添加都会"加剧 Agent 与无错误变体之间的性能差距"(p. 628)——把有瑕疵的执行存起来平均而言是有害的,除非评估器足够严格。它没有否认失败经验的价值,但把这个价值的实现条件量化了。

关键设计的传递。ExpeL 的 UPVOTE/DOWNVOTE 被替换成更硬的量 Φ(q_m, e_m)——该记录被检索后下游任务的实际得分,而非 LLM 的主观评价。这是从"自评"到"外部反馈"的关键一步。

2.4 Agent Workflow Memory — Wang et al., 2024(arXiv:2409.07429 · ACL 2025)

解决了什么问题。不存原始轨迹,而是从轨迹中归纳出可复用的 workflow,在 Mind2Web / WebArena 上显著改善泛化。它把记忆的粒度从"实例"提到了"抽象"。

遗留了什么问题。抽象不消除错误,只是把错误提升了级别——从若干次错误执行归纳出的 workflow 会被更多任务检索到,危害面更大。AWM 同样是加法式的:只增不减,也没有基于使用效果的淘汰。

核心工作如何回应。互补而非对抗。核心工作在 Limitations 中明确承认它略去了结构变换、合并、摘要与反思,即把 AWM 这一层排除在外。但 misaligned experience replay 恰好适用于 AWM:一个 workflow 可以完全正确却与当前任务错位,而这类记录只能靠下游效用(φ_hist)而非正确性检查(π)识别。核心工作提供了识别机制,这正是 AWM 缺的那一半。

关键设计的传递。"workflow 复用频次"被形式化为 fr_t(q_i, e_i),成为两条删除规则共同的触发条件。

2.5 Memory-R1 — Yan et al., ACL 2026 主会长文(2026.acl-long.583, pp. 12805–12825)

解决了什么问题。论文自述"多数现有 pipeline 是静态、启发式驱动的,缺少一个决定存什么、更新什么、检索什么的学习机制"。用两个 agent——Memory Manager(学 ADD / UPDATE / DELETE / NOOP)与 Answer Agent——通过 PPO 与 GRPO 做结果驱动 RL 微调,仅 152 条训练 QA 即在 LoCoMo / MSC / LongMemEval 与 3B–14B 多个尺度上超越强基线。

遗留了什么问题。它把管理策略学出来了,但奖励来自问答正确性这一相对干净的信号;在没有可验证答案的开放任务(代码生成、驾驶)上,奖励从哪来仍是空白。而这正是核心工作 C1/C2/C3 阶梯所刻画的问题——RL 并不能凭空生产可靠的奖励,它只是把评估器的质量问题从写入闸门搬到了奖励函数里。

与核心工作的关系。二者同为 ACL 2026 主会长文,构成同一问题的两个切面:核心工作说"信号质量是瓶颈",Memory-R1 说"策略形式是瓶颈"。二者从未在同一张表上对话——这是本届 ACL 留下的最显眼的实验空白。

关键设计的传递(反向)。Memory-R1 的四元操作集 {ADD, UPDATE, DELETE, NOOP} 与核心工作的 {π, φ} 是同一件事的两种写法:π 对应 ADD/NOOP,φ 对应 DELETE,唯独缺了 UPDATE。核心工作把 UPDATE 归入"结构变换/合并"并显式排除,而 Supersede 随后证明恰恰是 UPDATE 才是真正的失败模式:GPT-5.4 在 LongMemEval 知识更新子集上,从全上下文的 92% 掉到有界自维护记忆的 77%(p = 0.0033)。

三、技术演进脉络

3.1 演进树

2023 Generative Agents [memory stream · recency×importance×relevance · 纯追加] │ 确立"记忆=可检索经验流",但只管取、不管存 ├──────────────┬──────────────────────┐ ↓ ↓ ↓ 2023 Voyager 2023 MemGPT 2023 Reflexion [环境自验证 [虚拟内存分页 [自我反思写回] 后写入] Prompt 驱动] │ 闸门做对了, │ 解决容量,未解决质量 │ 但依赖免费 oracle │ ↓ │ 2024 ExpeL [成功+失败经验 → LLM 抽 insight · 仍为加法式] │ 主张失败有价值,但依赖"抽取本身可靠" ↓ 2024 AWM [轨迹 → workflow 归纳 · 粒度上移 · 仍只增不减] │ 抽象不消除错误,只是放大了错误的作用面 ↓ 2025 {A-MEM [链接式自组织], Mem0 [生产级抽取-更新], HiAgent [分层工作记忆]} │ 各自补一个维度:结构 / 工程 / 层次 │ ★ 共同盲点:写入闸门与回收机制仍是手工规则 ↓ ════════════════════════════════════════════════════════════════ 2026 ★ 核心工作 · Experience-Following (ACL 2026 long.27) 诊断:Agent 跟随记忆 ⇒ 记忆是闭环状态变量 Add-all 在 4/4 Agent 上净负(−16.2% ~ −22.1%) 评估器质量存在"净收益零点"(RegAgent: C3 仍在线下 −0.18pp) 删除应以「下游效用 Φ」而非「自身正确性」为依据 ════════════════════════════════════════════════════════════════ │ 这条诊断把"记忆管理"变成了一个必须被优化的对象 ├──────────────┬────────────────┬─────────────────┐ ↓ ↓ ↓ ↓ 2026 Memory-R1 AgeMem Supersede MemCon [RL 学 [LTM+STM [UPDATE 才是 [Memory MDP ADD/UPDATE/ 统一单策略] 真失败模式 + UCB bandit DELETE/NOOP] 92%→77%] 后端无关] ACL 2026 ACL 2026 arXiv 2606 arXiv 2607 │ │ │ │ └──────────────┴────────────────┴─────────────────┘ ↓ 共同未答:奖励 / 评估信号本身从哪来?

3.2 演进的内在逻辑线索

推动这条线的不是"更好的检索器",而是责任的逐级内移

阶段谁来决定记忆里放什么代表工作关键转折
一、Prompt 驱动人写的检索打分公式Generative Agents, MemGPT记忆成为一等组件
二、环境验证任务环境的 oracleVoyager写入第一次有了闸门,但闸门是"借"来的
三、模型自评LLM 自己评自己ExpeL, Reflexion, AWM闸门可移植了,但可靠性无保证
四、量化诊断—(先测量代价)★ 本期核心工作把"闸门质量"变成可读数的实验变量;证明闸门不够好时记忆是负资产
五、策略学习RL 学出来的策略Memory-R1, AgeMem, MemCon管理从规则变成策略
六、(未完成)策略的奖励信号仍是外生的、且质量未被审计
一句话概括这条线的推动力:每一代都把"谁来判断一条记忆好不好"往系统内部推了一层,而核心工作是唯一一个停下来去测量往里推一层要付多少钱的工作。阶段五的所有工作都建立在"我有一个可用的奖励信号"这个假设上;阶段四的数据说明,这个假设在评估器质量低于阈值时会让整个系统的收益翻负号。因此阶段四不是阶段五的前传,而是阶段五的地基审计报告。

四、开放挑战与研究机会

4.1 理论层面

  1. 净收益零点的可预测性。把评估器建模为带假阳率 ε₊、假阴率 ε₋ 的噪声通道,在 experience-following 强度 ρ(输入相似—输出相似的回归斜率)给定的条件下,推导使 dPerf/dt > 0(ε₊, ε₋, ρ) 可行域。目前连"零点是否只依赖 ε₊ 而与 ε₋ 无关"这样的一阶问题都没人回答——高价值、低门槛(一个可控合成环境 + 一个可注入噪声的评估器即可)。
  2. 错误传播的复利率。图 4 只描述了差距"被加剧",未给出增长的函数形式。在 RegAgent 上测量第 k 轮的期望放大因子 λ(k) = E[err_k]/E[err_{k−1}],判定它是几何发散、次线性发散还是收敛到不动点。这个数字直接决定"多久必须做一次记忆体检"。
  3. Φ 的信用分配偏差。φ_hist 用"被检索后下游任务的平均得分"作为记录价值,但 top-k 意味着每次任务由 k 条记录共同负责,均分是一个近似。用 Shapley 值或留一法计算真实边际贡献,量化均分近似带来的排序错误率。核心工作 top-k 从 1(AgentDriver)到 6(RegAgent)不等,恰好提供了检验"k 越大偏差越大"的天然梯度。

4.2 工程与应用层

  1. 判决性实验:evaluator 质量 vs 策略学习,谁是瓶颈?核心工作与 Memory-R1 同为 ACL 2026 主会长文却互不引用、无共同基准。在核心工作的四个 Agent 上把 Memory-R1 的 RL 管理器接进来,做 {C1, C2, C3, Strict} × {手工规则, RL 策略} 的 4×2 矩阵:若 RL 策略在 C1 档就能追平手工规则在 C3 档的表现,说明"策略形式"是主瓶颈;否则说明"信号质量"是主瓶颈。判决"A 优于 B"缺乏 head-to-head 实验,这是下一步的关键空白,而不是一个"值得探索的新方向"。
  2. 缺失的规模对照组。把 Add-all 的记忆库随机下采样到与 Strict 相同规模(4100 → 2938 等),跑同一套检索。这一组数据能一举判定"质量 vs 规模"的归因,成本极低(无需重跑 Agent,只需重跑检索与推理)。
  3. α / β 的敏感性曲线。在 EHRAgent 上扫 β ∈ [0.2, 0.8]α ∈ {0, 1, 2, 5},画出"记忆规模—精度"的帕累托前沿。已知 Combined 能在 248 条记忆下拿到 42.34 ACC,问题是这个点是否在前沿上、前沿在哪里拐弯。
  4. 把 UPDATE 加回来。Supersede 证明信息取代是有界记忆下的主要失败模式(GPT-5.4 92% → 77%,p=0.0033;对话规模扩大 24× 时 68% → 28%,且按比例扩大记忆预算无任何回补 28% → 28%)。在核心工作的框架里加入第三个算子 ψ(就地更新),构成 {π, ψ, φ} 三元组,检验"更新"能否在 RegAgent 这个删除会伤害性能的任务上提供第三条路。

4.3 新兴方向

  1. 评估器的自举。C3 已是"用 300 条正确判别数据微调"的产物。既然 Φ 提供了下游效用的免费标注,就用 Φ 反过来给评估器提供训练信号,形成"评估器 → 记忆质量 → 下游效用 → 评估器"的闭环自举,并检验这个闭环是否稳定(它同样可能自我中毒)。这是把诊断变成自愈系统的最直接路径。
  2. 可逆遗忘 / 分级冷存。Combined 在 RegAgent 上 −4.37 pp、在 EHRAgent 上 +3.67 pp——同一策略的代价高度依赖任务。把 φ 从"删除"松弛为"降级到冷层"(不参与 top-k 但可在检索失败时二次召回),检验 RegAgent 上的 −4.37 pp 是否可被回收。这直接针对"删除不可逆"这一设计假设。
  3. 多智能体共享记忆下的传播动力学。experience-following 在单 Agent 内部已会复利放大错误;共享记忆的多 Agent 系统里(Collaborative Memory),一条坏记录会同时污染 N 个 Agent。把 error-propagation 实验搬到 N-agent 共享池上,测量污染传播速度是否随 N 线性增长,并检验访问控制能否充当分布式的 π
  4. 对抗视角。如果写入闸门是系统的关键控制点,它就是攻击面(Forged Reasoning Attacks)。把 C1/C2/C3 阶梯当作防御强度阶梯,测量每一档下攻击者需要注入多少比例的恶意记录才能把性能压到 Fixed 基线以下——这会给出一个可比较的"记忆系统鲁棒性预算"。

五、相关工作表格对标

工作发表年月会议/出版核心贡献主要指标(论文自报)与核心工作的关系
Generative Agents2023-04UIST 2023memory stream + 三项加权检索25 agent 模拟社会,无量化记忆基准问题来源:纯追加、无写入闸门;被列为 named baseline
Voyager2023-05TMLR环境自验证后写入的技能库Minecraft 物品发现 3.3×、里程 2.3×技术来源:完美写入闸门的理想化上界;核心工作为其标价
ExpeL2023-08AAAI 2024成功+失败轨迹 → LLM 抽 insightHotpotQA / ALFWorld / WebShop 上超 ReAct对抗对象:存瑕疵执行平均有害,除非评估器足够严
Agent Workflow Memory2024-09ACL 2025轨迹归纳为可复用 workflowMind2Web +24.6%、WebArena +51.1%(相对基线)互补:抽象层的错位记录只能靠 Φ 识别
★ Experience-Following2026-07ACL 2026 long.27(pp. 623–645)量化 experience-following;诊断错误传播与错位重放;π/φ 双算子实验设计Strict vs Add-all:EHR +195.0%、Driver +57.8%、IoT +42.6%、Reg +27.9%(表 1)本期核心
Memory-R12026-07ACL 2026 long.583RL(PPO/GRPO)学 ADD/UPDATE/DELETE/NOOP152 条训练 QA;LoCoMo/MSC/LongMemEval,3B–14B镜像:同届会议、同一问题的另一切面;二者无 head-to-head
Supersede2026-06arXiv 2606.27472分离出 supersession gap 并用 GRPO 训练GPT-5.4 92%→77%(p=0.0033);24× 规模 68%→28%;Qwen2.5-3B 9.0%→16.7%补充:证明被显式排除的 UPDATE 才是有界记忆的主失败模式
MemCon2026-07arXiv 2607.13591Memory MDP + UCB 上下文 bandit,后端无关6 基准 × 3 框架;最高 +15.2 pt,token −5%~−20%延伸:把管理策略学出来,但奖励信号质量问题仍在

六、其他值得关注的近期工作

Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents(2026-06,arXiv)

把"retrieve-then-reason"的一次性检索改造成 Cue–Tag–Content 图上的迭代重构,让检索路径随推理中发现的中间证据动态调整;LoCoMo 上最高 +23%,同时 token 与耗时下降。它和核心工作是正交的两条改进轴(检索侧 vs 写入侧),值得放在一起读。
arXivCode

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents(2026-06,arXiv)

唯一一篇明确指出"扩大记忆预算不能修复更新失败"的工作(24× 对话规模下 28%→28%,n=25),也是本期少数报告了显著性水平(p=0.0033)的记忆论文。核心工作把 UPDATE 排除在外,这篇正好补上。
arXivCodeModel

Memory as a Controlled Process: Learned Adaptive Memory Management (MemCon)(2026-07,arXiv)

UCLA 等。把记忆操作形式化为 Memory MDP,用带 UCB 探索、warm-start 先验与反向折扣信用分配的表格式在线 bandit 学策略——不需要预训练、不需要额外 LLM 调用,且对后端完全无关。6 个基准 × 3 个框架上最高 +15.2 pt 并省 5–20% token。"轻量级学习式管理"路线里最工程友好的一份。
arXivCode

Memory-R1(2026-07,ACL 2026 主会长文)

与核心工作同届。152 条训练 QA 即可让 3B–14B 模型学会 ADD/UPDATE/DELETE/NOOP 并超越启发式基线。建议与核心工作对照阅读,看两篇如何对同一现象给出不同归因。
ACL Anthology

CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented RL(2026-07,arXiv)

用条件互信息增强 RL 学记忆管理,方向上正对 §4.1 提出的"信号质量能否被信息论刻画"。注:本期仅核实标题与链接可达,未逐页精读,评价从简。
arXiv

Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses(2026-07,arXiv)

记忆安全方向。既然 experience-following 意味着 Agent 会忠实复现被检索的记录,记忆投毒的攻击效率理论上很高——这篇给出了攻击与防御。注:本期仅核实标题与链接,未精读。
arXiv

Collaborative Memory: Multi-User Memory Sharing with Dynamic Access Control(2025-05,arXiv)

多用户共享记忆下的动态访问控制。与核心工作的错误传播放在一起,构成 §4.3"污染传播动力学"问题的两块拼图。
arXiv

Memory in the Age of AI Agents: A Survey(arXiv 2512.13564)及配套 paper list

46 位作者的综述及其持续更新的论文列表,是目前这个方向最全的检索入口。
Paper List

附录:链接清单(均已实际访问验证)

工作会议 / AnthologyarXiv代码数据 / 基准
★ Experience-Following2026.acl-long.27PDF2505.16067未找到MIMIC-III / nuScenes / CIC-IoT(无新基准)
Generative AgentsUIST 20232304.03442未核实
VoyagerTMLR / OpenReview2305.16291minedojo/voyagerMineDojo
ExpeLAAAI 20242308.10144LeapLabTHU/ExpeLHotpotQA / ALFWorld / WebShop
Agent Workflow MemoryACL 20252409.07429zorazrw/agent-workflow-memoryMind2Web / WebArena
Memory-R12026.acl-long.583未核实未找到LoCoMo / MSC / LongMemEval
Supersede2606.27472Vrin-cloud/supersedeLongMemEval(knowledge-update)
MemCon2607.13591ericjiang18/MemConALFWorld / PDDL / ScienceWorld / TriviaQA / WebWalkerQA / GAIA
MRAgent2606.06036Ji-shuo/MRAgentLoCoMo / LongMemEval

未找到 / 未核实的项已在表中明确标注。核心工作的官方代码仓库在本次检索中未能定位——ACL Anthology 页面与 arXiv 摘要页均未给出链接,因此表 1 / 表 2 之外的实现细节(如 α、β、n 的具体取值)无法独立核实。