ACL 2026 · Agent Memory · 每日文献追踪
How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior
一句话定位:记忆不是"越多越好"的资产,而是一条会自我放大的反馈回路——Agent 会亦步亦趋地复现被检索到的经验,因此写入门槛的质量、而不是记忆的规模,决定了长期性能的正负号。
本期检索覆盖 ACL Anthology 2026(acl-long / findings-acl / eacl-long)、ICLR 2026 virtual 与 MemAgents Workshop、ICML 2026 论文页、OpenReview,以及 arXiv 2601–2608 的 cs.CL / cs.AI 记忆相关条目,共扫读 28 篇候选(含 4 篇综述、6 篇 2607 新预印本),覆盖记忆架构、检索、压缩与遗忘、RL 训练记忆策略、评测基准、安全治理、多智能体共享记忆等子方向。
按"顶会主会长文 > Findings/Workshop > arXiv"的优先级,最终选定 ACL 2026 主会长文 2026.acl-long.27 作为核心工作。它不在首期已覆盖名单(MemGPT / A-MEM / Mem0 / Memory-R1 / MemAct / AgeMem)之内,且恰好是"学习式记忆管理"路线的问题来源。
| 项 | 内容 |
|---|---|
| 标题 | How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior |
| 作者 | Zidi Xiong, Yuping Lin, Wenya Xie, Pengfei He, Zirui Liu, Jiliang Tang, Himabindu Lakkaraju, Zhen Xiang |
| 出处 | Proceedings of ACL 2026 (Vol. 1: Long Papers), San Diego, July 2026, pp. 623–645 |
| 标识 | 2026.acl-long.27 | DOI 10.18653/v1/2026.acl-long.27 | arXiv:2505.16067(v1 2025-05-21,v2 已更新) |
论文自述贡献是"通过两个最基本的记忆操作——添加与删除——对 Agent 记忆动力学做系统性、定量的分析",据此揭示 experience-following property:"当前任务查询与被检索记录中查询之间的高'输入相似度',往往产生二者执行结果之间的高'输出相似度'"(p. 623)。由此衍生两个挑战——error propagation 与 misaligned experience replay。
2023 年以来的经验型记忆(Generative Agents 的 memory stream、Voyager 的 skill library、ExpeL 的 experience pool、AWM 的 workflow induction)几乎一致采用加法式设计——执行完就写回,隐含假设"更多经验不会更差"。论文第一件事就是打掉这个假设。
| Agent | Fixed(不写入) | Add all(全写入) | 绝对差 | 相对差 | 记忆规模膨胀 |
|---|---|---|---|---|---|
| RegAgent (SR) | 67.53 | 55.48 | −12.05 pp | −17.8% | 41.0× |
| EHRAgent (ACC) | 16.75 | 13.05 | −3.70 pp | −22.1% | 24.1× |
| AgentDriver (SR) | 40.11 | 32.32 | −7.79 pp | −19.4% | 11.8× |
| CIC-IoT (ACC) | 71.50 | 59.90 | −11.60 pp | −16.2% | 21.0× |
图 1 · 写入闸门决定符号:Add-all 在全部四个 Agent 上都劣于"什么都不写"
数据来源:论文表 1。纵轴为各 Agent 自身指标(RegAgent / AgentDriver 为 SR,EHRAgent / CIC-IoT 为 ACC,均为百分数)。悬停查看数值。
论文的论证不是"提出方法 → 打榜",而是一条诊断链:
论文不提出新架构,而是构造了一个双轴实验设计:添加策略(写入闸门质量)× 删除策略(回收机制)。
| 档位 | RegAgent 实例化 | 其他三个 Agent 的实例化 |
|---|---|---|
| Coarse C1 | 误差阈值 1.6 | GPT-4o-mini 作判别器 |
| Coarse C2 | 误差阈值 1.4 | GPT-4.1-mini 作判别器 |
| Coarse C3 | 误差阈值 1.2 | GPT-4.1-mini + 300 条正确判别数据微调 |
| Strict | 与真值比对 | 与真值比对(π_human) |
φ_hist 把"记忆记录的价值"定义为它作为示范时下游任务的平均表现(Φ),而不是它自身的正确性。这是把 credit assignment 引入记忆治理的最小可用形式——不需要 RL、不需要额外 LLM 调用,只需要一个能给完成的任务打分的评估器。它可以被移植到任何有 retrieve() / store() 接口的记忆后端上。
| Agent | 任务域 | 数据集 | 初始记忆 | 测试规模 | 检索 top-k |
|---|---|---|---|---|---|
| RegAgent | 合成一维回归 | 合成 | 100 | 4000 | 6 |
| EHRAgent | 医疗代码生成 | MIMIC-III | 100 | 2392 | 4 |
| AgentDriver | 自动驾驶轨迹 | nuScenes | 180 | 2000 | 1 |
| CIC-IoT Agent | IoT 流量分类 | CIC-IoT | 100 | 1000 | 3 |
主干模型:GPT-4o-mini(绝大多数实验);鲁棒性复核在 GPT-4o / DeepSeek-V3 / Qwen 上(附录 B.2)。RegAgent 的输出相似度用 RBF 核 exp(−γ|x₁ − x₂|²),γ = 1.0(附录 A.1);输入相似度统一为文本编码器特征的余弦相似度(p. 625)。
| 策略 | RegAgent SR↑ | Mem | EHRAgent ACC↑ | Mem | AgentDriver SR↑ | Mem | CIC-IoT ACC↑ | Mem |
|---|---|---|---|---|---|---|---|---|
| Fixed(不写入) | 67.53 | 100 | 16.75 | 100 | 40.11 | 180 | 71.50 | 50 |
| Add all | 55.48 | 4100 | 13.05 | 2411 | 32.32 | 2125 | 59.90 | 1050 |
| Coarse C1 | 63.18 | 3511 | 26.19 | 1447 | 36.92 | 1161 | 74.00 | 1030 |
| Coarse C2 | 65.78 | 3347 | 32.21 | 1467 | 40.01 | 1119 | 68.80 | 936 |
| Coarse C3 | 67.35 | 3139 | 34.66 | 1094 | 47.37 | 1285 | 79.50 | 952 |
| Strict | 70.95 | 2938 | 38.50 | 1012 | 51.00 | 1178 | 85.40 | 904 |
| 对比 | RegAgent | EHRAgent | AgentDriver | CIC-IoT |
|---|---|---|---|---|
| Strict − Add all(绝对) | +15.47 pp | +25.45 pp | +18.68 pp | +25.50 pp |
| Strict / Add all(相对) | +27.9% | +195.0% | +57.8% | +42.6% |
| Strict − Fixed(绝对) | +3.42 pp | +21.75 pp | +10.89 pp | +13.90 pp |
| Strict 相对 Add all 的记忆节省 | −28.3% | −58.0% | −44.6% | −13.9% |
| 可部署最优(C3)− Fixed | −0.18 pp | +17.91 pp | +7.26 pp | +8.00 pp |
图 2 · 评估器质量阶梯与"净收益零点"
数据来源:论文表 1。虚线为 RegAgent 的 Fixed 基线(67.53,仅 100 条记忆)——只有 Strict 越过了它。悬停查看数值。
在 EHRAgent 上,性能沿评估器质量呈严格单调阶梯,且增量明显边际递减:
但真正的相变在 RegAgent 上:
| 评估器 | 删除策略 | RegAgent SR↑ | Mem | EHRAgent ACC↑ | Mem | AgentDriver SR↑ | Mem | CIC-IoT ACC↑ | Mem |
|---|---|---|---|---|---|---|---|---|---|
| Coarse C1 | No deletion | 63.18 | 3511 | 25.91 | 1447 | 36.92 | 1161 | 74.00 | 1030 |
| Coarse C1 | Periodic | 60.88 | 1012 | 26.65 | 338 | 36.38 | 426 | 78.10 | 355 |
| Coarse C1 | History-based | 62.10 | 3205 | 33.55 | 1004 | 34.00 | 1019 | 73.70 | 952 |
| Coarse C1 | Combined | 59.32 | 951 | 31.47 | 279 | 35.62 | 372 | 68.80 | 352 |
| Strict | No deletion | 70.95 | 2938 | 38.67 | 1012 | 51.00 | 1178 | 85.40 | 904 |
| Strict | Periodic | 67.65 | 949 | 38.59 | 302 | 50.94 | 467 | 80.80 | 310 |
| Strict | History-based | 69.80 | 2286 | 42.06 | 784 | 51.81 | 846 | 89.60 | 788 |
| Strict | Combined | 66.58 | 890 | 42.34 | 248 | 49.97 | 323 | 85.50 | 188 |
| 对比 | RegAgent | EHRAgent | AgentDriver | CIC-IoT |
|---|---|---|---|---|
| Strict + History:性能变化 | −1.15 pp | +3.39 pp | +0.81 pp | +4.20 pp |
| Strict + History:记忆变化 | −22.2% | −22.5% | −28.2% | −12.8% |
| Strict + Combined:性能变化 | −4.37 pp | +3.67 pp | −1.03 pp | +0.10 pp |
| Strict + Combined:记忆变化 | −69.7% | −75.5% | −72.6% | −79.2% |
| Agent(Periodic 相对 No deletion) | Coarse C1 下的 Δ | Strict 下的 Δ | 方向 |
|---|---|---|---|
| CIC-IoT | +4.10 pp | −4.60 pp | 反转(摆幅 8.70 pp) |
| EHRAgent | +0.74 pp | −0.08 pp | 反转 |
| RegAgent | −2.30 pp | −3.30 pp | 同向,Strict 下更差 |
| AgentDriver | −0.54 pp | −0.06 pp | 反例(两侧均 < 0.6 pp,近噪声) |
它真正的贡献不是"证明了选择性添加有用"(这是直觉),而是三件更硬的事:
Φ)。不依赖特定后端、不需要 LLM 调用、不需要梯度,是目前把 credit assignment 引入记忆治理的最低成本形式。可脱离本文单独复用的部分:φ_hist 的效用回填机制;"评估器质量作为一等实验变量"的实验设计范式;以及"删除激进度 ∝ 1/评估器质量"这条由数据推出、论文未言明的耦合原则。
π_human,即与 ground truth 比对——真实部署中恰恰不可得。论文没有正面处理"当 ground truth 不可得时结论是否成立"。2026.acl-long.583)用 PPO/GRPO 学 ADD/UPDATE/DELETE/NOOP,仅 152 条训练 QA 就在 LoCoMo / MSC / LongMemEval 上超越启发式基线(3B–14B 全尺度)。本文未纳入任何学习式管理器作对照,因此"瓶颈是 evaluator 信号"还是"瓶颈是策略被写死"无法从本文数据判决。这是判决性实验的空白,而非补充实验的空白。r ≈ 1 主要来自 RegAgent(图 3),而 RegAgent 是一维合成回归任务,其输出相似度直接定义为 exp(−γ|x₁−x₂|²)。在连续、低维、光滑的输出空间上,"相似输入 → 相似输出"几乎是任务本身的性质,而非 Agent 行为的性质。图 9 的补充在指标口径上(SR vs ACC、离散代码 vs 连续轨迹)不可比。φ_per 依赖窗口与阈值 α,φ_hist 依赖 β 与最小检索次数 n。表 2 只给单点,但同一 Periodic 策略在 CIC-IoT 上跨两档评估器从 +4.10 pp 摆到 −4.60 pp(摆幅 8.70 pp),说明极度敏感。没有 α/β 扫描曲线,无法判断表 2 的数字是否落在各自最优点,也就无法判断策略排序是否稳健。p = 0.0033。在"经验记忆收益本来就在几个 pp 量级"的背景下,这削弱了细粒度排序的可信度。解决了什么问题。第一次把"长期记忆"做成 LLM Agent 的一等组件。memory stream + recency × importance × relevance 三项加权检索,让 Agent 在几十天的模拟社会里保持行为连贯。它确立了"记忆 = 可检索的经验流"这一至今仍是默认的范式。
遗留了什么问题。三项打分全是手工启发式,且只描述"值不值得被取出",不描述"值不值得被存进去"。memory stream 是纯追加的——没有写入闸门,也没有删除。它默认记录本身可信,因为在模拟社会里"观察"确实不会出错;一旦搬到真实任务(观察 = Agent 自己的执行结果),这个前提就崩了。
核心工作如何回应。核心工作直接把它列为 named baseline,并用 Add-all 把"纯追加"的代价钉死:四个 Agent 上全部为负,−16.2% 到 −22.1%。它保留了检索侧启发式(仍用余弦相似度 top-k),但在上游插入写入闸门 π、下游插入回收算子 φ。
关键设计的传递。recency 演化为 φ_per(窗口内检索次数 ≤ α 则删除)——从"旧的排后面"变成"冷的被清掉",从软打分变成硬回收。
解决了什么问题。技能库范式:把验证通过的可执行程序存库并复用。它是第一个把"写入闸门"做对了的系统——只有通过环境自验证的技能才被写入。
遗留了什么问题。这个闸门之所以完美,是因为 Minecraft 提供了免费、确定、零成本的验证器。绝大多数真实任务域没有这种东西:EHR 代码生成没有 oracle,驾驶轨迹没有即时真值。Voyager 因此把"如何在没有验证器的地方获得验证器"完整地留给了后人。
核心工作如何回应。核心工作正是在回答这个问题。C1/C2/C3/Strict 阶梯本质上是在问"当你只有近似验证器时你损失多少"。Strict(π_human)就是 Voyager 式完美验证器在通用任务上的理想化上界,C1–C3 是现实中能买到的替代品。核心工作的贡献可以完全重述为:给 Voyager 的自验证机制标了价。
关键设计的传递。"验证后写入"被抽象为一般化的指示函数 π(q, e),并从二值的"能跑通/不能"松弛为"由一个可能出错的评估器给出"。
解决了什么问题。把成功与失败轨迹都纳入经验池,并用 LLM 从跨任务对比中抽取自然语言 insight。它把经验从"可复用的解"升级为"可迁移的规则",并第一个明确主张失败经验也有价值。
遗留了什么问题。insight 抽取是单向追加式的——会被 ADD / UPVOTE,但没有基于下游效果的回收;而"失败经验有价值"与"失败经验会被 experience-following 复现"之间存在直接张力。ExpeL 假设 LLM 能从失败中抽出正确教训;核心工作的 error-propagation 实验说明,当抽取本身不可靠时,被存下来的是错误本身而非教训。
核心工作如何回应。这是对抗性回应。图 4 显示 add-all 与 coarse 选择性添加都会"加剧 Agent 与无错误变体之间的性能差距"(p. 628)——把有瑕疵的执行存起来平均而言是有害的,除非评估器足够严格。它没有否认失败经验的价值,但把这个价值的实现条件量化了。
关键设计的传递。ExpeL 的 UPVOTE/DOWNVOTE 被替换成更硬的量 Φ(q_m, e_m)——该记录被检索后下游任务的实际得分,而非 LLM 的主观评价。这是从"自评"到"外部反馈"的关键一步。
解决了什么问题。不存原始轨迹,而是从轨迹中归纳出可复用的 workflow,在 Mind2Web / WebArena 上显著改善泛化。它把记忆的粒度从"实例"提到了"抽象"。
遗留了什么问题。抽象不消除错误,只是把错误提升了级别——从若干次错误执行归纳出的 workflow 会被更多任务检索到,危害面更大。AWM 同样是加法式的:只增不减,也没有基于使用效果的淘汰。
核心工作如何回应。互补而非对抗。核心工作在 Limitations 中明确承认它略去了结构变换、合并、摘要与反思,即把 AWM 这一层排除在外。但 misaligned experience replay 恰好适用于 AWM:一个 workflow 可以完全正确却与当前任务错位,而这类记录只能靠下游效用(φ_hist)而非正确性检查(π)识别。核心工作提供了识别机制,这正是 AWM 缺的那一半。
关键设计的传递。"workflow 复用频次"被形式化为 fr_t(q_i, e_i),成为两条删除规则共同的触发条件。
解决了什么问题。论文自述"多数现有 pipeline 是静态、启发式驱动的,缺少一个决定存什么、更新什么、检索什么的学习机制"。用两个 agent——Memory Manager(学 ADD / UPDATE / DELETE / NOOP)与 Answer Agent——通过 PPO 与 GRPO 做结果驱动 RL 微调,仅 152 条训练 QA 即在 LoCoMo / MSC / LongMemEval 与 3B–14B 多个尺度上超越强基线。
遗留了什么问题。它把管理策略学出来了,但奖励来自问答正确性这一相对干净的信号;在没有可验证答案的开放任务(代码生成、驾驶)上,奖励从哪来仍是空白。而这正是核心工作 C1/C2/C3 阶梯所刻画的问题——RL 并不能凭空生产可靠的奖励,它只是把评估器的质量问题从写入闸门搬到了奖励函数里。
与核心工作的关系。二者同为 ACL 2026 主会长文,构成同一问题的两个切面:核心工作说"信号质量是瓶颈",Memory-R1 说"策略形式是瓶颈"。二者从未在同一张表上对话——这是本届 ACL 留下的最显眼的实验空白。
关键设计的传递(反向)。Memory-R1 的四元操作集 {ADD, UPDATE, DELETE, NOOP} 与核心工作的 {π, φ} 是同一件事的两种写法:π 对应 ADD/NOOP,φ 对应 DELETE,唯独缺了 UPDATE。核心工作把 UPDATE 归入"结构变换/合并"并显式排除,而 Supersede 随后证明恰恰是 UPDATE 才是真正的失败模式:GPT-5.4 在 LongMemEval 知识更新子集上,从全上下文的 92% 掉到有界自维护记忆的 77%(p = 0.0033)。
推动这条线的不是"更好的检索器",而是责任的逐级内移:
| 阶段 | 谁来决定记忆里放什么 | 代表工作 | 关键转折 |
|---|---|---|---|
| 一、Prompt 驱动 | 人写的检索打分公式 | Generative Agents, MemGPT | 记忆成为一等组件 |
| 二、环境验证 | 任务环境的 oracle | Voyager | 写入第一次有了闸门,但闸门是"借"来的 |
| 三、模型自评 | LLM 自己评自己 | ExpeL, Reflexion, AWM | 闸门可移植了,但可靠性无保证 |
| 四、量化诊断 | —(先测量代价) | ★ 本期核心工作 | 把"闸门质量"变成可读数的实验变量;证明闸门不够好时记忆是负资产 |
| 五、策略学习 | RL 学出来的策略 | Memory-R1, AgeMem, MemCon | 管理从规则变成策略 |
| 六、(未完成) | ? | — | 策略的奖励信号仍是外生的、且质量未被审计 |
ε₊、假阴率 ε₋ 的噪声通道,在 experience-following 强度 ρ(输入相似—输出相似的回归斜率)给定的条件下,推导使 dPerf/dt > 0 的 (ε₊, ε₋, ρ) 可行域。目前连"零点是否只依赖 ε₊ 而与 ε₋ 无关"这样的一阶问题都没人回答——高价值、低门槛(一个可控合成环境 + 一个可注入噪声的评估器即可)。λ(k) = E[err_k]/E[err_{k−1}],判定它是几何发散、次线性发散还是收敛到不动点。这个数字直接决定"多久必须做一次记忆体检"。Φ 的信用分配偏差。φ_hist 用"被检索后下游任务的平均得分"作为记录价值,但 top-k 意味着每次任务由 k 条记录共同负责,均分是一个近似。用 Shapley 值或留一法计算真实边际贡献,量化均分近似带来的排序错误率。核心工作 top-k 从 1(AgentDriver)到 6(RegAgent)不等,恰好提供了检验"k 越大偏差越大"的天然梯度。{C1, C2, C3, Strict} × {手工规则, RL 策略} 的 4×2 矩阵:若 RL 策略在 C1 档就能追平手工规则在 C3 档的表现,说明"策略形式"是主瓶颈;否则说明"信号质量"是主瓶颈。判决"A 优于 B"缺乏 head-to-head 实验,这是下一步的关键空白,而不是一个"值得探索的新方向"。β ∈ [0.2, 0.8]、α ∈ {0, 1, 2, 5},画出"记忆规模—精度"的帕累托前沿。已知 Combined 能在 248 条记忆下拿到 42.34 ACC,问题是这个点是否在前沿上、前沿在哪里拐弯。ψ(就地更新),构成 {π, ψ, φ} 三元组,检验"更新"能否在 RegAgent 这个删除会伤害性能的任务上提供第三条路。Φ 提供了下游效用的免费标注,就用 Φ 反过来给评估器提供训练信号,形成"评估器 → 记忆质量 → 下游效用 → 评估器"的闭环自举,并检验这个闭环是否稳定(它同样可能自我中毒)。这是把诊断变成自愈系统的最直接路径。φ 从"删除"松弛为"降级到冷层"(不参与 top-k 但可在检索失败时二次召回),检验 RegAgent 上的 −4.37 pp 是否可被回收。这直接针对"删除不可逆"这一设计假设。π。| 工作 | 发表年月 | 会议/出版 | 核心贡献 | 主要指标(论文自报) | 与核心工作的关系 |
|---|---|---|---|---|---|
| Generative Agents | 2023-04 | UIST 2023 | memory stream + 三项加权检索 | 25 agent 模拟社会,无量化记忆基准 | 问题来源:纯追加、无写入闸门;被列为 named baseline |
| Voyager | 2023-05 | TMLR | 环境自验证后写入的技能库 | Minecraft 物品发现 3.3×、里程 2.3× | 技术来源:完美写入闸门的理想化上界;核心工作为其标价 |
| ExpeL | 2023-08 | AAAI 2024 | 成功+失败轨迹 → LLM 抽 insight | HotpotQA / ALFWorld / WebShop 上超 ReAct | 对抗对象:存瑕疵执行平均有害,除非评估器足够严 |
| Agent Workflow Memory | 2024-09 | ACL 2025 | 轨迹归纳为可复用 workflow | Mind2Web +24.6%、WebArena +51.1%(相对基线) | 互补:抽象层的错位记录只能靠 Φ 识别 |
| ★ Experience-Following | 2026-07 | ACL 2026 long.27(pp. 623–645) | 量化 experience-following;诊断错误传播与错位重放;π/φ 双算子实验设计 | Strict vs Add-all:EHR +195.0%、Driver +57.8%、IoT +42.6%、Reg +27.9%(表 1) | 本期核心 |
| Memory-R1 | 2026-07 | ACL 2026 long.583 | RL(PPO/GRPO)学 ADD/UPDATE/DELETE/NOOP | 152 条训练 QA;LoCoMo/MSC/LongMemEval,3B–14B | 镜像:同届会议、同一问题的另一切面;二者无 head-to-head |
| Supersede | 2026-06 | arXiv 2606.27472 | 分离出 supersession gap 并用 GRPO 训练 | GPT-5.4 92%→77%(p=0.0033);24× 规模 68%→28%;Qwen2.5-3B 9.0%→16.7% | 补充:证明被显式排除的 UPDATE 才是有界记忆的主失败模式 |
| MemCon | 2026-07 | arXiv 2607.13591 | Memory MDP + UCB 上下文 bandit,后端无关 | 6 基准 × 3 框架;最高 +15.2 pt,token −5%~−20% | 延伸:把管理策略学出来,但奖励信号质量问题仍在 |
把"retrieve-then-reason"的一次性检索改造成 Cue–Tag–Content 图上的迭代重构,让检索路径随推理中发现的中间证据动态调整;LoCoMo 上最高 +23%,同时 token 与耗时下降。它和核心工作是正交的两条改进轴(检索侧 vs 写入侧),值得放在一起读。
arXiv | Code
唯一一篇明确指出"扩大记忆预算不能修复更新失败"的工作(24× 对话规模下 28%→28%,n=25),也是本期少数报告了显著性水平(p=0.0033)的记忆论文。核心工作把 UPDATE 排除在外,这篇正好补上。
arXiv | Code | Model
UCLA 等。把记忆操作形式化为 Memory MDP,用带 UCB 探索、warm-start 先验与反向折扣信用分配的表格式在线 bandit 学策略——不需要预训练、不需要额外 LLM 调用,且对后端完全无关。6 个基准 × 3 个框架上最高 +15.2 pt 并省 5–20% token。"轻量级学习式管理"路线里最工程友好的一份。
arXiv | Code
与核心工作同届。152 条训练 QA 即可让 3B–14B 模型学会 ADD/UPDATE/DELETE/NOOP 并超越启发式基线。建议与核心工作对照阅读,看两篇如何对同一现象给出不同归因。
ACL Anthology
用条件互信息增强 RL 学记忆管理,方向上正对 §4.1 提出的"信号质量能否被信息论刻画"。注:本期仅核实标题与链接可达,未逐页精读,评价从简。
arXiv
记忆安全方向。既然 experience-following 意味着 Agent 会忠实复现被检索的记录,记忆投毒的攻击效率理论上很高——这篇给出了攻击与防御。注:本期仅核实标题与链接,未精读。
arXiv
多用户共享记忆下的动态访问控制。与核心工作的错误传播放在一起,构成 §4.3"污染传播动力学"问题的两块拼图。
arXiv
46 位作者的综述及其持续更新的论文列表,是目前这个方向最全的检索入口。
Paper List
| 工作 | 会议 / Anthology | arXiv | 代码 | 数据 / 基准 |
|---|---|---|---|---|
| ★ Experience-Following | 2026.acl-long.27(PDF) | 2505.16067 | 未找到 | MIMIC-III / nuScenes / CIC-IoT(无新基准) |
| Generative Agents | UIST 2023 | 2304.03442 | 未核实 | — |
| Voyager | TMLR / OpenReview | 2305.16291 | minedojo/voyager | MineDojo |
| ExpeL | AAAI 2024 | 2308.10144 | LeapLabTHU/ExpeL | HotpotQA / ALFWorld / WebShop |
| Agent Workflow Memory | ACL 2025 | 2409.07429 | zorazrw/agent-workflow-memory | Mind2Web / WebArena |
| Memory-R1 | 2026.acl-long.583 | 未核实 | 未找到 | LoCoMo / MSC / LongMemEval |
| Supersede | — | 2606.27472 | Vrin-cloud/supersede | LongMemEval(knowledge-update) |
| MemCon | — | 2607.13591 | ericjiang18/MemCon | ALFWorld / PDDL / ScienceWorld / TriviaQA / WebWalkerQA / GAIA |
| MRAgent | — | 2606.06036 | Ji-shuo/MRAgent | LoCoMo / LongMemEval |
未找到 / 未核实的项已在表中明确标注。核心工作的官方代码仓库在本次检索中未能定位——ACL Anthology 页面与 arXiv 摘要页均未给出链接,因此表 1 / 表 2 之外的实现细节(如 α、β、n 的具体取值)无法独立核实。