Agent Memory 每日文献追踪 · Vol. 2026-08-10
Hierarchical Graph-based Agentic Memory for LLM Agents — 语义边界触发的 encoding–consolidation 解耦
记忆的瓶颈不在「存什么」或「怎么检索」,而在「什么时候允许写入长期存储」。GAM 把写入时机本身做成一个由语义边界触发的状态机——消融数据显示,这道闸门的价值是检索优化的 3.68 倍。
本期检索覆盖 ACL Anthology 2026(Main + Findings)、EACL 2026、IJCAI 2025 proceedings、arXiv cs.CL/cs.AI 2604–2607 月份、ICLR 2026 MemAgents workshop 页面,以及两份社区论文列表,累计浏览候选 24 篇。
2026.acl-long.1600)与 How Memory Management Impacts LLM Agents(2026.acl-long.27)。2607.08032(率失真视角的记忆压缩,7 轴分类法 / 四层对比)与 AgeMem 2601.01885 系工作——其标志性元素(7 轴分类表、奖励函数分量表、优势广播、PDDL 17.31 vs 18.39)均已在既往报告中详述,属点名回避范围。τ 的数值论文本身也未公开。LongDialQA 无独立发布页,论文引 Kim et al., 2024(即 DialSim)。
| 项目 | 链接 | 状态 |
|---|---|---|
| ACL Anthology | 2026.acl-long.1600 | ✅ 已验证 |
| aclanthology.org/2026.acl-long.1600.pdf | ✅ | |
| DOI | 10.18653/v1/2026.acl-long.1600 | ✅ |
| arXiv | abs/2604.12285 · HTML v1 | ✅ 已验证 |
| 代码仓库 | — | ❌ 未找到 |
| LoCoMo | ACL 2024 · GitHub · 项目页 | ✅ |
| LongDialQA | 无独立发布页;论文引 Kim et al., 2024 → DialSim (arXiv 2406.13144) | ⚠️ 部分 |
| MovieChat-1K | 论文附录 Table 8 使用,未给链接 | ⚠️ |
书目:Zhaofen Wu, Hanrong Zhang, Fulin Lin, Wujiang Xu, Xinran Xu, Yankai Chen, Henry Peng Zou, Shaowen Chen, Weizhi Zhang, Xue Liu, Philip S. Yu, Hongwei Wang. GAM: Hierarchical Graph-based Agentic Memory for LLM Agents. ACL 2026 (Vol. 1: Long Papers), July 2026.
单位:浙江大学(国际联合学院)、University of Illinois Chicago、Rutgers University、MBZUAI、McGill University。
| 工作 | 正式出版 | arXiv | 代码 |
|---|---|---|---|
| MemoryBank | AAAI 2024 | 2305.10250 (2023-05) | 未验证 |
| MemGPT | 未找到会议出版页 | 2310.08560 (2023-10) | 项目页 |
| A-MEM | NeurIPS 2025 | 2502.12110 (2025-02) | GitHub |
| AriGraph | IJCAI 2025 · PDF | 2407.04363 (v1 2024-07 / v3 2025-05) | GitHub |
| MemoryOS | EMNLP 2025 Main (Oral) | 2506.06326 (2025-05) | GitHub |
| Mem0 | 未找到会议出版页 | 2504.19413 (2025-04) | GitHub |
摘要的关键句:“To sustain coherent long-term interactions, LLM agents must navigate the tension between acquiring new information and retaining prior knowledge.”——为维持连贯的长期交互,agent 必须在「获取新信息」与「保留既有知识」这对张力之间导航。GAM 的做法是把记忆编码(encoding)与记忆巩固(consolidation)解耦:正在进行的对话被隔离在事件推进图(EPG)内,只有检测到语义漂移时才整合进主题联想网络(TAN),并配套图引导的多因子检索(MFR)。
这个定位与已覆盖过的 AgeMem 系工作形成有趣的对照:AgeMem 把记忆操作内化为策略的动作空间(学会怎么写),GAM 则主张即使不学,只要把「什么时候允许写」这个闸门装对,就能拿到大部分收益。两者构成「学习 vs. 架构」的正交路线。
论文指向的痛点是记忆污染(Memory Contamination),被拆成两个可观察的失败模式(Figure 1 上半部分):
| 失败模式 | 论文原文 | 机制解释 |
|---|---|---|
| Memory Loss | “established nodes become structurally isolated and forgotten due to weak connectivity” | 新节点持续涌入后旧节点的相对连接度被稀释,在基于连通性/相似度的检索里再也浮不上来——不是被删除,而是结构性失联 |
| Semantic Drift | “distinct topics are erroneously conflated, thereby distorting the agent's thematic consistency” | 未完成的、噪声化的片段被直接合并进长期节点,本应区分的主题被错误缝合 |
成因被归结为流式系统的开闸策略(open-gate policy):“Newly acquired and noisy information is directly appended or merged into the long-term store.”
w/o EPG)。论文的论证结构是「先假设机制 → 用消融反证机制存在」,而非「先测量现象 → 再设计机制」。这决定了它的说服力上限。
新颖之处在于归因层次。此前工作对同一现象的归因分散在别处:A-MEM 归因为缺乏关联结构;MemoryOS 归因为缺乏容量分层;Mem0 归因为抽取质量;AriGraph/Zep 归因为结构与时序表达力。GAM 说:以上都在优化「写什么」和「怎么组织」,没人管「什么时候写」——这是一个真正未被占据的设计维度。
论文对 E_cross 的定位:“These associations act as an index that connects topic nodes in the global graph to the archived snapshots of event graphs within S_arch.”——主题层负责导航,归档层负责证据,这是防止摘要化丢失细节的关键。
| 状态 | 触发条件 | 动作 | 保护目标 |
|---|---|---|---|
| Episodic Buffering | b_t = 0(默认) | V_event ← V_event ∪ {e_t};E_event ← E_event ∪ E_temp | 隔离瞬时噪声,全局层零写入 |
| Semantic Consolidation | b_t = 1 | 生成 v_new = {c_sum, c_raw};更新 V_topic / E_topic;EPG 归入 S_arch 并建 E_cross | 只在语义完整时提交,保证 TAN 信噪比 |
Δ(·,·) 由 LLM 作为 “neural proxy” 评估当前事件图与全局主题网络的语义偏离度。工程上的关键权衡:该检测器不是每轮调用,而由稀疏维护事件(session 结束、缓冲区溢出)触发——把昂贵的 LLM 调用摊薄到整个 session。
指数形式的门控意味着:某因子命中就乘 β_k,不命中乘 1(β⁰ = 1)——乘性、可组合、无需归一化的重排设计。
| 因子 | 符号 | 取值 | 语义 |
|---|---|---|---|
| 时间近因 | β_time | 1.4 | 命中时间相关线索则加权 |
| 角色中心 | β_role | 1.4 | 多方对话中匹配说话人身份 |
| 置信度 | β_conf | 1.2 | 边/节点置信度高则加权 |
β_time 与 β_role 相等而 β_conf 明显更低,暗示作者认为「谁说的」与「什么时候说的」是同等重要的检索线索,系统自身置信度只是次要修正。这在多方对话下合理,但在单人长程对话里 role 因子几乎不提供信息(见 §2.7 批判 3)。
| 项目 | 取值 | 来源 |
|---|---|---|
| Episodic buffer 上限 | 2,048 tokens | 实现细节 |
| 检索深度 k | 10 | 敏感性分析 Fig. 6 |
| 巩固候选召回 | top-5 | 方法节 |
| 嵌入模型 | all-MiniLM-L6-v2 | 实验设置 |
| 重排模型 | ms-marco-MiniLM-L-6-v2 | 实验设置 |
| β_time / β_role / β_conf | 1.4 / 1.4 / 1.2 | Fig. 5 |
| 语义阈值 τ | 未公开 | — |
| 边界检测器开销 | 0.63 s · 932.36 in / 6.15 out tok | 附录 C.1 |
图 1 · LoCoMo 平均 F1:GAM vs 最强基线 Mem0(跨四个 backbone)
数据来源:GAM 论文 Table 1。柱顶百分比为 GAM 相对 Mem0 的相对增益。悬停查看具体数值。
| Backbone · 指标 | ReadAgent | MemoryBank | MemGPT | A-Mem | MemoryOS | Mem0 | GAM | Δ / 相对% |
|---|---|---|---|---|---|---|---|---|
| Llama-3.2-3B · F1 | 4.36 | 6.23 | 6.12 | 21.12 | 20.03 | 30.11 | 36.27 | +6.16 / +20.5% |
| Llama-3.2-3B · B-1 | 3.86 | 5.30 | 5.11 | 16.73 | 14.02 | 21.28 | 30.02 | +8.74 / +41.1% |
| Qwen2.5-7B · F1 | 4.82 | 5.88 | 5.91 | 24.20 | 28.86 | 35.38 | 40.00 | +4.62 / +13.1% |
| Qwen2.5-7B · B-1 | 3.92 | 5.03 | 5.25 | 19.49 | 22.25 | 28.67 | 32.99 | +4.32 / +15.1% |
| Qwen2.5-14B · F1 | 4.27 | 4.57 | 8.98 | 27.14 | 24.11 | 37.29 | 40.38 | +3.09 / +8.3% |
| Qwen2.5-14B · B-1 | 3.82 | 4.17 | 7.59 | 21.76 | 18.20 | 30.66 | 33.55 | +2.89 / +9.4% |
| GPT-4o-mini · F1 | 9.18 | 6.71 | 25.59 | 32.41 | 36.27 | 40.37 | 43.14 | +2.77 / +6.9% |
| GPT-4o-mini · B-1 | 7.03 | 5.71 | 19.73 | 26.45 | 28.87 | 31.45 | 36.48 | +5.03 / +16.0% |
| Backbone | 方法 | Multi-Hop | Temporal | Open-Domain | Single-Hop |
|---|---|---|---|---|---|
| Llama-3.2-3B | Mem0 | 27.51 | 30.08 | 21.33 | 41.52 |
| Llama-3.2-3B | GAM | 28.74 | 46.12 | 21.18 | 49.02 |
| Qwen2.5-7B | Mem0 | 32.86 | 41.22 | 18.24 | 49.21 |
| Qwen2.5-7B | GAM | 35.32 | 48.97 | 21.14 | 54.58 |
| Qwen2.5-14B | Mem0 | 31.45 | 50.20 | 17.66 | 49.85 |
| Qwen2.5-14B | GAM | 33.32 | 50.25 | 20.40 | 57.55 |
| GPT-4o-mini | Mem0 | 32.78 | 56.42 | 20.45 | 51.81 |
| GPT-4o-mini | GAM | 35.88 | 51.96 | 28.12 | 56.58 |
| Backbone · F1 | ReadAgent | MemoryBank | MemGPT | A-Mem | MemoryOS | Mem0 | GAM | Δ vs Mem0 |
|---|---|---|---|---|---|---|---|---|
| Llama-3.2-3B | 3.97 | 3.93 | 3.90 | 4.11 | 5.85 | 6.85 | 7.36 | +0.51 / +7.4% |
| Qwen2.5-7B | 6.41 | 7.22 | 4.94 | 5.49 | 6.76 | 10.27 | 12.55 | +2.28 / +22.2% |
| Qwen2.5-14B | 8.71 | 9.86 | 5.83 | 8.53 | 9.07 | 11.48 | 11.86 | +0.38 / +3.3% |
| GPT-4o-mini | 4.50 | 5.95 | 3.87 | 6.49 | 10.61 | 10.90 | 11.18 | +0.28 / +2.6% |
子集分解(Qwen2.5-7B,Table 5):The Big Bang Theory 18.73(1.00×)| The Office 11.60(0.62×)| Friends 7.32(0.39×)。
| 变体 | 移除组件 | Multi-Hop | Temporal | Open-Dom | Single-Hop | Avg F1 | Avg B-1 | ΔF1 | 相对降幅 |
|---|---|---|---|---|---|---|---|---|---|
| GAM (Full) | — | 35.32 | 48.97 | 21.14 | 54.58 | 40.00 | 32.99 | — | — |
| w/o MFR | 多因子重排 | 33.73 | 46.12 | 16.30 | 47.61 | 35.94 | 29.28 | −4.06 | −10.2% |
| w/o TAN | 主题联想网络 | 31.80 | 39.74 | 16.28 | 52.46 | 35.07 | 29.00 | −4.93 | −12.3% |
| w/o SSM | 状态切换机制 | 30.32 | 39.53 | 16.73 | 43.72 | 32.58 | 26.13 | −7.42 | −18.6% |
| w/o EPG | 事件推进图(写隔离) | 25.35 | 33.61 | 14.59 | 26.68 | 25.06 | 20.76 | −14.94 | −37.4% |
图 2 · 组件重要性:各消融变体相对 GAM 完整版的 Avg F1 降幅
数据来源:GAM 论文 Table 3 / Table 6(Qwen2.5-7B, LoCoMo)。虚线为 GAM 相对最强基线 Mem0 的总增益(4.62 F1)。悬停查看具体数值。
E_cross 无归档可指)。这意味着 GAM 不是一个可以拆开局部采用的方案,工程复用成本高于论文暗示的水平。c_raw / S_arch),不依赖主题层——为「按查询类型走不同检索路径」提供了实证依据。w/o EPG 的 25.06 Avg F1 落在 A-Mem(24.20)与 MemoryOS(28.86)之间,而不是落在 Mem0(35.38)附近。
也就是说:一旦拆掉写隔离,一个拥有完整分层图、语义触发巩固、双粒度节点与三因子重排的系统,会退化到 2025 年初 A-Mem 的水平——所有结构性设计的收益被「开闸写入」一次性吞掉。这是对「记忆污染是主导瓶颈」这一命题最强的实证:结构不是护城河,闸门才是。反过来说,这也是对整条图记忆技术路线的一次冷水——没有写隔离,GraphRAG 式的精致结构在长程对话里带不来它承诺的收益。
| 切分策略 | Avg F1 | 与 GAM 差距 |
|---|---|---|
| 固定窗口 256 tokens | 34.23 | −5.77 |
| 固定窗口 512 tokens | 35.48 | −4.52 |
| 固定轮数 k=3 | 35.61 | −4.39 |
| 固定轮数 k=5 | 36.18 | −3.82 |
| Session 边界 | 36.59 | −3.41 |
| GAM(语义事件触发) | 40.00 | — |
| 条件 | Avg F1 |
|---|---|
| GAM,无噪声 | 40.00 |
| GAM,注入 40% 边界噪声(η=0.4) | 38.60 |
| Session 基线(无噪声) | 36.59 |
| 固定窗口基线(无噪声) | 34.23 |
GAM 在 40% 边界被打乱时仍有 38.60,高于所有启发式基线的无噪声成绩,降幅仅 −1.40(−3.5%)。说明多因子重排与跨层索引对边界错误有显著下游补偿能力——这是被论文低调处理但工程价值很高的结论。
| k | 5 | 10 | 15 | 20 | 40 |
|---|---|---|---|---|---|
| Avg F1 | 38.92 | 40.00 | 39.84 | 39.45 | 37.28 |
峰值在 k=10;k=40(37.28)低于 k=5(38.92),比峰值低 2.72(−6.8%)。典型的检索稀释:多召回的低相关节点挤占了有效证据的注意力预算。k=40 的 37.28 仍高于 Mem0 的 35.38,说明 GAM 下限尚可。
| 因子 | 扫描区间 | 峰值位置 | 峰值 F1 | 行为 |
|---|---|---|---|---|
| β_role | 1.0–2.0 | 1.4 | 40.00 | 单峰 |
| β_time | 1.0–2.0 | 1.4 | 40.00 | 单峰 |
| β_conf | 1.0–2.0 | 1.2 | 40.00 | 平坦(全区间 39.8–40.0) |
β_conf 在整个区间内波动 ≤ 0.2 F1(≤0.5% 相对变化),实际上是一个近乎无效的因子。把它设为 1.0(关闭)也几乎不损失性能。
| 方法 | Tokens/Query | 时延 (s) | Avg F1 | Token 效率 (F1/Ktok) |
|---|---|---|---|---|
| A-Mem | 4221.12 | 2.21 | 24.20 | 5.73 |
| MemoryOS | 3400.41 | 154.22 | 28.86 | 8.49 |
| Mem0 | 1533.94 | 0.51 | 35.38 | 23.06 |
| GAM | 1370.18 | 0.80 | 40.00 | 29.19 |
| Sessions | 事件节点 | 主题节点 | 边数 | Tokens/Query | 时延 (s) |
|---|---|---|---|---|---|
| 3 | 81 | 8 | 371 | 1604 | 0.65 |
| 15 | 363 | 43 | 1791 | 1864 | 4.16 |
| 27 | 657 | 84 | 3307 | 1836 | 4.71 |
| 任务 | AriGraph | GAM (Table 1, F1) | 倍数 |
|---|---|---|---|
| Temporal | 5.51 | 48.97 | 8.89× |
| Multi-Hop | 12.30 | 35.32 | 2.87× |
| Single-Hop | 24.44 | 54.58 | 2.23× |
| Open-Domain | 15.10 | 21.14 | 1.40× |
说明:论文将 AriGraph 放在附录 B.3 而非主表,因其面向文本游戏、迁移到开放域对话属 out-of-domain 使用。本报告在提取该表时发现 Multi-Hop 一行的 GAM 数值与 Table 1 存在对不齐的可能(25.77 恰为 GAM Multi-Hop 的 BLEU-1),故统一采用 Table 1 的 F1 口径,并标注该不确定性。
| 方法 | Accuracy | F1 | BLEU-1 |
|---|---|---|---|
| 直接输入 caption(baseline) | 47.35 | 42.35 | 45.31 |
| GAM | 55.51 | 48.95 | 51.63 |
| 提升 | +8.16 (+17.2%) | +6.60 (+15.6%) | +6.32 (+13.9%) |
这是把视频转成 dense caption 后走文本记忆的代理实验,论文明确不主张 native multimodal。价值在于证明「语义边界触发」这一机制不依赖对话这一特定模态——视频叙事的场景切换同样构成有效边界信号。
真正的贡献不是「提出了一个图记忆系统」,而是三件事:
w/o EPG 的 −37.4% 与切分策略实验里 34–37 带的天花板共同给出了这个轴的收益量级——它比检索优化(−10.2%)重要 3.7 倍。这个结论独立于 GAM 的具体实现而成立。| 可复用件 | 复用形式 | 支撑证据 |
|---|---|---|
| 写隔离缓冲区 | 任何 append-only 长期存储前加一层可丢弃 staging buffer | w/o EPG −37.4% |
| 稀疏触发的 LLM 判别器 | 用维护事件而非每轮触发昂贵判断 | 0.63 s + 932 token / session |
乘性门控重排 ∏ β_k^𝟙_k | 无需归一化、可增量加因子的重排范式 | Fig. 5 单峰、可独立调参 |
| 双粒度节点 | 摘要导航 + 原文取证,抗摘要信息损失 | Single-Hop 对 S_arch 的强依赖 |
| coarse-to-fine 建边 | 向量召回 top-5 → LLM 打分,把 LLM 调用压到 O(5) | 仅巩固时调用 |
b_t 变成策略的一个动作。GAM 与 RL 记忆路线不是竞争关系,而是 GAM 定义了那条路线最该优化的动作。
Limitations 节只谈了模态一件事:“the current instantiation of GAM is limited to text modality... Consequently, the model cannot perform fine-grained reasoning over visual or auditory inputs... We leave this extension to future work and do not claim native multimodal reasoning in the current system.”
可归纳为:(1) 仅文本模态;(2) 无法对视觉/听觉输入做细粒度推理;(3) 明确不主张 native multimodal(对 Table 8 代理实验作了自我限定,这一点是诚实的)。
批判 1 — 增益随 backbone 能力单调收窄,论文未讨论,这威胁到方法的长期价值。
| Backbone | GAM Avg F1 | 次优 | 相对增益 |
|---|---|---|---|
| Llama-3.2-3B | 36.27 | 30.11 | +20.5% |
| Qwen2.5-7B | 40.00 | 35.38 | +13.1% |
| Qwen2.5-14B | 40.38 | 37.29 | +8.3% |
| GPT-4o-mini | 43.14 | 40.37 | +6.9% |
单调递减,从 20.5% 收窄到 6.9%,跨度 2.97 倍。这与论文「架构性缓解记忆污染」的框架不一致:如果污染是架构层面的结构性缺陷,它不应该被 backbone 能力显著补偿;而数据显示它明显被补偿了。更合理的解释是:GAM 的一部分收益来自代替弱模型完成语义组织,而非消除一个模型无关的结构缺陷。论文缺失更强 backbone(GPT-4o / Claude / Qwen-72B 级)的外推点,因此无法排除「收益在前沿模型上趋近于零」。这是本文最重要的未验证风险。
批判 2 — Temporal 任务上的失手模式暴露了主题层的表达缺陷。四个 backbone 上 GAM vs Mem0 分别为 +16.04 / +7.75 / +0.05 / −4.46(BLEU-1 上后两者为 −0.52 和 −3.63)。这不是随机波动,而是与 backbone 能力反向相关的系统性模式。结构上的解释:GAM 的时间信息只体现为重排阶段的乘性 boost β_time = 1.4,主题联想网络本身没有时间轴——E_topic 是语义相关性打分建的边,不携带时序语义。相比之下 Mem0/Zep 会显式维护事实的时间属性与失效关系。这与论文声称的 “fuses temporal, confidence, and role-centric signals” 存在落差:时间是被加权的,不是被建模的。
批判 3 — β_role = 1.4 的设定在单人对话上是无依据的,而主结果的绝大部分来自单人对话。LoCoMo 是双人长程对话,role 因子的判别力极低(先验 50%,仅 1 bit);论文却在 LoCoMo 上把 β_role 调到与 β_time 相同的 1.4 并报告为单峰最优。一个只提供 1 bit 信息的因子却与时间因子同权重,要么说明 Fig. 5 的扫描是在噪声上找峰值,要么说明 role 因子实际在编码别的东西(如说话人风格的词面特征,从而与 F1/BLEU-1 这类词面指标耦合)。论文没有做「LoCoMo 上关闭 β_role」的单独消融,歧义无法排除。
批判 4 — β_conf 是一个装饰性因子,敏感性数据自己承认了这一点。Fig. 5 显示 β_conf 在 [1.0, 2.0] 全区间 F1 稳定在 39.8–40.0,波动 ≤0.2(≤0.5% 相对变化);作为对照 β_role 与 β_time 呈明显单峰。把 β_conf = 1.0(关闭)代入,性能损失在测量噪声内。论文仍将其作为「三因子」之一列入方法贡献并给出 1.2 这个精确取值,这在呈现上夸大了组件数量。诚实的写法应是「两个有效因子 + 一个中性因子」。
批判 5 — 指标选择使 GAM 与社区主流结果不可比,且可能系统性偏向 GAM。GAM 全程用 F1 + BLEU-1,而 LoCoMo 主流报告(含 Mem0 原论文的 +26% 相对提升、−91% p95 时延)用 LLM-as-a-Judge,两者不可换算。这带来两个问题:(i)可比性——读者无法把 43.14 F1 放进社区已有排行中定位;(ii)偏向性——GAM 的 c_raw 原文保留机制天然有利于词面重叠指标,检索回原始文本片段会直接抬高 F1/BLEU-1,而摘要式方法(Mem0 抽取的是改写后的事实)在词面指标上先天吃亏。GAM 相对 Mem0 的部分增益可能来自「是否保留原文」这一表示选择,而非「何时写入」这一核心主张。论文未提供 judge-based 或语义等价指标来隔离这个混淆因素,这是实验设计层面最需要补的一块。
批判 6 — 时延报告的内部不一致,且「comparable latency」的表述不成立。Table 4 报 0.80 s/query,Table 10 在 15/27 sessions 下报 4.16 / 4.71 s,相差 5.2–5.9 倍。即便采用最有利的 0.80 s,相对 Mem0 的 0.51 s 也是 +56.9%,称其为 “comparable latency” 与数据不符。由于论文未公开代码,两表口径差异无法核实,只能标注为待澄清项。
批判 7 — 缺少两类关键竞品对比,使核心主张的验证不完整。
解决了什么问题:第一批把「长期记忆」作为独立系统组件而非上下文技巧来处理的工作之一。引入基于艾宾浩斯遗忘曲线的时间衰减,让记忆强度随时间与重访频率演化。核心贡献一句话:把遗忘从一个缺陷重新定义为一个可设计的机制。
遗留了什么问题:衰减是纯时间函数,与内容语义完全解耦——一条被反复提及的琐事会比一条只说过一次的关键承诺存活更久。存储扁平、记忆间无关系结构,因此「记忆丢失」表现为条目被衰减掉,而非 GAM 刻画的结构性失联。它打开的空间是:遗忘/保留的判据应当来自语义与结构,而不是时钟。
核心工作如何回应:GAM 是这条线的彻底反转——它不做衰减。立场是:入口处就把噪声挡住,下游就不需要靠遗忘来救场。主结果中 MemoryBank 的 Avg F1 只有 4.57–6.71,是全表最弱之一。
关键设计的传递:「记忆强度随事件更新」在 GAM 中以变形存在——β_time = 1.4 就是一个极简化的、只作用于检索期而非存储期的衰减代理。GAM 把衰减从写侧搬到了读侧。
解决了什么问题:用操作系统的虚拟内存隐喻,把有限上下文窗口做成「主存 + 外存」的分页系统。核心贡献一句话:把上下文窗口的物理限制转化为一个可被 agent 自己管理的资源。
遗留了什么问题:分页解决的是容量,不是语义组织。换页由容量压力驱动(页满就换),写入外存的内容不经任何质量筛选——这正是 GAM 批评的 open-gate policy 的原型。它打开的空间是:容量管理 ≠ 记忆管理。
核心工作如何回应:GAM 的 EPG 表面像 MemGPT 的「主存」,但触发语义完全不同:MemGPT 换页由 buffer overflow 触发,GAM 巩固由 b_t = 1(语义边界)触发;overflow 在 GAM 里只是次要触发条件之一。这个替换正是 GAM 的全部主张。数据上 MemGPT 在 LoCoMo(Qwen-7B)Avg F1 为 5.91,GAM 为 40.00(6.77 倍)——这个对比对 MemGPT 不公平(它不是为对话记忆设计的),但足以说明容量隐喻与语义组织之间的鸿沟。
关键设计的传递:分层 + 溢出触发这套骨架被完整继承(2048-token buffer、overflow 作为维护事件之一),只是被降级为「兜底触发器」。
解决了什么问题:Zettelkasten 卡片盒方法的 agentic 实现——每条新记忆自动生成结构化属性、与已有记忆建立链接,并反向更新被链接记忆的上下文表示。核心贡献一句话:让记忆网络自组织,无需预定义 schema。
遗留了什么问题:这正是 GAM 点名的对象。A-MEM 的链接与演化在每条新记忆到达时触发,且直接作用于全局记忆网络——没有写隔离。于是每一条未完成的、含噪的对话片段都有权改写全局结构,Memory Loss 与 Semantic Drift 正是这个机制的直接产物。它打开的空间是:自组织的对象必须是「语义完整的单元」,而不是「每一条到达的片段」。
w/o EPG 的 25.06 与 A-Mem 的 24.20 几乎重合——去掉写隔离后 GAM 就退化成一个 A-MEM。这是全篇对 A-MEM 最精确的定量批注:A-MEM 与 GAM 的差距,几乎全部等于写隔离的价值。关键设计的传递:coarse-to-fine 建边是 A-MEM 链接生成机制的直系后代,改动在于从「每条触发」降频到「每次巩固触发」,把 LLM 调用量从 O(轮数) 压到 O(主题数)。
解决了什么问题:为 agent 构建语义记忆 + 情景记忆一体的知识图谱世界模型,在环境探索中增量更新。核心贡献一句话:证明了结构化图记忆可以支撑长时程的规划与多跳推理,而不只是检索。
遗留了什么问题:GAM 的批评很精准——AriGraph “tailored for text-based games with discrete state transitions, which are rarely present in the ambiguous boundaries of natural conversation.” 文本游戏的每个动作天然构成一次离散状态转移,图更新的时机是环境免费提供的。搬到自然对话后这个信号消失。附录 Table 7 是实证:AriGraph 在 Temporal 上只有 5.51 F1(GAM 48.97,8.89 倍),基本等同失效。它打开的空间是:结构化图记忆的可行性依赖于一个外部的「何时更新」信号;在没有该信号的域里,必须自己造一个。
核心工作如何回应:GAM 的答案就是「自己造」——b_t = 𝟙(Δ(G_event, G_topic) > ε) 正是 AriGraph 在游戏里免费得到的离散状态转移的合成替代品。而 Fig. 4 的噪声鲁棒性(40% 噪声下仍 38.60)进一步说明:这个合成信号不需要精确,只需要大致对齐语义。
关键设计的传递:语义/情景双层记忆的划分被完整继承并重命名——AriGraph semantic ↔ GAM G_topic,AriGraph episodic ↔ GAM G_event + S_arch。GAM 的创新不在这个划分,而在两层之间的转移由什么触发。
解决了什么问题:把 OS 隐喻做实,建立 STM / MTM / LPM 三级存储 + 四模块架构,用类似换页的 heat 机制在层间迁移。原论文报告 LoCoMo(GPT-4o-mini)上 F1 提升 49.11%、BLEU-1 提升 46.18%。核心贡献一句话:把「记忆分层」从隐喻落实为可运行的调度系统。
遗留了什么问题:分层有了,但层间迁移的触发仍是启发式的——由访问热度与容量压力驱动,而非语义完整性。代价在效率表里显露无遗:154.22 s/query,比 GAM 慢 193 倍、比 Mem0 慢 302 倍——多级调度的编排开销吞掉了架构收益。它打开的空间是:层数不是关键变量,触发信号才是;且分层调度的工程开销必须被显式预算。
核心工作如何回应:GAM 做了两件针对性的事——把三级压回两级(TAN + EPG/S_arch)减少调度面;把触发信号从 heat 换成语义边界。结果既超过 MemoryOS 的效果(40.00 vs 28.86,+38.6%),又把时延压回 0.80 s。这条对比是「分层的收益来自语义对齐而非层数」这一命题最直接的证据。
解决了什么问题:面向生产的记忆层——动态抽取显著事实,用 LLM 驱动的 ADD / UPDATE / DELETE 维护紧凑事实库。原论文报告 LoCoMo 上相对 OpenAI 记忆方案 +26%(LLM-as-a-Judge)、p95 时延低 91%、token 成本降 90%+。核心贡献一句话:证明了轻量抽取式记忆在成本/效果比上可以压过重型架构。
遗留了什么问题:Mem0 是 GAM 主表里最强的基线,但更新是逐条、即时、直接作用于全局事实库的——教科书式的 open-gate。抽取器面对一段尚未讲完的叙事时只能基于片段做决策,错误一旦写入就需后续 UPDATE/DELETE 纠正。此外抽取式表示丢弃原文,细粒度证据不可回溯。它打开的空间是:在保持轻量的前提下,能否给写入加一道语义闸门?
核心工作如何回应:GAM 的回答是「能,而且几乎不加成本」——1370.18 tok/query 低于 Mem0 的 1533.94(−10.7%),Avg F1 高 4.62(+13.1%),代价只是 +0.29 s 时延和一个稀疏的边界检测器。双粒度节点直接补上 Mem0 丢弃原文的缺口。
关键设计的传递:Mem0 的「紧凑摘要以控 token」被继承为 c_sum;GAM 的改动是在其旁边并置 c_raw,用 E_cross 按需取用——即用索引换存储,而不用摘要换 token。
这条线背后的推动力,是「记忆系统的控制变量」逐级上移:
| 阶段 | 被优化的变量 | 代表工作 | 触发信号来源 |
|---|---|---|---|
| 一 · 存多久 | 保留时长 | MemoryBank | 时钟 |
| 二 · 存哪儿 | 容量层级 | MemGPT → MemoryOS | 容量压力 / 访问热度 |
| 三 · 存成什么 | 表示结构 | AriGraph、A-MEM、Mem0 | 内容到达 |
| 四 · 什么时候存 | 写入时机 | GAM | 语义完整性 |
| 五 · 要不要存(学出来) | 写入策略 | Memory-R1 / MemAct / AgeMem | 任务回报 |
转折一(阶段二 → 三):社区意识到「容量管理 ≠ 记忆管理」。MemGPT 之后所有工作都开始在表示上做文章(图、卡片、事实三元组),触发信号却统一退化为「内容一到就写」。这是 open-gate 时代,也是记忆污染问题被批量制造出来的时期。
转折二(阶段三 → 四):GAM 指出表示的军备竞赛已经边际收益递减——w/o EPG 说得很清楚,再精致的表示在开闸写入下都会退回 A-MEM 水平。控制变量必须从「写什么」上移到「何时写」。
b_t,RL 路线则把记忆操作变成可学动作。GAM 的贡献恰恰是证明了 b_t 这个动作值得学——它的收益量级(−37.4%)远大于检索优化(−10.2%)。一句话概括五个阶段:从「按时钟遗忘」→「按容量搬运」→「按内容组织」→「按语义门控」→「按回报学习」。前四步都在把触发信号从系统外部(时钟、容量)搬向任务内部(语义),第五步则是把它彻底交给学习。
b_t,但没回答「最优边界是什么」。可操作切入:把巩固建模为最优停止问题——在事件流上每轮选择「继续缓冲」或「提交」,目标是最大化提交后主题节点对未来查询分布的互信息 I(v_new ; Q_future) 减去写入代价。这能给出 b_t 的可计算上界,也能解释 Fig. 3 中「启发式全部卡在 34–37 带」是否为信息论必然。门槛低在于:LoCoMo 已有查询标注,可直接近似 Q_future。{c_sum, c_raw} 把存储成本翻倍以换证据可回溯。消融显示 Single-Hop 高度依赖 c_raw(−51.1%),多跳/时序更依赖 c_sum。缺一个刻画:给定存储预算下 c_raw 保留比例 ρ 与各类查询准确率的 trade-off 曲线。这可直接与率失真那条压缩线接上——双粒度本质上是一个双码率方案。b_t 变成可学动作(高价值 · 中门槛)。边界检测器是一个二分类器,天然可用 GRPO/DPO 类方法在下游 QA 回报上微调。关键设计问题是奖励延迟——巩固决策的回报要在数十轮后兑现。可行替代:用 §5.1.1 的互信息代理作为过程奖励绕开延迟。(这与 AttriMem「用 token 级归因构造局部奖励」的思路同构,值得交叉验证。)E_topic 加 bi-temporal 标注边(事件发生时间 + 记录时间,即 Zep 与 Governed Shared Memory 的 temporal supersession 做法),并在 Stage 2 下钻时支持时间区间过滤,而不是把时间塞进 Stage 3 的乘性 boost。可直接在 LoCoMo Temporal 子集上验证是否消除该失手。c_raw 类设计会系统性「刷分」。EvoMemBench 与 Memora 各补了一角,但尚无一个基准同时覆盖。v_new 一旦进入 TAN 就不可撤销。但边界检测有 ~40% 的容错空间(Fig. 4),意味着错误巩固一定会发生。缺一个机制:当后续证据表明某次巩固切错主题时,把 v_new 拆回 S_arch 并重新巩固。这需要给 E_cross 加版本语义——技术上与 §5.2.6 的 bi-temporal 边是同一套基础设施。b_t 从「语义完整性判据」扩展为「语义完整性 + 来源权威性」的联合判据,是一个自然且未被占据的组合。b_t 触发时同时做来源绑定校验。当前的记忆安全工作(TMA-NM)在写时做 origin binding,GAM 在写时做语义门控,两者的触发点完全重合但从未被合并讨论。这是一个明显的空白。| 工作 | 发表年月 | 会议/出版 | 核心贡献 | 主要指标(来源) | 与 GAM 的关系 |
|---|---|---|---|---|---|
| MemoryBank | 2023-05 / 2024-02 | AAAI 2024 | 艾宾浩斯遗忘曲线驱动的记忆衰减 | LoCoMo Avg F1 4.57–6.71(Table 1) | 问题来源:遗忘判据与语义解耦;GAM 反转为「入口拦截」 |
| MemGPT | 2023-10 | arXiv | 虚拟内存分页 + 自主换页函数调用 | LoCoMo Avg F1 5.91–25.59(Table 1) | 技术来源:缓冲区 + overflow 触发被降级为兜底触发器 |
| AriGraph | 2024-07 / 2025-08 | IJCAI 2025 | 语义+情景一体的 KG 世界模型 | Temporal 5.51 / Single-Hop 24.44(Table 7) | 问题+技术来源:双层划分被继承;其「依赖环境提供离散边界」的缺陷正是 GAM 要合成的信号 |
| A-MEM | 2025-02 | NeurIPS 2025 | Zettelkasten 式自组织链接 + 记忆演化 | LoCoMo Avg F1 21.12–32.41(Table 1) | 最直接的对手:w/o EPG=25.06 ≈ A-Mem=24.20,量化了写隔离的全部价值 |
| Mem0 | 2025-04 | arXiv | 生产级抽取式事实库 + ADD/UPDATE/DELETE | LoCoMo Avg F1 30.11–40.37(Table 1);原文 +26% J | 最强基线:GAM 全面领先但 Temporal 在强 backbone 下反被超 |
| MemoryOS | 2025-05 | EMNLP 2025 Main (Oral) | STM/MTM/LPM 三级存储 + heat 换页 | Avg F1 20.03–36.27;154.22 s/query(Table 1/4) | 反面教材:证明「层数不是关键变量、触发信号才是」 |
| ★ GAM | 2026-04 / 2026-07 | ACL 2026 Main, Long | 语义边界触发的 encoding–consolidation 解耦 | Avg F1 36.27 / 40.00 / 40.38 / 43.14;1370 tok/q | — |
表格读出的三条趋势:
对「agent 用 markdown 文件系统当长期记忆」这一实际部署形态的首个系统性研究,结论相当逆耳:组织良好的存储在材料多时可把检索成本减半,但多数 agent 无法随记忆增长维持组织结构,且更好的组织并不稳定地带来更好的答案。最有意思的一条:工具选择对记忆结构的影响与换底座模型相当。与 GAM 形成对照——GAM 假设结构化组织有价值,这篇质疑这个假设在真实 agent 手里能否维持。
arXiv | Code: 未找到
用 token 级贡献度归因构造局部奖励,补在 outcome reward 之上训练记忆构建策略,报告在长程对话 QA 上优于检索式、启发式与其他 RL 方法并改善优化稳定性。这是对「轨迹级优势广播无法区分冗余/无效/有害操作」这一老问题的正面回应,也正是 §5.2.5 提到的过程奖励思路的现成实例。
arXiv | Code: 未找到
把 KV cache 管理到 agent 长期存储统一成同一个率失真决策,给出七轴分类法。核心发现对 GAM 很有杀伤力:注意力幅度、近因等选择信号会系统性失败,因为它们在查询到达之前就丢弃了信息——这恰是 GAM 的 β_time 式重排无法规避的问题。(注:已在既往报告中详述,此处仅作交叉引证。)
arXiv
刻画多 agent 共享记忆的四种失败模式——未授权泄露、陈旧传播、矛盾持存、来源坍塌,给出 scoped retrieval / temporal supersession / provenance tracking / policy-governed propagation 四个系统原语,在生产多租户服务 MemClaw 上验证(深度 4 推导链 100% 写者身份正确、跨 fleet 零泄露)。temporal supersession 正是 §5.2.6 建议 GAM 补上的那块。
arXiv | Code: 未找到
证明依赖内容分析或推导追踪的现有防御会被三种 LLM 特有的「攻击洗白」通道绕过(agent 摘要、可信工具回显、伪造佐证),并形式化证明写时来源绑定是必要的。八个前沿模型上现有防御攻击成功率最高 68%,TMA-NM 降到 0%。与 GAM 的写门控在触发点上完全重合(见 §5.3.10)。
arXiv
沿「记忆范围 × 记忆内容」两维统一评测 15 种记忆方法。五条结论都很扎手:长上下文基线依然有竞争力;收益主要出现在 16–32K 的受限预算下;不同域需要不同记忆类型;知识修订比知识保持难得多;跨环境迁移只在结构对齐时成功。对 GAM 而言第二条尤其值得警惕——它暗示记忆架构的收益窗口可能随上下文窗口扩张而关闭。
arXiv
覆盖周/月/季三档时间跨度、10 个 persona,要求跨 5–28 个历史 session 做记忆整合、处理 2–15 次知识更新,提出 FAMA(Forgetting-Aware Memory Accuracy)显式惩罚使用已失效记忆。关键发现:所有系统从周到季单调退化;推理任务平均分低于 28/100;引入遗忘惩罚后分数下降 5–43 分。正好补上 GAM Table 10 缺失的「长程性能衰减」那一列。
arXiv
实证刻画 agent 的 experience-following 属性:任务输入与被检索记忆输入越相似,输出就越相似——由此导出两个失败模式,错误传播与错位经验重放。提出用「未来任务的评估结果」作为已存记忆的质量信号。与 GAM 互补:GAM 管「何时写」,这篇管「写进去的东西质量如何被事后判定」。
ACL Anthology
按语义抽象度分层组织记忆,每个记忆向量内嵌位置索引编码指向下层子记忆,实现逐层检索而无需穷举相似度计算;在 LoCoMo 五类任务上超过五个基线。与 GAM 的分层动机相近但手段正交(索引编码 vs. 语义边界触发),值得做组合实验。
ACL Anthology
用滑动窗口均值 + 指数移动平均融合,动态刻画用户偏好的即时波动与长期趋势,在 LoCoMo 五类场景上对五个基线均有提升。它填的是 GAM 不处理的一块:记忆内容随用户偏好演化,而非随叙事结构演化。
ACL Anthology
| 维度 | 结论 |
|---|---|
| 核心工作 | GAM (ACL 2026 Main Long) — 语义边界触发的记忆巩固 |
| 一句话 | 写入时机是记忆系统被忽视的第一性变量,其收益是检索优化的 3.68 倍 |
| 最强证据 | w/o EPG → 25.06 Avg F1,落回 A-Mem (24.20) 水平:拆掉写隔离,全部结构性设计归零 |
| 第二强证据 | 五种启发式切分全部卡在 34.23–36.59 带内,语义触发一步到 40.00:性能非切分粒度的平滑函数 |
| 最好的数 | 1370 tok/query(比 Mem0 少 10.7%)+ 40.00 Avg F1(比 Mem0 高 13.1%);27 sessions 下 token 仅增 14.5% |
| 最大的坑 | 增益随 backbone 能力单调收窄 20.5% → 6.9%,缺前沿模型外推点 |
| 第二大坑 | 只报 F1/BLEU-1;c_raw 保留原文天然有利于词面指标,混淆未被隔离 |
| 失手处 | GPT-4o-mini / Temporal:51.96 vs Mem0 56.42(−7.9%)——时间被加权而非被建模 |
| 最该做的下一个实验 | GAM(架构门控)vs AgeMem/Memory-R1(学习门控)的 head-to-head + 组合实验 |
| 可复用件 | 写隔离缓冲区、稀疏触发 LLM 判别器、乘性门控重排、双粒度节点 |