ACL 2026 · Agent Memory · 每日文献追踪
Multi-Graph based Agentic Memory Architecture for AI Agents · Jiang, Li, Li, Li(UT Dallas / U. Florida)
一句话定位:记忆的结构不该是一张什么都往里塞的图,而应该是若干张语义上互不重叠的关系视图;检索则退化为一个由「问题意图」决定走哪张图的策略性遍历问题。
本期检索覆盖 ACL Anthology 2026、EACL 2026、NeurIPS 2025 proceedings、ICLR 2026 MemAgents workshop、arXiv cs.CL/cs.AI,以及 Agent-Memory-Paper-List 与若干 awesome-list,累计过筛 25+ 篇 2025-08 至 2026-07 的候选工作。
按任务给定优先级(顶会主会长文 > Findings/Workshop > arXiv 预印本),选定 MAGMA(ACL 2026 主会长文)。它满足全部硬条件:ACL 2026 Vol.1 Long Papers、arXiv v1 为 2026-01(6 个月内)、有可访问开源实现、与已覆盖的 MemGPT / A-MEM / Mem0 / Memory-R1 / MemAct / AgeMem 均不重复——A-MEM、MemoryOS 在本报告中仅作为前驱工作出现。覆盖子方向:记忆架构 + 记忆检索。
| 项目 | 链接 | 状态 |
|---|---|---|
| 会议页(ACL Anthology) | 2026.acl-long.1709 | ✅ 已访问 |
| 正式 PDF | acl-long.1709.pdf | ✅ 已访问 |
| DOI | 10.18653/v1/2026.acl-long.1709 | ✅ |
| arXiv(v1, 2026-01) | 2601.03236 · HTML | ✅ 已访问 |
| 代码 | FredJiang0324/MAGMA | ✅ 已访问(约 150 stars,README 标注 ACL 2026) |
| HuggingFace Papers | papers/2601.03236 | ✅ |
github.com/FredJiang0324/MAMGA(MAMGA 拼写颠倒),实际可达仓库是 .../MAGMA。按论文原文复制会 404。
| 基准 | 论文 | 链接 | 代码 / 数据 |
|---|---|---|---|
| LoCoMo | Maharana et al., ACL 2024 | ACL Anthology · arXiv 2402.17753 | snap-research/locomo · 项目页 |
| LongMemEval | Wu et al., ICLR 2025 | arXiv 2410.10813 · OpenReview | xiaowu0162/LongMemEval |
| 工作 | 会议页 | arXiv | 代码 |
|---|---|---|---|
| MemGPT (2023) | ACL 2023 companion(按论文引用) | 2310.08560(本次未逐一验证,标注为论文引用) | 未找到(论文未印出) |
| GraphRAG (2024) | 未找到正式会议页 | 2404.16130(v1 2024-04-24;v2 2025-02-19) | 论文未印出(社区仓库 microsoft/graphrag) |
| Zep / Graphiti (2025) | 未找到正式会议页(技术报告) | 2501.13956(v1 2025-01-20,12 页 3 表) | 论文未印出 |
| A-MEM (2025) | NeurIPS 2025 Proceedings | 2502.12110 | WujiangXu/A-mem |
| MemoryOS (2025) | EMNLP 2025 Main(Oral) | 2506.06326 | BAI-LAB/MemoryOS |
| Nemori (2025→2026) | 未找到正式会议页 | 2508.03341(v1 2025-08-05;v4 2026-04-16 已改题) | 未找到 |
原文主张的译述(非泛化概括):现有 Memory-Augmented Generation(MAG)系统把记忆存成单一的、以语义相似度为唯一索引的整体库,因此「把时序、因果与实体信息纠缠(entangle)在一起」。MAGMA 让每一条记忆条目同时存在于语义、时序、因果、实体四张正交图中,并把检索形式化为在这些关系视图上的策略引导遍历(policy-guided traversal)。
这句话的分量在于:它把记忆系统的瓶颈从「存什么」重新定位到「以什么关系存」。Nemori 回答「什么值得记」,MemoryOS 回答「记多久、放哪一层」,A-MEM 回答「记忆之间要不要连边」——MAGMA 问的是「连的是哪一种边,以及提问时该走哪一种边」。
具体痛点(论文 §1):① 注意力随距离衰减(lost-in-the-middle)——单靠拉长上下文无法解决长程记忆;② 单一语义索引丢失关系结构,论文点名 A-MEM 一类方法「retrieval via semantic embedding similarity, missing relations such as temporal or causal」;③ 对象恒常性断裂——同一实体在被打断的时间线片段中被反复提及时,纯语义检索无法把这些片段串成一个对象,这是引入 entity graph 的直接理由。
痛点是如何被量化的?论文没有给出独立的诊断性实验来量化这三条,采用的是间接论证:既然全上下文(101K tokens)在 LongMemEval 上只有 55.0%,而 3.4K tokens 的结构化检索能到 61.2%,那么「更长上下文 ≠ 更好记忆」就被证成了。
不过案例研究(Table 8 / §E.2)提供了三个可核查的定性证据:
| 场景 | 基线行为 | MAGMA 行为 | 归因的图 |
|---|---|---|---|
| 事实检索 | A-MEM / MemoryOS 只取回 "clarinet",漏掉 "violin" | 沿实体子图遍历,两者都取回 | Entity |
| 逻辑推断("几个孩子?") | 基线只抽取显式的 "two" | 多跳实体消解(照片两个 + 一个儿子 + 兄弟区分)→ "at least three" | Entity + Causal |
| 时间归一化("yesterday") | A-MEM / MemoryOS 幻觉出错误日期 | 正确归一到 2023-10-19 | Temporal |
问题的新颖之处:新意不在于「用图」(GraphRAG、Zep 都用图),而在于拒绝把不同语义类型的关系压进同一张图。Zep 把时间做成边上的属性;GraphRAG 把实体和社区做成一张图的两个层级;A-MEM 的链接是同质的。MAGMA 的赌注是:关系类型的解耦本身就能带来增益,因为它让「检索策略」有了可以选择的对象。
论文的推进不是章节罗列,而是一条相当干净的归谬链:
| 图 | 边集定义 | 判定方式 | 解决的具体失效 |
|---|---|---|---|
| 时序 Etemp | 严格有序对 (n_i, n_j),τ_i < τ_j | 规则,写入时 O(1) 即时建立 | "yesterday" 无法归一到绝对日期 |
| 因果 Ecausal | 有向边,S(n_j|n_i, q) > δ | LLM 慢路径异步推断,带置信度 | "为什么" 类问题无法从结果回溯原因 |
| 语义 Esem | 无向边,cos(v_i, v_j) > θsim | 向量相似度阈值 | (传统 RAG 的能力,作为基座) |
| 实体 Eent | 事件 ↔ 抽象实体节点的二部连接 | 元数据 A_i 中的实体抽取 | 对象恒常性:同一实体跨不连续时间片断裂 |
阶段 1 — 查询分析与分解:意图分类 T_q ∈ {Why, When, Entity};时间解析(相对表达 → 绝对区间 [τ_s, τ_e]);表示抽取(稠密 q⃗ + 稀疏关键词 q_key)。
阶段 2 — 多信号锚点识别(Reciprocal Rank Fusion):
阶段 3 — 自适应遍历策略(启发式 beam search),转移打分同时吃「结构对齐」和「语义亲和」:
即:边类型权重向量 w 是意图 T_q 的函数——问 "Why" 时因果边权重抬高,问 "When" 时时序边权重抬高。每步保留 top-k 节点,随深度施加衰减因子 γ。
阶段 4 — 图线性化的叙事合成:
| 参数 | 取值 / 范围 | 作用 |
|---|---|---|
| λ₁(结构系数) | 1.0(基准) | 边类型对齐权重 |
| λ₂(语义系数) | 0.3 – 0.7 | 语义亲和权重 |
| θsim | 0.75 | 语义边建边阈值 |
| δ(因果置信阈) | 0.6 | 因果边建边阈值 |
| Beam width | 8 | 每步保留节点数 |
| Max depth | 4 – 5 hops | 遍历深度上限 |
| Max nodes retrieved | 200 | 子图规模上限 |
| γ(衰减) | 0.85 | 逐层衰减 |
| 意图自适应权重 w | entity 2.5–6.0 / temporal 0.5–4.0 / causal 3.0–5.0 | wT_q 实际取值域 |
论文自述这些参数「empirically optimized on the LoCoMo benchmark」,但没有给出任何一条敏感性曲线或扫参表(见 §2.7 B3)。
实验设置:主干 gpt-4o-mini(检索推理 + 回答生成 + LLM-as-Judge,judge 温度 0.0);嵌入默认 all-MiniLM-L6-v2(384 维),可选 text-embedding-3-small(1536 维)。LoCoMo 1,986 条 = single-hop 841 / adversarial 446 / temporal 321 / multi-hop 282 / open-domain 96,对话平均约 9K tokens。LongMemEval 平均上下文 >100K tokens,6 类问题。指标:主指标 LLM-as-a-Judge([0,1]),辅助 token-level F1、BLEU-1。
| 方法 | Multi-Hop | Temporal | Open-Domain | Single-Hop | Adversarial | Overall |
|---|---|---|---|---|---|---|
| Full Context | 0.468 | 0.562 | 0.486 | 0.630 | 0.205 | 0.481 |
| A-MEM | 0.495 | 0.474 | 0.385 | 0.653 | 0.616 | 0.580 |
| MemoryOS | 0.552 | 0.422 | 0.504 | 0.674 | 0.428 | 0.553 |
| Nemori | 0.569 | 0.649 | 0.485 | 0.764 | 0.325 | 0.590 |
| MAGMA (ours) | 0.528 | 0.650 | 0.517 | 0.776 | 0.742 | 0.700 |
| 样本数(占比) | 282 (14.2%) | 321 (16.2%) | 96 (4.8%) | 841 (42.4%) | 446 (22.5%) | 1,986 |
| 类别 | 最强基线 | MAGMA | 绝对差 | 相对提升 |
|---|---|---|---|---|
| Multi-Hop | Nemori 0.569 | 0.528 | −0.041 | −7.2%(失手) |
| Temporal | Nemori 0.649 | 0.650 | +0.001 | +0.2% |
| Open-Domain | MemoryOS 0.504 | 0.517 | +0.013 | +2.6% |
| Single-Hop | Nemori 0.764 | 0.776 | +0.012 | +1.6% |
| Adversarial | A-MEM 0.616 | 0.742 | +0.126 | +20.5% |
| Overall | Nemori 0.590 | 0.700 | +0.110 | +18.6% |
这是全文最有说服力、同时也最令人不安的定量证据——而它并不在论文里,是从论文自己的表格算出来的。
LoCoMo 的 Overall 是样本加权微平均。用样本数回代 Table 1,可以精确复现 MAGMA(0.7003 vs 报告 0.700)、A-MEM(0.5804 vs 0.580)、MemoryOS(0.5525 vs 0.553)三行。把 MAGMA 相对 Nemori 的总差值按类别分解:
图 1 · MAGMA 相对 Nemori 的 LoCoMo 总差值,按问题类别分解
单位:对加权 Overall 的绝对贡献(本报告推算,基于论文 Table 1 与 §4.6 样本数)· 悬浮查看数值
图 2 · 报告的 Overall 分 vs 剔除对抗类后的加权分(LoCoMo)
蓝:论文 Table 1 报告的 Overall(含 446 条不可答样本)· 橙:仅 1,540 条可答样本上的加权分(本报告推算)
| 类别 | 权重 | 对总差值的贡献 | 占比 |
|---|---|---|---|
| Adversarial | 22.46% | +0.0937 | +98.98% |
| Single-Hop | 42.35% | +0.0051 | +5.37% |
| Open-Domain | 4.83% | +0.0015 | +1.63% |
| Temporal | 16.16% | +0.0002 | +0.17% |
| Multi-Hop | 14.20% | −0.0058 | −6.15% |
| 合计 | 100% | +0.0946 | 100% |
这不意味着 MAGMA 没有价值——把弃权校准从 0.325 拉到 0.742 是一个非常实用的工程成果,很可能正是 <ref:n_i.id> provenance 标注 + 结构化子图(「我沿着因果边走了 4 跳都没找到相关节点」是一个比「向量相似度都很低」更可判定的证据)带来的。但论文把它包装成「在长程推理任务上一致优于 SOTA」,是一个与自己数据不符的叙述:在真正需要推理的 1,540 条上,MAGMA 与 Nemori 统计上无法区分。
| 方法 | 由分项复现的微平均 | 论文报告的 Overall | 差值 |
|---|---|---|---|
| MAGMA | 0.7003 | 0.700 | +0.0003 ✅ |
| A-MEM | 0.5804 | 0.580 | +0.0004 ✅ |
| MemoryOS | 0.5525 | 0.553 | −0.0005 ✅ |
| Nemori | 0.6057 | 0.590 | +0.0157 ❌ |
| Full Context | 0.4936 | 0.481 | +0.0126 ❌ |
三行严丝合缝(误差 <0.0005),两行差 0.013–0.016。这两行恰好是论文自己没有跑、极可能直接引自 Nemori 原论文的两行(Nemori 与 Full-Context 通常成对出现在 Nemori 的表里)。若成立,则该表混合了两套 judge 协议。
| 问题类型 | Full-context (101K tok) | Nemori (3.7–4.8K tok) | MAGMA (0.7–4.2K tok) |
|---|---|---|---|
| single-session-preference | 6.7 | 62.7 | 73.3 |
| single-session-assistant | 89.3 | 73.2 | 83.9 |
| temporal-reasoning | 42.1 | 43.0 | 45.1 |
| multi-session | 38.3 | 51.4 | 50.4 |
| knowledge-update | 78.2 | 52.6 | 66.7 |
| single-session-user | 78.6 | 77.7 | 72.9 |
| Average(论文报告) | 55.0 | 56.2 | 61.2 |
| 统计口径 | Full-context | Nemori | MAGMA |
|---|---|---|---|
| 论文报告的 Average | 55.0 | 56.2 | 61.2 |
| 六类的算术平均 | 55.53 | 60.10 | 65.38 |
| 差值 | −0.53 | −3.90 | −4.18 |
| 剔除 preference 后五类算术平均 | 65.30 | 59.58 | 63.80 |
两点推论:① 论文的 "Average" 行不是所列六类的算术平均,说明使用了各类样本数加权——但论文没有披露每类的样本数,读者无法复核,这是一处透明度缺口。② 更关键:一旦剔除 single-session-preference 这一类,Full-context(65.30)反超 MAGMA(63.80)。MAGMA 在 6 类中有 3 类输给 Full-context(assistant −5.4pp、knowledge-update −11.5pp、user −5.7pp)。
因此 LongMemEval 上诚实的结论应当是:MAGMA 用约 96% 更少的 token(0.7–4.2K vs 101K)取得了与全上下文大体相当、略优的平均准确率,并在偏好类问题上有巨大优势——这是一个漂亮的效率结论,而不是一个能力结论。
| 配置 | Judge | F1 | BLEU-1 |
|---|---|---|---|
| w/o Adaptive Policy | 0.637 | 0.413 | 0.357 |
| w/o Causal Links | 0.644 | 0.439 | 0.354 |
| w/o Temporal Backbone | 0.647 | 0.438 | 0.349 |
| w/o Entity Links | 0.666 | 0.451 | 0.363 |
| MAGMA (Full) | 0.700 | 0.467 | 0.378 |
| 移除的组件 | ΔJudge | 相对降幅 | ΔF1 | ΔBLEU-1 |
|---|---|---|---|---|
| Adaptive Policy | −0.063 | −9.00% | −0.054 (−11.6%) | −0.021 (−5.6%) |
| Causal Links | −0.056 | −8.00% | −0.028 (−6.0%) | −0.024 (−6.3%) |
| Temporal Backbone | −0.053 | −7.57% | −0.029 (−6.2%) | −0.029 (−7.7%) |
| Entity Links | −0.034 | −4.86% | −0.016 (−3.4%) | −0.015 (−4.0%) |
| 配置 | Multi-Hop | Temporal | Open-Domain | Single-Hop | Adversarial | Overall |
|---|---|---|---|---|---|---|
| Causal Only | 0.470 | 0.460 | 0.430 | 0.650 | 0.680 | 0.590 |
| Temporal Only | 0.440 | 0.620 | 0.450 | 0.650 | 0.520 | 0.577 |
| Entity Only | 0.485 | 0.420 | 0.460 | 0.640 | 0.450 | 0.531 |
| Full MAGMA | 0.528 | 0.650 | 0.517 | 0.776 | 0.742 | 0.700 |
三条可验证的观察(本报告推算):
| 方法 | Build Time (h) | Tokens/Query (k) | Latency (s) |
|---|---|---|---|
| Full Context | N/A | 8.53 | 1.74 |
| A-MEM | 1.01 | 2.62 | 2.26 |
| MemoryOS | 0.91 | 4.76 | 32.68 |
| Nemori | 0.29 | 3.46 | 2.59 |
| MAGMA | 0.39 | 3.37 | 1.47 |
相对差(本报告推算):MAGMA 查询延迟 1.47 s 比 Nemori 快 43.2%、比 A-MEM 快 35.0%、比 MemoryOS 快 95.5%、甚至比 Full Context 还快 15.5%(送进去的 token 少 60.5%)。代价在构建侧:0.39 h 比 Nemori 慢 34.5%;tokens/query 3.37k 比 A-MEM 多 28.6%。
它真正的贡献是什么。MAGMA 把 agent memory 的检索问题从度量学习问题(怎么把 query 和 memory 嵌到同一个空间里)改写成了策略问题(在若干种已知语义的关系上,选择走哪一种)。这个改写的价值在于:它让检索行为变得可解释、可干预、可组合。向量检索的失败你只能靠换 embedding 修;关系遍历的失败你可以定位到「因果边没建出来」或「意图分类判错了」。
φ(r, T_q) = w_{T_q}ᵀ·𝟙_r)——只要记忆有多种边类型就能用,与边的具体语义无关。消融显示它是单一最大贡献项(−0.063)。<ref:id> provenance 标注——很可能是 adversarial 从 0.325 跃升到 0.742 的机制性来源(模型可以「看见」自己没有证据)。对后续工作的启发。把 φ 从手工权重表换成学出来的策略是最直接的下一步。目前 w_{T_q} 是人工设定的(entity 2.5–6.0 / temporal 0.5–4.0 / causal 3.0–5.0),意图分类也只有三类。这正好是 MemRL / Memory-R1 那条 RL 线可以嫁接进来的位置——MAGMA 提供了动作空间,RL 那条线提供了学习信号。
论文声称「consistently outperforms SOTA agentic memory systems on long-horizon reasoning tasks」。但按 §3.2 的分解,相对最强基线 Nemori 的整体优势中 98.98% 来自 adversarial(弃权)一列;剔除该列后的 1,540 条样本上,MAGMA 0.6882 vs Nemori 0.6869,差 +0.13pp。"consistently" 一词在 multi-hop 上也被直接证伪(0.528 vs 0.569,−7.2%)。准确的主张应当是「显著改善了不可答问题上的弃权校准,并在同等推理精度下大幅降低延迟」。
论文反复强调 semantic / temporal / causal / entity 四张正交图,但 Table 4 只有 w/o Causal / w/o Temporal / w/o Entity,没有 w/o Semantic;Table 5 只有 Causal Only / Temporal Only / Entity Only,没有 Semantic Only。而 "Semantic Only" 恰恰是本文的零假设——它约等于把 MAGMA 退化成一个带 beam search 的向量 RAG。缺了这一格,「关系解耦带来增益」这个核心主张就没有对照它自己的 null。这不是可有可无的一格,是唯一那格。
Appendix B 给出 λ₂ ∈ [0.3, 0.7]、θsim=0.75、δ=0.6、beam=8、γ=0.85,自述「empirically optimized on LoCoMo」,但没有一条敏感性曲线、没有一张扫参表。后果有二:(i) 无法判断 0.700 有多少来自在测试基准上调参(θsim 与 δ 直接决定图的稠密度,是高杠杆参数);(ii) 无法判断该配置迁移到别的语料需要多少重新调参。对一个把阈值建图作为机制核心的系统,这是实质性缺失。
按 §3.3,MAGMA / A-MEM / MemoryOS 三行可由分项精确复现(|Δ|<0.0005),而 Nemori(Δ=+0.0157)与 Full Context(Δ=+0.0126)两行不能。修正 Nemori 后,MAGMA 的领先从 +18.6% 降到 +15.6%。这两行恰好是最可能被外部引用而非自跑的两行,暗示表内混合了两套评测协议。
LOO 降幅之和 0.206 是「全图 − 最好单图」间隙 0.110 的 1.87 倍(§3.6)。若四视图真具备论文所暗示的独立性,二者应接近。1.87× 说明四张图功能上强耦合。论文的 "orthogonal" 仅指边集互不相交(表示层),但全文语气持续暗示贡献可分解(效果层)。这是一个会误导后续工作的措辞——按「可分解」去做模块化裁剪的人会拿到远低于预期的结果。
Table 1 的四个基线是 Full Context / A-MEM / MemoryOS / Nemori,没有任何一个图记忆系统。而 related work 明确点名了 GraphRAG 与 Zep,Zep 原论文还报告了 LongMemEval 上「最高 +18.5% 准确率、−90% 延迟」。既然核心主张是「单图不够,要多图」,那么至少要有一个单图(Zep 或 GraphRAG)基线才能把「多图 vs 单图」这一刀切出来。目前的对照只能证明「有结构 > 无结构」,不能证明「多图 > 单图」——而后者才是本文的贡献声明。
MAGMA 在 multi-hop 上 0.528,落后 Nemori 的 0.569 达 4.1pp(−7.2%)。这在结构上是反直觉的:多图遍历本该最擅长多跳。一个可检验的假说是 beam width=8 / max depth=4–5 的剪枝在多跳场景下过早收敛——Table 5 显示 Causal Only 在 multi-hop 只有 0.470、Entity Only 0.485,全图才 0.528,说明多跳恰恰最依赖跨图组合,而 beam search 的逐层剪枝会在跨图切换时丢掉候选。论文对此完全没有讨论。相比之下 Nemori 走「叙事化压缩」路线,把跨事件关系提前烘焙进叙事文本,反而不受遍历剪枝之苦。
LoCoMo 把 22.5% 的样本设为不可答,然后用同一个 LLM-Judge 分把「答对了」和「正确地拒答了」加总成一个 Overall。这个聚合方式让弃权保守的系统天然占优——一个永远拒答的系统能在 adversarial 上拿满分、拿到 0.225 的免费 Overall。建议后续工作报告两个分离的数字:非对抗子集上的准确率(能力)与对抗子集上的弃权率(校准),像检测任务报告 precision/recall 那样。若 LoCoMo 采用这个口径,MAGMA 的论文叙事会完全不同(能力持平、校准大胜)——而这恰恰是更有信息量的结论。
这五篇不是平行的同方向论文,而是沿着同一个问题被逐级剥离的历史:记忆从「一段可分页的文本」→「一堆带链接的笔记」→「一个分层的生命周期」→「一张带时间的知识图」→「一组被选择过的叙事」→ MAGMA 的「若干张按关系类型分离、按意图路由的图」。
解决了什么问题。朴素 RAG 只能回答「文档里哪一段提到了 X」,无法回答需要跨整个语料综合的全局性问题。GraphRAG 用 LLM 分两阶段建索引:先抽实体知识图,再预生成社区摘要;查询时由社区摘要生成局部答案再归并。一句话:把「检索单元」从 chunk 提升为「图上的社区」。
遗留了什么问题。GraphRAG 的图是静态语料索引,为「一次性建好、反复查询」设计。它不处理增量写入,不表示时间有效性(一条事实何时开始为真、何时被推翻),也不区分关系类型——实体图里的边就是「共现/相关」。对一个持续交互、事实不断被更新的 agent 而言,这三点都是硬伤。
MAGMA 如何回应。继承了「用 LLM 抽结构」这一步(慢路径的 Φ_reason),但把它从离线批处理改成在线异步流,并把「一种边」拆成四种。GraphRAG 的社区摘要对应 MAGMA 的 salience-based budgeting。
关键设计的传递。「LLM 作为图构建器」这个范式直接传下来了;但「预计算全局摘要」被替换为「查询时按意图动态遍历」——从预烘焙转向按需路由。
解决了什么问题。第一个把操作系统的虚拟内存隐喻搬进 LLM:主上下文 = 物理内存,外部存储 = 磁盘,由 LLM 自己通过函数调用在两者间分页。一句话:让模型自己管理「什么该在上下文里」。
遗留了什么问题。分页的粒度是文本块,组织方式是无结构的。MemGPT 解决了「放不下」,没解决「放进去的东西彼此什么关系」。检索仍然回落到相似度搜索,且全部决策依赖 prompt 中的启发式指令,脆弱且不可学习。
MAGMA 如何回应。是综合而非对抗:保留了「外部持久存储 + 按需调入」的骨架,但把「无结构块」换成「带四类关系的事件节点」,把「LLM 靠 prompt 决定调什么」换成「意图分类器 + 加权遍历」。
关键设计的传递。双流架构中的「快路径不阻塞、慢路径异步整理」,本质上是 MemGPT 的「前台交互 / 后台内存管理」在延迟维度上的重新切分。
解决了什么问题。借 Zettelkasten 卡片盒法,让记忆自己长出网络:新记忆写入时生成含上下文描述、关键词、标签的结构化笔记,系统分析历史记忆建立链接,且新记忆会反向触发旧记忆表示的更新(memory evolution)。原文批评:「Current memory systems enable basic storage and retrieval but lack sophisticated memory organization... these systems' fixed operations and structures limit their adaptability」。一句话:记忆条目之间应当有链接,且链接与内容都会演化。
遗留了什么问题。A-MEM 的链接是同质的——所有边都是「语义上相关」,建边依据仍是 embedding 相似度。后果有二:(i) 时序与因果关系无法被表达,只能寄希望于 embedding 隐式编码;(ii) 检索仍是向量搜索,链接主要用于扩展召回而非引导召回。数据上也印证了:A-MEM 在 LoCoMo Temporal 类只有 0.474(Table 1),全表倒数第二。
MAGMA 如何回应。这是直接对抗:整个立论就是「A-MEM 那种同质链接不够」。它把 A-MEM 的一种边裂解成四种,并让边类型进入打分函数 φ(type(e_ij), T_q)。效果上 Temporal 从 0.474 抬到 0.650(+37.1%,本报告推算)。
关键设计的传递。「写入时用 LLM 生成结构化元数据 A_i(实体、时间线索、上下文描述符)」几乎是 A-MEM 笔记模式的直接继承;A-MEM 的 memory evolution 则演化为 MAGMA 慢路径中的「更新因果边置信度、合并冗余语义簇」。
解决了什么问题。把记忆按生命周期分层:短期 / 中期 / 长期个人记忆三级存储,配四个算子(存储、更新、检索、生成)。在 LoCoMo 上用 GPT-4o-mini 取得 F1 +48.36%、BLEU-1 +46.18% 的相对提升。一句话:记忆需要一套显式的分层管理与换页策略,而不只是一个库。
遗留了什么问题。分层轴是时效/热度,不是关系类型:它回答了「一条记忆该放哪一层、何时被提升或淘汰」,但没回答「两条记忆之间是什么关系」。此外把四个算子串在同步路径上的代价极其可观:Table 3 显示其查询延迟 32.68 s,是 MAGMA 的 22.2 倍(本报告推算),交互式场景基本不可用。
MAGMA 如何回应。在两个正交的轴上分别回应:(i) 用四张关系图补上缺失的「关系轴」;(ii) 用双流架构把重算子挪出关键路径,延迟压到 1.47 s。值得注意的是 MemoryOS 在 Open-Domain 上是最强基线(0.504),MAGMA 只领先 2.6%——分层管理在开放域上确有独立价值。
关键设计的传递。「不同的记忆操作应该被区别对待」这个思想被保留,但分类维度从「时效层级」换成了「同步性」(快/慢路径)。这是一个很干净的重新切分。
解决了什么问题。第一个把时间有效性做成一等公民的 agent 记忆系统:Graphiti 引擎在知识图上维护双时态信息(事实发生时间 vs 被记录时间),从而能表达「这条事实曾经为真、现在已被推翻」。报告 DMR 94.8%(vs MemGPT 93.4%)、LongMemEval 最高 +18.5% 准确率、延迟降低最多 90%。一句话:agent 记忆里的事实是有有效期的,图必须能表达失效。
遗留了什么问题。Zep 只把一个维度(时间)显式化了,因果与实体共指仍隐含在同一张图的边和节点属性里。更重要的是,Zep 的检索不因问题类型而改变遍历方式——它是一张更聪明的图,配一套固定的检索流程。
MAGMA 如何回应。把 Zep 的「时间作为一等公民」推广成「每一类关系都是一等公民,各占一张图」,并额外增加了 Zep 没有的一层:让 query 的意图决定走哪张图。可以说 MAGMA = Zep 的思想在维度数上的展开 + 一个路由层。
关键设计的传递。时序骨架 E_temp(严格按 τ 排序的不可变链)几乎就是 Zep 时间轴的简化版;MAGMA 的「相对表达 → 绝对区间 [τ_s, τ_e]」也直接对应 Zep 的时间归一化。
解决了什么问题。从「什么值得记」这个此前被设计者启发式包办的问题入手,用预测误差(prediction error)作为价值信号:模型能预测到的交互不值得存,预测失败的才是新知识。两个组件——把原始交互转成结构化叙事、按可预测性抽取洞见。一句话:记忆的写入门槛应该由「意外程度」而非人工规则决定。
遗留了什么问题。Nemori 把功夫全下在内容选择上,选出来之后的组织形式仍是(结构化的)叙事文本,检索回到语义匹配。这带来一个非常具体的失效:Table 1 中 Nemori 在 adversarial 类只有 0.325,是除 Full Context 外最低的。原因可以推断:既然写入时已把「值得记的」蒸馏成连贯叙事,检索时几乎总能找到一段「看起来相关」的叙事,于是模型倾向于强答——高质量的压缩反而削弱了「我没有证据」这个判断的可用性。
MAGMA 如何回应。这正是 §3.2 中那 98.98% 的来源。MAGMA 的结构化子图 + <ref:id> provenance 让「找不到」变成一个可判定的结构事实(沿因果边走满深度仍无相关节点),而非一个模糊的相似度低分。adversarial 从 0.325 抬到 0.742(+128%,本报告推算)。
同时也是 MAGMA 的失手处。Nemori 的叙事化压缩在 multi-hop 上仍然领先(0.569 vs 0.528)——把跨事件关系提前烘焙进文本,比查询时用 beam search 现场拼更稳。
关键设计的传递。Nemori 是 MAGMA 的主对照而非技术来源。二者构成一组干净的对立:写入时压缩(Nemori)vs 查询时组装(MAGMA)。这组对立本身就是下一步最值得做的实验。
这条线的推动力是一个反复出现的模式:每一代都把上一代隐含在「相似度」或「启发式」里的某个东西显式化,代价是引入一个新的、需要被管理的对象。
| 阶段 | 被显式化的东西 | 引入的新对象 | 新的管理成本 |
|---|---|---|---|
| MemGPT (2023) | 上下文的进出(分页) | 外部存储层 | 换页策略 |
| GraphRAG (2024) | 跨文档的全局结构 | 实体图 + 社区 | 索引构建 |
| A-MEM (2025) | 记忆间的关联 | 链接 + 演化 | 链接维护 |
| MemoryOS (2025) | 记忆的生命周期 | 三级存储 + 四算子 | 延迟(32.68 s) |
| Zep (2025) | 事实的时间有效性 | 双时态边 | 失效判定 |
| Nemori (2025) | 写入的价值判断 | 预测误差信号 | 压缩损失(弃权崩塌) |
| MAGMA (2026) | 关系的类型 | 四张图 + 遍历策略 | 策略参数(手工设定) |
§3.6 显示 LOO 降幅之和是「全图−最优单图」间隙的 1.87 倍,说明四视图功能上强耦合,而 "orthogonal" 目前只是边集不交这一句话。具体可做的:借用方差分解,把「全图性能 − 各单图性能」拆成主效应 + 二阶交互项,用 2⁴=16 组图子集配置跑一遍 LoCoMo(成本可控,构图只需一次),直接得出一张交互矩阵,回答「哪两张图是真冗余、哪两张图是真互补」。目前整个领域没有人做过这个。
LoCoMo 把 22.5% 的不可答样本和 77.5% 的可答样本用同一个 Judge 分聚合,导致纯保守的系统能白拿 0.225。具体可做的:定义 (Acc_answerable, AbstentionRate_unanswerable) 二元组,并通过扫描弃权阈值画出 trade-off 曲线。这不需要新数据,只需要重新汇报——但它会改写现有多篇论文的结论排序(§3.2 已给出一个实例)。
Nemori 与 MAGMA 构成一组干净对立。信息论上这是一个在哪一端付出失真代价的问题:写入时压缩把失真固化(不可逆),查询时组装把失真推迟但要付遍历成本。What to Keep, What to Forget 已开始用 rate–distortion 视角看记忆压缩,但还没人把「压缩时机」作为变量纳入。具体可做的:在给定 token 预算下刻画两种策略的失真下界,并预测交叉点位于什么样的查询分布。
这是本报告认为最紧迫的一个空白。MAGMA 的核心主张是「多图优于单图」,但实验里既没有 Semantic-Only(自身的 null),也没有 Zep/GraphRAG(外部的单图代表)。具体可做的:在 开源仓库上关掉三张图跑 Semantic Only,再接一个 Graphiti 基线,同一 judge、同一 backbone。这是一次周末实验,却能判决整篇论文的核心主张成立与否。在这个数据出来之前,「多图 > 单图」应被视为未经验证。
§3.7 指出双流架构让 Latency 与 Tokens/Query 两列都系统性地对 MAGMA 有利。具体可做的:所有采用异步整理的记忆系统统一汇报 (query latency, query tokens, background LLM calls per stored event, background tokens per stored event) 四元组。这会让一批「低延迟」的说法回到可比状态。
MAGMA 在 multi-hop 上落后 Nemori 7.2%,而多跳本该是多图的主场。具体可做的:做一个 beam width × depth 网格(4/8/16 × 3/4/5/6),只看 multi-hop 一列;若性能随 beam 单调上升且未饱和,则剪枝假说成立,问题可以用算力换回来;若不上升,则问题在打分函数 φ 的跨图可比性上(不同边类型的分数没有归一化到同一尺度)——后者更有意思,因为它是一个真正的建模缺陷。
MAGMA 的图只增不减:慢路径会合并冗余语义簇,但没有任何遗忘或降权机制。长期部署下(数月量级),因果边会随 LLM 抽取误差累积而污染。SSGM 已论证「evolving memory 的错误是累积且持久的」。具体可做的:给因果边加一个基于后续检索效用的置信度更新规则(被检索到且回答正确 → 升权;被检索到但回答错误 → 降权),本质上是把 7.3.1 的「学出来的策略」先做一个无梯度版本。
把 φ(r, T_q) = w_{T_q}ᵀ·𝟙_r 中的 w 从手工设定换成 RL 学出来的策略,意图空间也从 {Why, When, Entity} 三类放开为连续表示。MAGMA 提供动作空间,MemRL 那条线提供学习信号。具体可做的:以遍历轨迹为 episode、以最终答案的 judge 分为 reward 做 GRPO——Supersede 已证明 GRPO 能把小模型的记忆更新能力从 9.0% 拉到 16.7%,说明这类「记忆操作策略」确实可训练。
MAGMA 的 salience-based budgeting 把低相关节点压成「简写码」,这是不可逆的——一旦压错就再也找不回来。R³Mem 已在探索可逆压缩。具体可做的:把简写码设计成可在遍历中途「展开」的形式(发现该分支变得重要时回查原文),让压缩决策变成可撤销的。
四图分解在多模态下有一个自然的扩展点:视觉观测天然带时间戳和实体,但几乎没有语义 embedding 上的可比性。这意味着多模态场景下四张图的相对重要性会剧烈变化(temporal / entity 权重应大幅上升)——而这恰好是「学出来的权重」比「手工权重」优势最大的场景。
四张图带来四个攻击面。因果边由 LLM 在慢路径异步推断,不经过任何人类或规则校验,是最脆弱的一环:注入一条伪因果边,就能让「Why」类查询被系统性地导向攻击者选定的节点。SSGM 的四维失效分类(Stability / Validity / Efficiency / Safety)提供了框架,但还没人针对多图记忆做具体的攻击面分析。具体可做的:设计一个「因果边投毒」基准,度量注入 k 条伪因果边后 Why 类查询的劫持率。
| 工作 | 发表年月 | 会议 / 出版 | 核心贡献 | 主要指标 | 与 MAGMA 的关系 |
|---|---|---|---|---|---|
| MemGPT | 2023-10 | ACL 2023 companion(论文引用) | 虚拟内存分页,LLM 自管上下文 | Zep 报告其 DMR 93.4% | 骨架来源:外部持久存储 + 按需调入;MAGMA 补上「结构」 |
| GraphRAG | 2024-04 (v2 2025-02) | arXiv(未找到正式会议页) | LLM 建实体图 + 社区摘要,检索单元从 chunk 升为社区 | 全局 sensemaking 优于朴素 RAG | 技术来源:LLM as graph builder;MAGMA 改为在线异步 + 四类边 |
| A-MEM | 2025-02 | NeurIPS 2025 主会 | Zettelkasten 式链接 + 记忆演化 | LoCoMo Overall 0.580;Temporal 仅 0.474 | 主要批评对象:链接同质、仍靠向量检索;MAGMA 拆成四类边 |
| MemoryOS | 2025-06 | EMNLP 2025 Main, Oral | 三级存储 + 四算子的生命周期管理 | LoCoMo F1 +48.36% / BLEU-1 +46.18%;延迟 32.68 s | 正交补充:MemoryOS 管「时效轴」,MAGMA 管「关系轴」;双流把延迟压到 1.47 s |
| Zep / Graphiti | 2025-01 | arXiv 技术报告 | 双时态知识图,事实有效期一等公民 | DMR 94.8%(vs MemGPT 93.4%);LongMemEval 最高 +18.5%,延迟 −90% | 思想母体:MAGMA = Zep 在维度数上的展开 + 意图路由层。⚠ 却未被列为基线 |
| Nemori | 2025-08 (v4 2026-04) | arXiv(未找到正式会议页) | 预测误差决定「什么值得记」,写入时蒸馏成叙事 | LoCoMo Overall 0.590(multi-hop 0.569 最优,adversarial 0.325 崩塌) | 最强基线兼主对照:写入时压缩 vs 查询时组装。MAGMA 的 98.98% 优势来自补上它的 adversarial 短板 |
| MAGMA | 2026-01 | ACL 2026 主会 Long | 四张正交关系图 + 意图路由遍历 + 双流写入 | LoCoMo 0.700(非对抗子集 0.688);LongMemEval 61.2%;延迟 1.47 s | 本期核心工作 |
不优化记忆内容而优化记忆系统的架构本身:把 12 个代表性记忆系统拆成 (encode, store, retrieve, manage) 的模块化设计空间(EvolveLab),再让 agent 元进化出适配任务的架构,对 SmolAgent / Flash-Searcher 最高提升 17.06%。若认可 §7.3.1 的判断(下一代是「学出来的策略」),这篇是那条路最完整的先行者。
arXiv | Code
用 RL 在情景记忆上做运行时进化,不更新权重即可持续改进;两阶段检索先过滤噪声再识别有价值策略;在 HLE / BigCodeBench / ALFWorld / LifelongAgentBench 四个基准上超过 SOTA。它是把 MAGMA 遍历策略学出来的最现成的技术底座。
arXiv | Code
把「事实被更新后 agent 记不住新值」隔离成一个可测量的 gap:LongMemEval knowledge-update 上从全上下文的 92% 掉到有界自维护记忆的 77%(gpt-5.4, p=0.0033),且给更大内存完全没有恢复(28%→28%)——证明这是策略问题不是容量问题;GRPO 微调 Qwen2.5-3B 把留出集准确率从 9.0% 拉到 16.7%。这是「记忆操作可训练」最干净的一次证明,直接支持 §7.3.1。
arXiv
发现 agent 的「经验跟随」特性:检索到的记忆与当前输入越相似,输出就越相似——由此推出两个失效模式(错误传播、错配经验重放),并证明用未来任务的评测结果反过来作为已存经验的质量标签能改善长期表现。与 MAGMA 互补:MAGMA 管「怎么取」,这篇管「取到的东西质量如何」。
ACL Anthology
按语义抽象程度分层组织记忆,高层记忆向量内嵌指向下层子记忆的位置索引编码,检索时逐层路由而不做全量相似度计算。与 MAGMA 是同一时期的另一种「结构化检索」答案:MAGMA 走横向(关系类型),H-MEM 走纵向(抽象层级),两者原则上可以叠加。
ACL Anthology
跨数周对话、含记忆巩固与变异(mutation)的基准,提出 FAMA 指标惩罚对过期信息的依赖。结果显示记忆 agent 在「记住」上聚合 FAMA 119.45(LLM 仅 65.60–65.80),但在「推理」上只有 27.55(LLM 12.37–13.92)——记住容易、推理极难这个 gap 与本报告 §3.2 的发现同向。
arXiv
换到参数化记忆一侧:系统评测知识编辑方法在连续更新下的保持力。AlphaEdit 在 Qwen-2.5 7B 上编辑成功率 0.92,但记忆半衰期只有 452 步;反过来偏稳定的 WISE 编辑成功率低于 0.12。这个「保持 ↔ 生效」的取舍,与外部记忆里的「压缩 ↔ 可判定性」取舍结构上完全同构。
arXiv
记忆治理与安全方向:提出 Stability / Validity / Efficiency / Safety 四维失效分类,主张把记忆演化与执行解耦,加校验门与时间衰减建模。核心论点「evolving memory 的错误是累积且持久的」直接指向 MAGMA 慢路径 LLM 推断因果边这一未设防的攻击面(§7.3.4)。
arXiv
用率失真理论给「记忆压缩到什么程度」一个形式化框架。与 §7.1.3 的「压缩时机」问题直接相关:它刻画了压缩多少,还没刻画何时压缩。
arXiv