ACL 2026 · Agent Memory · 每日文献追踪

MAGMA:把「一张记忆图」拆成四张正交关系图

Multi-Graph based Agentic Memory Architecture for AI Agents · Jiang, Li, Li, Li(UT Dallas / U. Florida)

ACL 2026 主会 Long arXiv 2601.03236 · 2026-01 LoCoMo + LongMemEval 代码开源 本报告发现:18.6% 提升中 98.98% 来自弃权校准

一句话定位:记忆的结构不该是一张什么都往里塞的图,而应该是若干张语义上互不重叠的关系视图;检索则退化为一个由「问题意图」决定走哪张图的策略性遍历问题。

0. 当日检索情况说明

本期检索覆盖 ACL Anthology 2026、EACL 2026、NeurIPS 2025 proceedings、ICLR 2026 MemAgents workshop、arXiv cs.CL/cs.AI,以及 Agent-Memory-Paper-List 与若干 awesome-list,累计过筛 25+ 篇 2025-08 至 2026-07 的候选工作。

按任务给定优先级(顶会主会长文 > Findings/Workshop > arXiv 预印本),选定 MAGMA(ACL 2026 主会长文)。它满足全部硬条件:ACL 2026 Vol.1 Long Papers、arXiv v1 为 2026-01(6 个月内)、有可访问开源实现、与已覆盖的 MemGPT / A-MEM / Mem0 / Memory-R1 / MemAct / AgeMem 均不重复——A-MEM、MemoryOS 在本报告中仅作为前驱工作出现。覆盖子方向:记忆架构 + 记忆检索

必须坦白的检索局限。MAGMA 的 arXiv HTML(v1)渲染时截断于 §3.4,全部实验表格与 Limitations 均取自 ACL Anthology 正式 PDF。本报告中所有数字都标注了出处表号;凡由我自行计算的数值,一律显式标注为「本报告推算」。

1. 链接清单(全部实际访问验证)

1.1 核心工作

项目链接状态
会议页(ACL Anthology)2026.acl-long.1709✅ 已访问
正式 PDFacl-long.1709.pdf✅ 已访问
DOI10.18653/v1/2026.acl-long.1709
arXiv(v1, 2026-01)2601.03236 · HTML✅ 已访问
代码FredJiang0324/MAGMA✅ 已访问(约 150 stars,README 标注 ACL 2026)
HuggingFace Paperspapers/2601.03236
论文自身的一处笔误。ACL PDF 正文印出的代码链接为 github.com/FredJiang0324/MAMGAMAMGA 拼写颠倒),实际可达仓库是 .../MAGMA。按论文原文复制会 404。

1.2 评测基准

基准论文链接代码 / 数据
LoCoMoMaharana et al., ACL 2024ACL Anthology · arXiv 2402.17753snap-research/locomo · 项目页
LongMemEvalWu et al., ICLR 2025arXiv 2410.10813 · OpenReviewxiaowu0162/LongMemEval

1.3 回溯的相关工作

工作会议页arXiv代码
MemGPT (2023)ACL 2023 companion(按论文引用)2310.08560(本次未逐一验证,标注为论文引用)未找到(论文未印出)
GraphRAG (2024)未找到正式会议页2404.16130(v1 2024-04-24;v2 2025-02-19)论文未印出(社区仓库 microsoft/graphrag)
Zep / Graphiti (2025)未找到正式会议页(技术报告)2501.13956(v1 2025-01-20,12 页 3 表)论文未印出
A-MEM (2025)NeurIPS 2025 Proceedings2502.12110WujiangXu/A-mem
MemoryOS (2025)EMNLP 2025 Main(Oral)2506.06326BAI-LAB/MemoryOS
Nemori (2025→2026)未找到正式会议页2508.03341(v1 2025-08-05;v4 2026-04-16 已改题未找到
一处引用陷阱。MAGMA 引用的「Nemori: Self-Organizing Agent Memory Inspired by Cognitive Science (Nan et al., 2025)」对应 arXiv 2508.03341,但该条目在 2026-04 的 v4 中已更名为 What Deserves Memory: Adaptive Memory Distillation for LLM Agents(Ma, Nan, Wu, Chen)。按标题检索会找不到,按 arXiv ID 才对得上。

2. 核心工作深度解析

2.1 摘要与核心定位

原文主张的译述(非泛化概括):现有 Memory-Augmented Generation(MAG)系统把记忆存成单一的、以语义相似度为唯一索引的整体库,因此「把时序、因果与实体信息纠缠(entangle)在一起」。MAGMA 让每一条记忆条目同时存在于语义、时序、因果、实体四张正交图中,并把检索形式化为在这些关系视图上的策略引导遍历(policy-guided traversal)

一句话核心创新:检索不再是「在一个向量空间里找最近邻」,而是「先判断这个问题问的是哪一类关系,再沿那一类关系的边走出去」。

这句话的分量在于:它把记忆系统的瓶颈从「存什么」重新定位到「以什么关系存」。Nemori 回答「什么值得记」,MemoryOS 回答「记多久、放哪一层」,A-MEM 回答「记忆之间要不要连边」——MAGMA 问的是「连的是哪一种边,以及提问时该走哪一种边」

2.2 Motivation 与问题论证

具体痛点(论文 §1):① 注意力随距离衰减(lost-in-the-middle)——单靠拉长上下文无法解决长程记忆;② 单一语义索引丢失关系结构,论文点名 A-MEM 一类方法「retrieval via semantic embedding similarity, missing relations such as temporal or causal」;③ 对象恒常性断裂——同一实体在被打断的时间线片段中被反复提及时,纯语义检索无法把这些片段串成一个对象,这是引入 entity graph 的直接理由。

痛点是如何被量化的?论文没有给出独立的诊断性实验来量化这三条,采用的是间接论证:既然全上下文(101K tokens)在 LongMemEval 上只有 55.0%,而 3.4K tokens 的结构化检索能到 61.2%,那么「更长上下文 ≠ 更好记忆」就被证成了。

不过案例研究(Table 8 / §E.2)提供了三个可核查的定性证据:

场景基线行为MAGMA 行为归因的图
事实检索A-MEM / MemoryOS 只取回 "clarinet",漏掉 "violin"沿实体子图遍历,两者都取回Entity
逻辑推断("几个孩子?")基线只抽取显式的 "two"多跳实体消解(照片两个 + 一个儿子 + 兄弟区分)→ "at least three"Entity + Causal
时间归一化("yesterday")A-MEM / MemoryOS 幻觉出错误日期正确归一到 2023-10-19Temporal

问题的新颖之处:新意不在于「用图」(GraphRAG、Zep 都用图),而在于拒绝把不同语义类型的关系压进同一张图。Zep 把时间做成边上的属性;GraphRAG 把实体和社区做成一张图的两个层级;A-MEM 的链接是同质的。MAGMA 的赌注是:关系类型的解耦本身就能带来增益,因为它让「检索策略」有了可以选择的对象。

2.3 论文的故事线(论证结构)

论文的推进不是章节罗列,而是一条相当干净的归谬链:

观察 A:上下文越长,注意力越不可靠(lost-in-the-middle) ↓ 所以不能靠拉长窗口 观察 B:外部记忆必须被检索,而检索目前只有一种信号 —— 语义相似度 ↓ 那么凡是「不能被语义相似度表达的关系」都会丢失 推论 C:时序(A 在 B 之前)、因果(A 导致 B)、共指(A 和 B 是同一个人) 这三类关系,恰恰都不是语义相似度 ↓ ★ 关键转折点 假设 D:如果把这三类关系显式建成独立的边集, 检索就从「找最近邻」变成「在若干种边上选一种走」 ↓ 于是问题从「表示学习」变成「策略选择」 方法 E:query intent 分类(Why / When / Entity)→ 决定边类型权重 w_{T_q} → beam search 遍历 → 图线性化成 prompt ↓ 但这样做每写一条记忆都要 LLM 推因果,太慢 工程 F:双流架构 —— 快路径只做「时间链 + 向量索引」, 慢路径异步做 LLM 因果 / 语义稠密化
最关键的一步是 C→D。整篇论文的可证伪性都压在这里:如果「时序/因果/实体」这三类关系其实可以被足够好的 embedding 隐式编码,那么四图分解就是纯粹的工程复杂度。论文用 Table 5 的单图消融来回应——但回应得并不完整(见 §2.7 B2)。

2.4 方法论与机制解剖

2.4.1 数据结构层

G_t = (N_t , E_t) 时变有向多重图 n_i = ⟨ c_i , τ_i , v_i , A_i ⟩ 统一事件节点(Event-Node) c_i ∈ Text 事件内容(观察 / 动作 / 状态变化) τ_i ∈ ℕ 离散时间戳 v_i ∈ ℝ^d 稠密向量(写入向量库;默认 d = 384) A_i 结构化元数据(实体、时间线索、上下文描述符)

2.4.2 四类关系图(论文 §3.1)

边集定义判定方式解决的具体失效
时序 Etemp严格有序对 (n_i, n_j),τ_i < τ_j规则,写入时 O(1) 即时建立"yesterday" 无法归一到绝对日期
因果 Ecausal有向边,S(n_j|n_i, q) > δLLM 慢路径异步推断,带置信度"为什么" 类问题无法从结果回溯原因
语义 Esem无向边,cos(v_i, v_j) > θsim向量相似度阈值(传统 RAG 的能力,作为基座)
实体 Eent事件 ↔ 抽象实体节点的二部连接元数据 A_i 中的实体抽取对象恒常性:同一实体跨不连续时间片断裂
注意一个不对称性。四张图里只有语义图是「传统方法本来就有的」,而消融实验(Table 4 / 5)恰恰只拆了另外三张。这个不对称在 §2.7 B2 会被展开成一条实质批评。

2.4.3 查询流程:自适应分层检索(Algorithm 1,四阶段)

阶段 1 — 查询分析与分解:意图分类 T_q ∈ {Why, When, Entity};时间解析(相对表达 → 绝对区间 [τ_s, τ_e]);表示抽取(稠密 q⃗ + 稀疏关键词 q_key)。

阶段 2 — 多信号锚点识别(Reciprocal Rank Fusion)

S_anchor = Top_K ( Σ_{m ∈ {vec, key, time}} 1 / ( k + r_m(n) ) )

阶段 3 — 自适应遍历策略(启发式 beam search),转移打分同时吃「结构对齐」和「语义亲和」:

S(n_j | n_i , q) = exp( λ₁ · φ( type(e_ij) , T_q ) + λ₂ · sim( n⃗_j , q⃗ ) ) 结构对齐项: φ(r , T_q) = w_{T_q}ᵀ · 𝟙_r

即:边类型权重向量 w 是意图 T_q 的函数——问 "Why" 时因果边权重抬高,问 "When" 时时序边权重抬高。每步保留 top-k 节点,随深度施加衰减因子 γ。

阶段 4 — 图线性化的叙事合成

C_prompt = ⊕_{n_i ∈ Sort(G_sub)} [ <t:τ_i> n_i.content <ref:n_i.id> ] 排序规则:时序类问题按 τ 排序;因果类问题在 E_causal 上做拓扑排序(因先于果) 预算分配:高相关节点保留全文,低概率节点压缩成简写码(salience-based budgeting)

2.4.4 双流记忆演化

写入事件 I │ ├─── 快路径(Algorithm 2 · 延迟敏感 · 非阻塞 · 无 LLM) │ ① n_t ← SegmentEvent(I) │ ② G.AddEdge(n_prev, n_t, type=Temp) ← 时间骨架立刻建好 │ ③ v_t ← Encoder(n_t.c) ; VDB.Add(v_t, n_t.id) │ ④ Queue.Enqueue(n_t.id) │ └─── 慢路径(Algorithm 3 · 异步 · LLM 密集) ⑤ 出队近期事件,稠密化图结构 ⑥ E_new = Φ_reason( N(n_t) , H_history ) ← LLM 推断潜在因果 / 语义边 ⑦ 更新因果边置信度;合并冗余语义簇
这是整篇论文最值得单独复用的工程设计。它把「必须即时完成的」(时间链 + 向量索引,纯规则/纯编码器)与「可以延后的」(因果推断、语义聚类,需 LLM)在关键路径层面切开。MemoryOS 的 32.68 s 查询延迟(Table 3)大概率正是没做这个切分的代价。

2.4.5 超参配置(Appendix B)与实验设置

参数取值 / 范围作用
λ₁(结构系数)1.0(基准)边类型对齐权重
λ₂(语义系数)0.3 – 0.7语义亲和权重
θsim0.75语义边建边阈值
δ(因果置信阈)0.6因果边建边阈值
Beam width8每步保留节点数
Max depth4 – 5 hops遍历深度上限
Max nodes retrieved200子图规模上限
γ(衰减)0.85逐层衰减
意图自适应权重 wentity 2.5–6.0 / temporal 0.5–4.0 / causal 3.0–5.0wT_q 实际取值域

论文自述这些参数「empirically optimized on the LoCoMo benchmark」,但没有给出任何一条敏感性曲线或扫参表(见 §2.7 B3)。

实验设置:主干 gpt-4o-mini(检索推理 + 回答生成 + LLM-as-Judge,judge 温度 0.0);嵌入默认 all-MiniLM-L6-v2(384 维),可选 text-embedding-3-small(1536 维)。LoCoMo 1,986 条 = single-hop 841 / adversarial 446 / temporal 321 / multi-hop 282 / open-domain 96,对话平均约 9K tokens。LongMemEval 平均上下文 >100K tokens,6 类问题。指标:主指标 LLM-as-a-Judge([0,1]),辅助 token-level F1、BLEU-1。

3. 实验设计与定量结果

3.1 主结果 A:LoCoMo(论文 Table 1,LLM-Judge 分)

方法Multi-HopTemporalOpen-DomainSingle-HopAdversarialOverall
Full Context0.4680.5620.4860.6300.2050.481
A-MEM0.4950.4740.3850.6530.6160.580
MemoryOS0.5520.4220.5040.6740.4280.553
Nemori0.5690.6490.4850.7640.3250.590
MAGMA (ours)0.5280.6500.5170.7760.7420.700
样本数(占比)282 (14.2%)321 (16.2%)96 (4.8%)841 (42.4%)446 (22.5%)1,986

相对最强基线的提升(本报告推算)

类别最强基线MAGMA绝对差相对提升
Multi-HopNemori 0.5690.528−0.041−7.2%(失手)
TemporalNemori 0.6490.650+0.001+0.2%
Open-DomainMemoryOS 0.5040.517+0.013+2.6%
Single-HopNemori 0.7640.776+0.012+1.6%
AdversarialA-MEM 0.6160.742+0.126+20.5%
OverallNemori 0.5900.700+0.110+18.6%

3.2 ⚡ 相变式发现:18.6% 的整体提升,98.98% 来自「对抗性(不可答)」这一类

这是全文最有说服力、同时也最令人不安的定量证据——而它并不在论文里,是从论文自己的表格算出来的。

LoCoMo 的 Overall 是样本加权微平均。用样本数回代 Table 1,可以精确复现 MAGMA(0.7003 vs 报告 0.700)、A-MEM(0.5804 vs 0.580)、MemoryOS(0.5525 vs 0.553)三行。把 MAGMA 相对 Nemori 的总差值按类别分解:

图 1 · MAGMA 相对 Nemori 的 LoCoMo 总差值,按问题类别分解

单位:对加权 Overall 的绝对贡献(本报告推算,基于论文 Table 1 与 §4.6 样本数)· 悬浮查看数值

正向贡献 负向贡献(MAGMA 落后)
-0.010 +0.000 +0.025 +0.050 +0.075 +0.100 Adversarial(不可答) +98.98% Single-Hop +5.37% Open-Domain +1.63% Temporal +0.17% Multi-Hop −6.15%

图 2 · 报告的 Overall 分 vs 剔除对抗类后的加权分(LoCoMo)

蓝:论文 Table 1 报告的 Overall(含 446 条不可答样本)· 橙:仅 1,540 条可答样本上的加权分(本报告推算)

Overall(论文报告) 非对抗子集(本报告推算)
0.0 0.2 0.4 0.6 0.8 0.481 0.577 Full Context 0.580 0.570 A-MEM 0.553 0.589 MemoryOS 0.590 0.687 Nemori 0.700 0.688 MAGMA LLM-Judge
类别权重对总差值的贡献占比
Adversarial22.46%+0.0937+98.98%
Single-Hop42.35%+0.0051+5.37%
Open-Domain4.83%+0.0015+1.63%
Temporal16.16%+0.0002+0.17%
Multi-Hop14.20%−0.0058−6.15%
合计100%+0.0946100%
剔除 adversarial 后的 1,540 条样本上:MAGMA 0.6882 vs Nemori 0.6869,差 +0.13 个百分点(相对 +0.19%)。 LoCoMo 的 adversarial 类是不可从对话中回答的问题,正确行为是拒答。因此这一列度量的主要不是推理能力,而是弃权校准(abstention calibration)。Full Context 拿 0.205(几乎全在幻觉),A-MEM 0.616,Nemori 0.325。

这不意味着 MAGMA 没有价值——把弃权校准从 0.325 拉到 0.742 是一个非常实用的工程成果,很可能正是 <ref:n_i.id> provenance 标注 + 结构化子图(「我沿着因果边走了 4 跳都没找到相关节点」是一个比「向量相似度都很低」更可判定的证据)带来的。但论文把它包装成「在长程推理任务上一致优于 SOTA」,是一个与自己数据不符的叙述:在真正需要推理的 1,540 条上,MAGMA 与 Nemori 统计上无法区分。

3.3 ⚠️ Table 1 的两行对不上账

方法由分项复现的微平均论文报告的 Overall差值
MAGMA0.70030.700+0.0003 ✅
A-MEM0.58040.580+0.0004 ✅
MemoryOS0.55250.553−0.0005 ✅
Nemori0.60570.590+0.0157 ❌
Full Context0.49360.481+0.0126 ❌

三行严丝合缝(误差 <0.0005),两行差 0.013–0.016。这两行恰好是论文自己没有跑、极可能直接引自 Nemori 原论文的两行(Nemori 与 Full-Context 通常成对出现在 Nemori 的表里)。若成立,则该表混合了两套 judge 协议。

对结论的影响是可量化的:把 Nemori 的 Overall 按其分项修正为 0.6057,MAGMA 的领先从 +0.110(+18.6%)缩到 +0.094(+15.6%)。方向不变,幅度打了七折。而 Table 5(单图消融)五行全部完美自洽(0.5898→0.590、0.5765→0.577、0.5311→0.531),进一步支持「问题只出在外部引用的两行」这一假说。

3.4 主结果 B:LongMemEval(论文 Table 2,准确率 %)

问题类型Full-context (101K tok)Nemori (3.7–4.8K tok)MAGMA (0.7–4.2K tok)
single-session-preference6.762.773.3
single-session-assistant89.373.283.9
temporal-reasoning42.143.045.1
multi-session38.351.450.4
knowledge-update78.252.666.7
single-session-user78.677.772.9
Average(论文报告)55.056.261.2

同一类问题再次出现(本报告推算)

统计口径Full-contextNemoriMAGMA
论文报告的 Average55.056.261.2
六类的算术平均55.5360.1065.38
差值−0.53−3.90−4.18
剔除 preference 后五类算术平均65.3059.5863.80

两点推论:① 论文的 "Average" 行不是所列六类的算术平均,说明使用了各类样本数加权——但论文没有披露每类的样本数,读者无法复核,这是一处透明度缺口。② 更关键:一旦剔除 single-session-preference 这一类,Full-context(65.30)反超 MAGMA(63.80)。MAGMA 在 6 类中有 3 类输给 Full-context(assistant −5.4pp、knowledge-update −11.5pp、user −5.7pp)。

全表最需要解释、却完全没被解释的一项:single-session-preference 上 Full-context 只拿 6.7%。一个能看到全部 101K tokens 原文的系统,在「用户偏好」类问题上比随机基线还难看,比 MAGMA 低 11 倍。合理解释是评测协议下 full-context 在这一类系统性地不给出偏好性回答(格式失配而非知识缺失),但论文没有讨论。

因此 LongMemEval 上诚实的结论应当是:MAGMA 用约 96% 更少的 token(0.7–4.2K vs 101K)取得了与全上下文大体相当、略优的平均准确率,并在偏好类问题上有巨大优势——这是一个漂亮的效率结论,而不是一个能力结论。

3.5 消融研究(论文 Table 4,LoCoMo)

配置JudgeF1BLEU-1
w/o Adaptive Policy0.6370.4130.357
w/o Causal Links0.6440.4390.354
w/o Temporal Backbone0.6470.4380.349
w/o Entity Links0.6660.4510.363
MAGMA (Full)0.7000.4670.378

留一法(LOO)边际贡献(本报告推算)

移除的组件ΔJudge相对降幅ΔF1ΔBLEU-1
Adaptive Policy−0.063−9.00%−0.054 (−11.6%)−0.021 (−5.6%)
Causal Links−0.056−8.00%−0.028 (−6.0%)−0.024 (−6.3%)
Temporal Backbone−0.053−7.57%−0.029 (−6.2%)−0.029 (−7.7%)
Entity Links−0.034−4.86%−0.016 (−3.4%)−0.015 (−4.0%)
这条排序反驳了论文自己的叙事重心。标题、摘要、贡献列表都把重点放在「四张正交图」这个表示创新上,但消融告诉我们,单一最大贡献者是 Adaptive Traversal Policy 这个检索策略(−0.063 > 因果 −0.056 > 时序 −0.053 > 实体 −0.034)。MAGMA 真正的价值可能是「意图路由」而非「多图分解」——多图只是让路由有东西可路由。

3.6 单图消融(论文 Table 5,LoCoMo)

配置Multi-HopTemporalOpen-DomainSingle-HopAdversarialOverall
Causal Only0.4700.4600.4300.6500.6800.590
Temporal Only0.4400.6200.4500.6500.5200.577
Entity Only0.4850.4200.4600.6400.4500.531
Full MAGMA0.5280.6500.5170.7760.7420.700

三条可验证的观察(本报告推算):

  1. 单图已足以打平最强基线。Causal Only 的 0.590 = Nemori 报告的 0.590。只用一张因果图 + 意图路由就到了 Nemori 的水平;四图全开才拿到剩下的 0.110。
  2. 「正交」这个词与自己的数据打架。LOO 降幅之和 = 0.063+0.056+0.053+0.034 = 0.206;而「全图 − 最好单图」的间隙只有 0.700−0.590 = 0.110。前者是后者的 1.87 倍。若四张图的贡献真是可加/独立的,两者应当接近。1.87× 的超可加性说明四张图在功能上高度纠缠——表示层的正交(边集互不相交)不等于效果层的独立。
  3. 对角线是干净的:Temporal Only 在 Temporal 类拿最高(0.620)、Causal Only 在 Adversarial 拿最高(0.680)、Entity Only 在 Open-Domain 拿到单图最高(0.460)。这是「每张图确实各司其职」的最好证据,值得肯定。
精度不一致提示。Table 5 全为两位小数,Table 1 为三位小数;Table 5 中 Causal Only 与 Temporal Only 的 Single-Hop 恰好都是 0.650、Entity Only 是 0.640——在 841 条样本上出现这样整齐的取值,提示 Table 5 可能是四舍五入后的估计值,不宜按 0.001 量级解读。

3.7 系统效率(论文 Table 3)

方法Build Time (h)Tokens/Query (k)Latency (s)
Full ContextN/A8.531.74
A-MEM1.012.622.26
MemoryOS0.914.7632.68
Nemori0.293.462.59
MAGMA0.393.371.47

相对差(本报告推算):MAGMA 查询延迟 1.47 s 比 Nemori 快 43.2%、比 A-MEM 快 35.0%、比 MemoryOS 快 95.5%、甚至比 Full Context 还快 15.5%(送进去的 token 少 60.5%)。代价在构建侧:0.39 h 比 Nemori 慢 34.5%;tokens/query 3.37k 比 A-MEM 多 28.6%

这张表最重要的一点是它没说的。双流架构把 LLM 因果推断挪到异步慢路径,所以 Latency 一列天然对 MAGMA 有利——慢路径的算力既不体现在 Latency,也不体现在 Tokens/Query(该列度量查询时的 token),只能部分体现在 Build Time 里。论文没有报告慢路径消耗的 LLM token 总量,因此 MAGMA 的总拥有成本(TCO)在这张表里是不可见的。对一个把「异步 LLM 稠密化」作为核心机制的系统,这是最该补的一个数。

4. 价值分析与局限性

4.1 价值分析

它真正的贡献是什么。MAGMA 把 agent memory 的检索问题从度量学习问题(怎么把 query 和 memory 嵌到同一个空间里)改写成了策略问题(在若干种已知语义的关系上,选择走哪一种)。这个改写的价值在于:它让检索行为变得可解释、可干预、可组合。向量检索的失败你只能靠换 embedding 修;关系遍历的失败你可以定位到「因果边没建出来」或「意图分类判错了」。

可以脱离本文单独复用的四个设计

  1. 双流写入(快/慢路径分离)——与四图分解完全解耦。任何在写入时需要 LLM 做结构推断的记忆系统都可直接采纳:规则可完成的骨架放同步路径,需要推理的稠密化放异步队列。MemoryOS 的 32.68 s 就是没这么做的反例。
  2. 意图 → 边类型权重的路由φ(r, T_q) = w_{T_q}ᵀ·𝟙_r)——只要记忆有多种边类型就能用,与边的具体语义无关。消融显示它是单一最大贡献项(−0.063)。
  3. 拓扑排序的上下文线性化——因果类问题让「因」在 prompt 中先于「果」出现。几乎零成本,且与检索方式正交。
  4. <ref:id> provenance 标注——很可能是 adversarial 从 0.325 跃升到 0.742 的机制性来源(模型可以「看见」自己没有证据)。

对后续工作的启发。φ手工权重表换成学出来的策略是最直接的下一步。目前 w_{T_q} 是人工设定的(entity 2.5–6.0 / temporal 0.5–4.0 / causal 3.0–5.0),意图分类也只有三类。这正好是 MemRL / Memory-R1 那条 RL 线可以嫁接进来的位置——MAGMA 提供了动作空间,RL 那条线提供了学习信号。

4.2 局限性 A:论文自述(§6 原文要点)

  1. 依赖 LLM 的推理保真度。"the quality of the constructed memory graph depends on the reasoning fidelity of the underlying Large Language Models used during asynchronous consolidation",并承认「erroneous or missing relations may still arise and propagate to downstream retrieval」,只靠结构化 prompt 与保守阈值缓解。
  2. 多图带来存储与工程复杂度。"Maintaining multiple relational views and dual-stream processing incurs a little higher implementation and memory overhead",资源受限环境下适用性有限。
  3. 评测范围窄。承认包括自身在内的多数 agentic memory 系统只在 LoCoMo / LongMemEval 这类长上下文对话基准上评测,未覆盖多模态、异构观测流等场景。

4.3 局限性 B:补充批判(本报告的独立观察)

B1 · 论证缺口 —— 核心主张与自身数据不符(最严重)

论文声称「consistently outperforms SOTA agentic memory systems on long-horizon reasoning tasks」。但按 §3.2 的分解,相对最强基线 Nemori 的整体优势中 98.98% 来自 adversarial(弃权)一列;剔除该列后的 1,540 条样本上,MAGMA 0.6882 vs Nemori 0.6869,差 +0.13pp。"consistently" 一词在 multi-hop 上也被直接证伪(0.528 vs 0.569,−7.2%)。准确的主张应当是「显著改善了不可答问题上的弃权校准,并在同等推理精度下大幅降低延迟」。

B2 · 实验设计问题 —— 四图声明,只消融了三图

论文反复强调 semantic / temporal / causal / entity 四张正交图,但 Table 4 只有 w/o Causal / w/o Temporal / w/o Entity,没有 w/o Semantic;Table 5 只有 Causal Only / Temporal Only / Entity Only,没有 Semantic Only。而 "Semantic Only" 恰恰是本文的零假设——它约等于把 MAGMA 退化成一个带 beam search 的向量 RAG。缺了这一格,「关系解耦带来增益」这个核心主张就没有对照它自己的 null。这不是可有可无的一格,是唯一那格。

B3 · 实验设计问题 —— 承诺了超参研究,实际只给了取值范围

Appendix B 给出 λ₂ ∈ [0.3, 0.7]、θsim=0.75、δ=0.6、beam=8、γ=0.85,自述「empirically optimized on LoCoMo」,但没有一条敏感性曲线、没有一张扫参表。后果有二:(i) 无法判断 0.700 有多少来自在测试基准上调参(θsim 与 δ 直接决定图的稠密度,是高杠杆参数);(ii) 无法判断该配置迁移到别的语料需要多少重新调参。对一个把阈值建图作为机制核心的系统,这是实质性缺失。

B4 · 指标有效性问题 —— Overall 列的两行无法从分项复现

按 §3.3,MAGMA / A-MEM / MemoryOS 三行可由分项精确复现(|Δ|<0.0005),而 Nemori(Δ=+0.0157)与 Full Context(Δ=+0.0126)两行不能。修正 Nemori 后,MAGMA 的领先从 +18.6% 降到 +15.6%。这两行恰好是最可能被外部引用而非自跑的两行,暗示表内混合了两套评测协议。

B5 · 术语与证据不一致 —— "orthogonal" 一词被过度承载

LOO 降幅之和 0.206 是「全图 − 最好单图」间隙 0.110 的 1.87 倍(§3.6)。若四视图真具备论文所暗示的独立性,二者应接近。1.87× 说明四张图功能上强耦合。论文的 "orthogonal" 仅指边集互不相交(表示层),但全文语气持续暗示贡献可分解(效果层)。这是一个会误导后续工作的措辞——按「可分解」去做模块化裁剪的人会拿到远低于预期的结果。

B6 · 缺乏关键竞品对比 —— 没有一个图结构基线

Table 1 的四个基线是 Full Context / A-MEM / MemoryOS / Nemori,没有任何一个图记忆系统。而 related work 明确点名了 GraphRAG 与 Zep,Zep 原论文还报告了 LongMemEval 上「最高 +18.5% 准确率、−90% 延迟」。既然核心主张是「单图不够,要多图」,那么至少要有一个单图(Zep 或 GraphRAG)基线才能把「多图 vs 单图」这一刀切出来。目前的对照只能证明「有结构 > 无结构」,不能证明「多图 > 单图」——而后者才是本文的贡献声明。

B7 · 失手的子任务及其结构性解释

MAGMA 在 multi-hop 上 0.528,落后 Nemori 的 0.569 达 4.1pp(−7.2%)。这在结构上是反直觉的:多图遍历本该最擅长多跳。一个可检验的假说是 beam width=8 / max depth=4–5 的剪枝在多跳场景下过早收敛——Table 5 显示 Causal Only 在 multi-hop 只有 0.470、Entity Only 0.485,全图才 0.528,说明多跳恰恰最依赖跨图组合,而 beam search 的逐层剪枝会在跨图切换时丢掉候选。论文对此完全没有讨论。相比之下 Nemori 走「叙事化压缩」路线,把跨事件关系提前烘焙进叙事文本,反而不受遍历剪枝之苦。

B8 · 假设性讨论 —— 如果把弃权和推理拆开评测会怎样

LoCoMo 把 22.5% 的样本设为不可答,然后用同一个 LLM-Judge 分把「答对了」和「正确地拒答了」加总成一个 Overall。这个聚合方式让弃权保守的系统天然占优——一个永远拒答的系统能在 adversarial 上拿满分、拿到 0.225 的免费 Overall。建议后续工作报告两个分离的数字:非对抗子集上的准确率(能力)与对抗子集上的弃权率(校准),像检测任务报告 precision/recall 那样。若 LoCoMo 采用这个口径,MAGMA 的论文叙事会完全不同(能力持平、校准大胜)——而这恰恰是更有信息量的结论。

B9 · 坦白本报告分析的不完备之处

5. 相关工作回溯:一条「记忆结构逐步显式化」的问题传递链

这五篇不是平行的同方向论文,而是沿着同一个问题被逐级剥离的历史:记忆从「一段可分页的文本」→「一堆带链接的笔记」→「一个分层的生命周期」→「一张带时间的知识图」→「一组被选择过的叙事」→ MAGMA 的「若干张按关系类型分离、按意图路由的图」。

5.1 GraphRAG(Edge et al., arXiv 2404.16130,v1 2024-04,v2 2025-02)

解决了什么问题。朴素 RAG 只能回答「文档里哪一段提到了 X」,无法回答需要跨整个语料综合的全局性问题。GraphRAG 用 LLM 分两阶段建索引:先抽实体知识图,再预生成社区摘要;查询时由社区摘要生成局部答案再归并。一句话:把「检索单元」从 chunk 提升为「图上的社区」。

遗留了什么问题。GraphRAG 的图是静态语料索引,为「一次性建好、反复查询」设计。它不处理增量写入,不表示时间有效性(一条事实何时开始为真、何时被推翻),也不区分关系类型——实体图里的边就是「共现/相关」。对一个持续交互、事实不断被更新的 agent 而言,这三点都是硬伤。

MAGMA 如何回应。继承了「用 LLM 抽结构」这一步(慢路径的 Φ_reason),但把它从离线批处理改成在线异步流,并把「一种边」拆成四种。GraphRAG 的社区摘要对应 MAGMA 的 salience-based budgeting。

关键设计的传递。「LLM 作为图构建器」这个范式直接传下来了;但「预计算全局摘要」被替换为「查询时按意图动态遍历」——从预烘焙转向按需路由

5.2 MemGPT(Packer et al., 2023;MAGMA 按 ACL 2023 companion 引用)

解决了什么问题。第一个把操作系统的虚拟内存隐喻搬进 LLM:主上下文 = 物理内存,外部存储 = 磁盘,由 LLM 自己通过函数调用在两者间分页。一句话:让模型自己管理「什么该在上下文里」。

遗留了什么问题。分页的粒度是文本块,组织方式是无结构的。MemGPT 解决了「放不下」,没解决「放进去的东西彼此什么关系」。检索仍然回落到相似度搜索,且全部决策依赖 prompt 中的启发式指令,脆弱且不可学习。

MAGMA 如何回应。综合而非对抗:保留了「外部持久存储 + 按需调入」的骨架,但把「无结构块」换成「带四类关系的事件节点」,把「LLM 靠 prompt 决定调什么」换成「意图分类器 + 加权遍历」。

关键设计的传递。双流架构中的「快路径不阻塞、慢路径异步整理」,本质上是 MemGPT 的「前台交互 / 后台内存管理」在延迟维度上的重新切分。

5.3 A-MEM(Xu et al., NeurIPS 2025 主会,arXiv 2502.12110)

解决了什么问题。借 Zettelkasten 卡片盒法,让记忆自己长出网络:新记忆写入时生成含上下文描述、关键词、标签的结构化笔记,系统分析历史记忆建立链接,且新记忆会反向触发旧记忆表示的更新(memory evolution)。原文批评:「Current memory systems enable basic storage and retrieval but lack sophisticated memory organization... these systems' fixed operations and structures limit their adaptability」。一句话:记忆条目之间应当有链接,且链接与内容都会演化。

遗留了什么问题。A-MEM 的链接是同质的——所有边都是「语义上相关」,建边依据仍是 embedding 相似度。后果有二:(i) 时序与因果关系无法被表达,只能寄希望于 embedding 隐式编码;(ii) 检索仍是向量搜索,链接主要用于扩展召回而非引导召回。数据上也印证了:A-MEM 在 LoCoMo Temporal 类只有 0.474(Table 1),全表倒数第二。

MAGMA 如何回应。这是直接对抗:整个立论就是「A-MEM 那种同质链接不够」。它把 A-MEM 的一种边裂解成四种,并让边类型进入打分函数 φ(type(e_ij), T_q)。效果上 Temporal 从 0.474 抬到 0.650(+37.1%,本报告推算)。

关键设计的传递。「写入时用 LLM 生成结构化元数据 A_i(实体、时间线索、上下文描述符)」几乎是 A-MEM 笔记模式的直接继承;A-MEM 的 memory evolution 则演化为 MAGMA 慢路径中的「更新因果边置信度、合并冗余语义簇」。

5.4 MemoryOS(Kang et al., EMNLP 2025 Main, Oral,arXiv 2506.06326)

解决了什么问题。把记忆按生命周期分层:短期 / 中期 / 长期个人记忆三级存储,配四个算子(存储、更新、检索、生成)。在 LoCoMo 上用 GPT-4o-mini 取得 F1 +48.36%、BLEU-1 +46.18% 的相对提升。一句话:记忆需要一套显式的分层管理与换页策略,而不只是一个库。

遗留了什么问题。分层轴是时效/热度,不是关系类型:它回答了「一条记忆该放哪一层、何时被提升或淘汰」,但没回答「两条记忆之间是什么关系」。此外把四个算子串在同步路径上的代价极其可观:Table 3 显示其查询延迟 32.68 s,是 MAGMA 的 22.2 倍(本报告推算),交互式场景基本不可用。

MAGMA 如何回应。两个正交的轴上分别回应:(i) 用四张关系图补上缺失的「关系轴」;(ii) 用双流架构把重算子挪出关键路径,延迟压到 1.47 s。值得注意的是 MemoryOS 在 Open-Domain 上是最强基线(0.504),MAGMA 只领先 2.6%——分层管理在开放域上确有独立价值。

关键设计的传递。「不同的记忆操作应该被区别对待」这个思想被保留,但分类维度从「时效层级」换成了「同步性」(快/慢路径)。这是一个很干净的重新切分。

5.5 Zep / Graphiti(Rasmussen et al., arXiv 2501.13956,v1 2025-01-20)

解决了什么问题。第一个把时间有效性做成一等公民的 agent 记忆系统:Graphiti 引擎在知识图上维护双时态信息(事实发生时间 vs 被记录时间),从而能表达「这条事实曾经为真、现在已被推翻」。报告 DMR 94.8%(vs MemGPT 93.4%)、LongMemEval 最高 +18.5% 准确率、延迟降低最多 90%。一句话:agent 记忆里的事实是有有效期的,图必须能表达失效。

遗留了什么问题。Zep 只把一个维度(时间)显式化了,因果与实体共指仍隐含在同一张图的边和节点属性里。更重要的是,Zep 的检索不因问题类型而改变遍历方式——它是一张更聪明的图,配一套固定的检索流程。

MAGMA 如何回应。把 Zep 的「时间作为一等公民」推广成「每一类关系都是一等公民,各占一张图」,并额外增加了 Zep 没有的一层:让 query 的意图决定走哪张图。可以说 MAGMA = Zep 的思想在维度数上的展开 + 一个路由层。

关键设计的传递。时序骨架 E_temp(严格按 τ 排序的不可变链)几乎就是 Zep 时间轴的简化版;MAGMA 的「相对表达 → 绝对区间 [τ_s, τ_e]」也直接对应 Zep 的时间归一化。

一处必须指出的空白。如 B6 所述,MAGMA 没有把 Zep 放进基线。这是整个实验设计里最可惜的一处——Zep 是「单一但时间感知的图」的最佳代表,正是「多图 vs 单图」这个核心命题的天然对照组。

5.6 Nemori(Ma, Nan, Wu, Chen;arXiv 2508.03341,v1 2025-08,v4 2026-04 已改题)

解决了什么问题。从「什么值得记」这个此前被设计者启发式包办的问题入手,用预测误差(prediction error)作为价值信号:模型能预测到的交互不值得存,预测失败的才是新知识。两个组件——把原始交互转成结构化叙事、按可预测性抽取洞见。一句话:记忆的写入门槛应该由「意外程度」而非人工规则决定。

遗留了什么问题。Nemori 把功夫全下在内容选择上,选出来之后的组织形式仍是(结构化的)叙事文本,检索回到语义匹配。这带来一个非常具体的失效:Table 1 中 Nemori 在 adversarial 类只有 0.325,是除 Full Context 外最低的。原因可以推断:既然写入时已把「值得记的」蒸馏成连贯叙事,检索时几乎总能找到一段「看起来相关」的叙事,于是模型倾向于强答——高质量的压缩反而削弱了「我没有证据」这个判断的可用性

MAGMA 如何回应。这正是 §3.2 中那 98.98% 的来源。MAGMA 的结构化子图 + <ref:id> provenance 让「找不到」变成一个可判定的结构事实(沿因果边走满深度仍无相关节点),而非一个模糊的相似度低分。adversarial 从 0.325 抬到 0.742(+128%,本报告推算)。

同时也是 MAGMA 的失手处。Nemori 的叙事化压缩在 multi-hop 上仍然领先(0.569 vs 0.528)——把跨事件关系提前烘焙进文本,比查询时用 beam search 现场拼更稳。

关键设计的传递。Nemori 是 MAGMA 的主对照而非技术来源。二者构成一组干净的对立:写入时压缩(Nemori)vs 查询时组装(MAGMA)。这组对立本身就是下一步最值得做的实验。

6. 技术演进脉络

6.1 非线性演进树

2023 MemGPT [虚拟内存分页 · prompt 驱动 · 无结构文本块] │ 解决「放不下」,遗留「放进去的东西没有关系」 │ ├────────────────┬─────────────────┬──────────────────┐ ↓ ↓ ↓ ↓ 2024 GraphRAG 2025 A-MEM 2025 MemoryOS 2025 Zep/Graphiti [实体图+社区] [Zettelkasten [三级存储 [双时态知识图] 语料级结构 链接+演化] +四算子] 时间有效性 ⚠ 静态·无时间 ⚠ 链接同质 ⚠ 分层轴是时效 ⚠ 只显式化了 无增量 仍靠向量检索 不是关系 时间一个维度 │ │ │ 延迟 32.68s │ └────────┬────────┴─────────────────┴──────────────────┘ │ 「结构」这条线:各自补全一个维度 │ │ 2025 Nemori [预测误差决定「什么值得记」] │ 「内容」这条线:写入时压缩成叙事 │ ⚠ 组织仍是扁平叙事 · adversarial 崩到 0.325 │ │ └───────────┬───────────┘ ↓ 2026 MAGMA (ACL'26 Long) ┌──────────────────────────────────────────┐ │ 表示:四张正交关系图(sem/temp/caus/ent)│ │ 检索:意图 → 边类型权重 → beam 遍历 │ │ 写入:快路径(规则) ‖ 慢路径(LLM 异步) │ └──────────────────────────────────────────┘ ✓ adversarial 0.325 → 0.742(结构可判定「无证据」) ✓ 延迟 2.59s → 1.47s(LLM 移出关键路径) ✗ multi-hop 0.569 → 0.528(beam 剪枝跨图丢候选) ✗ 非对抗子集上与 Nemori 持平(+0.13pp)

6.2 演进的内在逻辑

这条线的推动力是一个反复出现的模式:每一代都把上一代隐含在「相似度」或「启发式」里的某个东西显式化,代价是引入一个新的、需要被管理的对象。

阶段被显式化的东西引入的新对象新的管理成本
MemGPT (2023)上下文的进出(分页)外部存储层换页策略
GraphRAG (2024)跨文档的全局结构实体图 + 社区索引构建
A-MEM (2025)记忆间的关联链接 + 演化链接维护
MemoryOS (2025)记忆的生命周期三级存储 + 四算子延迟(32.68 s)
Zep (2025)事实的时间有效性双时态边失效判定
Nemori (2025)写入的价值判断预测误差信号压缩损失(弃权崩塌)
MAGMA (2026)关系的类型四张图 + 遍历策略策略参数(手工设定)
阶段间的关键转折:prompt 驱动(MemGPT)→ 规则编码(GraphRAG / MemoryOS)→ 结构显式化(A-MEM / Zep)→ 内容选择(Nemori)→ 检索策略化(MAGMA)

而 MAGMA 引入的新管理成本——策略参数 w_{T_q} 目前是手工设定的——正好是下一代的入口。按这个模式外推,2026 下半年最可能出现的工作是「把遍历策略变成学出来的」:意图分类器和边权重都由 RL 从任务回报中学习。MemRLMemEvolve 已在往这个方向走,但它们优化的是记忆内容与记忆系统配置,还没人优化图上的遍历策略本身。

7. 开放挑战与研究机会

7.1 理论层面

7.1.1 「关系正交性」需要一个可测量的定义(高价值 · 低门槛)

§3.6 显示 LOO 降幅之和是「全图−最优单图」间隙的 1.87 倍,说明四视图功能上强耦合,而 "orthogonal" 目前只是边集不交这一句话。具体可做的:借用方差分解,把「全图性能 − 各单图性能」拆成主效应 + 二阶交互项,用 2⁴=16 组图子集配置跑一遍 LoCoMo(成本可控,构图只需一次),直接得出一张交互矩阵,回答「哪两张图是真冗余、哪两张图是真互补」。目前整个领域没有人做过这个。

7.1.2 弃权与能力必须在指标层面分离(高价值 · 低门槛)

LoCoMo 把 22.5% 的不可答样本和 77.5% 的可答样本用同一个 Judge 分聚合,导致纯保守的系统能白拿 0.225。具体可做的:定义 (Acc_answerable, AbstentionRate_unanswerable) 二元组,并通过扫描弃权阈值画出 trade-off 曲线。这不需要新数据,只需要重新汇报——但它会改写现有多篇论文的结论排序(§3.2 已给出一个实例)。

7.1.3 「写入时压缩 vs 查询时组装」的理论刻画

Nemori 与 MAGMA 构成一组干净对立。信息论上这是一个在哪一端付出失真代价的问题:写入时压缩把失真固化(不可逆),查询时组装把失真推迟但要付遍历成本。What to Keep, What to Forget 已开始用 rate–distortion 视角看记忆压缩,但还没人把「压缩时机」作为变量纳入。具体可做的:在给定 token 预算下刻画两种策略的失真下界,并预测交叉点位于什么样的查询分布。

7.2 工程与应用层

7.2.1 补上那格缺失的对照:Semantic Only 与 Zep 基线(判决性实验 · 极低门槛)

这是本报告认为最紧迫的一个空白。MAGMA 的核心主张是「多图优于单图」,但实验里既没有 Semantic-Only(自身的 null),也没有 Zep/GraphRAG(外部的单图代表)。具体可做的:开源仓库上关掉三张图跑 Semantic Only,再接一个 Graphiti 基线,同一 judge、同一 backbone。这是一次周末实验,却能判决整篇论文的核心主张成立与否。在这个数据出来之前,「多图 > 单图」应被视为未经验证。

7.2.2 报告慢路径的总算力,而非只报查询延迟

§3.7 指出双流架构让 Latency 与 Tokens/Query 两列都系统性地对 MAGMA 有利。具体可做的:所有采用异步整理的记忆系统统一汇报 (query latency, query tokens, background LLM calls per stored event, background tokens per stored event) 四元组。这会让一批「低延迟」的说法回到可比状态。

7.2.3 多跳遍历的剪枝失效需要单独攻

MAGMA 在 multi-hop 上落后 Nemori 7.2%,而多跳本该是多图的主场。具体可做的:做一个 beam width × depth 网格(4/8/16 × 3/4/5/6),只看 multi-hop 一列;若性能随 beam 单调上升且未饱和,则剪枝假说成立,问题可以用算力换回来;若不上升,则问题在打分函数 φ跨图可比性上(不同边类型的分数没有归一化到同一尺度)——后者更有意思,因为它是一个真正的建模缺陷。

7.2.4 动态/在线设置与图的老化

MAGMA 的图只增不减:慢路径会合并冗余语义簇,但没有任何遗忘或降权机制。长期部署下(数月量级),因果边会随 LLM 抽取误差累积而污染。SSGM 已论证「evolving memory 的错误是累积且持久的」。具体可做的:给因果边加一个基于后续检索效用的置信度更新规则(被检索到且回答正确 → 升权;被检索到但回答错误 → 降权),本质上是把 7.3.1 的「学出来的策略」先做一个无梯度版本。

7.3 新兴方向

7.3.1 学出来的遍历策略(最直接的下一步)

φ(r, T_q) = w_{T_q}ᵀ·𝟙_r 中的 w 从手工设定换成 RL 学出来的策略,意图空间也从 {Why, When, Entity} 三类放开为连续表示。MAGMA 提供动作空间,MemRL 那条线提供学习信号。具体可做的:以遍历轨迹为 episode、以最终答案的 judge 分为 reward 做 GRPO——Supersede 已证明 GRPO 能把小模型的记忆更新能力从 9.0% 拉到 16.7%,说明这类「记忆操作策略」确实可训练。

7.3.2 可逆的关系压缩

MAGMA 的 salience-based budgeting 把低相关节点压成「简写码」,这是不可逆的——一旦压错就再也找不回来。R³Mem 已在探索可逆压缩。具体可做的:把简写码设计成可在遍历中途「展开」的形式(发现该分支变得重要时回查原文),让压缩决策变成可撤销的。

7.3.3 多视角编码与多模态扩展

四图分解在多模态下有一个自然的扩展点:视觉观测天然带时间戳和实体,但几乎没有语义 embedding 上的可比性。这意味着多模态场景下四张图的相对重要性会剧烈变化(temporal / entity 权重应大幅上升)——而这恰好是「学出来的权重」比「手工权重」优势最大的场景。

7.3.4 关系图的安全面

四张图带来四个攻击面。因果边由 LLM 在慢路径异步推断,不经过任何人类或规则校验,是最脆弱的一环:注入一条伪因果边,就能让「Why」类查询被系统性地导向攻击者选定的节点。SSGM 的四维失效分类(Stability / Validity / Efficiency / Safety)提供了框架,但还没人针对多图记忆做具体的攻击面分析。具体可做的:设计一个「因果边投毒」基准,度量注入 k 条伪因果边后 Why 类查询的劫持率。

8. 相关工作表格对标

工作发表年月会议 / 出版核心贡献主要指标与 MAGMA 的关系
MemGPT2023-10ACL 2023 companion(论文引用)虚拟内存分页,LLM 自管上下文Zep 报告其 DMR 93.4%骨架来源:外部持久存储 + 按需调入;MAGMA 补上「结构」
GraphRAG2024-04 (v2 2025-02)arXiv(未找到正式会议页)LLM 建实体图 + 社区摘要,检索单元从 chunk 升为社区全局 sensemaking 优于朴素 RAG技术来源:LLM as graph builder;MAGMA 改为在线异步 + 四类边
A-MEM2025-02NeurIPS 2025 主会Zettelkasten 式链接 + 记忆演化LoCoMo Overall 0.580;Temporal 仅 0.474主要批评对象:链接同质、仍靠向量检索;MAGMA 拆成四类边
MemoryOS2025-06EMNLP 2025 Main, Oral三级存储 + 四算子的生命周期管理LoCoMo F1 +48.36% / BLEU-1 +46.18%;延迟 32.68 s正交补充:MemoryOS 管「时效轴」,MAGMA 管「关系轴」;双流把延迟压到 1.47 s
Zep / Graphiti2025-01arXiv 技术报告双时态知识图,事实有效期一等公民DMR 94.8%(vs MemGPT 93.4%);LongMemEval 最高 +18.5%,延迟 −90%思想母体:MAGMA = Zep 在维度数上的展开 + 意图路由层。⚠ 却未被列为基线
Nemori2025-08 (v4 2026-04)arXiv(未找到正式会议页)预测误差决定「什么值得记」,写入时蒸馏成叙事LoCoMo Overall 0.590(multi-hop 0.569 最优,adversarial 0.325 崩塌)最强基线兼主对照:写入时压缩 vs 查询时组装。MAGMA 的 98.98% 优势来自补上它的 adversarial 短板
MAGMA2026-01ACL 2026 主会 Long四张正交关系图 + 意图路由遍历 + 双流写入LoCoMo 0.700(非对抗子集 0.688);LongMemEval 61.2%;延迟 1.47 s本期核心工作

这张表读出来的三条趋势

  1. 性能阶梯是真的,但集中在特定能力上。LoCoMo Overall 从 A-MEM 0.580 → MemoryOS 0.553 → Nemori 0.590 → MAGMA 0.700 看起来是一条上升线;但按 §3.2 拆开后,2025→2026 这一跳几乎全在弃权校准上,推理能力(非对抗子集)从 Nemori 的 0.687 到 MAGMA 的 0.688 基本停滞。领域可能正处在一个推理能力的平台期,而记账方式把它掩盖了。
  2. 延迟差异远大于精度差异。32.68 s(MemoryOS)→ 2.59 s(Nemori)→ 1.47 s(MAGMA),跨越 22 倍;而 Overall 分只跨越 0.55–0.70。工程可用性目前是比精度更强的区分维度,但被论文叙事系统性低估。
  3. 正式发表的比例在快速上升。2025 上半年这条线主要是 arXiv 技术报告(Zep、GraphRAG),2025 下半年进入 NeurIPS/EMNLP 主会(A-MEM、MemoryOS),2026 进入 ACL 主会长文(MAGMA)。这个方向正在从工程社区完成向学术主流的迁移。

9. 其他值得关注的近期工作

MemEvolve: Meta-Evolution of Agent Memory Systems(2025-12,ICML 2026

不优化记忆内容而优化记忆系统的架构本身:把 12 个代表性记忆系统拆成 (encode, store, retrieve, manage) 的模块化设计空间(EvolveLab),再让 agent 元进化出适配任务的架构,对 SmolAgent / Flash-Searcher 最高提升 17.06%。若认可 §7.3.1 的判断(下一代是「学出来的策略」),这篇是那条路最完整的先行者。
arXiv | Code

MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory(2026-01,arXiv)

用 RL 在情景记忆上做运行时进化,不更新权重即可持续改进;两阶段检索先过滤噪声再识别有价值策略;在 HLE / BigCodeBench / ALFWorld / LifelongAgentBench 四个基准上超过 SOTA。它是把 MAGMA 遍历策略学出来的最现成的技术底座。
arXiv | Code

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents(2026-06,arXiv)

把「事实被更新后 agent 记不住新值」隔离成一个可测量的 gap:LongMemEval knowledge-update 上从全上下文的 92% 掉到有界自维护记忆的 77%(gpt-5.4, p=0.0033),且给更大内存完全没有恢复(28%→28%)——证明这是策略问题不是容量问题;GRPO 微调 Qwen2.5-3B 把留出集准确率从 9.0% 拉到 16.7%。这是「记忆操作可训练」最干净的一次证明,直接支持 §7.3.1。
arXiv

How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior(2026-07,ACL 2026 主会 Long

发现 agent 的「经验跟随」特性:检索到的记忆与当前输入越相似,输出就越相似——由此推出两个失效模式(错误传播、错配经验重放),并证明用未来任务的评测结果反过来作为已存经验的质量标签能改善长期表现。与 MAGMA 互补:MAGMA 管「怎么取」,这篇管「取到的东西质量如何」。
ACL Anthology

H-MEM: Hierarchical Memory for High-Efficiency Long-Term Reasoning in LLM Agents(2026-03,EACL 2026 Long

语义抽象程度分层组织记忆,高层记忆向量内嵌指向下层子记忆的位置索引编码,检索时逐层路由而不做全量相似度计算。与 MAGMA 是同一时期的另一种「结构化检索」答案:MAGMA 走横向(关系类型),H-MEM 走纵向(抽象层级),两者原则上可以叠加。
ACL Anthology

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents (Memora)(2026-04,arXiv)

跨数周对话、含记忆巩固与变异(mutation)的基准,提出 FAMA 指标惩罚对过期信息的依赖。结果显示记忆 agent 在「记住」上聚合 FAMA 119.45(LLM 仅 65.60–65.80),但在「推理」上只有 27.55(LLM 12.37–13.92)——记住容易、推理极难这个 gap 与本报告 §3.2 的发现同向。
arXiv

ForgetBench: Benchmarking Forgetting Dynamics of Long-Term Parametric Memory(2026-07,arXiv)

换到参数化记忆一侧:系统评测知识编辑方法在连续更新下的保持力。AlphaEdit 在 Qwen-2.5 7B 上编辑成功率 0.92,但记忆半衰期只有 452 步;反过来偏稳定的 WISE 编辑成功率低于 0.12。这个「保持 ↔ 生效」的取舍,与外部记忆里的「压缩 ↔ 可判定性」取舍结构上完全同构。
arXiv

Governing Evolving Memory in LLM Agents: the SSGM Framework(2026-03,arXiv)

记忆治理与安全方向:提出 Stability / Validity / Efficiency / Safety 四维失效分类,主张把记忆演化与执行解耦,加校验门与时间衰减建模。核心论点「evolving memory 的错误是累积且持久的」直接指向 MAGMA 慢路径 LLM 推断因果边这一未设防的攻击面(§7.3.4)。
arXiv

What to Keep, What to Forget: A Rate–Distortion View of Memory Compaction(2026-07,arXiv)

用率失真理论给「记忆压缩到什么程度」一个形式化框架。与 §7.1.3 的「压缩时机」问题直接相关:它刻画了压缩多少,还没刻画何时压缩。
arXiv