ACL 2026 · Agent Memory · 每日文献追踪

NEMORI:把「该记什么」从设计者直觉
改写成系统自己的预测误差

What Deserves Memory: Adaptive Memory Distillation for LLM Agents — 核心工作深度解析 + 五篇前驱回溯

ACL 2026 Main · Long 2026-08-04 acl-long.1607 · pp. 34789–34812 arXiv:2508.03341 v4 子方向:记忆蒸馏 / 压缩 候选池 26 篇

记忆的价值不再由设计者的启发式(重要性打分、情绪标签、事实模板)来裁定,而由交互序列自身的预测误差来裁定——「存什么」第一次成为一个可从数据中读出的内生信号,而不是一个需要被人工编码的先验。

0 · 本期检索说明

1 · 链接清单(全部已实际访问核实)

工作官方出版页arXiv代码数据集
NEMORI
(核心工作)
ACL 2026 acl-long.1607 · PDF arXiv:2508.03341
v1 2025-08-05 → v4 2026-04-16
nemori-ai/nemori
经站内检索确认存在;直接抓取被权限拦截,未逐文件核实
LoCoMo / LongMemEval-S
Generative Agents UIST 2023(DOI 待核 arXiv:2304.03442 joonspk-research/generative_agents(待核 无公开 benchmark
MemoryBank AAAI 2024(官方 proceedings 页未找到 arXiv:2305.10250 未核实到可达仓库 SiliconFriend 场景(未公开托管)
A-MEM 未见主会出版记录 arXiv:2502.12110(v9) agiresearch/A-mem LoCoMo
MemoryOS EMNLP 2025 Main, Oral arXiv:2506.06326 BAI-LAB/MemoryOS LoCoMo
Zep / Graphiti 无会议出版记录 arXiv:2501.13956(2025-01-20) Graphiti 开源(链接未核实 DMR / LongMemEval
LoCoMo(基准) ACL 2024 acl-long.747 arXiv:2402.17753 snap-research/locomo 项目页
LongMemEval(基准) ICLR 2025 xiaowu0162/LongMemEval 同左
核实口径。 标注「待核 / 未找到 / 未核实」的条目,是本次运行中 WebFetch 返回权限错误或搜索未命中官方页面的结果。宁可留空也不臆造 URL——这是本系列报告的硬约束。

2 · 核心工作深度解析

2.1 摘要译述与核心定位

NEMORI 处理的问题只有一句话:记忆系统如何判定「什么信息值得被留下」。作者的诊断是,现有系统给出的答案全部是设计者直觉的编码——Generative Agents 用 importance score,情绪型记忆用 emotion tag,Mem0 用事实模板,MemoryOS 用 heat score。论文原文的措辞是这些方法 “encoding designer intuition rather than learning from the data itself”,其后果被拆成两条:subjective bias 导致不可逆的信息扭曲,systemic bloat 导致过度存储并放大检索噪声。

NEMORI 的答案来自预测编码理论(Rao & Ballard 1999;Friston 2010 自由能原理):可被现有知识预测的信息即冗余,不可预测的部分才是记忆的候选。系统先用已有语义知识对即将到来的一段交互生成「预期图式」(anticipatory schema),再把实际内容与预期之间的差蒸馏成语义知识。

一句话捕捉创新点:把「该记什么」从一个人工设定的评分函数,改写成一个系统对自身预测失败的度量。

2.2 Motivation 与问题论证

论文的痛点论证是三层递进的。

第一层:容量约束是硬的。无状态 LLM 依赖不断膨胀的交互轨迹,而上下文窗口有限,且存在 Lost in the Middle 现象。这一层是全领域共识,NEMORI 不在此处争胜。

第二层:启发式蒸馏引入不可逆损失。这是论文真正的攻击面。作者在 Table 1 中把整个记忆系统谱系按 Distillation / Management / Retrieval 三个时机重排(见表 A),一个结构性事实随之浮现:13 条基线中只有 5 条在 Distillation 列有内容,且判据全部是人工先验;另外 7 条干脆留空——它们把原始交互整体塞进存储,把问题推给管理与检索阶段补救。

第三层:这一痛点被量化了。

这条成本证据比性能提升更硬。 更便宜更好,说明省下来的确实是冗余而不是信息——这正是「启发式导致 systemic bloat」这一主张所需要的证据形态。

2.3 论文的故事线(论证结构)

论文的推进逻辑不是「提出模块 A/B/C」,而是一条由三个先验(prior)串起来的演绎链。这三个先验是论文的真正骨架,也是它区别于同期「又一个记忆框架」论文的地方。

观察① 交互序列存在天然的分组边界,组内消息互为语境 ⇒【Structure Prior · Integrity of Episode】 ⇒ 推论:记忆的原子单位不是 message,也不是定长 chunk,而是 episode ⇒ 设计:LLM 驱动的 Local Message Partitioning(而非定长切分) 观察② 记忆为「回忆」服务;回忆本质是推理,是 allocentric 重构, 而原始 episode 是 egocentric、含噪的 ⇒【Representation Prior · Asymmetry of Perspective】 ⇒ 推论:存储表征 ≠ 原始表征,需要一次视角转换 ⇒ 设计:Narrative Episode Generation(叙事化重写 + episodic cue) 观察③ 交互序列信息高度冗余;从预测编码看,「意外」才是巩固的候选 ⇒【Distillation Prior · Predictability Implies Redundancy】 ⇒ 推论:蒸馏判据 = 系统预测与实际之差 ⇒ 设计:Anticipatory Schema → Prediction Error Distillation
关键转折点在观察③到设计的这一跳。 它需要一个非平凡假设:系统当前的语义知识库足以生成一个有意义的「预期」。知识库为空(冷启动)时预期为空,全段都是「预测误差」,退化为全量蒸馏;知识库饱和时预期覆盖大部分内容,蒸馏输出趋近于零。论文没有对这个冷启动—饱和动力学做任何实验刻画,这是故事线上最明显的论证缺口。

2.4 方法论与机制解剖

表 A · 论文 Table 1:按「蒸馏 / 管理 / 检索」三时机重排的记忆系统谱系(原文转录)

类别方法DistillationManagementRetrieval
Retrieval-timeLewis et al. (2020) RAGSimilarity search
Management-timePacker et al. (2023) MemGPTTiered storageFunction calls
Management-timeZhong et al. (2024) MemoryBankSummary + forgetting
Management-timeKang et al. (2025) MemoryOSHeat scoringTwo-step search
Management-timeLi et al. (2025b)Hierarchical summaryMulti-step search
Management-timeAnokhin et al. (2025)Graph updateGraph spreading
Management-timeXu et al. (2025) A-MEMAdaptive note linking
Management-timeRasmussen et al. (2025) ZepValidity managementReranking
Distillation-timePark et al. (2023) Generative AgentsImportance scoringReflection treesWeighted scoring
Distillation-timeHuang et al. (2024)Emotion taggingEmotion matching
Distillation-timeChhikara et al. (2025) Mem0Facts extraction
Distillation-timeLi et al. (2025a)Summary + personaNoun overlap
Distillation-timePan et al. (2025)TopicToken compression
Distillation-timeNEMORI(本文)Prediction errorAgnostic
这张表本身就是最有力的定位工具。 NEMORI 在 Management 列写的是 Agnostic(不可知/中立),即主动放弃管理层的竞争,只主张蒸馏层。这个自我限定既是诚实,也在 §2.8 中成为一个可被追问的软肋。

形式化定义 · Module 1:Episodic Memory Integration

(1a) 局部消息切分 B_t = {m_1,…,m_z}, m_i = (r_i, c_i, τ_i), 窗口 w ∈ Z⁺ O ← f_LLM(P_par ‖ B_t), O = {O_1,…,O_n} 为索引集 {1,…,w} 的一个划分 P = {P_1,…,P_n} 索引映射回消息,得到原始 episode (1b) 叙事化生成 (N_j, c_j) ← f_LLM(P_nar ‖ P_j) # N_j 叙事表征, c_j 检索线索 v_j ← f_emb(c_j ‖ N_j) M_j = (c_j, N_j, P_j, v_j) (1c) 联想式整合(Supersede 语义) C = {U_1,…,U_{K_e}} ← Search(D_e, v_j, K_e) idx ← f_LLM(P_sel ‖ (c_j,N_j) ‖ {(c_k,N_k)}) idx = k ⇒ (c_ν,N_ν) ← f_LLM(P_int ‖ c_k ‖ N_k ‖ c_j ‖ N_j) M_ν = (c_ν, N_ν, P_k ‖ P_j, f_emb(c_ν ‖ N_ν)) # M_ν 取代 U_k idx = -1 ⇒ 无连续性,M_j 作为独立条目插入

形式化定义 · Module 2:Semantic Knowledge Distillation(论文核心)

(2a) 预期图式合成 S_in ← Evoke(M_in, M) 原生实现: S_in ← Top-K_s { S_r ∈ D_s | sim(v_in, u_r) > τ }, τ = 0.70 P̂_in ← f_LLM(P_ant ‖ c_in ‖ S_in) # 由现有知识预测这段 episode (2b) 预测误差蒸馏 K_in = {k_1,…,k_d} ← f_LLM(P_dis ‖ P_in ‖ P̂_in) ↑ ground truth ↑ prediction (2c) 语义巩固(三态决策) S̃_q ← Search(D_s, u_q, K_m), K_m = 5 (δ, idxs, k_μ) ← f_LLM(P_con ‖ k_q ‖ {k_h}) δ ∈ { new : 插入 (k_q, u_q) merge : 用 (k_μ, f_emb(k_μ)) 取代 idxs 指向的条目 conflict : 清除过时条目,用 (k_q, u_q) 替换 } 响应生成 R̃_e ← Search(D_e, v_Q, k) # k = 10 叙事 episode R̃_s ← Search(D_s, v_Q, m) # m = 2k = 20 语义知识 a ← f_LLM(P_ans ‖ Q ‖ R_e ‖ R_p ‖ R_s) # R_p: r = 2 条原文

表 B · 超参配置与敏感性覆盖

超参作用是否做了敏感性分析
τ 相似度阈值0.70预期图式的上下文唤起门槛否 — 关键缺口
K_e episodic 候选5整合阶段检索数
K_m 语义候选5巩固阶段检索数
K_s 唤起条目10预期图式上下文规模
w 观察窗口20触发切分(条消息)是 — Fig.2 / Table 11,w ∈ {5,10,20,30,40}
k episodic 检索10响应生成是 — Fig.3 / Table 12,k ∈ {2…30}
m 语义检索20响应生成(= 2k)随 k 联动
r 原文 episode2响应中带全文

三阶段流程与成本占比

原始对话流 B_t │ ├─[① Partition]──▶ LLM 切出 episode 边界 P = {P_1..P_n} 成本 15.3% │ ├─[② Narrate]────▶ (N_j, c_j) 叙事重写 + cue, v_j 索引 成本 38.3% ← 最贵 │ │ │ └─[③ Integrate]─▶ supersede / insert 成本 16.2% │ ↓ D_e (episodic store) │ └─[④ Distill]────▶ Evoke(τ=0.70) ─▶ 预期图式 P̂ │ ├─ 实际 P vs 预期 P̂ ⇒ 预测误差 K 成本 30.3% ← 核心 │ └─[⑤ Consolidate]─▶ new / merge / conflict ↓ D_s (semantic store)

图 1 · LoCoMo 平均 LLM-judge 分数:8 种方法 × 2 个生成模型

数据来源:NEMORI 论文 Table 2 的 Average 列。虚线为对应模型的 Full Context(全上下文 oracle)水平。悬停查看具体数值。

gpt-4o-mini gpt-4.1-mini Full Context 基准线

2.5 实验设计与定量结果

评测配置

LoCoMoLongMemEval-S
规模10 段对话,平均 24K tokens,1,540 题500 段对话,平均 105K tokens
题型Temporal / Open Domain / Multi-Hop / Single-Hop6 类(偏好、助手、时间、跨会话、知识更新、用户)
指标LLM-judge (0–100) / F1 / BLEU-1LLM-judge
生成模型gpt-4.1-mini, gpt-4o-mini;嵌入 text-embedding-3-small;judge = gpt-4o-mini
重复次数单次运行(single-run),无方差报告

表 C · LoCoMo 主结果矩阵(论文 Table 2;格式 LLM-judge / F1 / BLEU-1)

gpt-4.1-mini

方法TemporalOpen DomainMulti-HopSingle-HopAverage
Full Context(oracle)74.2 / 47.5 / 40.056.6 / 28.4 / 22.277.2 / 44.2 / 33.786.9 / 61.4 / 53.480.6 / 53.3 / 45.0
RAG-409627.4 / 22.3 / 19.128.8 / 17.9 / 13.931.7 / 20.1 / 12.835.9 / 25.8 / 22.032.9 / 23.5 / 19.2
LangMem50.8 / 48.5 / 40.959.0 / 32.8 / 26.471.0 / 41.5 / 32.584.5 / 51.0 / 43.673.4 / 47.6 / 40.0
Zep60.2 / 23.9 / 20.043.8 / 24.2 / 19.353.7 / 30.5 / 20.466.9 / 45.5 / 40.061.6 / 36.9 / 30.9
Mem056.9 / 39.2 / 33.247.9 / 23.7 / 17.768.2 / 40.1 / 30.371.4 / 48.6 / 42.066.3 / 43.5 / 36.5
A-MEM66.7 / 40.3 / 33.737.5 / 13.4 / 12.755.7 / 30.4 / 20.064.0 / 45.0 / 39.861.4 / 39.4 / 33.2
MemoryOS37.7 / 36.5 / 27.460.4 / 30.2 / 25.662.4 / 34.0 / 25.868.9 / 44.2 / 37.560.6 / 39.9 / 32.5
NEMORI77.3 / 58.7 / 50.756.3 / 31.7 / 25.174.8 / 40.8 / 31.787.0 / 55.7 / 49.580.8 / 52.1 / 45.0
论文报告的相对提升+15.9 / +21.0 / +24.0%+5.4% / — / —+3.0 / +9.2 / +13.5%+10.1 / +9.5 / +12.5%

gpt-4o-mini

方法TemporalOpen DomainMulti-HopSingle-HopAverage
Full Context(oracle)56.2 / 44.1 / 36.148.6 / 24.5 / 17.266.8 / 35.4 / 26.183.0 / 53.1 / 44.772.3 / 46.2 / 37.8
RAG-409623.7 / 19.5 / 15.732.6 / 19.0 / 13.531.3 / 18.6 / 11.732.0 / 22.2 / 18.630.2 / 20.8 / 16.4
LangMem24.9 / 31.9 / 26.247.6 / 29.4 / 23.552.4 / 33.5 / 23.961.4 / 38.8 / 33.151.3 / 35.8 / 29.4
Zep58.9 / 44.8 / 38.139.6 / 22.9 / 15.750.5 / 27.5 / 19.363.2 / 39.7 / 33.758.5 / 37.5 / 30.9
Mem050.4 / 44.4 / 37.640.6 / 27.1 / 19.460.3 / 34.3 / 25.268.1 / 44.4 / 37.761.3 / 41.5 / 34.2
A-MEM54.2 / 38.1 / 33.822.9 / 9.0 / 8.643.6 / 24.0 / 18.858.2 / 35.6 / 29.252.5 / 32.4 / 27.0
MemoryOS38.0 / 38.5 / 27.545.8 / 26.0 / 19.252.5 / 35.2 / 24.162.5 / 43.7 / 37.754.5 / 39.9 / 31.9
NEMORI67.6 / 57.3 / 47.645.8 / 23.9 / 18.561.7 / 38.1 / 26.081.9 / 54.8 / 43.873.0 / 50.3 / 39.7
论文报告的相对提升+14.8 / +27.9 / +24.9%+2.3 / +8.2 / +3.2%+20.3 / +23.4 / +16.2%+19.1 / +21.2 / +16.1%

表 D · 本报告自行计算:NEMORI vs Full Context 的类目级战绩(LLM-judge)

类目gpt-4.1-mini Δ相对gpt-4o-mini Δ相对
Temporal Reasoning+3.1 pp+4.18%+11.4 pp+20.28%
Open Domain−0.3 pp−0.53%−2.8 pp−5.76%
Multi-Hop−2.4 pp−3.11%−5.1 pp−7.63%
Single-Hop+0.1 pp+0.12%−1.1 pp−1.33%
Average(论文口径)+0.2 pp+0.25%+0.7 pp+0.97%
Average(F1)−1.2 pp−2.25%+4.1 pp+8.87%
这是本报告最重要的再计算结果。 论文正文的 “+10.1% / +19.1%” 是相对最强记忆系统基线(gpt-4.1-mini 下 LangMem 73.4;gpt-4o-mini 下 Mem0 61.3)计算的,而非相对 Full Context。换成 Full Context 口径:gpt-4.1-mini 上 NEMORI 2 胜 2 负、均值 +0.25%、F1 反而落后 2.25%;gpt-4o-mini 上 1 胜 3 负、均值 +0.97%。也就是说,NEMORI 相对全上下文的全部平均优势,几乎完全由 Temporal Reasoning 一个类目贡献。

表 E · 记忆构建成本(论文 Table 3,LoCoMo / gpt-4o-mini)

方法LLM-judgeAPI 调用输入 (k)输出 (k)总 tokens (k)每分成本*
LangMem51.3920.6898.3112.01010.219.7
Mem061.31602.21483.4210.01693.427.6
A-MEM52.51175.5912.6236.81149.421.9
MemoryOS54.51016.1404.5122.0526.59.7
NEMORI73.0373.2277.245.7322.94.4
论文报告的改进+19.1%↓59.5%↓31.5%↓59.2%↓38.7%

* 「每分成本」为本报告计算(总 tokens ÷ LLM-judge 分数),用于剥离性能差异后比较真实效率。NEMORI 的单位分数成本是 Mem0 的 1/6.3、MemoryOS 的 1/2.2。 论文表中 “↓38.7%” 相对最省的 MemoryOS 计算;相对 Mem0 则是 ↓80.9%

表 F · 消融研究(论文 Table 5)+ 本报告计算的相对跌幅

配置原生管理gpt-4o-miniΔgpt-4.1-miniΔ
w/o NEMORI(无记忆)0.6 / 0.5 / 0.9−99.2%1.2 / 1.6 / 1.5−98.5%
Nemori-s(直接蒸馏,替换预测误差)51.7 / 36.4 / 28.9−29.2%66.0 / 41.4 / 34.9−18.3%
Nemori-s(去掉原生管理)52.0 / 36.6 / 29.1−28.8%65.5 / 41.1 / 34.1−18.9%
w/o e(去掉 episodic 检索)64.6 / 46.2 / 37.1−11.5%74.7 / 48.2 / 40.9−7.5%
w/o e(naive RAG 替代)65.0 / 46.2 / 36.9−11.0%74.9 / 48.1 / 40.7−7.3%
w/o s(去掉语义检索)54.7 / 39.6 / 31.7−25.1%76.9 / 50.0 / 42.9−4.8%
w/o p(定长 20 条切分)68.0 / 47.4 / 36.8−6.8%75.7 / 48.1 / 40.9−6.3%
NEMORI 全量73.0 / 50.3 / 39.780.8 / 52.1 / 45.0

表 G · 构建成本的组件拆分(论文 Table 9,gpt-4o-mini)

组件输入 (k)输出 (k)合计 (k)占比
Partition (§3.2.1)44.74.649.315.3%
Narration (§3.2.2)99.823.9123.638.3%
Integration (§3.2.3)43.88.452.216.2%
Distillation (§3.3)88.98.897.730.3%
叙事化(38.3%)而非预测误差蒸馏(30.3%)才是最大的成本项,但消融表里没有「去掉叙事化、保留原始 episode」的干净配置——Table 6 的 Partitioned→Partitioned 只有 75.3(−6.8%),且它同时改变了索引与检索两端。论文最贵的组件恰好缺一个干净的消融。

表 H · 检索策略消融(论文 Table 6,LoCoMo / gpt-4.1-mini)

索引用什么检索返回什么LLM-judgeF1BLEU-1
NarrativeNarrative(默认)76.950.042.9
PartitionedNarrative76.450.743.7
NarrativePartitioned77.050.242.6
PartitionedPartitioned75.350.142.7

四种组合的 LLM-judge 极差仅 1.7 pp(75.3–77.0),F1 极差 0.7 pp这组消融实际上说明「索引/检索表征的选择几乎不重要」,与 §2.3 中 Representation Prior 的强主张形成张力。论文默认设 N→N,但 N→P 的 LLM-judge 反而略高(77.0)。

表 I · 第三方系统集成(论文 Table 7):NEMORI 作为前置蒸馏器

宿主模型输入LLM-judgeCore ScoreMemTokens
A-MEMgpt-4o-miniRaw (P)52.552.6397K
A-MEMgpt-4o-miniNEMORI (K)50.9 (↓3.0%)55.8 (↑6.1%)142K (↓64.3%)
A-MEMgpt-4.1-miniRaw (P)61.460.4498K
A-MEMgpt-4.1-miniNEMORI (K)59.0 (↓3.9%)64.1 (↑6.1%)243K (↓51.3%)
MemoryOSgpt-4o-miniRaw (P)54.659.2405K
MemoryOSgpt-4o-miniNEMORI (K)54.0 (↓1.1%)60.3 (↑1.9%)190K (↓53.1%)
MemoryOSgpt-4.1-miniRaw (P)60.766.9354K
MemoryOSgpt-4.1-miniNEMORI (K)61.4 (↑1.2%)69.2 (↑3.4%)194K (↓45.3%)

表 J · 可扩展性(论文 Table 8,LongMemEval-S,105K 平均 tokens)

题型4o-mini Full Ctx4o-mini NEMORI相对4.1-mini Full Ctx4.1-mini NEMORI相对
Single-session Preference6.746.7+597%16.786.7+419%
Single-session Assistant89.383.9−6.0%98.292.9−5.4%
Temporal Reasoning42.161.7+46.6%60.272.2+19.9%
Multi-session38.351.1+33.4%51.155.6+8.8%
Knowledge Update78.261.5−21.4%76.979.5+3.4%
Single-session User78.688.6+12.7%85.790.0+5.0%
Average55.064.2+16.7%65.674.6+13.7%

Full Context 用 101K tokens;NEMORI 用 3.7–4.8K tokens(↓95–96%)。「相对」列为本报告计算。

表 K · 超参敏感性

观察窗口 w(Table 11,gpt-4.1-mini)

wTemporalOpen DomainMulti-HopSingle-HopOverall
577.059.473.886.380.4
1077.657.377.085.780.7
20(默认)77.356.374.887.080.8
3076.660.479.486.081.2
4076.354.277.386.480.7

检索数 k(Fig.3 / Table 12)

kgpt-4o-minigpt-4.1-mini
265.0 / 66.6*73.4
570.079.3
10(默认)73.080.8
1572.582.7
2072.583.4
3073.0 / 74.4*83.3

* 抽取到的 Fig.3 与 Table 12 在 k=2 与 k=30 两点上数值略有出入(65.0 vs 66.6;73.0 vs 74.4)。本报告未能确定哪一组是正文口径,如实并列。

2.6 相变现象高亮 · 全文最有说服力的定性证据

在 LongMemEval-S 的 Single-session Preference 一类上,gpt-4o-mini 用 101K tokens 的完整上下文只得 6.7 分;换成 NEMORI 蒸馏出的 3.7–4.8K tokens,得 46.7 分(+597%)。在 gpt-4.1-mini 上是 16.7 → 86.7(+419%,5.19 倍)。

这不是「压缩带来的边际增益」,这是一次符号翻转:把上下文缩小到 1/25,性能提升 5–7 倍。它说明在偏好类问题上,原始上下文不是「信息不足」,而是「信息主动有害」——用户偏好散落在长对话各处,被大量无关内容淹没,模型在 101K tokens 里根本定位不到;而预测误差蒸馏恰好把「与既有画像不符的新偏好」单独挑出来存成一条语义知识。

这是全文唯一一处 shape 而非 degree 的证据:其他类目上 NEMORI 与 Full Context 的差距都在 ±20% 之内(表 J),只有 Preference 一项跨越了一个数量级。如果论文要选一条主张来押注,应该是「记忆的价值在于对抗上下文稀释,而不是对抗上下文长度」——但论文并没有把这条相变单独作为核心论据展开。

反向证据同样值得高亮Knowledge Update 一类上,gpt-4o-mini 从 78.2 掉到 61.5(−21.4%)。而 conflict 正是 NEMORI 语义巩固的三态之一、专为知识更新设计的机制。专门设计的机制在专门对应的题型上失手最狠——这条内部矛盾在论文中未被讨论。

图 2 · LongMemEval-S 六类题型:Full Context vs NEMORI

数据来源:NEMORI 论文 Table 8(gpt-4o-mini)。Full Context 用 101K tokens,NEMORI 用 3.7–4.8K tokens。注意 Preference 一类的相变式跃迁与 Knowledge Update 的回退。悬停查看具体数值。

Full Context(101K tokens) NEMORI(3.7–4.8K tokens)

2.7 价值分析

真正的贡献不是「性能更好」,而是三件事:

  1. 把「存什么」重新定义为一个可测量的量。在 NEMORI 之前,importanceheatemotion 都是外生的:需要一个提示词、一个阈值、一个衰减系数。预测误差是内生的:由系统当前知识状态与输入共同决定,不需要额外的配置界面。这个转换的意义类似于从「手工特征」到「自监督目标」的转换。
  2. 给出了一个「成本 ↓80.9% 且性能 ↑19.1%」的存在性证明(表 E,相对 Mem0)。它把「记忆系统的成本是必要代价」这一默认假设证伪了:大部分成本来自存了不该存的东西。
  3. 可拆卸的模块化贡献。表 I 证明预测误差蒸馏可以作为前置滤波器插到别人的系统前面:A-MEM 存储量降 51–64%,Core Score 反升 6.1%。这意味着这个机制不依赖 NEMORI 的其余部分,可被 A-MEM / MemoryOS / Mem0 直接吸收。

可脱离本文单独复用的设计原则

设计可复用形式迁移到哪里
Predictability Implies Redundancy任何「写入前先让系统预测一次,只存差值」的门控KV-cache 压缩、RAG 索引构建、agent trajectory 日志
LLM 驱动的 episode 边界切分表 F 显示贡献 −6.3~6.8%,成本仅占 15.3%,性价比高长文档分块、多轮工具调用轨迹分段
三态巩固 new / merge / conflict显式区分「新增/合并/冲突」而非统一 upsert知识图谱增量更新、用户画像维护
Narrative 重写(allocentric 转换)存储表征与原始表征解耦但表 H 显示收益 ≤1.7 pp,性价比存疑

2.8 局限性

(A)论文自述的限制 — ACL 正式版 Limitations 节,原文引用

  1. 蒸馏中心的作用域:“NEMORI focuses on distillation and adopts naive strategies for management and retrieval. This simplicity suffices for the benchmarks studied here, but may become a bottleneck for tasks that demand more sophisticated reasoning over memory. The performance we report should be understood as reflecting this design scope rather than the ceiling of what a complete memory system could achieve.”
  2. 接口尚未标准化:“The interfaces we define are currently conceptual, and due to the lack of standardized protocols in the area, concrete integration still requires case-by-case implementation.”
一个可核验的版本差异:arXiv v4(HTML)正文在 Section 5 之后直接进入 References 与 Appendix A–D,未包含 Limitations 节;上述两条来自 ACL Anthology 正式版 PDF。引用时请以 ACL 版为准。

(B)本报告的补充批判(9 点,每点附证据)

① 相对 Full Context 的优势几乎为零,且被报告口径掩盖(论证缺口)。论文全文相对提升均以最强记忆系统基线为分母。改用 Full Context 口径(表 D):gpt-4.1-mini 上 Average 仅 +0.2 pp(+0.25%),F1 反而低 1.2 pp(52.1 vs 53.3,−2.25%),Multi-Hop 低 2.4 pp。这与摘要给人的印象(“improved performance alongside reduced storage”)不一致:在能装得下全上下文的场景里,NEMORI 的性能收益在噪声量级内,真实卖点只有成本。论文若把主张收敛为「等性能、1/5 成本」,反而更稳固。

② 核心机制的贡献随模型能力急剧衰减(指标有效性 + 外推风险)。表 F 中 w/o s(去掉预测误差蒸馏出的语义层):gpt-4o-mini 掉 −25.1%,gpt-4.1-mini 只掉 −4.8%。两个模型仅差一代,核心贡献的边际价值就衰减了 5.2 倍。线性外推到前沿模型,语义层的贡献可能趋近于零——即预测误差蒸馏在补的是弱模型的检索/整合能力,而非提供不可替代的信息。论文没有在任何更强的模型上验证这条趋势是否收敛,这是最需要补的实验

③ 为知识更新设计的 conflict 机制,恰在知识更新题型上失手最重(内部矛盾)。表 J:Knowledge Update gpt-4o-mini 78.2 → 61.5(−21.4%),是六类中唯一的两位数负增长;同一模型上 Preference 却是 +597%。若 conflict 真能「清除过时条目」,这个类目本该是主场。合理猜测:conflict 的触发依赖 Search(D_s, u_q, K_m=5) 召回到旧条目,而新旧表述若语义相似度低于召回阈,冲突根本不会被检出——这直接指向未做敏感性分析的 τ = 0.70。论文对此无任何讨论。

④ 关键超参 τ = 0.70 完全没有敏感性分析(实验设计缺口)。表 B:论文扫了 w(5→40)和 k(2→30),却没扫 τ。而 τ预期图式唤起的门槛,直接决定「系统认为自己知道多少」,从而决定预测误差的规模——它是整个 Distillation Prior 的旋钮。跳过 τ 而扫 w,等于给次要参数做了体检、给主动脉留了空白。附带地 K_e = K_m = 5K_s = 10r = 2 也均无消融。

⑤ 自称的「原生管理」模块在两组对照里都是负贡献(论证缺口)。表 F:Nemori-s 带管理 51.7 vs 不带 52.0(−0.3);w/o e 带管理 64.6 vs naive RAG 65.0(−0.4)。两次对照,管理模块都略微拖后腿。论文解读为 “management overhead negligible”,但更严格的读法是:在单次运行、无方差报告的前提下,±0.3–0.4 pp 无法区分「无害」与「有害」,而这两个数的符号是一致的。既然如此,Table 1 里 Management 列写 “Agnostic” 就不只是自我限定,而是一个未经证成的默认值。

⑥ 缺少与「学习型记忆策略」分支的 head-to-head(关键竞品对比空白)。2025–2026 年记忆方向的另一条主线把记忆操作交给 RL 训练的策略(Memory-R1、MemAct、AgeMem),其判据是外生奖励;NEMORI 的判据是内生预测误差。两条路线在概念上直接竞争(「什么信号该驱动记忆写入」),但论文的 7 条基线没有一条来自 RL 分支。「内生信号优于外生奖励」这一隐含主张因此完全未被检验。这是下一步最有价值的实验。

⑦ 表 I 的两个指标符号相反,指标有效性存疑(指标问题)。NEMORI 作为 A-MEM 的前置蒸馏器,LLM-judge 降 3.0%/3.9%,Core Score 却升 6.1%/6.1%。论文用后者支持 “maintaining/improving performance”。同一次实验里两个指标方向相反时,选择对自己有利的那个需要额外论证——论文没有说明 Core Score 的定义、它与 LLM-judge 的差异来源,也没说明为什么主表不使用 Core Score。

⑧ 评测面过窄,标题中的 “LLM Agents” 被过度承诺(实验设计问题)。LoCoMo 与 LongMemEval-S 都是对话式问答基准,没有任何工具调用、网页/具身环境、规划类(ALFWorld / WebArena / PDDL)实验。记忆在 agent 场景中要承载的是行为经验(哪次工具调用失败、哪条路径走不通),其冗余结构与对话事实完全不同。此外 LoCoMo 只有 10 段对话、1,540 题、单次运行、无置信区间,而表 D 中若干关键差异只有 0.1–1.2 pp,在该样本量下不可区分

⑨ 本报告自身的不完备之处(坦诚声明)。本次分析基于 ACL 正式版 PDF 与 arXiv v4 HTML 的抽取结果,未运行代码github.com/nemori-ai/nemori 仅经检索确认存在,未核实是否为论文完整实现(该仓库的公开描述自称 “a minimalist MVP”,与论文中 “a production-grade implementation” 的表述存在潜在出入,复现者需特别注意)。Fig.3 与 Table 12 的数值出入亦未能消解。

3 · 相关工作回溯:一条「先验逐步内生化」的问题传递链

选择标准:这五项工作都在回答同一个问题——「该记什么/该忘什么」,且每一项都在 NEMORI 的 Table 1 中被点名归类。它们不是平行的同方向论文,而是同一个旋钮被换了五种拧法,NEMORI 是把旋钮拆掉的那一步。

3.1 Generative Agents — Park et al., UIST 2023

解决了什么问题。首次给出可运行的长期 agent 记忆闭环:memory stream 记录全部观察,检索用 importance × recency × relevance 三项加权,reflection 把低层观察合成高层洞见。它是 NEMORI Table 1 中 Distillation 列第一个有内容的条目

遗留了什么问题。importance 由 LLM 按提示词打 1–10 分,这个分数与下游任务效用之间没有任何监督信号,它是设计者对「什么重要」的直觉的代理。打分偏高 → systemic bloat;偏低 → 不可逆丢失。更根本的是,importance 是绝对量——不随系统已知内容变化,同一句话第一次说和第十次说得分相同。

核心工作如何回应。NEMORI 把绝对量换成相对量:一条信息的价值 = 它相对系统当前知识的意外程度。第十次重复的内容会被 Evoke 命中、被预期图式覆盖、蒸馏输出为空。表 F 的 Nemori-s 掉 18.3–29.2%,正是这条替换的定量代价。

关键设计的传递。Generative Agents 的 reflection tree 在 NEMORI 中演化为 merge 巩固状态——但只在检索到语义相邻条目时触发,而非按固定 importance 累积阈值触发。触发条件从「计数器」变成了「联想命中」。

3.2 MemoryBank — Zhong et al., AAAI 2024

解决了什么问题。第一次把「遗忘」当作一等公民:借 Ebbinghaus 遗忘曲线,让记忆强度随时间指数衰减、随重复召回增强。它给出了「该忘什么」的第一个可计算答案。

遗留了什么问题。遗忘曲线是关于时间的先验,不是关于内容的判据。一条一周未被访问的关键事实(用户对某种药物过敏)与一条一周未被访问的闲聊,衰减速率相同。它把「重要性」外包给「被访问频率」这个代理量,而访问频率取决于问了什么问题,在冷启动或低频场景下几乎无信息

核心工作如何回应。NEMORI 干脆不做时间衰减。它的「遗忘」发生在写入之前:可预测的内容根本不进入语义存储;写入后的清除只发生在 conflict(被新信息证伪)时。从「按时间衰减」变成「按可预测性过滤 + 按矛盾清除」——遗忘从后处理过程变成了写入门控。

本链上最有意思的一次符号翻转:MemoryBank 的「重复召回增强记忆」这一 Hebbian 直觉,在 NEMORI 里被反转——重复出现的内容不是被加强,而是被丢弃(因为它可预测)。同一个观察(重复),在「记忆强度」框架下意味着「更该留」,在「预测编码」框架下意味着「已经在模型里了,不必再存」。

3.3 A-MEM — Xu et al., 2025 (按约定从简,此前报告已详述)

解决了什么问题。借 Zettelkasten 卡片盒方法,让记忆条目自主生成关键词/标签、与既有条目建立链接,并在新条目加入时触发邻居的记忆演化。它放弃了预设 schema,是「结构自组织」的代表作。

遗留了什么问题。A-MEM 优化的是已存内容之间的组织,对「该不该存」保持沉默——Table 1 中它的 Distillation 列是空的。结果是链接结构建在未经筛选的语料上:噪声条目同样生成标签、同样参与链接,把冗余从存储层传导到了图结构层

核心工作如何回应。表 I 给出了最直接的回答:把 NEMORI 的蒸馏输出(K)而非原始 episode(P)喂给 A-MEM,MemTokens 从 397K→142K(↓64.3%),Core Score 从 52.6→55.8(↑6.1%)。A-MEM 的组织能力没有变,只是被组织的东西干净了。

关键设计的传递。A-MEM 的「新条目触发旧条目更新」在 NEMORI 中演化为 SupersedeM_ν 直接取代 U_k,且 P_k ‖ P_j 保留原始溯源。差别在于 A-MEM 是追加式演化(旧条目被改写但仍存在),NEMORI 是替换式演化(旧条目被顶掉)——后者更省,也更不可逆。

3.4 MemoryOS — Kang et al., EMNLP 2025 Main (Oral)

解决了什么问题。把操作系统的分页思想搬到记忆:短期 / 中期 / 长期三级存储,用 heat score 决定条目在层级间迁移,配合两步检索。它是「启发式路线的工程化极致」,论文自报在 LoCoMo 上相对基线取得 F1 +48.36%、BLEU-1 +46.18%(gpt-4o-mini)。

遗留了什么问题。heat score 仍是外生的:迁移阈值、衰减系数、层容量都要人工设定。更关键的是它管的是「放在哪一层」,而不是「要不要存」——所有内容都先进短期层。分层只是把 bloat 的成本从检索延迟转移到了存储层级管理上。

一条跨论文的定量对照(本报告的观察)。 在 NEMORI 的统一评测框架下(表 C,gpt-4o-mini),MemoryOS 的 LoCoMo 平均 LLM-judge 为 54.5、F1 39.9——低于同表中的 Mem0(61.3 / 41.5)。这与 MemoryOS 自报的 “+48.36% F1” 形成鲜明反差。两组数字并不必然矛盾(分母基线、prompt、judge 设置均不同),但共同说明:记忆系统的自报增益高度依赖评测 harness,第三方统一复现是必要的。 同样的现象出现在 Zep 身上:自报 LongMemEval “+18.5%、latency −90%”,在表 C 中 LoCoMo 平均只有 58.5(gpt-4o-mini),同样低于 Mem0。这条观察本身就是本领域一个未被充分正视的方法论问题。

关键设计的传递。MemoryOS 的分层在 NEMORI 里被压扁成两个正交存储(D_e episodic / D_s semantic),迁移规则从「热度阈值」换成「预测误差是否非空」。层级从时间维度的分级变成了表征类型的分工——与 McClelland 等人的 Complementary Learning Systems 理论对齐(论文明确引用)。

3.5 Zep / Graphiti — Rasmussen et al., 2025

解决了什么问题。时间知识图谱处理「记忆会过期」:每条边带有效区间,新事实到来时把旧边标记为 invalid 而非删除,支持时点查询与冲突消解。

遗留了什么问题。有效性管理要求信息先被结构化为三元组,这一步本身就是一次有损蒸馏,且判据(抽什么实体、什么关系)依然是人工 schema。此外图谱抽取昂贵,而 Zep 在统一评测里 LoCoMo 平均仅 58.5 / 61.6,Temporal Reasoning 上 60.2(gpt-4.1-mini)反而低于 NEMORI 的 77.3——一个专门为时间语义设计的系统,在时间推理题上落后 17.1 pp。

核心工作如何回应。NEMORI 用 conflict 处理同样的问题,但代价小得多:不需要维护图结构,只需在语义条目层面判断「新证据是否证伪旧条目」。代价是失去时点查询能力——NEMORI 无法回答「三个月前用户的偏好是什么」,因为旧条目被 purge 了。表 J 中 Knowledge Update 的 −21.4% 可能正是这种「廉价冲突消解」的账单。

关键设计的传递。Zep 的「invalidate 而非 delete」这一保守策略,在 NEMORI 中被简化为 “purge and replace”。这是本链上唯一一次「退化」而非「进化」——NEMORI 在这个维度上更弱,值得后续工作把时间有效性重新接回预测误差框架(见 §5 ⑤)。

4 · 技术演进脉络

核心问题:什么值得被记住?(判据从哪来) │ ┌───────────────────────────────┴────────────────────────────────┐ │ │ [外生先验 · 人工编码] [结构自组织 · 放弃 schema] │ │ 2023 Generative Agents ── importance × recency × relevance 2025 A-MEM ── Zettelkasten 链接 │ [绝对重要性评分 · reflection tree] │ [标签自生成 · 邻居演化] │ │ ✗ Distillation 列为空 2023 MemGPT ── 虚拟内存分页 │ │ [tiered storage · function call] │ │ │ 2024 MemoryBank ── Ebbinghaus 遗忘曲线 │ │ [时间先验 · 召回增强] │ │ │ 2025 MemoryOS ── heat score 三级分页 ← 启发式工程化极致 ──────────────┤ │ [EMNLP 2025 Oral · 自报 F1 +48.4%] │ │ │ 2025 Zep/Graphiti ── 时间有效性图谱 │ │ [validity interval · invalidate 而非 delete] │ │ │ └──────────────┬──────────────────────────────────────────────────┘ │ 共同遗留:判据全部外生。旋钮(阈值/系数/schema)必须人工设定, 且与下游效用之间没有监督信号。 │ ├──────────────────────┬──────────────────────────┐ ▼ ▼ ▼ [外生奖励内生化] [内生信号替代先验] [评测与治理补位] 2025–26 Memory-R1 / MemAct 2026 NEMORI (ACL Long) 2026 遗忘向评测 / AgeMem 统一策略 ═══════════════ 记忆投毒攻击 / 用 RL reward 学记忆操作 预测误差 = 蒸馏判据 安全与治理综述 ✗ 需要任务奖励信号 ✓ 零额外监督 ✗ 训练成本高 ✓ 成本 ↓80.9% (vs Mem0) ╲ ╱ ╲ ╱ ✗ 二者从未 head-to-head 对比(§2.8 批判 ⑥) —— 这是当前最明确的空白 ——

演进的内在逻辑:判据的来源在不断内移

阶段判据来源代表需要人工设定什么
Ⅰ. 直觉编码设计者的语义直觉Generative Agentsimportance 提示词与阈值
Ⅱ. 认知先验借用人类记忆的经验规律MemoryBank遗忘曲线半衰期
Ⅲ. 结构先验让条目之间自己组织A-MEM链接策略(不再需要 schema)
Ⅳ. 工程先验把多种直觉揉成一个热度函数MemoryOS / Zep热度系数、层容量、图谱 schema
Ⅴ. 外生奖励从下游任务反传Memory-R1 / MemAct / AgeMem奖励函数设计、RL 训练预算
Ⅵ. 内生信号系统自身的预测失败NEMORI一个相似度阈值 τ(且未做敏感性分析)

两个关键转折点:Ⅳ→Ⅴ 是「把判据交给优化」——既然人工设不好,就用奖励学,代价是需要任务奖励与训练;Ⅳ→Ⅵ 是「把判据交给系统状态」——既然人工设不好,就让系统自己度量惊讶,代价是判据的质量完全取决于预期图式的质量

本报告对该演进最重要的判断:NEMORI 声称消除了 designer intuition,但实际上是把它从语义层面的先验(什么重要)压缩成了几何层面的先验(多相似算「已知」)。这是一次真实的降维——几何先验更少、更可迁移、更容易自动调——但不是消除。而论文恰恰没有对这个残余先验(τ)做任何实验。

5 · 开放挑战与研究机会

5.1 理论层面

① 冷启动—饱和动力学的形式刻画(高价值、低门槛)。预测误差蒸馏的输出量 |K_in| 是系统已有知识量 |D_s| 的函数:|D_s| = 0 时退化为全量蒸馏,|D_s| → ∞ 时趋近于零。这条曲线的形状决定了记忆库的稳态大小,而论文完全没有测量它。具体可操作的实验:在 LoCoMo 的 10 段对话上,按会话序号绘制 |K_in||D_s| 的联合轨迹,看是否存在饱和点、饱和点是否依赖 τ。只需 log 现有 pipeline,不需要新训练。

τ 与预测误差质量的 trade-off 定量化。τ 高 ⇒ 唤起少 ⇒ 预期弱 ⇒ 假阳性「意外」多(存了冗余);τ 低 ⇒ 唤起多 ⇒ 预期强 ⇒ 假阴性(漏存新信息)。这是标准的精确率—召回率权衡,但没有人给出它的经验曲线。建议扫 τ ∈ [0.5, 0.9],同时记录(a)语义库规模、(b)LoCoMo 各类目分数、(c)conflict 触发次数。第三项尤其关键——§2.8 批判 ③ 的假设可由此直接证实或证伪。

③ 内生信号与外生奖励的可达上界比较。预测误差是无监督判据,RL reward 是有监督判据;理论上后者上界不低于前者(可以学出任何判据,包括预测误差本身)。问题因此变成:在多大的训练预算下,RL 学到的记忆策略才能超过零训练的预测误差判据?这是一个可以画出交叉点的实验,也是判决 §4 图中两条分支的唯一方式。

5.2 工程与应用层

④ 补齐 agent 场景的评测(最紧迫)。NEMORI 标题是 “for LLM Agents”,但两个基准都是对话 QA。具体下一步:在 ALFWorld / WebArena / τ-bench 上把 episode 定义为「一次工具调用序列」,把预测误差定义为「预期的工具返回 vs 实际返回之差」。这个迁移几乎是字面的——预测编码框架天然适配「我以为会发生什么 vs 实际发生了什么」,而这正是 agent 轨迹的结构。若成立,它比对话场景更有说服力。

⑤ 把 Zep 的时间有效性接回预测误差框架。NEMORI 的 conflict 用 purge 换效率,代价是丢失时点查询。具体设计:把 conflict 从「清除并替换」改为「标记 invalid_at 并追加」,只在检索时按查询时间过滤。存储成本上升有限(旧条目已蒸馏过,很短),但恢复了时间维度。可直接在 LongMemEval-S 的 Knowledge Update 与 Temporal Reasoning 两类上验证是否能修复那 −21.4%。

⑥ 在线/动态设置下的记忆稳定性。现有评测都是「先离线构建记忆库,再统一提问」,真实 agent 是边用边写。预测误差判据在在线设置下有一个未被讨论的风险:早期的错误蒸馏会污染预期图式,进而系统性地扭曲后续的预测误差(一个正反馈回路)。这与 ACL 2026 How Memory Management Impacts LLM Agents(acl-long.27)报告的 error propagation 现象高度同构——用那篇论文的「未来任务结果作为记忆质量信号」的方法给 NEMORI 的语义库做后验清洗,是一个现成的组合。

5.3 新兴方向

⑦ 可逆蒸馏 / 有损度可控。NEMORI 的蒸馏不可逆(虽然 M_j 保留 P_j 原文,但语义层 K_in 无法还原)。能否给预测误差蒸馏加一个可调有损度旋钮,让同一套记忆库在「高保真昂贵」与「低保真廉价」之间切换?这与 rate–distortion 视角的记忆压缩工作(arXiv:2607.08032)形成天然对话:预测误差正是率失真理论中「残差编码」的对应物,NEMORI 实际上实现了一个未加显式码率约束的残差编码器。把码率约束显式化,是合并这两条线的最短路径。

⑧ 多视角预期图式。当前 Evoke 只用一次相似度检索生成单一预期。若并行生成 K 个来自不同视角的预期(事实性 / 偏好性 / 因果性),取各视角误差的交集作为高置信新信息、并集作为候选池,可能显著改善 §2.8 批判 ③ 的漏检问题。这与同期 MAGMA(acl-long.1709)的「四正交图」思想同构,但作用在蒸馏端而非检索端。

⑨ 预测误差作为记忆投毒的攻击面(安全)。一个尚未有人提出的具体风险:攻击者若能推断出系统的语义库内容,就能构造「高预测误差但无价值」的输入,强制系统写入垃圾——因为 NEMORI 的写入门控完全由「意外程度」决定,而意外程度是可被对手操纵的。这比针对启发式系统的投毒更容易(不需要伪装成「重要」,只需伪装成「意外」)。结合 arXiv:2607.06595 的记忆投毒攻击框架,这是一个可以立刻做出来的攻击实验。

⑩ 判决性实验的缺失本身是最大的机会。 不是「探索预测编码在记忆中的应用」,而是:当前没有任何一篇工作在同一 harness、同一模型、同一检索预算下,同时评测 {启发式蒸馏, 结构自组织, RL 学习策略, 预测误差} 四条路线。§3.4 中 MemoryOS 自报 +48.4% 却在第三方 harness 下低于 Mem0 的反差,说明这个缺失已在造成实质性的认知混乱。一篇高质量的四路线 head-to-head 复现论文,其价值可能高于任何一条路线上的下一个增量。

6 · 相关工作表格对标

工作发表会议 / 出版核心贡献主要指标(来源)与核心工作的关系
NEMORI2026-07
(arXiv 2025-08)
ACL 2026 Main, Long 预测误差作为记忆蒸馏判据 LoCoMo avg 73.0 / 80.8(Table 2);构建 322.9k tokens(Table 3) 核心工作
Generative Agents2023-04UIST 2023memory stream + importance×recency×relevance + reflection无公开 benchmark 分数问题起源:绝对重要性 → 相对意外度
MemoryBank2023-05AAAI 2024Ebbinghaus 遗忘曲线驱动的记忆衰减自报场景评测,未进入 NEMORI 基线时间先验:遗忘从后处理 → 前置为写入门控
A-MEM2025-02未见主会出版(arXiv v9)Zettelkasten 自组织链接 + 邻居演化LoCoMo avg 52.5 / 61.4(NEMORI Table 2)正交层:Table 7 证明前置蒸馏可让其 MemTokens ↓64.3%、Core ↑6.1%
MemoryOS2025-06EMNLP 2025 Main, Oralheat score 三级分页存储自报 LoCoMo F1 +48.36%;第三方 harness 下 avg 54.5 / 60.6启发式极致:分层管理 → 压扁为两个正交存储
Zep / Graphiti2025-01无会议出版记录时间知识图谱 + 有效性区间自报 DMR 94.8%、LongMemEval +18.5%;第三方 harness 下 LoCoMo avg 58.5 / 61.6时间维度:invalidate → purge(唯一一次退化)
LoCoMo2024-02ACL 2024 Long超长对话记忆评测基准10 对话 / 1,540 题 / 24K tokens评测底座:样本量小是表 D 中 0.1–1.2 pp 差异不可区分的根源
LongMemEval2024-10ICLR 2025六类型长期交互记忆评测500 对话 / 105K tokens相变发现的舞台:Preference 类 +597% 出自此

这张表读出的三条趋势

  1. 性能趋势已经饱和,成本趋势没有。从 Generative Agents 到 NEMORI,LoCoMo 平均分从无到 73–81,但 NEMORI 与 Full Context 的差距只有 0.2–0.7 pp(表 D)。下一个数量级的进步不会来自 LoCoMo 上的分数。
  2. 自报增益与第三方复现之间存在系统性缺口。MemoryOS(+48.4% → 第三方低于 Mem0)与 Zep(+18.5% → 第三方低于 Mem0)是两个独立例证。
  3. 出版层级在上移。2023–2025 的代表作多为 arXiv 或 workshop(A-MEM 至今无主会记录,Zep 无出版记录),2025–2026 已稳定进入 EMNLP/ACL 主会长文与 Oral。这个领域的评审标准正在收紧。

7 · 其他值得关注的近期工作

How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior(2026-07,ACL 2026 Main Long)

EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning(2026-07,ACL 2026 Main Long)

MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents(2026-07,ACL 2026 Main Long)

Dynamic Long Context Reasoning over Compressed Memory via End-to-End RL (LycheeMemory)(2026-07,ACL 2026 Main Long)

FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning(2026-07,ACL 2026 Main Long)

Scaling Self-Evolving Agents via Parametric Memory (TMEM)(2026-06,arXiv)

When Agents Remember Too Much: Memory Poisoning Attacks on LLM Agents(2026-07,arXiv)

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents(2026-04,arXiv)

8 · 一句话总结

NEMORI 最重要的贡献不是它在 LoCoMo 上的分数(相对 Full Context 只有 +0.25%),而是它证明了记忆系统 80% 的成本花在了系统本来就知道的事情上——以及在 LongMemEval 的偏好类问题上,把 101K tokens 砍到 4K 能让分数从 6.7 涨到 46.7 这一相变式证据:长上下文的敌人不是长度,是稀释。