Agent Memory 每日文献追踪 · 2026-08-07

OCR-Memory:把 Agent 的记忆渲染成图片

Optical Context Retrieval for Long-Horizon Agent Memory — 当文本空间内的压缩–保真取舍走到尽头,答案是换一个表示空间

ACL 2026 Main · Long arXiv 2604.26622 HKU / UNT / Tsukuba / Yonsei 记忆压缩 · 多模态表示 无公开代码

一句话定位:OCR-Memory 真正压缩的不是记忆本身,而是「找到记忆的那张地图」——原文仍以逐字形式完整躺在磁盘上(每 episode 1.47 MB),被压到 10× 的只是 agent 用来定位它的视觉索引。这个区分同时解释了它最漂亮的结果(无幻觉、逐字保真)和最尴尬的代价(磁盘占用是文本 RAG 的 81.7×)。

当日检索说明

本期覆盖 ACL Anthology 2026 主会/Findings、EACL 2026、OpenReview(ICLR 2026 + MemAgents Workshop)、arXiv cs.CL/cs.AI,共筛出 20+ 篇候选。ACL 2026 主会长文候选包括 2026.acl-long.27(Experience-Following 实证)、2026.acl-long.474(OCR-Memory)、2026.acl-long.1600(GAM)、2026.acl-long.1607(Adaptive Memory Distillation)、2026.acl-long.1709(MAGMA);EACL 2026 有 H-MEM、Amory;Findings 有 RecMem。

最终选定 OCR-Memory,理由有三:(1) ACL 2026 主会长文,2026-04 上 arXiv,时效性满足;(2) 它开辟的是记忆表示的模态维度,与首期报告覆盖的 MemGPT / A-MEM / Mem0 / Memory-R1 / MemAct / AgeMem 全部为纯文本路线正交;(3) 它把 2025Q4 兴起的 contexts optical compression 技术线第一次完整搬进 agent memory 场景,技术传递脉络清晰。

坦诚性声明。 tabzhangjx.github.io/year-archive/ 在本次运行中三次返回抓取权限错误,无法在线核对历史选题;本期改用任务提示中显式列出的已覆盖名单作为去重依据。另:OCR-Memory 未公开代码仓库,论文正文与附录均无 GitHub 链接,因此下文所有工程细节均只能依据论文文本,无法交叉核实实现。

链接清单(Link Manifest)

核心工作

项目链接状态
ACL Anthology2026.acl-long.474✅ 已验证
ACL PDF2026.acl-long.474.pdf✅ 已验证
arXivarXiv:2604.26622✅ 已验证
arXiv HTML (v1)html/2604.26622v1✅ 全文可读
DOI10.18653/v1/2026.acl-long.474✅ Anthology 给出
代码仓库未找到(论文未提供)

书目:Jinze Li, Yang Zhang, Xin Yang, Jiayi Qu, Jinfeng Xu, Shuo Yang, Junhua Ding, Edith Cheuk-Han Ngai. OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory. ACL 2026 (Volume 1: Long Papers), San Diego, California, July 2026. 单位:香港大学 / 北德克萨斯大学 / 筑波大学 / 延世大学。

回溯的相关工作

工作会议 / 出版arXiv代码
MemoryBankAAAI 20242305.10250GitHub
AWM未找到正式会议页2409.07429GitHub
ACONICML 20262510.00615 (v1 2025-10-01 / v3 2026-06-01)GitHub
DeepSeek-OCR技术报告 2025-10-212510.18234GitHub
Set-of-MarkarXiv 2023-10-172310.11441GitHub
GlypharXiv 2025-10-202510.17800GitHub

评测基准 / 数据集

Benchmark链接用途
Mind2Web (Cross-Task)GitHub · 主页网页导航主实验
AppWorldACL 2024 · arXiv · GitHubAPI 交互主实验
HotpotQAhotpotqa.github.io检索模块微调
NIAH未找到(论文未给出具体实现链接)压缩率–精度扩展性

1. 核心工作深度解析

1.1 摘要与核心定位

论文自述:OCR-Memory「利用视觉模态作为 agent 经验的高密度表示,使得在最小 prompt 开销下保留任意长的历史成为可能」;它把交互历史渲染成带唯一视觉标识的图像,用 locate-and-transcribe(先定位、后逐字转录)范式检索——通过视觉锚点选出相关区域,再取回对应的逐字原文,从而绕开生成式检索的错误。

一句话定位(本报告的读法,与论文自述有意拉开距离):OCR-Memory 真正压缩的不是记忆本身,而是「找到记忆的那张地图」。视觉模态只承担定位职责,内容职责仍由磁盘上的逐字文本承担——这既是它无幻觉的原因,也是它磁盘放大 81.7× 的原因。

1.2 Motivation 与问题论证

论文把痛点论证成一条三选一困境:长程 agent 的完整轨迹既有价值又存不下,而现有三条出路各自破产。

出路代表工作论文的批评(原文)破产在哪
检索片段RAG, MemGPT, MemoryBank, Self-RAG, Memory-R1“Retrieved snippets may be topically related yet logically irrelevant, especially when tasks hinge on causality or long-range dependencies”语义相似 ≠ 逻辑相关
经验抽象AWM, skill / workflow abstraction“Abstraction can discard crucial low-level details (e.g., exact error messages, intermediate states)”抽象即丢失
上下文压缩ACON, LLMLingua 系, attention sink“Text-centric compression inevitably trades off compression ratio against information fidelity压缩率与保真度此消彼长

量化论证:Mind2Web 上每步推理上下文从 3,980 → 596 tokens(6.7×)(Table 7);NIAH 上跨 4k–32k 稳定 10.2×–10.7× 压缩率、精度 98.5 → 94.1(Table 4)。

新颖之处:前三条路线都在文本空间内做取舍,因而必然落在同一条 rate–distortion 曲线上。OCR-Memory 的论断是:换一个表示空间(像素),就换了一条曲线——这是模态层面的跳变,而非曲线上的移动。

为什么值得解决:Mind2Web 上所有方法的 Task SR 都在 2.2%–4.8% 区间(Table 1),长程 web agent 的端到端成功率仍近乎在地板上;上下文预算是这个地板的直接约束之一(论文把 context window 硬性设为 4096 tokens)。

1.3 论文的故事线(论证结构)

论文的论证不是「我们提出 X」,而是一条四步逼近

第一步:把问题从「存什么」改写成「用什么表示存」。既然文本空间内的压缩–保真是零和的,那就问:有没有一种表示,其信息密度天然高于 token 序列?答案指向 DeepSeek-OCR 的经验事实——一页文档用 100 个 visual token 可以打败用 256 token 的 GOT-OCR2.0。

第二步(关键转折):承认视觉表示会引入新的失败模式,然后把它绕过去。这是全文最聪明的一步。若让 VLM 从渲染图中解码文本,就把 OCR 误差直接引入 agent 的推理链——而 DeepSeek-OCR 自己的曲线显示,压缩率 <10× 时精度 97%,到 20× 就掉到约 60%。作者的推断是:既然解码不可靠,就别解码。于是 VLM 的输出被限制为段落索引(0/1 标签),文本从磁盘逐字取回。

论证逻辑:作者观察到「optical decoding 存在保真度悬崖」这一现象,由此推断「视觉模态应当只承担定位职责,不承担内容重建职责」。

第三步:把「索引」变成可训练的视觉任务。借 Set-of-Mark:渲染图上画红框 + 打编号,VLM 只需回答「哪几个编号相关」。这把开放式生成变成有界的多标签分类,既可微调(加权 BCE)又可校准(softmax over logits "1"/"0")。

第四步:引入时间维度,让老记忆自动降级。最近 5 步高分辨率,其余低分辨率;一旦某段低分辨率记忆被检索命中,就「主动回忆」升采样回高保真。这是把遗忘曲线做成了分辨率曲线

关键假设(论文未验证,见 §1.7-⑥):「相关性判断所需的信息量」远小于「内容重建所需的信息量」,因此低分辨率足以支撑定位。这个假设是整个 age-aware 设计的地基,但论文没有直接测量它。

1.4 方法论与机制解剖

1.4.1 形式化定义

记忆库结构(Eq. 5)——注意:文本并未被丢弃。

𝓜 = { m_i }_{i=1..N}, m_i = ( I_i , { s_{i,k} }_{k=1..K_i} , π_i ) I_i : 轨迹分块渲染出的带标记图像 s_{i,k} : 逐字保存的文本片段 π_i : 元数据(时间戳、episode id)

两阶段检索(Eq. 6)

Ŝ(q) = g_θ(q, 𝓜) ← 视觉模型只输出「索引集合」 E = Fetch(Ŝ(q), 𝓜) ← 确定性地从磁盘取回原文,零生成

Set-of-Mark 二值相关性(Eq. 7–8)与概率校准(Eq. 11)

ŷ_i(q) = (ŷ_{i,1}, ..., ŷ_{i,K_i}) ∈ {0,1}^{K_i} Ŝ(q) = { (i,k) | ŷ_{i,k} = 1 } p_{i,k}(q) = exp(z_{i,k}(1)) / [ exp(z_{i,k}(1)) + exp(z_{i,k}(0)) ]

推理期阈值 + Top-K 兜底(Eq. 12)

Ŝ_i(q) = { (i,k) | p_{i,k}(q) ≥ τ } ∪ TopK({p_{i,k}(q)}_{k=1..K_i}, K)

年龄感知多分辨率(Eq. 13)与主动回忆(Eq. 14–15)

ℓ_i = ρ(Δt_i) ← 单调老化函数 I_i = φ_{ℓ_i}( I_i^hi ) ← 按层级降采样 若 ∃(i,k) ∈ Ŝ(q) 使 ℓ_i > ℓ_min,则 I_i ← I_i^hi ← 命中即恢复原始保真

训练目标(Eq. 20)——加权 BCE,刻意偏向召回。

ℒ_BCE(θ) = -Σ_n Σ_k [ w₊ · y_k log p_k + w₋ · (1-y_k) log(1-p_k) ] w₊ = 2.0, w₋ = 1.0

1.4.2 关键机制对照表

机制输入输出解决的失败模式代价
视觉存储轨迹文本块带标记渲染图上下文窗口溢出磁盘 ×81.7
Set-of-Mark 索引图 + query段落索引 0/1生成式检索的幻觉需微调 3B VLM
Locate-and-Transcribe索引集合逐字原文OCR 解码误差必须保留全量文本副本
Age-aware 降采样时间差 Δt分辨率层级 ℓtoken 预算随时间线性增长Step SR −0.4pp(Table 3)
Active-recall 升采样命中记录恢复 hi-res老记忆定位精度衰减无法完全补回高分辨率的差距

1.4.3 超参与工程细节(全部来自附录 A)

类别参数取值
检索阈值 τ0.4
检索Top-K 兜底(每图)5
检索单 query 最大返回段数20
分辨率高分辨率1024² → 256 vis-tok
分辨率低分辨率512² → 64 vis-tok
分辨率部署策略最近 5 步 hi-res
训练BackboneDeepSeek-OCR 3B(vision encoder 冻结)
训练LoRAr=16, α=32, dropout=0.05
训练优化器AdamW, β=(0.9, 0.95), wd=0.1
训练学习率1e-5 peak, 10% warmup
训练Batch / Epochsglobal 128 / 3 ep (HotpotQA)
训练分辨率课程 π[0.3, 0.7] over {1024², 512²}
渲染框 / 编号RGB(255,0,0) 3px / Arial 36pt 白字红底
渲染缩放插值Bicubic

1.4.4 三阶段流程

┌─ 写入 (Write) ─────────────────────────────────────────────────┐ │ 轨迹片段 s_{i,1..K} │ │ │ │ │ ├──► 逐字落盘 ─────────────────────► {s_{i,k}} (1.47MB/ep) │ │ │ │ │ └──► 渲染 + 画红框 + 编号 ─────────► I_i^hi (1024², 256tok)│ │ │ │ │ └── ρ(Δt) 老化 ──────► I_i^lo (512², 64tok)│ └─────────────────────────────────────────────────────────────────┘ │ ┌─ 检索 (Locate) ─────────▼───────────────────────────────────────┐ │ query q + {I_i} ──► DeepSeek-OCR(3B, LoRA) ──► p_{i,k} │ │ (只输出 "0"/"1" logits,绝不生成正文) │ │ │ τ=0.4 ∪ TopK(5),单 query 上限 20 │ │ ▼ │ │ Ŝ(q) = {(i,k)} │ └─────────────────────────────────────────────────────────────────┘ │ ┌─ 转录 (Transcribe) ─────▼───────────────────────────────────────┐ │ Fetch(Ŝ(q)) ──► 逐字原文 E ──► 拼进 agent prompt (596 tok) │ │ 同时: 命中的 lo-res 记忆 ──► 升采样回 hi-res (active recall) │ └─────────────────────────────────────────────────────────────────┘

1.5 实验设计与定量结果

1.5.1 实验设置

项目设置
推理主干GPT-4, temperature = 0
泛化主干Qwen3-32B
检索模块DeepSeek-OCR (3B),LoRA 微调
上下文预算严格 4096 tokens(默认)
主基准Mind2Web (Cross-Task split)、AppWorld (Easy / Med / Hard)
辅助基准NIAH(扩展性)、HotpotQA(检索训练)
随机种子⚠️ 论文未报告多种子或误差棒

图 1 · 主结果对比(数据来源:论文 Table 1)

六种方法在 Mind2Web Element Accuracy 与 AppWorld 平均成功率上的表现。悬浮查看具体数值与相对提升。

Mind2Web · Element Accuracy (%) AppWorld · Avg Success Rate (%)
0 20 40 60 80 100 53.8 58.1 Zero-Shot Retrieval MemoryBank AWM ACON OCR-Memory 数值单位:% | 纵轴为单一刻度 0–100,两个系列共用

1.5.2 主结果矩阵(Table 1)+ 相对提升

绝对值来自论文 Table 1;「Δ vs 次优」与「相对提升 %」为本报告基于该表计算的派生量。

方法 M2W
Ele Acc
M2W
F1
M2W
Step SR
M2W
Task SR
AW
Easy
AW
Med
AW
Hard
AW
Avg
Zero-Shot40.146.237.92.268.736.220.941.9
Retrieval (dense RAG)41.348.238.92.772.544.821.446.2
MemoryBank43.849.539.23.381.350.124.952.1
AWM49.155.742.64.384.153.627.255.0
ACON48.254.141.44.184.855.128.756.2
OCR-Memory53.859.246.14.886.257.430.858.1
Δ vs 次优 (pp)+4.7+3.5+3.5+0.5+1.4+2.3+2.1+1.9
相对提升 vs 次优+9.6%+6.3%+8.2%+11.6%+1.7%+4.2%+7.3%+3.4%
相对提升 vs Zero-Shot+34.2%+28.1%+21.6%+118.2%+25.5%+58.6%+47.4%+38.7%

斜体 = 该列次优;高亮行 = 最优方法。

结构性发现 ①:AppWorld 上的相对增益随难度单调上升。 Easy +1.7% → Med +4.2% → Hard +7.3%。这与论文「长程、紧预算下优势更明显」的主张一致——难任务 = 更长轨迹 = 更大的上下文压力。这是全表中最支持核心论断的一条趋势线。
结构性发现 ②:Mind2Web 的绝对 Task SR 全体在地板上(2.2–4.8)。 所有方法的端到端成功率都不到 5%,这直接影响该指标的可解释性——见 §1.7 补充批判 ①。

1.5.3 消融研究

(a) Set-of-Mark 机制消融(Table 2)

这同时是对「若改用端到端 OCR 解码会怎样」这一反事实的直接回答。

配置Ele Acc (%)Step SR (%)延迟 (s)Δ Ele Acc延迟倍数
OCR-Memory (Full)53.846.11.71.0×
w/o SoM(改为文本生成检索)46.539.25.3−7.3pp3.1×
w/o SoM(仅 BBox,无编号)49.244.52.1−4.6pp1.2×

读法:去掉 SoM 改成生成式检索,Ele Acc 掉 7.3pp 且延迟涨 3.1×——准确率和效率同时崩,这是 §1.3 第二步论证的实验兑现。而「只画框不编号」仍掉 4.6pp,说明离散编号本身(而非视觉分割)承担了大部分收益:模型需要的是一个可以指认的离散符号锚点,不是一个空间区域。

(b) 多分辨率策略(Table 3)

策略Step SR (%)Task SR (%)平均 tokenstokens 相对 hi-res
Static Low-Res (512²)39.72.9650.25×
Static High-Res (1024²)46.54.92561.00×
Dynamic(本文)46.14.8820.32×

读法:Dynamic 用 32% 的 token 换到了 99.1% 的 Step SR(46.1 / 46.5)。但注意——Table 1 的头条数字 46.1 用的是 Dynamic,而论文自己的最优配置其实是 Static High-Res 的 46.5。作者在主表里报告略低但更省的配置,方法论上是诚实的;不过这也意味着 active-recall 升采样并未完全补回降采样的损失(残差 0.4pp),见 §1.7-④。

分层消融的缺口。 论文没有提供 base / +SoM / +多分辨率 / +active-recall 的逐级累加消融表。Table 2 与 Table 3 是两条独立的单因素消融,无法读出两个模块的交互效应

图 2 · NIAH 扩展性:压缩率恒定,精度对数线性衰减(数据来源:论文 Table 4)

上下文从 4k 增长到 32k(8×)时,压缩率几乎不动(10.2–10.7×),精度累计下降 4.4pp。悬浮查看压缩率。

NIAH 检索精度 (%) 每档的压缩率(见 tooltip / 标注)
94 95 96 97 98 99 98.5 97.2 95.8 94.1 10.3× 10.2× 10.7× 10.6× 4k 8k 16k 32k 上下文长度 | 纵轴为单一刻度(精度 %),压缩率以文字标注而非第二根轴

1.5.4 扩展性与压缩率(Table 4)

上下文长度压缩率NIAH 精度Δ 精度 vs 4k
4k10.3×98.5
8k10.2×97.2−1.3pp
16k10.7×95.8−2.7pp
32k10.6×94.1−4.4pp

关键观察:压缩率几乎恒定(10.2–10.7×,波动 <5%)。这说明压缩率是渲染器的常数属性,不随上下文长度自适应——与摘要中 “retention of arbitrarily long histories” 的措辞存在张力(§1.7-②)。精度衰减近似 log-linear:每翻倍约 −1.5pp。

1.5.5 主干泛化(Table 5)

方法BackboneEle AccStep SRTask SR
Text Retrieval (RAG)GPT-441.338.92.7
OCR-MemoryGPT-453.846.14.8
Text Retrieval (RAG)Qwen3-32B35.231.51.8
OCR-MemoryQwen3-32B48.642.33.9
Δ(OCR − RAG) on GPT-4+12.5pp+7.2pp+2.1pp
Δ(OCR − RAG) on Qwen3-32B+13.4pp+10.8pp+2.1pp

增益在两个主干上稳定甚至略增(Qwen3-32B 上 Ele Acc 增益 +13.4pp > GPT-4 的 +12.5pp)。合理解释:检索模块是同一个冻结的 3B VLM,主干越弱,被喂进去的证据质量的边际价值越高。

1.5.6 检索层评测(Table 6)

方法Recall@1Recall@5Recall@10MRR
Dense Text-RAG52.774.382.10.61
OCR-Memory78.693.496.20.84
相对提升+49.1%+25.7%+17.2%+37.7%

Recall@1 相对提升 +49.1% 是全文单项最大增幅——但这也是最需要打折的一个数字,见 §1.7-③(对比不对等)。

1.5.7 系统开销画像(Table 7)

方法磁盘 / episode文本 tokens / step检索延迟 / step
Text-RAG18 KB3,9800.3 s
OCR-Memory1.47 MB5961.7 s
倍数81.7× 更差6.7× 更好5.7× 更差
这张表是全文最诚实、也最容易被读者跳过的一张。 OCR-Memory 的交易本质是:用 82 倍磁盘 + 5.7 倍延迟,换 6.7 倍 prompt token。在 token 成本主导的场景(长上下文计费)这笔账划算;在延迟敏感的实时 agent 场景则未必。

1.5.8 🔺 相变现象高亮:token 预算收紧时的分叉

全文最有说服力的定性证据。 论文 Figure 2 显示,在 1024–8192 tokens 的预算扫描中,OCR-Memory 与 text-RAG 的性能差距随预算收紧而单调扩大;在 1024-token 极限预算下,“OCR-Memory remains functional while text-RAG degrades substantially”。

这是一个典型的相变式分叉:两条曲线在宽预算区间可能收敛(论文未提供 8192 以上的数据),但在窄预算区间发生质变——因为 text-RAG 的最小可用单元是「一段完整文本」,而 OCR-Memory 的最小可用单元是「64 个 visual token 的一张缩略图」。当预算低于前者的粒度下限时,text-RAG 不是变差,而是失效

坦诚提示:Figure 2 的具体数值在论文正文中未以表格形式给出,因此本报告无法引用该图上的确切数字,只能转述其定性趋势。这是本次分析的一处不完备。

1.6 价值分析

它真正的贡献不是「用图片存记忆」,而是三个可迁移的设计原则:

① 表示与职责的解耦——「视觉负责定位,文本负责内容」。
为什么关键:它把一个模态的优势(高信息密度、空间可寻址)和劣势(解码有损)拆开,只用优势那一半。这个原则可脱离本文复用到任何「高密度但有损」的表示上——latent memory、KV-cache 压缩、向量量化索引。凡是「压缩后无法可靠重建」的表示,都可以退化为索引而非存储

② 把开放式生成降级为有界分类——SoM 作为检索接口。
为什么关键:生成式检索不可验证、不可校准、延迟高(Table 2: 5.3s)。SoM 把它变成 K 个二值 logits,于是可微调、可校准(Eq. 11)、可加阈值(Eq. 12)、可加类别权重(Eq. 20)——四个工程手柄一次性到位。

③ 遗忘 = 分辨率退化,而非删除。
为什么关键:MemoryBank 式的遗忘不可逆;OCR-Memory 的遗忘有损但可逆——降采样后仍可通过 active recall 升回高保真。这在概念上更接近人类记忆的「提取失败 vs 存储失败」之分。这个框架让我们可以把同样的思路迁移到其他层:KV cache 的分级精度、embedding 的分级维度、summary 的分级粒度。

对后续工作的启发:如果「定位所需信息量 ≪ 重建所需信息量」这个假设成立(论文未直接验证),那么所有记忆系统的索引层都可以被激进压缩,而内容层保持无损。这是一条与「端到端压缩」完全不同的架构路线。

1.7 局限性

(A) 论文自述的限制(原文引用)

  1. 训练开销:“unlike training-free retrieval baselines, our framework requires fine-tuning a specialized optical retrieval model, which incurs additional training resource overhead.”
  2. 渲染与存储开销:“the process of rendering interaction logs into images is computationally more expensive than direct text storage, and storing visual histories inevitably consumes more disk space than raw text logs.”
  3. 部署内存足迹:“deploying the system imposes an extra memory footprint, as the parameters of the vision encoder must be maintained in memory alongside the primary language model.”

(B) 补充批判(本报告的独立观察,8 点)

①【指标有效性】Mind2Web Task SR 的 +0.5pp 很可能落在噪声内。
OCR-Memory 4.8 vs AWM 4.3,绝对差 0.5pp。Mind2Web Cross-Task 测试集在数百任务量级,0.5pp 对应的是个位数任务的差异。论文未报告随机种子、未给误差棒、未做显著性检验。相比之下 Ele Acc 的 +4.7pp 才有说服力。结论:摘要中并列的四个 Mind2Web 指标说服力并不等价,Task SR 一项应当降权。

②【论证缺口】「任意长历史」的主张与 32k 的证据上限不一致。
摘要称 “enabling retention of arbitrarily long histories”,但 Table 4 的扩展性实验止于 32k,精度已从 98.5 单调降到 94.1(−4.4pp)。按每翻倍约 −1.5pp 外推,128k 约 91%、1M 约 87%。更关键的是压缩率恒为 ~10.5× 而不随长度自适应——histories 每增长 10×,visual token 也线性增长 10×,没有任何机制阻止它最终撑爆上下文。「任意长」在证据上没有支撑;正确的表述应是「在 32k 内以近恒定的 10× 系数换取 <5pp 的精度损失」。

③【缺乏关键竞品对比】Table 6 的检索对比不对等。
OCR-Memory 的检索模块在 HotpotQA 上微调了 3 个 epoch,而对照的 Dense Text-RAG 按论文描述是未微调的现成稠密检索。在这种设置下 Recall@1 从 52.7 涨到 78.6(+49.1%)无法归因于模态——它至少混杂了「微调 vs 零样本」的效应。缺失的关键实验:在同一批 HotpotQA 数据上微调一个同量级文本检索器(E5 / ColBERTv2 / 3B text reranker)作为对照。没有这一行,「视觉索引优于文本索引」这一核心主张的验证是空白的。

④【实验设计问题】active-recall 没有补回降采样的损失,且缺少直接消融。
Table 3 中 Dynamic 46.1 vs Static High-Res 46.5,残差 −0.4pp;Task SR 4.8 vs 4.9,残差 −0.1pp。如果 active recall 完全有效(命中即恢复 hi-res),Dynamic 应当追平 High-Res。0.4pp 的持续缺口说明升采样触发得不够及时或不够全——即存在「因为已经是低分辨率所以没被检索到,因而也就没机会被升采样」的自我实现的遗忘。论文没有做 “Dynamic w/o active recall” 的消融,因此无从知道 active recall 究竟贡献了多少(可能把 39.7 抬到了 46.1,也可能只抬了 1pp)。这是全文最重要的一处消融缺失。

⑤【论证缺口】没有「长上下文 LLM 直接吞全文」的上界对照。
所有实验的 context window 被硬性设为 4096 tokens。这是 2023 年的预算,而 GPT-4 系与 Qwen3-32B 在论文写作时均支持 128k 量级上下文。缺失的对照是:给 text-RAG 32k 预算,它还输给 4k 预算的 OCR-Memory 吗? 由 Table 4 可知 OCR-Memory 在 32k 下精度已降至 94.1,而 32k 文本 RAG 的表现完全未知。在没有这条上界线的情况下,「上下文窗口有限」这个 motivation 是被实验设置人为制造出来的,而不是被证明的。

⑥【论证缺口】核心假设「定位所需信息 ≪ 重建所需信息」从未被直接测量。
可直接检验它的实验是:在同一批记忆上分别测量 (i) 低分辨率下的检索 Recall 与 (ii) 低分辨率下的 OCR 重建精度。论文只给了 Table 3 的下游任务指标(39.7 Step SR),这是被 agent 推理稀释过的间接信号。旁证支持这个假设:DeepSeek-OCR 报告 20× 压缩下 OCR 精度约 60%,而 OCR-Memory 在 512² 下 Step SR 仍有 39.7(vs zero-shot 37.9)——定位能力确实没有随重建能力一起崩塌。但这是本报告的推断,不是论文的证明。

⑦【实验设计问题】主干选择与规模覆盖过窄。
只有 GPT-4 与 Qwen3-32B 两个主干,且 GPT-4 在 2026 年的 ACL 论文中已属过时基线。没有 7B/8B 级小模型结果——而 ACON 恰恰报告「对小模型可带来最高 46% 的提升」,说明上下文管理方法在小模型上的规律不同。若 OCR-Memory 的收益在 8B 模型上消失(小 VLM 主干看不懂密集渲染图),论文的适用范围就要大打折扣,而这一点目前无从判断。

⑧【工程可复现性】未公开代码,且渲染细节高度敏感。
论文给出了字号(Arial 36pt)、框宽(3px)、颜色(纯红)、插值(bicubic)等参数,这恰恰说明渲染配置对结果是敏感的——Glyph 甚至专门用 LLM 驱动的遗传搜索优化渲染配置。在没有代码的情况下,第三方复现需要盲搜这一整套排版超参。论文自述限制中未提及此点,但它是实际影响最大的一条。

2. 相关工作回溯:一条「从丢弃到不丢弃」的问题传递链

这五篇不是平行罗列,而是同一个问题被逐层剥离的历史:先是「存不下」,再是「存下了但选不准」,再是「选不准就抽象,抽象又丢细节」,再是「那就压缩,压缩还是丢」,最后是「换个空间存索引,正文一个字都不丢」。

2.1 MemoryBank — AAAI 2024

解决了什么问题。LLM 对话系统没有跨会话的长期记忆。MemoryBank 建立「存储 → 检索 → 更新」的完整记忆循环,并引入艾宾浩斯遗忘曲线,让记忆强度随时间与复习频率演化。一句话:它第一次把「遗忘」作为一等公民写进 LLM 记忆系统的设计中。

遗留了什么问题。它的遗忘是不可逆的删除式衰减——强度掉到阈值以下就永久消失;检索仍是纯语义相似度,正是 OCR-Memory 点名批评的 “topically related yet logically irrelevant”。打开的空间:能否有一种「衰减但不销毁」的遗忘?

核心工作如何回应。OCR-Memory 把遗忘从删除改写成分辨率退化(Eq. 13),并配上 active recall 升采样(Eq. 14–15)——记忆变模糊但从不消失,命中即恢复原始保真。这是对 MemoryBank 遗忘机制的直接对抗性改写。数据上:Mind2Web Ele Acc 43.8 → 53.8(+10.0pp / +22.8%),AppWorld Avg 52.1 → 58.1(+6.0pp)。

关键设计的传递。MemoryBank 的「时间驱动的记忆强度函数」直接对应 OCR-Memory 的老化函数 ρ(Δt)——形式几乎同构,只是值域从 [0,1] 的强度标量变成了离散的分辨率层级 ℓ。

2.2 Agent Workflow Memory (AWM) — arXiv 2409.07429, 2024-09

解决了什么问题。Web agent 每次都从零开始。AWM 从历史轨迹归纳可复用 workflow 并按需注入 prompt。原文摘要数字:Mind2Web +24.6% 相对成功率、WebArena +51.1% 相对成功率,成功任务步数下降;在线 AWM 在跨任务/跨网站/跨域设置下超越基线 8.9–14.0 绝对点。一句话:记忆不必是原始经验,可以是从经验中蒸馏出的过程性知识。

遗留了什么问题。抽象是单向有损的。归纳出 workflow 后,具体报错信息、中间状态、按钮确切文案就再也取不回来。打开的空间:能否既有抽象层的可复用性,又保留原始层的可回溯性?

核心工作如何回应。OCR-Memory 的答案是综合而非对抗:承认需要一个高层索引(视觉图),但坚持索引之下必须挂着逐字原文(Eq. 5 的 {s_{i,k}})。locate-and-transcribe 就是「先在抽象层定位、再回原始层取值」的两级结构。Table 1 上 OCR-Memory 全面超过 AWM(Ele Acc 49.1→53.8,+9.6%;AW Avg 55.0→58.1,+5.6%),但差距小于对 MemoryBank 的差距——说明抽象路线本身有效,OCR-Memory 赢在「抽象不丢底」。

关键设计的传递。AWM 的 selectively providing workflows 演化成了 τ=0.4 ∪ TopK(5)、单 query 上限 20 段的有界注入策略——从「注入哪些 workflow」变成「注入哪些原文片段」。

2.3 ACON — arXiv 2510.00615 (v3 2026-06),ICML 2026

解决了什么问题。长程 agent 的 context 无界增长。ACON 用自然语言优化——分析失败案例、迭代改写压缩准则——同时压缩观测与历史,无需微调。原文摘要:峰值 token 相对已有压缩基线降低 26–54%,小模型上最高 +46%;基准为 AppWorld / OfficeBench / Multi-objective QA。一句话:压缩准则本身可以被优化,而且可以用自然语言而非梯度来优化。

遗留了什么问题。ACON 是 OCR-Memory 眼中「文本中心压缩」的最强代表,而它的宿命被一句话钉死:“Text-centric compression inevitably trades off compression ratio against information fidelity”。ACON 压出来的是改写过的文本——准则再好,被压掉的字就是没了。打开的空间:是否存在一条不在文本空间内的压缩路径?

核心工作如何回应。这是全篇最直接的「问题传递」。OCR-Memory 的回应不是「压得更好」,而是换空间:把 rate–distortion 的取舍挪到像素空间,并通过 locate-and-transcribe 让 distortion 在内容维度上归零(只在定位维度上有损)。数据上:ACON 是 Table 1 中 AppWorld 三档全部的次优方法(84.8 / 55.1 / 28.7),OCR-Memory 分别 +1.4 / +2.3 / +2.1pp;而 Mind2Web 上 ACON 反而不如 AWM(48.2 vs 49.1),提示通用文本压缩在网页 DOM 这类高度结构化的观测上吃亏

关键设计的传递。ACON 的「按失败案例迭代优化压缩策略」在 OCR-Memory 中被替换成梯度版本:加权 BCE(w₊=2.0 偏向召回)本质上也是「宁可多带一点,别漏掉关键证据」的失败驱动设计,只是从 prompt 层的自然语言优化下沉到了参数层。

2.4 DeepSeek-OCR: Contexts Optical Compression — arXiv 2510.18234, 2025-10

解决了什么问题。它提出并用实验验证了一个此前只是直觉的命题:一段文本渲染成图后,用少得多的 visual token 就能承载。原文摘要数字:压缩率 <10× 时解码精度 97%20× 时约 60%;用 100 个 visual token 打败用 256 token/页的 GOT-OCR2.0,用 <800 token 打败平均 6000+ token 的 MinerU2.0;单张 A100-40G 日产 20 万+ 页训练数据。一句话:光学压缩不是比喻,它有一条可测量的 rate–distortion 曲线。

遗留了什么问题。DeepSeek-OCR 面向文档解析,成功判据是「能不能把字读对」,因此把自己牢牢绑在重建任务上——而重建正是那条曲线最陡的部分(过 10× 就断崖到 60%)。留下的空白:如果下游任务根本不需要重建,这条曲线还成立吗?可用区间能否被任务重定义拓宽?

核心工作如何回应。OCR-Memory 的整个设计可读作对这个问题的回答:把任务从「重建」换成「定位」,曲线的可用区间就变了。而且它给出了一个此前不明显的推论——OCR-Memory 实测工作在 10.2–10.7×(Table 4),正好卡在 DeepSeek-OCR 那条 97% 曲线的边缘。这不是巧合:设计点是被编码器的保真悬崖钉住的,不是自由选的。这也解释了为什么论文不敢往 20× 推——那里 DeepSeek-OCR 只剩 60%。

关键设计的传递。最直接的一次技术迁移:OCR-Memory 的 backbone 就是 DeepSeek-OCR (3B),vision encoder 完全冻结,只对 language decoder 做 LoRA(r=16)。OCR-Memory 继承的是 DeepSeek-OCR 的「看」,替换的是它的「说」——原本说文本,现在说 0/1 索引。

2.5 Set-of-Mark Prompting — arXiv 2310.11441, 2023-10

解决了什么问题。GPT-4V 能看懂图,却说不准「图里第几个东西」。SoM 的方案朴素得近乎粗暴:在图上直接画出分割区域并标上数字,让模型引用编号而不是描述位置。一句话:给视觉输入加上离散、可指认的符号锚点,视觉 grounding 就从生成问题变成了选择问题。

遗留了什么问题。SoM 的原始场景是单张图像的空间理解。它没有回答:当「图」不是真实场景而是被渲染的文本、当标记数量从十几个涨到成百上千个、当查询是语义相关性而非空间位置时,这套机制还成立吗?

核心工作如何回应。OCR-Memory 把 SoM 从「空间锚点」重新解释为记忆段落的地址(Eq. 7–8),并做了两处关键升级:(1) 输出从自由文本引用变成每段一个二值 logit,从而可校准(Eq. 11)、可加阈值与 TopK 兜底(Eq. 12);(2) 通过加权 BCE 训练这套指认能力,而非零样本 prompt。Table 2 给出了这次迁移的价值量化:「仅 BBox 无编号」相比完整 SoM 掉 4.6pp Ele Acc——真正起作用的是离散编号这个符号锚点,而非视觉分块本身。这是对 SoM 原论文结论在新场景下的一次独立验证。

关键设计的传递。红框 + 编号的渲染规范被几乎原样继承(RGB 255,0,0 / 3px / Arial 36pt 白字红底),只是标记对象从「图像中的物体」变成了「轨迹中的段落」。

2.6 Glyph(并行工作参照)— arXiv 2510.17800, 2025-10

解决了什么问题。与 DeepSeek-OCR 同月出现的另一条光学压缩路线,目标不是 OCR 而是长上下文建模本身:把长文本渲染成图交给 VLM 处理,用 LLM 驱动的遗传搜索优化渲染配置。原文摘要数字:3–4× token 压缩、约 4× prefill/decode 加速、约 2× SFT 加速,精度与 Qwen3-8B 相当。

跨论文引证:Glyph 与 OCR-Memory 的分歧点极具信息量。 Glyph 让 VLM 直接在渲染图上做任务推理(因此压缩率保守,只有 3–4×,要保住理解精度);OCR-Memory 让 VLM 只做定位、把原文交回文本模型推理(因此敢压到 10×)。同一技术底座,因为职责划分不同,可用压缩率相差 3 倍。这恰好为 §1.6 第一条设计原则提供了跨论文的对照证据:把重建职责从视觉模态上卸下来,是压缩率能翻 3 倍的直接原因。

Glyph 还留下一个 OCR-Memory 没有处理的问题:渲染配置需要搜索优化。OCR-Memory 用的是一套手工固定的排版参数且未做敏感性分析(§1.7-⑧)——把 Glyph 的遗传搜索接到 OCR-Memory 的渲染器上,是一个几乎现成的改进。

3. 技术演进脉络

3.1 演进树(非线性)

┌── 问题:agent 的历史存不下 ──┐ │ │ 2023 MemGPT [虚拟内存分页,prompt 驱动] ─────────────┐ │ 留下:换页策略靠 prompt,不可学 │ ▼ │ 2024 MemoryBank [艾宾浩斯遗忘曲线,AAAI'24] │ │ ✦ 遗忘成为一等公民 │ │ 留下:遗忘 = 不可逆删除;检索 = 纯语义相似 │ ▼ │ ┌─────────────── 分叉:怎么少存一点? ───────────┤ │ │ ▼ (抽象路线) ▼ (压缩路线) │ 2024 AWM [归纳 workflow] 2025 ACON [NL 优化压缩准则, ICML'26] │ ✦ 记忆 = 过程性知识 │ ✦ 压缩准则可优化 │ M2W +24.6% rel │ peak token −26~54% │ 留下:低层细节丢失 │ 留下:文本空间内 rate-distortion 零和 │ │ └────────────┬───────────────────┘ │ 共同的死结:都在「文本空间」里做取舍 │ ┌────────────┴──── 外部技术注入(2025 Q4)────────────┐ │ │ ▼ (模态底座) ▼ (视觉接口) │ 2025 DeepSeek-OCR [光学压缩] 2023 Set-of-Mark [离散符号锚点] │ ✦ <10× → 97%; 20× → 60% │ ✦ grounding: 生成 → 选择 │ 留下:曲线绑死在「重建」任务上 │ 留下:只验证过单图空间理解 │ │ │ 2025 Glyph [视觉-文本压缩] ──┤ │ ✦ 3-4×,但 VLM 直接推理 │ │ → 对照组:不卸载重建职责,压缩率就上不去 │ │ └──────────────┬──────────────────────┘ │ ▼ 2026 ★ OCR-Memory [ACL'26 Main] 「视觉负责定位,文本负责内容」 ├─ 回应 MemoryBank:遗忘 = 可逆的分辨率退化,不是删除 ├─ 回应 AWM:抽象层之下必须挂逐字原文(locate-and-transcribe) ├─ 回应 ACON:不在文本空间内压缩,换到像素空间 ├─ 继承 DeepSeek-OCR:冻结 vision encoder,只 LoRA decoder └─ 继承 SoM:红框+编号 → 二值 logits,可校准可训练

3.2 演进的内在逻辑线索

这条线背后的推动力,可概括成一个逐步后撤的失败链

存不下 → 那就只存一部分(检索) → 选不准(语义 ≠ 逻辑) → 那就存高层的(抽象) → 低层细节丢了 → 那就压缩而非抽象(保留结构,缩短表达) → 文本空间内压缩率与保真度是零和的 → 那就换个空间(像素) → 换空间引入了新的有损(OCR 误差) → 那就不让新空间承担内容职责,只承担定位职责 ★
阶段时间记忆的本质是决定「记什么」的是代表
I. Prompt 驱动2023上下文的分页副本手写的换页规则MemGPT
II. 规则编码2024带强度衰减的知识条目时间函数 / 归纳算法MemoryBank, AWM
III. 学习式压缩2025被优化过的上下文可优化的压缩准则(NL 或梯度)ACON
IV. 模态重构2026文本原件 + 视觉索引一个被训练的跨模态定位器OCR-Memory

关键转折的性质变化:I→II 是「从人写规则到规则可演化」,II→III 是「从规则到目标驱动的优化」,而 III→IV 是唯一一次改变了记忆的物理载体——前三阶段都在问「文本该怎么裁」,第四阶段第一次问「为什么一定是文本」。

与首期报告主线的关系。 这条线与 MemGPT → A-MEM / Mem0 / Memory-R1 / MemAct → AgeMem 的「策略内化」主线是正交的:那条线在问「谁来决定记忆操作」(从 prompt 到 RL 策略),这条线在问「记忆用什么表示」。两条线目前尚未交汇——没有任何工作把 RL 训练的记忆策略和光学记忆表示放在一起,这是 §4 中最显眼的空白之一。

4. 开放挑战与研究机会

4.1 理论层面

(T1) 测量「定位信息量」与「重建信息量」的分离度 —— 高价值、低门槛。
不是「研究视觉记忆的理论性质」,而是:在固定语料上,把渲染分辨率作为自变量,同时测量 (a) 检索 Recall@k 和 (b) OCR 字符级重建精度,画出两条曲线。若 (a) 的衰减显著慢于 (b),就为 OCR-Memory 的核心假设(§1.7-⑥)提供了第一份直接证据,也顺带给出「分辨率该降到多低」的原则性答案,取代目前「最近 5 步 hi-res」这种手工常数。用 DeepSeek-OCR 开源权重 + 任意长文档语料,一张 A100 一天可以做完

(T2) 光学记忆的 rate–distortion 下界。
DeepSeek-OCR 的 97%@10× / 60%@20× 是特定编码器的经验曲线,不是信息论下界。开放问题:给定 d×d 像素与固定字体渲染,段落级相关性判定任务的可达压缩率上界是多少?这决定了 OCR-Memory 的 10× 究竟是接近极限还是远未触顶。

(T3) 跨层 trade-off 的定量化。
OCR-Memory 同时交易三种资源:prompt token(−6.7×)、磁盘(+81.7×)、延迟(+5.7×),目前没有任何工作给出三者的等价换算。可操作的形式化:定义 Cost = α·tokens + β·bytes + γ·latency,扫描 (α,β,γ) 找出 OCR-Memory 优于 text-RAG 的参数区域边界。这会直接回答「什么场景该用光学记忆」这个部署问题。

4.2 工程与应用层

(E1) 补上那条缺失的对照线:微调过的文本检索器。
如 §1.7-③ 所述,「视觉索引优于文本索引」目前没有被公平验证过。具体实验:在同一份 HotpotQA distractor 数据上用相同 3 epoch 预算微调一个 ~3B 文本 reranker,在同样的 Mind2Web / AppWorld 设置下报告 Recall@1/5/10 与 MRR。判决 A 优于 B 缺乏 head-to-head 实验,这是下一步最关键的空白。

(E2) 打破 4096 的人为天花板。
在 4k / 8k / 16k / 32k / 128k 五档预算下同时跑 text-RAG 与 OCR-Memory,画出交叉点。若交叉点在 16k 以下,OCR-Memory 的适用场景就收窄到边缘 / 小模型部署;若在 128k 以上,它就是长上下文时代的通用方案。这一条实验的信息量高于论文现有的任何一张表。

(E3) 渲染配置的自动搜索。
把 Glyph 的 LLM 驱动遗传搜索接到 OCR-Memory 的渲染器上,搜索(字号、行距、列宽、框宽、编号样式、分辨率层级数 L)。论文当前用手工固定值且无敏感性分析;Glyph 的经验说明这些参数不是二阶效应

(E4) 动态在线设置下的老化函数。
OCR-Memory 的 ρ(Δt) 是纯时间函数,而 MemoryBank 的艾宾浩斯曲线同时考虑复习频率。直接的改进:ρ(Δt, n_recall)——被 active recall 命中过 n 次的记忆,老化速度按 n 减缓。这几乎是免费的(命中记录已存在),且能缓解 §1.7-④ 的「自我实现的遗忘」。

(E5) 多模态原生轨迹。
Web agent 的轨迹本来就包含截图。当前 OCR-Memory 把文本日志渲染成图,但截图本身就是图——自然的扩展是让记忆图同时容纳「渲染的文本」与「原始截图」,共用同一套 SoM 索引。这是光学记忆相比文本记忆独有的可扩展方向,论文完全没有触及。

4.3 新兴方向

(N1) 把 RL 记忆策略接到光学记忆上 —— 两条主线的首次交汇。
Memory-R1 / MemAct / AgeMem 的「策略内化」主线与 OCR-Memory 的「模态重构」主线尚未相遇。具体可做:把「渲染哪些段落到同一张图」「何时触发升采样」「τ 取多少」作为 RL 的动作空间,用任务成功率作奖励。当前这三个决策全是手工常数。

(N2) 可逆压缩的一般化。
locate-and-transcribe 本质是「有损索引 + 无损存储」。这个模式能否推广到 KV cache(低精度 KV 用于 attention 路由,命中后加载高精度 KV)?或 embedding(低维粗筛、高维精排——虽接近传统 ANN 两阶段检索,但「命中即永久升级」的 active recall 语义是新的)?

(N3) 多智能体共享的视觉记忆与其安全面。
渲染图是跨模型可读的:3B VLM 索引出的段落,任何文本模型都能消费,天然适合多 agent 共享记忆池。但也带来治理问题:渲染图上的对抗性排版(隐藏文字、误导性编号)是一种全新的记忆投毒面。目前没有任何工作研究光学记忆的安全性。

(N4) 存储成本的正面攻击。
81.7× 的磁盘放大(Table 7)是最大的工程短板,且可以直接优化——当前是「渲染图 + 全量文本」双份存储。若渲染图能可靠重建大部分文本(DeepSeek-OCR 在 <10× 下 97%),是否只需保留高不确定性段落的文本副本?这可能把磁盘放大压到个位数倍。

5. 相关工作表格对标

工作发表年月会议 / 出版核心贡献主要指标(来源)与核心工作的关系
MemoryBank2023-05 / 2024AAAI 2024 艾宾浩斯遗忘曲线驱动的长期记忆 OCR-Memory Table 1:M2W Ele Acc 43.8 / AW Avg 52.1 被对抗性改写:遗忘从「删除」→「可逆的分辨率退化」
AWM2024-09arXiv(未见正式会议页) 从轨迹归纳可复用 workflow 原文摘要:M2W +24.6% rel SR, WebArena +51.1% rel SR;OCR-Memory Table 1:Ele Acc 49.1 / AW Avg 55.0 被综合:保留高层索引,但要求索引下挂逐字原文
ACON2025-10 / 2026-06 (v3)ICML 2026 自然语言优化的上下文压缩准则 原文摘要:peak token −26~54%,小模型 +46%;OCR-Memory Table 1:Ele Acc 48.2 / AW Avg 56.2(AW 三档均次优) 被直接反驳:文本空间内压缩–保真零和,故换模态
DeepSeek-OCR2025-10技术报告 光学上下文压缩的可测曲线 原文摘要:<10× → 97% OCR 精度;20× → ~60%;100 vis-tok > GOT-OCR2.0 (256 tok) 技术底座:backbone 直接沿用(3B,vision encoder 冻结)
Set-of-Mark2023-10arXiv 离散符号锚点解锁视觉 grounding OCR-Memory Table 2:去掉编号(仅 BBox)Ele Acc −4.6pp 接口来源:空间 grounding → 记忆段落寻址 + 二值 logits
Glyph2025-10arXiv 视觉-文本压缩 + 渲染配置遗传搜索 原文摘要:3–4× 压缩、~4× prefill/decode 加速、~2× SFT 加速 平行对照:VLM 直接推理 → 只能压 3–4×,反证「卸载重建职责」的价值
OCR-Memory2026-04 / 2026-07ACL 2026 Main, Long 视觉索引 + 逐字转录的 agent 记忆 自报 Table 1:M2W Ele Acc 53.8 / AW Avg 58.1;Table 4:10.2–10.7×;Table 7:token −6.7×,磁盘 +81.7×
这张表读出的两条趋势。
① 性能阶梯清晰:Mind2Web Ele Acc 沿 MemoryBank 43.8 → ACON 48.2 → AWM 49.1 → OCR-Memory 53.8 单调上升,但最大单步跃迁(+4.7pp)恰好发生在模态切换那一步——这是「换空间比在空间内优化更有效」的最直接证据。
② 压缩率的三级台阶:ACON(文本空间,peak token −26~54%,约 1.3–2.2×)→ Glyph(像素空间但承担推理,3–4×)→ OCR-Memory(像素空间且只承担定位,10.5×)。职责越轻,压缩率越高——这个规律跨三篇论文成立。

6. 其他值得关注的近期工作

How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior(ACL 2026 Main, Long)

GAM: Hierarchical Graph-based Agentic Memory for LLM Agents(ACL 2026 Main, Long, pp. 34647–34664)

MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents(ACL 2026 Main, Long, pp. 36848–36865)

Adaptive Memory Distillation for LLM Agents(ACL 2026 Main, Long)

H-MEM: Hierarchical Memory for High-Efficiency Long-Term Reasoning in LLM Agents(EACL 2026, Long)

RecMem: Recurrence-based Memory Consolidation(Findings of ACL 2026)

Amory: Building Coherent Narrative-Driven Agent Memory(EACL 2026, Long)

Governed Shared Memory for Multi-Agent LLM Systems(arXiv 2606.24535, 2026-06)

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents(arXiv 2604.20006, 2026-04)

附:本报告的不完备之处

  1. Figure 2 的具体数值无法引用——论文以图形式给出 token 预算扫描结果,正文未附表格,故 §1.5.8 的相变分析只能转述定性趋势。
  2. OCR-Memory 无公开代码——所有工程细节均无法交叉核实。老化函数 ρ 的解析形式论文实际上未给出,只说明是「单调老化函数」。
  3. tabzhangjx.github.io/year-archive/ 抓取失败——去重依据来自任务提示中的显式名单,而非在线归档页。
  4. Mind2Web Cross-Task 测试集的确切规模论文未声明——§1.7-① 中「0.5pp 对应个位数任务」的推断基于该 split 数百任务量级的公开常识;若实际规模远大于此,该批评需相应减弱。
  5. AWM 的正式会议出处未能确认——只找到 arXiv 页面,未找到对应的 proceedings 页,故标注为 arXiv 预印本。
  6. 论文未报告任何超参敏感性扫描(τ、分辨率层级数 L、hi-res 步数)——本报告不臆造该类曲线,仅在 §4 中把它列为待补的实验空白。