Agent Memory 每日文献追踪 · 2026-08-07
Optical Context Retrieval for Long-Horizon Agent Memory — 当文本空间内的压缩–保真取舍走到尽头,答案是换一个表示空间
一句话定位:OCR-Memory 真正压缩的不是记忆本身,而是「找到记忆的那张地图」——原文仍以逐字形式完整躺在磁盘上(每 episode 1.47 MB),被压到 10× 的只是 agent 用来定位它的视觉索引。这个区分同时解释了它最漂亮的结果(无幻觉、逐字保真)和最尴尬的代价(磁盘占用是文本 RAG 的 81.7×)。
本期覆盖 ACL Anthology 2026 主会/Findings、EACL 2026、OpenReview(ICLR 2026 + MemAgents Workshop)、arXiv cs.CL/cs.AI,共筛出 20+ 篇候选。ACL 2026 主会长文候选包括 2026.acl-long.27(Experience-Following 实证)、2026.acl-long.474(OCR-Memory)、2026.acl-long.1600(GAM)、2026.acl-long.1607(Adaptive Memory Distillation)、2026.acl-long.1709(MAGMA);EACL 2026 有 H-MEM、Amory;Findings 有 RecMem。
最终选定 OCR-Memory,理由有三:(1) ACL 2026 主会长文,2026-04 上 arXiv,时效性满足;(2) 它开辟的是记忆表示的模态维度,与首期报告覆盖的 MemGPT / A-MEM / Mem0 / Memory-R1 / MemAct / AgeMem 全部为纯文本路线正交;(3) 它把 2025Q4 兴起的 contexts optical compression 技术线第一次完整搬进 agent memory 场景,技术传递脉络清晰。
tabzhangjx.github.io/year-archive/ 在本次运行中三次返回抓取权限错误,无法在线核对历史选题;本期改用任务提示中显式列出的已覆盖名单作为去重依据。另:OCR-Memory 未公开代码仓库,论文正文与附录均无 GitHub 链接,因此下文所有工程细节均只能依据论文文本,无法交叉核实实现。
| 项目 | 链接 | 状态 |
|---|---|---|
| ACL Anthology | 2026.acl-long.474 | ✅ 已验证 |
| ACL PDF | 2026.acl-long.474.pdf | ✅ 已验证 |
| arXiv | arXiv:2604.26622 | ✅ 已验证 |
| arXiv HTML (v1) | html/2604.26622v1 | ✅ 全文可读 |
| DOI | 10.18653/v1/2026.acl-long.474 | ✅ Anthology 给出 |
| 代码仓库 | — | ❌ 未找到(论文未提供) |
书目:Jinze Li, Yang Zhang, Xin Yang, Jiayi Qu, Jinfeng Xu, Shuo Yang, Junhua Ding, Edith Cheuk-Han Ngai. OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory. ACL 2026 (Volume 1: Long Papers), San Diego, California, July 2026. 单位:香港大学 / 北德克萨斯大学 / 筑波大学 / 延世大学。
| 工作 | 会议 / 出版 | arXiv | 代码 |
|---|---|---|---|
| MemoryBank | AAAI 2024 | 2305.10250 | GitHub |
| AWM | 未找到正式会议页 | 2409.07429 | GitHub |
| ACON | ICML 2026 | 2510.00615 (v1 2025-10-01 / v3 2026-06-01) | GitHub |
| DeepSeek-OCR | 技术报告 2025-10-21 | 2510.18234 | GitHub |
| Set-of-Mark | arXiv 2023-10-17 | 2310.11441 | GitHub |
| Glyph | arXiv 2025-10-20 | 2510.17800 | GitHub |
论文自述:OCR-Memory「利用视觉模态作为 agent 经验的高密度表示,使得在最小 prompt 开销下保留任意长的历史成为可能」;它把交互历史渲染成带唯一视觉标识的图像,用 locate-and-transcribe(先定位、后逐字转录)范式检索——通过视觉锚点选出相关区域,再取回对应的逐字原文,从而绕开生成式检索的错误。
论文把痛点论证成一条三选一困境:长程 agent 的完整轨迹既有价值又存不下,而现有三条出路各自破产。
| 出路 | 代表工作 | 论文的批评(原文) | 破产在哪 |
|---|---|---|---|
| 检索片段 | RAG, MemGPT, MemoryBank, Self-RAG, Memory-R1 | “Retrieved snippets may be topically related yet logically irrelevant, especially when tasks hinge on causality or long-range dependencies” | 语义相似 ≠ 逻辑相关 |
| 经验抽象 | AWM, skill / workflow abstraction | “Abstraction can discard crucial low-level details (e.g., exact error messages, intermediate states)” | 抽象即丢失 |
| 上下文压缩 | ACON, LLMLingua 系, attention sink | “Text-centric compression inevitably trades off compression ratio against information fidelity” | 压缩率与保真度此消彼长 |
量化论证:Mind2Web 上每步推理上下文从 3,980 → 596 tokens(6.7×)(Table 7);NIAH 上跨 4k–32k 稳定 10.2×–10.7× 压缩率、精度 98.5 → 94.1(Table 4)。
新颖之处:前三条路线都在文本空间内做取舍,因而必然落在同一条 rate–distortion 曲线上。OCR-Memory 的论断是:换一个表示空间(像素),就换了一条曲线——这是模态层面的跳变,而非曲线上的移动。
为什么值得解决:Mind2Web 上所有方法的 Task SR 都在 2.2%–4.8% 区间(Table 1),长程 web agent 的端到端成功率仍近乎在地板上;上下文预算是这个地板的直接约束之一(论文把 context window 硬性设为 4096 tokens)。
论文的论证不是「我们提出 X」,而是一条四步逼近:
第一步:把问题从「存什么」改写成「用什么表示存」。既然文本空间内的压缩–保真是零和的,那就问:有没有一种表示,其信息密度天然高于 token 序列?答案指向 DeepSeek-OCR 的经验事实——一页文档用 100 个 visual token 可以打败用 256 token 的 GOT-OCR2.0。
第二步(关键转折):承认视觉表示会引入新的失败模式,然后把它绕过去。这是全文最聪明的一步。若让 VLM 从渲染图中解码文本,就把 OCR 误差直接引入 agent 的推理链——而 DeepSeek-OCR 自己的曲线显示,压缩率 <10× 时精度 97%,到 20× 就掉到约 60%。作者的推断是:既然解码不可靠,就别解码。于是 VLM 的输出被限制为段落索引(0/1 标签),文本从磁盘逐字取回。
第三步:把「索引」变成可训练的视觉任务。借 Set-of-Mark:渲染图上画红框 + 打编号,VLM 只需回答「哪几个编号相关」。这把开放式生成变成有界的多标签分类,既可微调(加权 BCE)又可校准(softmax over logits "1"/"0")。
第四步:引入时间维度,让老记忆自动降级。最近 5 步高分辨率,其余低分辨率;一旦某段低分辨率记忆被检索命中,就「主动回忆」升采样回高保真。这是把遗忘曲线做成了分辨率曲线。
记忆库结构(Eq. 5)——注意:文本并未被丢弃。
两阶段检索(Eq. 6)
Set-of-Mark 二值相关性(Eq. 7–8)与概率校准(Eq. 11)
推理期阈值 + Top-K 兜底(Eq. 12)
年龄感知多分辨率(Eq. 13)与主动回忆(Eq. 14–15)
训练目标(Eq. 20)——加权 BCE,刻意偏向召回。
| 机制 | 输入 | 输出 | 解决的失败模式 | 代价 |
|---|---|---|---|---|
| 视觉存储 | 轨迹文本块 | 带标记渲染图 | 上下文窗口溢出 | 磁盘 ×81.7 |
| Set-of-Mark 索引 | 图 + query | 段落索引 0/1 | 生成式检索的幻觉 | 需微调 3B VLM |
| Locate-and-Transcribe | 索引集合 | 逐字原文 | OCR 解码误差 | 必须保留全量文本副本 |
| Age-aware 降采样 | 时间差 Δt | 分辨率层级 ℓ | token 预算随时间线性增长 | Step SR −0.4pp(Table 3) |
| Active-recall 升采样 | 命中记录 | 恢复 hi-res | 老记忆定位精度衰减 | 无法完全补回高分辨率的差距 |
| 类别 | 参数 | 取值 |
|---|---|---|
| 检索 | 阈值 τ | 0.4 |
| 检索 | Top-K 兜底(每图) | 5 |
| 检索 | 单 query 最大返回段数 | 20 |
| 分辨率 | 高分辨率 | 1024² → 256 vis-tok |
| 分辨率 | 低分辨率 | 512² → 64 vis-tok |
| 分辨率 | 部署策略 | 最近 5 步 hi-res |
| 训练 | Backbone | DeepSeek-OCR 3B(vision encoder 冻结) |
| 训练 | LoRA | r=16, α=32, dropout=0.05 |
| 训练 | 优化器 | AdamW, β=(0.9, 0.95), wd=0.1 |
| 训练 | 学习率 | 1e-5 peak, 10% warmup |
| 训练 | Batch / Epochs | global 128 / 3 ep (HotpotQA) |
| 训练 | 分辨率课程 π | [0.3, 0.7] over {1024², 512²} |
| 渲染 | 框 / 编号 | RGB(255,0,0) 3px / Arial 36pt 白字红底 |
| 渲染 | 缩放插值 | Bicubic |
| 项目 | 设置 |
|---|---|
| 推理主干 | GPT-4, temperature = 0 |
| 泛化主干 | Qwen3-32B |
| 检索模块 | DeepSeek-OCR (3B),LoRA 微调 |
| 上下文预算 | 严格 4096 tokens(默认) |
| 主基准 | Mind2Web (Cross-Task split)、AppWorld (Easy / Med / Hard) |
| 辅助基准 | NIAH(扩展性)、HotpotQA(检索训练) |
| 随机种子 | ⚠️ 论文未报告多种子或误差棒 |
图 1 · 主结果对比(数据来源:论文 Table 1)
六种方法在 Mind2Web Element Accuracy 与 AppWorld 平均成功率上的表现。悬浮查看具体数值与相对提升。
绝对值来自论文 Table 1;「Δ vs 次优」与「相对提升 %」为本报告基于该表计算的派生量。
| 方法 | M2W Ele Acc | M2W F1 | M2W Step SR | M2W Task SR |
AW Easy | AW Med | AW Hard | AW Avg |
|---|---|---|---|---|---|---|---|---|
| Zero-Shot | 40.1 | 46.2 | 37.9 | 2.2 | 68.7 | 36.2 | 20.9 | 41.9 |
| Retrieval (dense RAG) | 41.3 | 48.2 | 38.9 | 2.7 | 72.5 | 44.8 | 21.4 | 46.2 |
| MemoryBank | 43.8 | 49.5 | 39.2 | 3.3 | 81.3 | 50.1 | 24.9 | 52.1 |
| AWM | 49.1 | 55.7 | 42.6 | 4.3 | 84.1 | 53.6 | 27.2 | 55.0 |
| ACON | 48.2 | 54.1 | 41.4 | 4.1 | 84.8 | 55.1 | 28.7 | 56.2 |
| OCR-Memory | 53.8 | 59.2 | 46.1 | 4.8 | 86.2 | 57.4 | 30.8 | 58.1 |
| Δ vs 次优 (pp) | +4.7 | +3.5 | +3.5 | +0.5 | +1.4 | +2.3 | +2.1 | +1.9 |
| 相对提升 vs 次优 | +9.6% | +6.3% | +8.2% | +11.6% | +1.7% | +4.2% | +7.3% | +3.4% |
| 相对提升 vs Zero-Shot | +34.2% | +28.1% | +21.6% | +118.2% | +25.5% | +58.6% | +47.4% | +38.7% |
斜体 = 该列次优;高亮行 = 最优方法。
这同时是对「若改用端到端 OCR 解码会怎样」这一反事实的直接回答。
| 配置 | Ele Acc (%) | Step SR (%) | 延迟 (s) | Δ Ele Acc | 延迟倍数 |
|---|---|---|---|---|---|
| OCR-Memory (Full) | 53.8 | 46.1 | 1.7 | — | 1.0× |
| w/o SoM(改为文本生成检索) | 46.5 | 39.2 | 5.3 | −7.3pp | 3.1× |
| w/o SoM(仅 BBox,无编号) | 49.2 | 44.5 | 2.1 | −4.6pp | 1.2× |
读法:去掉 SoM 改成生成式检索,Ele Acc 掉 7.3pp 且延迟涨 3.1×——准确率和效率同时崩,这是 §1.3 第二步论证的实验兑现。而「只画框不编号」仍掉 4.6pp,说明离散编号本身(而非视觉分割)承担了大部分收益:模型需要的是一个可以指认的离散符号锚点,不是一个空间区域。
| 策略 | Step SR (%) | Task SR (%) | 平均 tokens | tokens 相对 hi-res |
|---|---|---|---|---|
| Static Low-Res (512²) | 39.7 | 2.9 | 65 | 0.25× |
| Static High-Res (1024²) | 46.5 | 4.9 | 256 | 1.00× |
| Dynamic(本文) | 46.1 | 4.8 | 82 | 0.32× |
读法:Dynamic 用 32% 的 token 换到了 99.1% 的 Step SR(46.1 / 46.5)。但注意——Table 1 的头条数字 46.1 用的是 Dynamic,而论文自己的最优配置其实是 Static High-Res 的 46.5。作者在主表里报告略低但更省的配置,方法论上是诚实的;不过这也意味着 active-recall 升采样并未完全补回降采样的损失(残差 0.4pp),见 §1.7-④。
base / +SoM / +多分辨率 / +active-recall 的逐级累加消融表。Table 2 与 Table 3 是两条独立的单因素消融,无法读出两个模块的交互效应。
图 2 · NIAH 扩展性:压缩率恒定,精度对数线性衰减(数据来源:论文 Table 4)
上下文从 4k 增长到 32k(8×)时,压缩率几乎不动(10.2–10.7×),精度累计下降 4.4pp。悬浮查看压缩率。
| 上下文长度 | 压缩率 | NIAH 精度 | Δ 精度 vs 4k |
|---|---|---|---|
| 4k | 10.3× | 98.5 | — |
| 8k | 10.2× | 97.2 | −1.3pp |
| 16k | 10.7× | 95.8 | −2.7pp |
| 32k | 10.6× | 94.1 | −4.4pp |
关键观察:压缩率几乎恒定(10.2–10.7×,波动 <5%)。这说明压缩率是渲染器的常数属性,不随上下文长度自适应——与摘要中 “retention of arbitrarily long histories” 的措辞存在张力(§1.7-②)。精度衰减近似 log-linear:每翻倍约 −1.5pp。
| 方法 | Backbone | Ele Acc | Step SR | Task SR |
|---|---|---|---|---|
| Text Retrieval (RAG) | GPT-4 | 41.3 | 38.9 | 2.7 |
| OCR-Memory | GPT-4 | 53.8 | 46.1 | 4.8 |
| Text Retrieval (RAG) | Qwen3-32B | 35.2 | 31.5 | 1.8 |
| OCR-Memory | Qwen3-32B | 48.6 | 42.3 | 3.9 |
| Δ(OCR − RAG) on GPT-4 | +12.5pp | +7.2pp | +2.1pp | |
| Δ(OCR − RAG) on Qwen3-32B | +13.4pp | +10.8pp | +2.1pp | |
增益在两个主干上稳定甚至略增(Qwen3-32B 上 Ele Acc 增益 +13.4pp > GPT-4 的 +12.5pp)。合理解释:检索模块是同一个冻结的 3B VLM,主干越弱,被喂进去的证据质量的边际价值越高。
| 方法 | Recall@1 | Recall@5 | Recall@10 | MRR |
|---|---|---|---|---|
| Dense Text-RAG | 52.7 | 74.3 | 82.1 | 0.61 |
| OCR-Memory | 78.6 | 93.4 | 96.2 | 0.84 |
| 相对提升 | +49.1% | +25.7% | +17.2% | +37.7% |
Recall@1 相对提升 +49.1% 是全文单项最大增幅——但这也是最需要打折的一个数字,见 §1.7-③(对比不对等)。
| 方法 | 磁盘 / episode | 文本 tokens / step | 检索延迟 / step |
|---|---|---|---|
| Text-RAG | 18 KB | 3,980 | 0.3 s |
| OCR-Memory | 1.47 MB | 596 | 1.7 s |
| 倍数 | 81.7× 更差 | 6.7× 更好 | 5.7× 更差 |
这是一个典型的相变式分叉:两条曲线在宽预算区间可能收敛(论文未提供 8192 以上的数据),但在窄预算区间发生质变——因为 text-RAG 的最小可用单元是「一段完整文本」,而 OCR-Memory 的最小可用单元是「64 个 visual token 的一张缩略图」。当预算低于前者的粒度下限时,text-RAG 不是变差,而是失效。
坦诚提示:Figure 2 的具体数值在论文正文中未以表格形式给出,因此本报告无法引用该图上的确切数字,只能转述其定性趋势。这是本次分析的一处不完备。
它真正的贡献不是「用图片存记忆」,而是三个可迁移的设计原则:
① 表示与职责的解耦——「视觉负责定位,文本负责内容」。
为什么关键:它把一个模态的优势(高信息密度、空间可寻址)和劣势(解码有损)拆开,只用优势那一半。这个原则可脱离本文复用到任何「高密度但有损」的表示上——latent memory、KV-cache 压缩、向量量化索引。凡是「压缩后无法可靠重建」的表示,都可以退化为索引而非存储。
② 把开放式生成降级为有界分类——SoM 作为检索接口。
为什么关键:生成式检索不可验证、不可校准、延迟高(Table 2: 5.3s)。SoM 把它变成 K 个二值 logits,于是可微调、可校准(Eq. 11)、可加阈值(Eq. 12)、可加类别权重(Eq. 20)——四个工程手柄一次性到位。
③ 遗忘 = 分辨率退化,而非删除。
为什么关键:MemoryBank 式的遗忘不可逆;OCR-Memory 的遗忘有损但可逆——降采样后仍可通过 active recall 升回高保真。这在概念上更接近人类记忆的「提取失败 vs 存储失败」之分。这个框架让我们可以把同样的思路迁移到其他层:KV cache 的分级精度、embedding 的分级维度、summary 的分级粒度。
①【指标有效性】Mind2Web Task SR 的 +0.5pp 很可能落在噪声内。
OCR-Memory 4.8 vs AWM 4.3,绝对差 0.5pp。Mind2Web Cross-Task 测试集在数百任务量级,0.5pp 对应的是个位数任务的差异。论文未报告随机种子、未给误差棒、未做显著性检验。相比之下 Ele Acc 的 +4.7pp 才有说服力。结论:摘要中并列的四个 Mind2Web 指标说服力并不等价,Task SR 一项应当降权。
②【论证缺口】「任意长历史」的主张与 32k 的证据上限不一致。
摘要称 “enabling retention of arbitrarily long histories”,但 Table 4 的扩展性实验止于 32k,精度已从 98.5 单调降到 94.1(−4.4pp)。按每翻倍约 −1.5pp 外推,128k 约 91%、1M 约 87%。更关键的是压缩率恒为 ~10.5× 而不随长度自适应——histories 每增长 10×,visual token 也线性增长 10×,没有任何机制阻止它最终撑爆上下文。「任意长」在证据上没有支撑;正确的表述应是「在 32k 内以近恒定的 10× 系数换取 <5pp 的精度损失」。
③【缺乏关键竞品对比】Table 6 的检索对比不对等。
OCR-Memory 的检索模块在 HotpotQA 上微调了 3 个 epoch,而对照的 Dense Text-RAG 按论文描述是未微调的现成稠密检索。在这种设置下 Recall@1 从 52.7 涨到 78.6(+49.1%)无法归因于模态——它至少混杂了「微调 vs 零样本」的效应。缺失的关键实验:在同一批 HotpotQA 数据上微调一个同量级文本检索器(E5 / ColBERTv2 / 3B text reranker)作为对照。没有这一行,「视觉索引优于文本索引」这一核心主张的验证是空白的。
④【实验设计问题】active-recall 没有补回降采样的损失,且缺少直接消融。
Table 3 中 Dynamic 46.1 vs Static High-Res 46.5,残差 −0.4pp;Task SR 4.8 vs 4.9,残差 −0.1pp。如果 active recall 完全有效(命中即恢复 hi-res),Dynamic 应当追平 High-Res。0.4pp 的持续缺口说明升采样触发得不够及时或不够全——即存在「因为已经是低分辨率所以没被检索到,因而也就没机会被升采样」的自我实现的遗忘。论文没有做 “Dynamic w/o active recall” 的消融,因此无从知道 active recall 究竟贡献了多少(可能把 39.7 抬到了 46.1,也可能只抬了 1pp)。这是全文最重要的一处消融缺失。
⑤【论证缺口】没有「长上下文 LLM 直接吞全文」的上界对照。
所有实验的 context window 被硬性设为 4096 tokens。这是 2023 年的预算,而 GPT-4 系与 Qwen3-32B 在论文写作时均支持 128k 量级上下文。缺失的对照是:给 text-RAG 32k 预算,它还输给 4k 预算的 OCR-Memory 吗? 由 Table 4 可知 OCR-Memory 在 32k 下精度已降至 94.1,而 32k 文本 RAG 的表现完全未知。在没有这条上界线的情况下,「上下文窗口有限」这个 motivation 是被实验设置人为制造出来的,而不是被证明的。
⑥【论证缺口】核心假设「定位所需信息 ≪ 重建所需信息」从未被直接测量。
可直接检验它的实验是:在同一批记忆上分别测量 (i) 低分辨率下的检索 Recall 与 (ii) 低分辨率下的 OCR 重建精度。论文只给了 Table 3 的下游任务指标(39.7 Step SR),这是被 agent 推理稀释过的间接信号。旁证支持这个假设:DeepSeek-OCR 报告 20× 压缩下 OCR 精度约 60%,而 OCR-Memory 在 512² 下 Step SR 仍有 39.7(vs zero-shot 37.9)——定位能力确实没有随重建能力一起崩塌。但这是本报告的推断,不是论文的证明。
⑦【实验设计问题】主干选择与规模覆盖过窄。
只有 GPT-4 与 Qwen3-32B 两个主干,且 GPT-4 在 2026 年的 ACL 论文中已属过时基线。没有 7B/8B 级小模型结果——而 ACON 恰恰报告「对小模型可带来最高 46% 的提升」,说明上下文管理方法在小模型上的规律不同。若 OCR-Memory 的收益在 8B 模型上消失(小 VLM 主干看不懂密集渲染图),论文的适用范围就要大打折扣,而这一点目前无从判断。
⑧【工程可复现性】未公开代码,且渲染细节高度敏感。
论文给出了字号(Arial 36pt)、框宽(3px)、颜色(纯红)、插值(bicubic)等参数,这恰恰说明渲染配置对结果是敏感的——Glyph 甚至专门用 LLM 驱动的遗传搜索优化渲染配置。在没有代码的情况下,第三方复现需要盲搜这一整套排版超参。论文自述限制中未提及此点,但它是实际影响最大的一条。
这五篇不是平行罗列,而是同一个问题被逐层剥离的历史:先是「存不下」,再是「存下了但选不准」,再是「选不准就抽象,抽象又丢细节」,再是「那就压缩,压缩还是丢」,最后是「换个空间存索引,正文一个字都不丢」。
解决了什么问题。LLM 对话系统没有跨会话的长期记忆。MemoryBank 建立「存储 → 检索 → 更新」的完整记忆循环,并引入艾宾浩斯遗忘曲线,让记忆强度随时间与复习频率演化。一句话:它第一次把「遗忘」作为一等公民写进 LLM 记忆系统的设计中。
遗留了什么问题。它的遗忘是不可逆的删除式衰减——强度掉到阈值以下就永久消失;检索仍是纯语义相似度,正是 OCR-Memory 点名批评的 “topically related yet logically irrelevant”。打开的空间:能否有一种「衰减但不销毁」的遗忘?
核心工作如何回应。OCR-Memory 把遗忘从删除改写成分辨率退化(Eq. 13),并配上 active recall 升采样(Eq. 14–15)——记忆变模糊但从不消失,命中即恢复原始保真。这是对 MemoryBank 遗忘机制的直接对抗性改写。数据上:Mind2Web Ele Acc 43.8 → 53.8(+10.0pp / +22.8%),AppWorld Avg 52.1 → 58.1(+6.0pp)。
关键设计的传递。MemoryBank 的「时间驱动的记忆强度函数」直接对应 OCR-Memory 的老化函数 ρ(Δt)——形式几乎同构,只是值域从 [0,1] 的强度标量变成了离散的分辨率层级 ℓ。
解决了什么问题。Web agent 每次都从零开始。AWM 从历史轨迹归纳可复用 workflow 并按需注入 prompt。原文摘要数字:Mind2Web +24.6% 相对成功率、WebArena +51.1% 相对成功率,成功任务步数下降;在线 AWM 在跨任务/跨网站/跨域设置下超越基线 8.9–14.0 绝对点。一句话:记忆不必是原始经验,可以是从经验中蒸馏出的过程性知识。
遗留了什么问题。抽象是单向有损的。归纳出 workflow 后,具体报错信息、中间状态、按钮确切文案就再也取不回来。打开的空间:能否既有抽象层的可复用性,又保留原始层的可回溯性?
核心工作如何回应。OCR-Memory 的答案是综合而非对抗:承认需要一个高层索引(视觉图),但坚持索引之下必须挂着逐字原文(Eq. 5 的 {s_{i,k}})。locate-and-transcribe 就是「先在抽象层定位、再回原始层取值」的两级结构。Table 1 上 OCR-Memory 全面超过 AWM(Ele Acc 49.1→53.8,+9.6%;AW Avg 55.0→58.1,+5.6%),但差距小于对 MemoryBank 的差距——说明抽象路线本身有效,OCR-Memory 赢在「抽象不丢底」。
关键设计的传递。AWM 的 selectively providing workflows 演化成了 τ=0.4 ∪ TopK(5)、单 query 上限 20 段的有界注入策略——从「注入哪些 workflow」变成「注入哪些原文片段」。
解决了什么问题。长程 agent 的 context 无界增长。ACON 用自然语言优化——分析失败案例、迭代改写压缩准则——同时压缩观测与历史,无需微调。原文摘要:峰值 token 相对已有压缩基线降低 26–54%,小模型上最高 +46%;基准为 AppWorld / OfficeBench / Multi-objective QA。一句话:压缩准则本身可以被优化,而且可以用自然语言而非梯度来优化。
遗留了什么问题。ACON 是 OCR-Memory 眼中「文本中心压缩」的最强代表,而它的宿命被一句话钉死:“Text-centric compression inevitably trades off compression ratio against information fidelity”。ACON 压出来的是改写过的文本——准则再好,被压掉的字就是没了。打开的空间:是否存在一条不在文本空间内的压缩路径?
核心工作如何回应。这是全篇最直接的「问题传递」。OCR-Memory 的回应不是「压得更好」,而是换空间:把 rate–distortion 的取舍挪到像素空间,并通过 locate-and-transcribe 让 distortion 在内容维度上归零(只在定位维度上有损)。数据上:ACON 是 Table 1 中 AppWorld 三档全部的次优方法(84.8 / 55.1 / 28.7),OCR-Memory 分别 +1.4 / +2.3 / +2.1pp;而 Mind2Web 上 ACON 反而不如 AWM(48.2 vs 49.1),提示通用文本压缩在网页 DOM 这类高度结构化的观测上吃亏。
关键设计的传递。ACON 的「按失败案例迭代优化压缩策略」在 OCR-Memory 中被替换成梯度版本:加权 BCE(w₊=2.0 偏向召回)本质上也是「宁可多带一点,别漏掉关键证据」的失败驱动设计,只是从 prompt 层的自然语言优化下沉到了参数层。
解决了什么问题。它提出并用实验验证了一个此前只是直觉的命题:一段文本渲染成图后,用少得多的 visual token 就能承载。原文摘要数字:压缩率 <10× 时解码精度 97%、20× 时约 60%;用 100 个 visual token 打败用 256 token/页的 GOT-OCR2.0,用 <800 token 打败平均 6000+ token 的 MinerU2.0;单张 A100-40G 日产 20 万+ 页训练数据。一句话:光学压缩不是比喻,它有一条可测量的 rate–distortion 曲线。
遗留了什么问题。DeepSeek-OCR 面向文档解析,成功判据是「能不能把字读对」,因此把自己牢牢绑在重建任务上——而重建正是那条曲线最陡的部分(过 10× 就断崖到 60%)。留下的空白:如果下游任务根本不需要重建,这条曲线还成立吗?可用区间能否被任务重定义拓宽?
核心工作如何回应。OCR-Memory 的整个设计可读作对这个问题的回答:把任务从「重建」换成「定位」,曲线的可用区间就变了。而且它给出了一个此前不明显的推论——OCR-Memory 实测工作在 10.2–10.7×(Table 4),正好卡在 DeepSeek-OCR 那条 97% 曲线的边缘。这不是巧合:设计点是被编码器的保真悬崖钉住的,不是自由选的。这也解释了为什么论文不敢往 20× 推——那里 DeepSeek-OCR 只剩 60%。
关键设计的传递。最直接的一次技术迁移:OCR-Memory 的 backbone 就是 DeepSeek-OCR (3B),vision encoder 完全冻结,只对 language decoder 做 LoRA(r=16)。OCR-Memory 继承的是 DeepSeek-OCR 的「看」,替换的是它的「说」——原本说文本,现在说 0/1 索引。
解决了什么问题。GPT-4V 能看懂图,却说不准「图里第几个东西」。SoM 的方案朴素得近乎粗暴:在图上直接画出分割区域并标上数字,让模型引用编号而不是描述位置。一句话:给视觉输入加上离散、可指认的符号锚点,视觉 grounding 就从生成问题变成了选择问题。
遗留了什么问题。SoM 的原始场景是单张图像的空间理解。它没有回答:当「图」不是真实场景而是被渲染的文本、当标记数量从十几个涨到成百上千个、当查询是语义相关性而非空间位置时,这套机制还成立吗?
核心工作如何回应。OCR-Memory 把 SoM 从「空间锚点」重新解释为记忆段落的地址(Eq. 7–8),并做了两处关键升级:(1) 输出从自由文本引用变成每段一个二值 logit,从而可校准(Eq. 11)、可加阈值与 TopK 兜底(Eq. 12);(2) 通过加权 BCE 训练这套指认能力,而非零样本 prompt。Table 2 给出了这次迁移的价值量化:「仅 BBox 无编号」相比完整 SoM 掉 4.6pp Ele Acc——真正起作用的是离散编号这个符号锚点,而非视觉分块本身。这是对 SoM 原论文结论在新场景下的一次独立验证。
关键设计的传递。红框 + 编号的渲染规范被几乎原样继承(RGB 255,0,0 / 3px / Arial 36pt 白字红底),只是标记对象从「图像中的物体」变成了「轨迹中的段落」。
解决了什么问题。与 DeepSeek-OCR 同月出现的另一条光学压缩路线,目标不是 OCR 而是长上下文建模本身:把长文本渲染成图交给 VLM 处理,用 LLM 驱动的遗传搜索优化渲染配置。原文摘要数字:3–4× token 压缩、约 4× prefill/decode 加速、约 2× SFT 加速,精度与 Qwen3-8B 相当。
Glyph 还留下一个 OCR-Memory 没有处理的问题:渲染配置需要搜索优化。OCR-Memory 用的是一套手工固定的排版参数且未做敏感性分析(§1.7-⑧)——把 Glyph 的遗传搜索接到 OCR-Memory 的渲染器上,是一个几乎现成的改进。
这条线背后的推动力,可概括成一个逐步后撤的失败链:
| 阶段 | 时间 | 记忆的本质是 | 决定「记什么」的是 | 代表 |
|---|---|---|---|---|
| I. Prompt 驱动 | 2023 | 上下文的分页副本 | 手写的换页规则 | MemGPT |
| II. 规则编码 | 2024 | 带强度衰减的知识条目 | 时间函数 / 归纳算法 | MemoryBank, AWM |
| III. 学习式压缩 | 2025 | 被优化过的上下文 | 可优化的压缩准则(NL 或梯度) | ACON |
| IV. 模态重构 | 2026 | 文本原件 + 视觉索引 | 一个被训练的跨模态定位器 | OCR-Memory |
关键转折的性质变化:I→II 是「从人写规则到规则可演化」,II→III 是「从规则到目标驱动的优化」,而 III→IV 是唯一一次改变了记忆的物理载体——前三阶段都在问「文本该怎么裁」,第四阶段第一次问「为什么一定是文本」。
(T1) 测量「定位信息量」与「重建信息量」的分离度 —— 高价值、低门槛。
不是「研究视觉记忆的理论性质」,而是:在固定语料上,把渲染分辨率作为自变量,同时测量 (a) 检索 Recall@k 和 (b) OCR 字符级重建精度,画出两条曲线。若 (a) 的衰减显著慢于 (b),就为 OCR-Memory 的核心假设(§1.7-⑥)提供了第一份直接证据,也顺带给出「分辨率该降到多低」的原则性答案,取代目前「最近 5 步 hi-res」这种手工常数。用 DeepSeek-OCR 开源权重 + 任意长文档语料,一张 A100 一天可以做完。
(T2) 光学记忆的 rate–distortion 下界。
DeepSeek-OCR 的 97%@10× / 60%@20× 是特定编码器的经验曲线,不是信息论下界。开放问题:给定 d×d 像素与固定字体渲染,段落级相关性判定任务的可达压缩率上界是多少?这决定了 OCR-Memory 的 10× 究竟是接近极限还是远未触顶。
(T3) 跨层 trade-off 的定量化。
OCR-Memory 同时交易三种资源:prompt token(−6.7×)、磁盘(+81.7×)、延迟(+5.7×),目前没有任何工作给出三者的等价换算。可操作的形式化:定义 Cost = α·tokens + β·bytes + γ·latency,扫描 (α,β,γ) 找出 OCR-Memory 优于 text-RAG 的参数区域边界。这会直接回答「什么场景该用光学记忆」这个部署问题。
(E1) 补上那条缺失的对照线:微调过的文本检索器。
如 §1.7-③ 所述,「视觉索引优于文本索引」目前没有被公平验证过。具体实验:在同一份 HotpotQA distractor 数据上用相同 3 epoch 预算微调一个 ~3B 文本 reranker,在同样的 Mind2Web / AppWorld 设置下报告 Recall@1/5/10 与 MRR。判决 A 优于 B 缺乏 head-to-head 实验,这是下一步最关键的空白。
(E2) 打破 4096 的人为天花板。
在 4k / 8k / 16k / 32k / 128k 五档预算下同时跑 text-RAG 与 OCR-Memory,画出交叉点。若交叉点在 16k 以下,OCR-Memory 的适用场景就收窄到边缘 / 小模型部署;若在 128k 以上,它就是长上下文时代的通用方案。这一条实验的信息量高于论文现有的任何一张表。
(E3) 渲染配置的自动搜索。
把 Glyph 的 LLM 驱动遗传搜索接到 OCR-Memory 的渲染器上,搜索(字号、行距、列宽、框宽、编号样式、分辨率层级数 L)。论文当前用手工固定值且无敏感性分析;Glyph 的经验说明这些参数不是二阶效应。
(E4) 动态在线设置下的老化函数。
OCR-Memory 的 ρ(Δt) 是纯时间函数,而 MemoryBank 的艾宾浩斯曲线同时考虑复习频率。直接的改进:ρ(Δt, n_recall)——被 active recall 命中过 n 次的记忆,老化速度按 n 减缓。这几乎是免费的(命中记录已存在),且能缓解 §1.7-④ 的「自我实现的遗忘」。
(E5) 多模态原生轨迹。
Web agent 的轨迹本来就包含截图。当前 OCR-Memory 把文本日志渲染成图,但截图本身就是图——自然的扩展是让记忆图同时容纳「渲染的文本」与「原始截图」,共用同一套 SoM 索引。这是光学记忆相比文本记忆独有的可扩展方向,论文完全没有触及。
(N1) 把 RL 记忆策略接到光学记忆上 —— 两条主线的首次交汇。
Memory-R1 / MemAct / AgeMem 的「策略内化」主线与 OCR-Memory 的「模态重构」主线尚未相遇。具体可做:把「渲染哪些段落到同一张图」「何时触发升采样」「τ 取多少」作为 RL 的动作空间,用任务成功率作奖励。当前这三个决策全是手工常数。
(N2) 可逆压缩的一般化。
locate-and-transcribe 本质是「有损索引 + 无损存储」。这个模式能否推广到 KV cache(低精度 KV 用于 attention 路由,命中后加载高精度 KV)?或 embedding(低维粗筛、高维精排——虽接近传统 ANN 两阶段检索,但「命中即永久升级」的 active recall 语义是新的)?
(N3) 多智能体共享的视觉记忆与其安全面。
渲染图是跨模型可读的:3B VLM 索引出的段落,任何文本模型都能消费,天然适合多 agent 共享记忆池。但也带来治理问题:渲染图上的对抗性排版(隐藏文字、误导性编号)是一种全新的记忆投毒面。目前没有任何工作研究光学记忆的安全性。
(N4) 存储成本的正面攻击。
81.7× 的磁盘放大(Table 7)是最大的工程短板,且可以直接优化——当前是「渲染图 + 全量文本」双份存储。若渲染图能可靠重建大部分文本(DeepSeek-OCR 在 <10× 下 97%),是否只需保留高不确定性段落的文本副本?这可能把磁盘放大压到个位数倍。
| 工作 | 发表年月 | 会议 / 出版 | 核心贡献 | 主要指标(来源) | 与核心工作的关系 |
|---|---|---|---|---|---|
| MemoryBank | 2023-05 / 2024 | AAAI 2024 | 艾宾浩斯遗忘曲线驱动的长期记忆 | OCR-Memory Table 1:M2W Ele Acc 43.8 / AW Avg 52.1 | 被对抗性改写:遗忘从「删除」→「可逆的分辨率退化」 |
| AWM | 2024-09 | arXiv(未见正式会议页) | 从轨迹归纳可复用 workflow | 原文摘要:M2W +24.6% rel SR, WebArena +51.1% rel SR;OCR-Memory Table 1:Ele Acc 49.1 / AW Avg 55.0 | 被综合:保留高层索引,但要求索引下挂逐字原文 |
| ACON | 2025-10 / 2026-06 (v3) | ICML 2026 | 自然语言优化的上下文压缩准则 | 原文摘要:peak token −26~54%,小模型 +46%;OCR-Memory Table 1:Ele Acc 48.2 / AW Avg 56.2(AW 三档均次优) | 被直接反驳:文本空间内压缩–保真零和,故换模态 |
| DeepSeek-OCR | 2025-10 | 技术报告 | 光学上下文压缩的可测曲线 | 原文摘要:<10× → 97% OCR 精度;20× → ~60%;100 vis-tok > GOT-OCR2.0 (256 tok) | 技术底座:backbone 直接沿用(3B,vision encoder 冻结) |
| Set-of-Mark | 2023-10 | arXiv | 离散符号锚点解锁视觉 grounding | OCR-Memory Table 2:去掉编号(仅 BBox)Ele Acc −4.6pp | 接口来源:空间 grounding → 记忆段落寻址 + 二值 logits |
| Glyph | 2025-10 | arXiv | 视觉-文本压缩 + 渲染配置遗传搜索 | 原文摘要:3–4× 压缩、~4× prefill/decode 加速、~2× SFT 加速 | 平行对照:VLM 直接推理 → 只能压 3–4×,反证「卸载重建职责」的价值 |
| ★ OCR-Memory | 2026-04 / 2026-07 | ACL 2026 Main, Long | 视觉索引 + 逐字转录的 agent 记忆 | 自报 Table 1:M2W Ele Acc 53.8 / AW Avg 58.1;Table 4:10.2–10.7×;Table 7:token −6.7×,磁盘 +81.7× | — |
How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior(ACL 2026 Main, Long)
GAM: Hierarchical Graph-based Agentic Memory for LLM Agents(ACL 2026 Main, Long, pp. 34647–34664)
MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents(ACL 2026 Main, Long, pp. 36848–36865)
Adaptive Memory Distillation for LLM Agents(ACL 2026 Main, Long)
H-MEM: Hierarchical Memory for High-Efficiency Long-Term Reasoning in LLM Agents(EACL 2026, Long)
RecMem: Recurrence-based Memory Consolidation(Findings of ACL 2026)
Amory: Building Coherent Narrative-Driven Agent Memory(EACL 2026, Long)
Governed Shared Memory for Multi-Agent LLM Systems(arXiv 2606.24535, 2026-06)
From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents(arXiv 2604.20006, 2026-04)
ρ 的解析形式论文实际上未给出,只说明是「单调老化函数」。tabzhangjx.github.io/year-archive/ 抓取失败——去重依据来自任务提示中的显式名单,而非在线归档页。