AgeMem
Published:
Agent Memory 每日追踪:解读 ACL 2026 AgeMem,以及统一长期与短期记忆管理的 Agent 策略。
Published:
Agent Memory 每日追踪:解读 ACL 2026 AgeMem,以及统一长期与短期记忆管理的 Agent 策略。
Published:
追踪 LLM Agent 记忆系统的新攻击面:伪造推理记忆(FARMA)、相关安全风险,以及现有防御机制的演进。
Published:
追踪 ACL 2026 工作 GAM:通过事件进度图与主题关联网络,在快速适应和长期知识稳定之间取得平衡。
Published:
解析 EMO-R3 如何将推理形式与推理有效性共同纳入奖励设计,以应对主观视觉任务中的强化学习训练与评估难题。
Published:
深度解析 NEMORI 如何以系统自身的预测误差作为记忆蒸馏判据,让 LLM Agent 自适应判断哪些经验值得保留。
Published:
深入解析 MAGMA 如何用四张正交关系图组织 Agent 记忆,并审视其在 LoCoMo、LongMemEval 上的实验结果、贡献与局限。
Published:
解析 CVPR 2026 Highlight 工作 RnG 如何以统一 Transformer 和 KV-Cache 隐式表示,从部分观测完成三维建模。
Published:
从五个维度解析 Agent-STAR 的长视野工具使用强化学习方案,包括课程数据、奖励设计、训练算法、泛化表现与成本权衡。
Published:
梳理经验跟随行为的实证研究,分析记忆管理如何让 LLM Agent 的历史经验形成自我放大回路,以及更多记忆为何未必更好。
Published:
解析 OCR-Memory 如何把长期记忆转移到视觉表示空间,以光学上下文检索缓解文本压缩中的容量、成本与信息保真矛盾。
Published:
深度解析 SubSpec 如何将目标模型自身的低比特副本用作草稿模型,为卸载式大模型提供无损、免训练的投机解码加速。
Published:
解析 ICLR 2026 Outstanding Paper 对 Transformer 表达简洁性的理论刻画,以及其相对其他网络架构的复杂度优势与成立条件。
Published:
梳理 MolGraphBench 对分子回归 GNN 的系统评测,揭示层类型选择并非常量,而是能够带来显著性能差异的关键超参数。
Published:
解析 ACL 2026 Outstanding Paper GeoRA 如何依据梯度几何选择可训练参数,重新设计适用于可验证奖励强化学习的低秩适配。
Published:
解析 Tempo 如何将视频压缩器设计为问题感知的小型 VLM,以相关性评分动态分配全局 token 预算并提升长视频理解效率。
Published:
解析 EARL-BO 如何在高斯过程世界模型中用强化学习训练多步查询策略,使高维非短视贝叶斯优化避免显式展开场景树。
Published:
解析 DPLM-2.1 如何通过位级监督、几何偏置与结构表征对齐,改善多模态蛋白语言模型的三维结构学习。
Published:
解析 HEX 如何将跨块长共识引入扩散语言模型,以隐式半自回归专家实现测试时扩展,并审视其计算成本。
Published:
解析 MMedPO 如何以病灶局部扰动和临床相关性加权,让医疗多模态偏好优化同时比较回答质量与影像证据。
Published:
解析奖励加权分布如何统一扩散模型与流匹配模型的对齐,在无需针对每个奖励重训模型的情况下修正采样动力学。
Published:
解析 SimbaV2 如何通过超球面归一化与尺度稳定的分布式价值分类,提升深度强化学习的可扩展性与训练稳定性。
Published:
解析 PARQ 如何以分段仿射正则和聚合近端更新取代直通估计器,让量化训练从连续权重收缩到真正的离散权重。
Published:
解析 LIMEFLDL 如何用受概率单纯形约束的归因矩阵,一次性解释结构化输出模型的完整标签分布。
Published:
解析 KLDM 如何引入欧氏辅助速度,将周期晶体坐标上的流形扩散改写为适合生成建模的动力系统。
Published:
解析 Alignment Potential 如何依据奖励模型与当前策略之间的教师—学生差距,为 LLM 对齐选择更有价值的偏好数据。
Published:
解析 AutoResearchEval 如何从科学 Agent 的最终结果转向过程与产物诊断,并通过 800 条轨迹揭示发现缺陷却不修订的高频失败闭环。
Published:
解析 Visual Graph Arena 如何评测多模态模型从像素恢复图结构的能力,并审视布局鲁棒性、测试泄漏与感知—推理解耦问题。
Published:
解析 Q-VDiT 如何通过 token-aware 低秩补偿与全视频关系蒸馏,缓解低比特视频扩散 Transformer 的质量崩溃。
Published:
解析 TARL 如何以动作熵最小化和原策略 KL 约束进行无奖励测试时策略适配,并审视环境偏移与实现一致性风险。
Published:
解析 QServe 如何通过 W4A8KV4 量化与 GPU 内核协同设计,将解量化移出关键路径并提升大模型推理吞吐。
Published:
解析 DocVXQA 如何以充分性、最小性与 token interaction 生成文档问答解释,并审视答案条件化训练对解释忠实度的影响。
Published:
解析 TIMING 如何以连续片段随机积分路径重写时间序列归因,并审视其评价指标、完整性取舍与证据边界。
Published:
解析 AVUT 如何通过多轮文本捷径过滤构建真正依赖音视频证据的视频问答基准,并分析音频贡献的归因风险。
Published:
解析 LongLive 如何以流式长视频训练、frame sink 与 KV-recache 实现可持续的长视频生成,并权衡长程质量与速度。
About me
Published:
每日 ML/AI 深度报告:解读 CVPR 2026 Oral 工作 INSID3 与 training-free in-context segmentation。
Published:
深度分析 Graph of Tokens 如何利用 token 间关系缓解稀疏混合专家模型的路由波动、负载均衡与扩展性问题。
Published:
从维度相位转移视角解析神经网络由记忆走向泛化的 Grokking 现象,并梳理相关理论、实验设定与可信性问题。
Published:
深入解析 Evo 2 的长上下文基因组建模能力、训练与评测体系,以及统一生物基础模型对基因组理解和设计的意义。
Published:
分析大模型推理轨迹在提供可解释性的同时,如何诱发解释过度、错误信任与评估偏差,并梳理相关研究方向。