Blog posts

Research map

Reports by technology and year

Select a method to jump to its report card.

Technology area2026
Agent Memory & Security
VLM, Vision & 3D
LLM Systems & Efficient Inference
Reinforcement Learning & PEFT
Trustworthy ML & Learning Theory
AI4Science & Scientific ML

2026

Research notes

LongLive

解析 LongLive 如何以流式长视频训练、frame sink 与 KV-recache 实现可持续的长视频生成,并权衡长程质量与速度。

Research notes

AVUT

解析 AVUT 如何通过多轮文本捷径过滤构建真正依赖音视频证据的视频问答基准,并分析音频贡献的归因风险。

Research notes

TIMING

解析 TIMING 如何以连续片段随机积分路径重写时间序列归因,并审视其评价指标、完整性取舍与证据边界。

Research notes

DocVXQA

解析 DocVXQA 如何以充分性、最小性与 token interaction 生成文档问答解释,并审视答案条件化训练对解释忠实度的影响。

Research notes

QServe

解析 QServe 如何通过 W4A8KV4 量化与 GPU 内核协同设计,将解量化移出关键路径并提升大模型推理吞吐。

Research notes

TARL

解析 TARL 如何以动作熵最小化和原策略 KL 约束进行无奖励测试时策略适配,并审视环境偏移与实现一致性风险。

Research notes

Q-VDiT

解析 Q-VDiT 如何通过 token-aware 低秩补偿与全视频关系蒸馏,缓解低比特视频扩散 Transformer 的质量崩溃。

Research notes

VGA

解析 Visual Graph Arena 如何评测多模态模型从像素恢复图结构的能力,并审视布局鲁棒性、测试泄漏与感知—推理解耦问题。

Research notes

ARFT / AutoResearchEval

解析 AutoResearchEval 如何从科学 Agent 的最终结果转向过程与产物诊断,并通过 800 条轨迹揭示发现缺陷却不修订的高频失败闭环。

Research notes

Alignment Potential

解析 Alignment Potential 如何依据奖励模型与当前策略之间的教师—学生差距,为 LLM 对齐选择更有价值的偏好数据。

Research notes

KLDM

解析 KLDM 如何引入欧氏辅助速度,将周期晶体坐标上的流形扩散改写为适合生成建模的动力系统。

Research notes

LIMEFLDL

解析 LIMEFLDL 如何用受概率单纯形约束的归因矩阵,一次性解释结构化输出模型的完整标签分布。

Research notes

PARQ

解析 PARQ 如何以分段仿射正则和聚合近端更新取代直通估计器,让量化训练从连续权重收缩到真正的离散权重。

Research notes

SimbaV2

解析 SimbaV2 如何通过超球面归一化与尺度稳定的分布式价值分类,提升深度强化学习的可扩展性与训练稳定性。

Research notes

DM/FM Alignment

解析奖励加权分布如何统一扩散模型与流匹配模型的对齐,在无需针对每个奖励重训模型的情况下修正采样动力学。

Research notes

MMedPO

解析 MMedPO 如何以病灶局部扰动和临床相关性加权,让医疗多模态偏好优化同时比较回答质量与影像证据。

Research notes

HEX

解析 HEX 如何将跨块长共识引入扩散语言模型,以隐式半自回归专家实现测试时扩展,并审视其计算成本。

Research notes

DPLM-2.1

解析 DPLM-2.1 如何通过位级监督、几何偏置与结构表征对齐,改善多模态蛋白语言模型的三维结构学习。

Research notes

EARL-BO

解析 EARL-BO 如何在高斯过程世界模型中用强化学习训练多步查询策略,使高维非短视贝叶斯优化避免显式展开场景树。

Research notes

Tempo

解析 Tempo 如何将视频压缩器设计为问题感知的小型 VLM,以相关性评分动态分配全局 token 预算并提升长视频理解效率。

Research notes

GeoRA

解析 ACL 2026 Outstanding Paper GeoRA 如何依据梯度几何选择可训练参数,重新设计适用于可验证奖励强化学习的低秩适配。

Research notes

MolGraphBench

梳理 MolGraphBench 对分子回归 GNN 的系统评测,揭示层类型选择并非常量,而是能够带来显著性能差异的关键超参数。

Research notes

TIS

解析 ICLR 2026 Outstanding Paper 对 Transformer 表达简洁性的理论刻画,以及其相对其他网络架构的复杂度优势与成立条件。

Research notes

SubSpec

深度解析 SubSpec 如何将目标模型自身的低比特副本用作草稿模型,为卸载式大模型提供无损、免训练的投机解码加速。

Research notes

OCR-Memory

解析 OCR-Memory 如何把长期记忆转移到视觉表示空间,以光学上下文检索缓解文本压缩中的容量、成本与信息保真矛盾。

Research notes

Experience-Following

梳理经验跟随行为的实证研究,分析记忆管理如何让 LLM Agent 的历史经验形成自我放大回路,以及更多记忆为何未必更好。

Research notes

Agent-STAR

从五个维度解析 Agent-STAR 的长视野工具使用强化学习方案,包括课程数据、奖励设计、训练算法、泛化表现与成本权衡。

Research notes

RnG

解析 CVPR 2026 Highlight 工作 RnG 如何以统一 Transformer 和 KV-Cache 隐式表示,从部分观测完成三维建模。

Research notes

MAGMA

深入解析 MAGMA 如何用四张正交关系图组织 Agent 记忆,并审视其在 LoCoMo、LongMemEval 上的实验结果、贡献与局限。

Research notes

NEMORI

深度解析 NEMORI 如何以系统自身的预测误差作为记忆蒸馏判据,让 LLM Agent 自适应判断哪些经验值得保留。

Research notes

EMO-R3

解析 EMO-R3 如何将推理形式与推理有效性共同纳入奖励设计,以应对主观视觉任务中的强化学习训练与评估难题。

Research notes

ETM

分析大模型推理轨迹在提供可解释性的同时,如何诱发解释过度、错误信任与评估偏差,并梳理相关研究方向。

Research notes

Evo 2

深入解析 Evo 2 的长上下文基因组建模能力、训练与评测体系,以及统一生物基础模型对基因组理解和设计的意义。

Research notes

GDPT

从维度相位转移视角解析神经网络由记忆走向泛化的 Grokking 现象,并梳理相关理论、实验设定与可信性问题。

Research notes

Graph of Tokens

深度分析 Graph of Tokens 如何利用 token 间关系缓解稀疏混合专家模型的路由波动、负载均衡与扩展性问题。

Research notes

GAM

追踪 ACL 2026 工作 GAM:通过事件进度图与主题关联网络,在快速适应和长期知识稳定之间取得平衡。

Research notes

FARMA

追踪 LLM Agent 记忆系统的新攻击面:伪造推理记忆(FARMA)、相关安全风险,以及现有防御机制的演进。

Research notes

INSID3

每日 ML/AI 深度报告:解读 CVPR 2026 Oral 工作 INSID3 与 training-free in-context segmentation。

Research notes

AgeMem

Agent Memory 每日追踪:解读 ACL 2026 AgeMem,以及统一长期与短期记忆管理的 Agent 策略。