ML/AI 每日深度论文追踪 · 周二 = 视觉与多模态
把「推理该长什么样」和「推理是否成立」一起写进奖励
在主观任务上,答案对不对根本管不住推理写得对不对——所以必须把推理的结构和推理的自洽性分别做成两个可打分的奖励项,而不是继续指望 accuracy reward 顺带把推理带好。
核心论文选取。 今日周二,轮转领域为「视觉与多模态」。候选池共 27 篇(来源:CVPR 2026 Highlighted Papers、ICLR 2026 Oral 列表、NeurIPS 2025 poster 检索、arXiv cs.CV 2026-07 新提交列表、HF Trending Papers),使用 shuf -i 1-27 -n 3 抽取,首抽命中 #7 = EMO-R3,资料充足,无重抽。
资料获取的完整披露(这一段关系到你该如何信任下面每一个数字):
| 来源 | 状态 |
|---|---|
arxiv.org/html/2602.23802v1 | 可读,但抓取在 §3.4 中途截断;第 4 节(实验)、第 5 节、参考文献全部不可见。7 次不同锚点重试均失败 |
arxiv.org/pdf/2602.23802 | 返回空文本(PDF 文本抽取路径失效) |
| CVF Open Access HTML | 403(CVF 主机拒绝,非网关限制) |
| CVPR virtual poster #38026 | 可读:摘要 + 场次 + Award Candidate 标记 |
| alphaXiv overview | 仅页面框架,无正文 |
| ResearchGate 全文页 | 可读 — 第 4 节全部表格由此获得 |
唯一的重构。 表 1 中 GRPO, G=4 一行在渲染时丢失了首个单元格。我用同一套算术约束反解:由 AI=72.74、AO=53.59、A=59.97,得 EmoSetI = 74.60。该值在下文以 † 标注,表示算术重构而非直接读取。
未能获得(不猜、不补): batch size、epoch、KL 系数 β、温度、Cold-Start-Emo 样本量、λ 敏感性扫描、图 4/5 精确坐标、参考文献编号。凡涉及之处一律写「未公开 / 未能获取」。
所有链接均经实际访问确认可达(✅)或明确标注失败原因。
| 论文 | 会议主页 / 正式出版 | arXiv | Code | 数据集 / 权重 | 项目主页 |
|---|---|---|---|---|---|
| 核心:EMO-R3 | CVPR 2026 Poster #38026 ✅(Award Candidate);CVF Open Access ⚠️ 403 | abs/2602.23802v1 ✅;HTML ✅(截断) | 论文脚注给出 github.com/xiaomi-research/emo-r3,未能验证可达——组织页 ✅ 前 10 个仓库(共 46)中未见 |
未发布(未找到) | 未找到 |
| EmoVIT | CVPR 2024 CVF ✅ pp.26596–26605 | abs/2404.16670 ✅ | aimmemotion/EmoVIT ✅ | EmoSet-118K ✅(118,102 图) | 未找到 |
| Emotion-LLaMA | NeurIPS 2024 ✅ | abs/2406.11161 ✅(v1 2024-06-17;v2 2024-11-02) | ZebangCheng/Emotion-LLaMA ✅ | MERR(Drive,README 内) | 项目主页 ✅ · HF Demo ✅ |
| AffectGPT | ICML 2025 Oral ✅;PMLR v267:36993-37014 ✅ | abs/2501.16566 ✅(v1 2025-01-27) | zeroQiaoba/AffectGPT ✅(伞形仓库) | 在子目录,顶层无直链(未找到) | 未找到 |
| DeepSeekMath (GRPO) | 无同行评审出版(未找到) | abs/2402.03300 ✅(v1 2024-02-05;v2 02-06;v3 04-27) | deepseek-ai/DeepSeek-Math ✅ | — | 未找到 |
| DeepSeek-R1 | Nature 645(8081):633–638, 2025-09 ✅(PubMed 40962978 核实;nature.com ⚠️ 503) | abs/2501.12948 ✅(v2 标注 2026-01-04,Nature 后修订版) | deepseek-ai/DeepSeek-R1 ✅ | HF:R1 / R1-Zero / 6 个蒸馏版 | 未找到 |
| R1-Omni | 无同行评审出版(未找到) | abs/2503.05379 ✅(2025-03-07) | HumanMLLM/R1-Omni ✅ | R1-Omni-0.5B ✅ | 未找到 |
这不是「给 GRPO 加了两个 reward」这么简单。它是一次关于 RLVR 适用边界的显式声明:可验证奖励(RLVR)的全部合法性,建立在「推理链与最终答案之间存在紧耦合」这一在数学题上成立、在情感判断上不成立的假设之上。EMO-R3 做的是在这个假设失效的地方,人工重建一条替代性的耦合通道。
基本信息. Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye。武汉大学计算机学院 + 小米 MiLM Plus。arXiv:2602.23802v1,CVPR 2026 Poster(2026-06-05,ExHall A-F),Award Candidate。
大多数「给 X 加 RL」的论文,motivation 写的是「X 很重要但很难」。EMO-R3 不是。它给出两条具体的、可被证伪的观察,并把整篇论文挂在这两条上。
论文没有停留在定性说法上。表 1 的证据是刺眼的:Qwen2.5-VL-3B-Instruct 原始模型 AI=50.77、AO=45.71;做完 SFT 之后 AI 冲到 73.34(+22.57pp,相对 +44.46%),而 AO 塌到 29.09(−16.62pp,相对下降 36.36%)。
含义不是「SFT 泛化一般」,而是:SFT 让模型在域外比什么都不做还差 16.6 个百分点。更极端的单点:SFT 在 EmoSet 上训练后,WebEmo 上准确率是 17.75%——而 WebEmo 有 7 类,随机猜测期望是 14.29%。SFT 后的模型在这个数据集上只比抛硬币好 3.46pp。论文的解释是「固定的、预定义的标签体系把模型锁死在离散的情感类型上」——SFT 学到的不是情感,是 EmoSet 的 8 个标签词。
图 1(b) 的实验设计值得单独表扬:作者把 roll-out 的 think 段落单独拿出来重新喂给模型,问「根据这段文字,情感是什么」,再与该 roll-out 的 answer 比对。结论是二者经常不一致。
这一步是整篇论文的支点。GRPO 的全部有效性依赖一个隐含假设:只有正确的推理路径才能稳定导出正确答案,因此奖励答案 ≈ 间接奖励推理。这在 AIME 上近似成立(一步算错,答案几乎必错);在「这张图让人感到什么」上完全不成立——模型可以写一段风马牛不相及的分析,然后猜中一个高频标签。于是 accuracy reward 对推理链的约束力趋近于零,GRPO 退化成一个昂贵的、带格式约束的标签分类器。
新颖之处。 前驱 R1-Omni 在自己的 §5.2「Hallucination in Reasoning」里已经承认了这个现象,但把它列为遗留问题;DeepSeek-R1 的局限性章节也从另一方向预告了同类风险(「对缺乏可靠评估方法的任务,策略模型可能找到捷径来 hack 奖励模型」)。EMO-R3 的贡献是把这个两条谱系都指出过、但都没有处理的问题,变成一个有构造性方案的技术问题。
为什么值得解决。 2025 年以来 RLVR 的扩散速度远快于对其适用条件的检验速度——从数学扩散到代码、视频、GUI、情感。EMO-R3 实际在做一件比「提升情感识别准确率」更一般的事:给出一个当 verifiable reward 不再 verifiable 时的补救模板。情感只是最锋利的测试场,因为它的主观性最强。
EMO-R3 的论证是一条严格的四跳链,每一跳都由前一跳强制推出:
基座:GRPO 目标函数(式 1)
SET:结构化输出(式 2)
通用奖励
RER:两个自反奖励(式 3、式 4)
合成(式 5、式 6)
| 机制 / 维度 | 设计选择 | 动机 | 关键取值 |
|---|---|---|---|
| 推理结构 | 三段式 SET(触发→反射→结论) | 把评价理论流程硬编码,制造可评估接口 | 由 R_format 强制,权重 0.1 |
| 视觉接地 | s₁ + 原图 → 二元判定 | 阻止 step-1 脱离图像自说自话 | R_cons ∈ {0,1} |
| 推理—答案耦合 | s₁+s₂(去图、去结论)→ 情感分类 | 直接奖励「推理能独立推出答案」 | R_coh ∈ {0,1} |
| 反思聚合 | 算术平均 | 两信号等权,无学习参数 | (R_cons+R_coh)/2 |
| 奖励合成 | 凸组合,accuracy 主导 | 避免辅助奖励压过任务目标 | λ₁ = λ₂ = 0.1 |
| 冷启动 | Cold-Start-Emo:无 CoT 标注的轻量 SFT | 只学格式/标签体系,不学推理链 | 样本量未公开 |
| RL 算法 | 原生 GRPO(未改优化器) | 贡献定位在奖励侧而非优化侧 | G ∈ {4, 8} |
| 推理时开销 | 零(反思仅训练期) | 部署成本不变 | — |
论文明确说明,Cold-Start-Emo 不是为了注入推理能力——它使用「少量任务特定样本,不含 CoT 标注」,目的是缓解主观偏差带来的训练困难,让模型先学会输出格式、情感标签体系、表达模式三件事。
这与 DeepSeek-R1 的冷启动是不同性质的东西:R1 的冷启动 SFT 数据带长推理链,用于给 RL 一个好的起点分布;EMO-R3 的冷启动是纯格式对齐。这个区分决定了消融怎么读——表 2 中 Cold-Start-Emo 带来的 +0.34pp 应被读作「减少了格式噪声」,而非「增强了推理」。
| 项 | 取值 |
|---|---|
| 基座模型 | Qwen2.5-VL-3B-Instruct(唯一基座) |
| 硬件 | 8 × NVIDIA H20,单卡 96GB |
| 学习率 | 2.0e-6 |
| λ₁ / λ₂ | 0.1 / 0.1(无扫描) |
| 随机性控制 | 每配置跑 3 次,报告中位数(无标准差) |
| 结果读取点 | 收敛后的同一 step |
| 未公开 | batch size、epoch、max pixels、温度、β、冷启动样本量 |
| 数据集 | 类别数 | 本文使用规模 | 角色 |
|---|---|---|---|
| EmoSet | 8 | 训练/测试各 2,000 | 训练集之一 / 交叉评测 |
| Emotion6 | 6 | 训练/测试各 2,000 | 训练集之一 / 交叉评测 |
| WebEmo | 7 | 测试 2,000 | 纯域外(从不用于训练) |
评测协议是这篇论文最值得学习的地方之一。 作者不是训一次测多个基准,而是做了一个 2 训练集 × 3 评测集的交叉矩阵:分别在 EmoSet 和 Emotion6 上独立训练,各自在三个数据集上评测。于是每个方法有 6 个数字:2 个域内、4 个域外。AI = 2 个域内均值,AO = 4 个域外均值,A = 6 列总均值。这个设计让「泛化」变成了可测的量而不是修辞。
基线:LLaVA-1.5-7B(vanilla,转引)、SEPM(转引)、Qwen2.5-VL-3B-Instruct(vanilla)、SFT、GRPO、DAPO。带 * 者为转引数字。
前 3 列 = 在 EmoSet 上训练后分别在 EmoSet(域内)/Emotion6/WebEmo 上评测;中 3 列 = 在 Emotion6 上训练后在 Emotion6(域内)/EmoSet/WebEmo 上评测。上标 I = 域内。
| 方法 | G | EmoSetI | Emotion6 | WebEmo | Emotion6I | EmoSet | WebEmo | AI | AO | A |
|---|---|---|---|---|---|---|---|---|---|---|
| LLaVA1.5-7B Vanilla* | – | 52.77 | 48.32 | 25.56 | 48.32 | 52.77 | 25.56 | 50.55 | 38.05 | 42.22 |
| SEPM* | – | 56.04 | 54.21 | 42.39 | 54.21 | 56.04 | 42.39 | 55.13 | 48.76 | 50.88 |
| Qwen2.5-VL-3B Vanilla | – | 51.55 | 50.00 | 40.65 | 50.00 | 51.55 | 40.65 | 50.77 | 45.71 | 47.40 |
| SFT | – | 77.15 | 34.51 | 17.75 | 69.53 | 26.45 | 37.65 | 73.34 | 29.09 | 43.84 |
| GRPO | 4 | 74.60† | 60.10 | 49.50 | 70.88 | 59.90 | 44.85 | 72.74 | 53.59 | 59.97 |
| DAPO | 4 | 68.99 | 56.90 | 49.80 | 68.56 | 59.95 | 45.50 | 68.78 | 53.04 | 58.28 |
| EMO-R3 | 4 | 75.50 | 60.44 | 50.45 | 70.71 | 60.70 | 45.20 | 73.10 | 54.20 | 60.50 |
| GRPO | 8 | 75.45 | 57.91 | 49.40 | 69.87 | 60.30 | 42.05 | 72.66 | 52.42 | 59.16 |
| DAPO | 8 | 70.21 | 55.72 | 48.80 | 62.39 | 58.05 | 46.30 | 66.30 | 52.22 | 56.91 |
| EMO-R3 | 8 | 76.40 | 59.26 | 49.70 | 71.72 | 61.80 | 43.65 | 74.06 | 53.60 | 60.42 |
† 由行内算术反解重构(渲染缺失单元格),非直接读取。* 转引自他文。
图 A|域内 vs 域外:SFT 的崩塌与 RL 的修复
表 1 的 AI(域内均值,2 列)与 AO(域外均值,4 列)。RL 方法均取 G=8。悬浮查看具体数值。
| 对比 | AI | AO | A |
|---|---|---|---|
| Qwen2.5-VL-3B Vanilla | 50.77 | 45.71 | 47.40 |
| SFT | 73.34(+22.57pp) | 29.09(−16.62pp) | 43.84(−3.56pp) |
| 净效应 | 相对 +44.5% | 相对 −36.4% | 总均值反而低于不训练 |
做完 SFT,模型的总平均分比什么都不做还低 3.56pp。这一行数字单独就足以支撑「SFT 路线在开放情感理解上是死路」的判断。
这是本报告最该说清楚的一件事,论文自己没有量化:
| 阶段跃迁 | AO 变化 | 占总域外增益 |
|---|---|---|
| SFT (29.09) → GRPO G=8 (52.42) | +23.33pp | 95.2% |
| GRPO G=8 (52.42) → EMO-R3 G=8 (53.60) | +1.18pp | 4.8% |
| 合计 SFT → EMO-R3 | +24.51pp(相对 +84.3%) | 100% |
图 B|域外增益的归因分解:95% 来自「改用 RL」
以 SFT 的 AO = 29.09 为起点,到 EMO-R3 G=8 的 53.60 为终点,全部 +24.51pp 增益的来源拆分(单位:百分点)。
| 方法 | A @ G=4 | A @ G=8 | Δ |
|---|---|---|---|
| GRPO | 59.97 | 59.16 | −0.81 |
| DAPO | 58.28 | 56.91 | −1.37 |
| EMO-R3 | 60.50 | 60.42 | −0.08 |
| EMO-R3 − GRPO 差距 | +0.53 | +1.26 | 扩大 2.4× |
加大采样预算让两个基线都变差,而 EMO-R3 几乎持平。一个合理(但论文未验证)的解释是:当组内 roll-out 变多,二元 accuracy reward 造成的「同分组」(组内奖励全同、优势全为 0)比例上升,梯度被稀释;RER 提供的 0 / 0.5 / 1 三档信号增加了奖励分辨率,使组内优势不易退化。若该解释成立,EMO-R3 的真正价值在奖励密度而非「反思」这个叙事——这是一个可以直接实验检验的假说(见 §6 T2)。
DAPO 在 G=4 / G=8 上分别是 58.28 / 56.91,均低于 GRPO 的 59.97 / 59.16。DAPO 在数学 RL 上通常优于 GRPO,这个反转很反常且未获解释。详见 §2.7 批评 6。
| 配置 | SET | RER | EmoSetI | Emotion6 | WebEmo | A | 逐层增量 |
|---|---|---|---|---|---|---|---|
| Base(原生 GRPO) | ○ | ○ | 75.45 | 57.91 | 49.40 | 60.92 | — |
| + SET | ● | ○ | 76.02 | 58.42 | 49.20 | 61.21 | +0.29pp |
| + SET + RER(完整) | ● | ● | 76.40 | 59.26 | 49.70 | 61.79 | +0.58pp |
| 合计 | +0.95 | +1.35 | +0.30 | +0.87pp |
| 方法 | EmoSetI | Emotion6 | WebEmo | A | vs GRPO |
|---|---|---|---|---|---|
| SFT | 77.15 | 34.51 | 17.75 | 43.14 | −17.78 |
| GRPO | 75.45 | 57.91 | 49.40 | 60.92 | — |
| EMO-R3 | 76.40 | 59.26 | 49.70 | 61.79 | +0.87 |
| EMO-R3#(+ Cold-Start-Emo) | 77.81 | 58.59 | 50.00 | 62.13 | +1.21 |
冷启动带来 +0.34pp,但结构性地重新分配了收益:域内 +1.41pp(76.40→77.81),Emotion6 −0.67pp,WebEmo +0.30pp。即冷启动买的是域内精度,代价是最近的那个域外集——与「冷启动只对齐格式与标签体系」的定位吻合。
图 C|各组件的边际贡献(表 2 / 表 3,EmoSet 训练设定,G=8)
从原生 GRPO 基线 60.92 出发的逐层增量,单位百分点。每根柱下方标注累计值与该增量在 2,000 样本测试集上折合的样本数。
论文未提供 λ₁ / λ₂ 的敏感性扫描。 λ₁ = λ₂ = 0.1 是直接给定的,没有 λ₁ ∈ {0, 0.05, 0.1, 0.2, 0.3} 的曲线,也没有 β、学习率、温度的扫描。唯一存在的「超参趋势」是 roll-out 数 G ∈ {4, 8} 的两点对比。这是本文实验完整性上最明显的缺口。
论文声明「为消除随机性,每个实验跑 3 次并报告中位数」。但未报告标准差、四分位距或置信区间。
测试集被裁剪到 2,000 样本,因此单个样本的分类翻转 = 0.05pp:
| 增量 | 绝对值 | 折合样本数(/2000) |
|---|---|---|
| EMO-R3 − GRPO(A,G=8) | +1.26pp | ≈ 25 例 |
| EMO-R3 − GRPO(A,G=4) | +0.53pp | ≈ 11 例 |
| + SET(消融) | +0.29pp | ≈ 6 例 |
| + RER(消融) | +0.58pp | ≈ 12 例 |
| Cold-Start-Emo | +0.34pp | ≈ 7 例 |
消融表里的每一层增量都在 6–12 个样本的量级上。 在没有方差估计的情况下,「+SET 贡献 0.29pp」这样的陈述无法与种子噪声区分。中位数确实比均值稳健,但 3 次运行的中位数不提供任何离散度信息。
| 指标 | GRPO | EMO-R3 | 变化 |
|---|---|---|---|
| 每步训练时间 | ≈ 600 s | ≈ 750 s | 约 +25%(论文表述为 126%) |
| 推理时额外开销 | — | 0 | 反思模块不参与推理 |
| 总 GPU 小时 / 显存峰值 | 未公开 | 未公开 | — |
+25% 训练时间换 +1.26pp 总准确率。 在「跑一次就部署」的场景下划算(一次性成本、永久收益、零部署代价);需要频繁重训时需斟酌。论文未给出总 GPU 小时数,因此无法计算「每 pp 提升的 GPU 小时成本」这个更有用的指标。
不是「在情感识别上刷了 1.26pp」。真正的贡献是给出了一个当 verifiable reward 失去可验证性时的通用补救模板,它有三个可拆卸部件:
| 可复用件 | 迁移形式 | 目标场景 |
|---|---|---|
| 推理—答案解耦诊断 | 去掉输入与答案,只喂推理,看能否复原答案 | 任何非可验证域的 RLVR(法律判断、医学鉴别诊断、审美评估、内容审核) |
| SET 的「结构即接口」原则 | 用格式奖励强制槽位,每个槽位配一个 verifier | 多步骤专业判断任务 |
| RER 的自反打分 | 策略模型自评(零额外模型) | 显存受限、无法引入独立 reward model |
| 2 训练集 × 3 评测集交叉矩阵 | AI / AO 分离报告 | 所有声称「提升泛化」的工作都该这么报 |
| Cold-Start-Emo(无 CoT 的格式冷启动) | 只对齐输出格式与标签体系 | 标签体系复杂、SFT 数据昂贵的任务 |
最直接的迁移空间是「人类偏好类」任务的 RL:审美评分、内容适宜性判断、共情回复生成——这些任务都具有「答案主观、推理链与答案弱耦合」的特征,都会遭遇与情感相同的 RLVR 失效。模板可以直接套用:先做解耦诊断确认问题存在,再定义任务专属的推理结构,再为每个结构槽位设计一个自反 verifier。
更深一层:EMO-R3 暗示了一个可能被低估的方向——奖励的「分辨率」可能比奖励的「正确性」更重要。从二元 accuracy 到三档(0/0.5/1)复合奖励,在 G=8 时把差距从 +0.53 拉到 +1.26。若该观察站得住,「如何在稀疏二元奖励上增加分辨率」本身就是一个独立方向,与「反思」这个叙事无关。
需要坦白说明:这篇论文没有独立的 Limitations 章节。 结论部分只提到未来工作——「更复杂的多模态场景,包括序列或交互式任务设定」。这本身就是一个可批评点:一篇 CVPR Award Candidate 不设 limitations 章节,在当下的社区规范里是不够的。从方法描述中可提炼出作者隐含承认的三点:
批评 1|效应量与噪声无法分离(论证缺口 + 可复现性风险)
核心增量 +1.26pp(G=8)折合约 25 个样本;消融表每层增量折合 6–12 个样本。论文跑 3 次取中位数,但未报告任何离散度统计。在 RL 训练固有的高方差背景下,3 次运行的中位数不足以支撑「+SET 贡献 0.29pp、+RER 贡献 0.58pp」这种精确到小数点后两位的因果归因。这是全文最脆弱的一环:不是结论错,而是证据强度与结论精确度不匹配。
批评 2|消融做在了次优工作点上(实验设计问题)
EMO-R3 的最优总均值出现在 G=4(A=60.50),而非 G=8(60.42)。但表 2 和表 3 的全部消融都基于 G=8。即「SET 贡献 2×、RER 贡献 1×」是在次优超参点上测得的,未验证在 G=4 下是否成立。考虑到 EMO-R3 与 GRPO 的差距在两个 G 之间相差 2.4 倍,两个组件的相对贡献很可能也随 G 变化。这个交互作用完全未被探查。
批评 3|同一个「GRPO」在文中有两个数字(呈现问题)
表 1 的 GRPO(G=8) 全局 A = 59.16(6 列均值),表 2/表 3 的 GRPO 基线 A = 60.92(仅 EmoSet 训练设定的 3 列均值)。两者都正确、都自洽(已算术核验),但论文未在表题中说明列范围不同。读者若把 61.79 与 59.16 相减会得到 +2.63pp 的错误结论(真实值 +0.87pp)。
批评 4|RER 用策略模型自评,存在奖励合谋风险且无对照实验(论证缺口 + 关键竞品对比缺失)
R_cons 与 R_coh 都由 M——即正在被训练的同一个 MLLM——打分。随着策略漂移,评判者同步漂移,二者不独立。模型完全可能学会生成「自己容易判 Yes」的 step-1 文本,而非「真正描述图像」的文本。论文没有做任何对照实验来排除这一点:没有冻结参考模型打分的对照,没有第三方更强 VLM 打分的对照,也没有报告 R_cons / R_coh 在训练过程中的取值分布(若 R_cons 迅速饱和到接近 1,它就基本不提供信号)。这恰是 DeepSeek-R1 自述局限中点名的 reward hacking 情形。这是最该补的一个 head-to-head 实验。
批评 5|在最难的域外集上被基线反超(失手的子任务)
| 方法(Emotion6 训练 → WebEmo 评测) | 准确率 |
|---|---|
| DAPO (G=8) | 46.30 |
| DAPO (G=4) | 45.50 |
| EMO-R3 (G=4) | 45.20 |
| GRPO (G=4) | 44.85 |
| EMO-R3 (G=8)(主推配置) | 43.65 |
| GRPO (G=8) | 42.05 |
主推配置在这一格上是 43.65,比 DAPO(G=8) 低 2.65pp,也低于自己 G=4 的 45.20。WebEmo 是唯一从不参与训练的数据集,是最纯粹的泛化测试。论文的核心叙事是「提升泛化」,而在最能检验泛化的那一格上,主推配置输给了它宣称超越的基线。论文未讨论。
批评 6|DAPO 全面弱于 GRPO,缺乏解释(关键竞品对比的有效性问题)
DAPO 在两个 roll-out 设定下都弱于 GRPO(58.28 vs 59.97;56.91 vs 59.16)。DAPO 相对 GRPO 的改进(dynamic sampling、clip-higher、token-level loss)在数学 RL 上普遍带来正收益,这里的全面反转需要解释。一个可能机制是:DAPO 的 dynamic sampling 会过滤掉组内奖励完全相同的样本组,而在二元离散奖励下这类组占比极高,导致有效批量骤降。但论文既未诊断也未说明是否为 DAPO 单独调参。在缺乏解释的情况下,DAPO 这一行更像未调优的稻草人。
批评 7|数据缩水至 2,000 使其与领域内最强方法不可比(实验设计 + 关键竞品缺失)
EmoSet 原始规模 118,102 图,本文裁到训练 2,000 / 测试 2,000。作为对照,EmoVIT(CVPR 2024)在同一数据集上报告 83.36%(全量设定),而本文最高的 EmoSet 分数是 77.81%。这两个数字不可直接比较,但论文的基线表里完全没有 EmoVIT、Emotion-LLaMA、AffectGPT 这三个情感 MLLM 专用模型,只有通用 VLM 和 RL 算法变体。读者无从判断 EMO-R3 相对于该领域最强专用方法处在什么位置。
批评 8|Motivation 的诊断指标没有出现在结果里(论证闭环缺口)
论文用图 1(b) 的「think 推出的情感 ≠ final answer」立论,这是整篇论文的支点。但训练之后这个不一致率降到了多少?论文没有报告。 全部结果都用分类准确率衡量。这意味着论文的核心主张——「我们改善了推理与答案的耦合」——从未被直接测量,只被间接的准确率提升所暗示。这是一个用一张表就能补上的缺口,它的缺席让 +1.26pp 到底来自「更好的推理」还是「更密的奖励」变得无法区分。
批评 9|超参敏感性完全缺失(可复现性风险)
λ₁ = λ₂ = 0.1 无扫描、无来源说明。R_overall 是凸组合,accuracy 权重 0.8。在只有 +1.26pp 增量的情况下,无法排除该增量位于一个尖锐最优点上(即针对基准过拟合调参)。补一条 λ₁ ∈ {0, 0.05, 0.1, 0.2, 0.3} 的曲线成本极低(5 个点),却能把「方法稳健」从声称变成证据。
批评 10|结论建立在单一 3B 基座上(外部效度)
全部实验只用 Qwen2.5-VL-3B-Instruct。双向不确定性:(a) SET 的三段式结构对 3B 可能是必要脚手架,对 7B/32B 可能是多余约束——更强的模型本来就会自发结构化推理;(b) RER 的全部有效性依赖基座的自我评估能力,3B 的判别能力较弱,这既可能低估收益(判别噪声掩盖信号)也可能高估收益(弱模型上外部约束的边际价值更高)。没有第二个基座,无法判断结论是关于方法的还是关于 3B 的。
GRPO, G=4 的 EmoSetI = 74.60 是算术反解值,不是读出来的。github.com/xiaomi-research/emo-r3 是否已公开,因此无法核实任何实现细节。EMO-R3 站在两条互不相交、最终在它这里汇合的谱系上。下面按「问题传递链」而非平行罗列的方式展开。
① 解决了什么问题。 2024 年初视觉指令微调已成熟,但没有情感专用的指令数据——通用 VLM 在情感任务上接近随机。EmoVIT 的核心贡献是一条 GPT-4 辅助的数据合成流水线,然后在 InstructBLIP 基座上做指令微调。关键技术选择是把情感理解转化为一个数据问题。头条结果:EmoSet 准确率 83.36%,对比 BLIP2 46.79%、LLaVA 44.03%、InstructBLIP 42.20%、Flamingo 29.59%,且只用约一半训练数据。
② 遗留了什么缺口。 83.36% 是在闭集、单数据集、静态图像上取得的。纯 SFT:无推理链、无策略学习、无跨数据集泛化验证。论文无 limitations 章节,但结构性缺口清楚:(a) 标签体系被数据集固定,(b) GPT-4 标注质量构成天花板,(c) 完全没有「模型为什么这么判断」的可解释输出。最关键的是它从未在其他情感数据集上做过零样本评测——「83.36%」到底是学会了情感还是学会了 EmoSet,无从判断。
③ 核心论文如何回应。 EMO-R3 把这个未被检验的问题直接做成了实验设计。它的 2×3 交叉矩阵中,SFT 一行就是对 EmoVIT 路线的定量证伪:域内 73.34、域外 29.09。EMO-R3 用一个实验协议回答了 EmoVIT 从未被问过的问题,答案是「学会的是数据集」。
④ 关键设计的传递。 EmoVIT 的正向遗产是 EmoSet 数据集(118K,8 类)——EMO-R3 的主训练集与主评测集就是它(裁剪到 2,000)。此外「情感任务需要专用适配,通用 VLM 直接用效果很差」这一判断被 EMO-R3 继承并量化(Qwen2.5-VL-3B vanilla 的 AI 仅 50.77)。
① 解决了什么问题。 单模态方法无法覆盖真实世界的情感复杂度,当时的 MLLM 既不能整合音频也无法识别微表情。两件贡献:MERR 数据集(28,618 粗粒度 + 4,487 细粒度,约 33K)和一个把音频/视觉/文本分别经情感专用编码器送入指令微调 LLaMA 的模型。头条结果:MER2023-SEMI F1 = 0.9036(A+V+T,表 3);EMER Clue Overlap 7.83 / Label Overlap 6.25(表 1);DFEW 零样本 UAR 45.59 / WAR 59.37(表 2)。
② 遗留了什么缺口。 作者自述:「Neutral」类别在所有类别中得分最低,因为「当角色情感为中性时,面部和音频线索较弱,使自动标注更困难」——即支撑 MERR 的自动标注流水线恰恰在线索微弱处失效。更结构性的缺口是:模态越加越多、数据越做越大,但范式没变,仍是「拟合一个标注分布」。当标注本身是主观的、有噪声的,这个拟合就有不可跨越的上界。
③ 核心论文如何回应。 回应是范式层面的:不再拟合分布,而是优化策略。更微妙的呼应是:Emotion-LLaMA 在「线索微弱」时失效,而 EMO-R3 的 SET 第一步恰恰是显式地枚举情感触发物——把「找线索」从隐式表征变成了显式的、可被 R_cons 打分的文本步骤。
④ 关键设计的传递。 迁移形式是:从「用专用编码器隐式提取情感线索」到「用结构化推理步骤显式陈述情感线索」。前者的线索藏在权重里无法检验,后者的线索是一段可以被反问「这段文字能描述这张图吗」的自然语言。这是本条演进链上最重要的表征形式转变。
① 解决了什么问题。 明确提出要把 MER 从「朴素的判别式任务」推向「复杂的情感理解」。三项贡献:MER-Caption / MER-Caption+(115K 样本,超过 2,000 个细粒度情感类别)、采用 pre-fusion 的 AffectGPT 模型、MER-UniBench 统一基准。头条结果:MER-UniBench 平均分 74.77(A+V+T),较此前 MLLM 提升约 9%(表 2);表 3 数据消融显示,用 MER-Caption+ 训练得 74.77,用 MERR-Fine(Emotion-LLaMA 的数据集)训练得 64.55,相差 10.2pp。
② 遗留了什么缺口。 自述三条:仅限单人视频;MER-Caption+ 的模型生成标注「即便经过过滤仍可能包含不准确描述」;以及最要命的——基本情感识别缺乏细粒度参考标签,无法公正地给一个「非标准但正确」的情感预测打分。第三条正是把标签体系从 8 类扩到 2,000+ 类后必然遇到的困境:类别越细,「正确答案」越不唯一,基于精确匹配的评测就越失效。
③ 核心论文如何回应。 这是整条链上最微妙的一次传递。AffectGPT 通过扩大标签空间逼近情感的真实复杂度,结果撞上「评测无法定义正确性」的墙。EMO-R3 走了相反方向:保持标签空间小(6–8 类),转而扩大「什么算好」的定义——从「答案对」扩展到「答案对 + 推理接地 + 推理自洽」。AffectGPT 增加的是输出空间的分辨率,EMO-R3 增加的是奖励信号的分辨率。
④ 关键设计的传递。 MER-UniBench 确立了「评测必须同时覆盖分类指标与自由文本输出质量」的规范。EMO-R3 的 RER 可以被看作把这个规范内化进训练循环:R_coh 本质上就是一个在线的、自动化的「自由文本输出质量」评分器。
① 解决了什么问题。 DeepSeekMath 在 120B 数学 token 上继续预训练 DeepSeek-Coder-Base-v1.5 7B,并首次提出 GRPO:丢弃 value/critic 网络、用组内相对分数估计基线的 PPO 变体。头条结果:MATH 51.7%(无工具、无投票),64 样本自洽投票下 60.9%。DeepSeek-R1 则证明推理能力可以从纯 RL、零人工推理轨迹中涌现(R1-Zero 无任何 SFT 冷启动),自我反思、验证、动态策略调整均为涌现行为。头条结果:AIME 2024 pass@1 = 79.8%(R1)/ 77.9% pass@1、86.7% cons@16(R1-Zero)。
② 遗留了什么缺口。 GRPO 的设计与验证完全在可验证、单一正确答案的数学推理上完成,不携带任何面向主观、多有效答案、或分级正确性领域的机制。DeepSeek-R1 的局限性章节从另一方向预告了同样的问题:「对于缺乏可靠评估方法的任务,策略模型可能找到捷径来 hack 奖励模型」,并呼吁「未来研究应聚焦于为难以验证的问题定义和精炼奖励结构」。情感恰恰就是这样一个领域。
③ 核心论文如何回应。 EMO-R3 整篇论文可以被读作对 DeepSeek-R1 这句自述局限的一次正面作答:它的诊断(图 1(b))证明「捷径」在情感任务上确实存在且普遍;它的方案(RER)正是 R1 呼吁的「为难以验证的问题精炼奖励结构」。
④ 关键设计的传递。 EMO-R3 原样保留了 GRPO 的优化侧(式 1 未作任何修改),只在奖励侧做手术。这是刻意且正确的定位:把贡献隔离在一个正交维度上,使其可叠加到任何后续 GRPO 变体(DAPO、GSPO 等)。代价是它继承了 GRPO 的全部固有问题——包括二元奖励下组内优势退化(我怀疑这正是 G=8 下基线变差的原因)。
① 解决了什么问题。 通义实验室 / 阿里的工作,首次把 RLVR 应用于全模态 LLM 的情感识别,同时瞄准推理能力、识别准确率、泛化性三个目标。
| 模型 | DFEW WAR / UAR | MAFW WAR / UAR | RAVDESS (OOD) WAR / UAR |
|---|---|---|---|
| HumanOmni-0.5B | 22.64 / 19.44 | 20.18 / 13.52 | 7.33 / 9.38 |
| EMER-SFT | 38.66 / 35.31 | 38.39 / 28.02 | 29.00 / 27.19 |
| MAFW-DFEW-SFT | 60.23 / 44.39 | 50.44 / 30.39 | 29.33 / 30.75 |
| R1-Omni | 65.83 / 56.27 | 57.68 / 40.04 | 43.00 / 44.69 |
标志性数字是域外的 RAVDESS WAR 43.00 vs 最强 SFT 基线 29.33(+13.67pp)。
② 遗留了什么缺口。 R1-Omni 有明确的 §5 Limitations,三条命名的失败模式:5.1 字幕识别不准、5.2 推理中的幻觉(「生成的推理不反映实际视频内容 / 决策过程」)、5.3 音频线索利用不足。§5.2 就是 EMO-R3 的整个立论基础——前驱工作亲口承认自己生成的推理与它所推理的内容不可靠地对应。
③ 核心论文如何回应。 EMO-R3 的批评措辞非常直接:R1-Omni「验证了 RL 在主观情感推理中的潜力」,但「GRPO 的应用仍然相当表面……未处理其与主观情感推理的内在不匹配」。RER 就是为闭合 §5.2 而存在:R_cons 针对「推理不反映内容」,R_coh 针对「推理不反映决策」。一个自述缺口,两个奖励项,一一对应。
④ 关键设计的传递。 R1-Omni 传给 EMO-R3 的是「RLVR 在情感上的域外增益是真实的」这一实证前提(RAVDESS +13.67pp),EMO-R3 在自己的实验里独立复现了同一现象(AO:SFT 29.09 → GRPO 52.42,+23.33pp)。两者评测语境差异很大(视频+音频+文本 / 0.5B 基座 vs 静态图像 / 3B 基座),因此该结论在两个相当不同的设定下各被验证一次,可信度反而更高。
主线:情感判断的「正确性」由谁定义——从数据集,到标注者,到模型自己。
| 阶段 | 正确性的来源 | 代表工作 | 该阶段的天花板 |
|---|---|---|---|
| 闭集分类 | 数据集的 8 个标签 | EmoVIT | 学到的是标签词,不是情感(EMO-R3 实测 AO 29.09) |
| 多模态扩容 | 更多模态 + 更多标注 | Emotion-LLaMA | 标注在线索微弱处失效(Neutral 类最差) |
| 开放词表 | 2,000+ 细粒度类别 | AffectGPT | 类别越细,精确匹配式评测越无效(自述) |
| 可验证 RL | 规则化奖励 | GRPO / R1 / R1-Omni | 主观任务上「可验证」不再可验证(R1 自述 reward hacking) |
| 自反 RL | 模型对自己推理的再评估 | EMO-R3 | 评判者与被评者不独立(尚未被检验) |
转折一:从确定性系统到自适应系统(2025.03,R1-Omni)。 在此之前,情感 MLLM 的行为完全由训练数据分布决定;引入 RL 之后,行为由奖励函数的形状决定。定量证据是 AO:29.09 → 52.42(+23.33pp,占全部域外增益的 95.2%)。这是整条链上唯一的一次相变。
转折二:从「奖励结果」到「奖励过程」(2026.02,EMO-R3)。 RLVR 的原始形态只奖励最终答案;EMO-R3 把奖励的作用点前移到推理过程本身。定量效应要小得多(+1.18pp on AO,占 4.8%),但它改变的是方法的适用边界而非性能数字——它让 RL 可以进入那些「结果无法验证」的领域。
早期(2024 上):准确率。 EmoVIT 的 83.36% 是一个纯粹的 leaderboard 数字。
中期(2024 下 – 2025):覆盖度。 模态数、类别数、数据规模成为核心竞争维度(33K → 115K / 2000+ 类)。
当前(2025 下 – 2026):泛化与可解释。 EMO-R3 的整个评测协议围绕 AI / AO 分离设计,而它的两个新机制都不直接提升准确率,而是提升「推理是否可信」。
| 工作 | 年月 | 会议 / 出版 | 核心贡献 | 主要指标(来源) | 与核心工作的关系 |
|---|---|---|---|---|---|
| EmoVIT | 2024.06 | CVPR 2024 | GPT-4 合成情感视觉指令数据 + SFT | EmoSet Acc 83.36%(主结果表;BLIP2 46.79) | 提供 EmoSet;其 SFT 范式被 EMO-R3 定量证伪(AO 29.09) |
| Emotion-LLaMA | 2024.12 | NeurIPS 2024 | 模态专用情感编码器 + MERR(33K) | MER2023-SEMI F1 0.9036(表 3);DFEW 零样本 UAR 45.59 / WAR 59.37(表 2) | 「隐式线索提取」→ EMO-R3 的「显式线索陈述(SET step-1)」 |
| AffectGPT | 2025.07 | ICML 2025 Oral | MER-Caption+(115K,>2000 类)+ MER-UniBench | MER-UniBench 74.77(表 2,+9%);数据消融 74.77 vs 64.55(表 3) | 扩大输出空间分辨率 vs. EMO-R3 扩大奖励分辨率 |
| DeepSeekMath (GRPO) | 2024.02 | arXiv(无出版) | GRPO:去 critic 的组相对策略优化 | MATH 51.7%(无工具)/ 60.9%(cons@64) | EMO-R3 原样沿用其优化侧(式 1 未改) |
| DeepSeek-R1 | 2025.09 | Nature 645:633–638 | 纯 RL 涌现推理(R1-Zero 无 SFT) | AIME 2024 pass@1 79.8%(图 1a / 表 3) | 其自述的 reward hacking 风险 = EMO-R3 的问题定义 |
| R1-Omni | 2025.03 | arXiv(无出版) | 首次将 RLVR 用于全模态情感识别 | RAVDESS OOD WAR 43.00 vs SFT 29.33(+13.67pp) | 其 §5.2「推理幻觉」= EMO-R3 的直接靶点 |
| EMO-R3 | 2026.02 | CVPR 2026(Award Cand.) | SET + RER | A 60.42 vs GRPO 59.16(+1.26pp);AO 53.60 vs SFT 29.09(+84.3%) | ★ 两条谱系的汇聚点 |
(T1)自反奖励的不动点存在性与合谋边界。 RER 用策略模型评价自己的输出,构成自指系统。具体问题:在什么条件下存在稳定不动点,而不是收敛到「模型生成自己必然判 Yes 的退化文本」?可操作的形式化:把 R_cons 视作 π_θ 的泛函,考察 E[R_cons] 随训练步数的轨迹——若单调饱和至 1 而任务准确率不动,即为合谋证据。低门槛高价值:只需记录训练期的奖励分量分布,成本近乎为零,论文却没做。
(T2)离散奖励下组内优势退化的定量刻画。 GRPO 的 Â_i = (r_i−μ)/σ 在组内奖励全同时退化。具体问题:给定二元奖励成功率 p 与组大小 G,「退化组」比例为 pG + (1−p)G;引入 K 档奖励后这个比例如何下降?可验证的预测:本文 G=4→8 时基线变差(GRPO −0.81pp,DAPO −1.37pp)而 EMO-R3 几乎不变(−0.08pp),恰与「RER 把 2 档变成 3 档、降低退化组比例」的预测方向一致。这是一个可以用纯计数实验证实或证伪的假说,且它给出了与「反思」完全不同的机制解释。
(T3)「结构化推理」的信息论代价。 SET 把策略输出分布约束到一个子流形上。具体问题:损失了多少熵?在什么任务上这个熵有用(创造性)、什么任务上是噪声(判断性)?表 3 给了提示:单加 SET 时 WebEmo 下降 0.20pp——最远的域外集最先受害。可设计的实验:固定 SET,扫描 λ₂(格式奖励权重),观察 OOD 性能与推理多样性(distinct-n)的 trade-off 曲线。
(E1)把 motivation 的诊断指标做成标准报告项。 具体空白:本文用「think 推出的情感 ≠ answer」立论却从不报告训练后的该指标。建议实验:在训练前 / GRPO 后 / EMO-R3 后三个检查点,各采样 1,000 个 roll-out,报告 think-answer 一致率。若 EMO-R3 的一致率显著高于 GRPO 但准确率只高 1.26pp,则本文的贡献应被重新定位为「可解释性」而非「准确率」。这个实验能改变论文的定位,成本却只有一次推理。
(E2)RER 评判者独立性的 head-to-head 实验。 建议实验:在相同硬件预算、相同数据预算下,对比三种评判者——(a) 训练中的策略模型(本文)、(b) 冻结的初始模型、(c) 独立的更强 VLM。若 (a) 与 (b) 相近,说明合谋风险小;若 (a) 显著优于 (b) 但推理质量(E1 的指标)没有同步改善,则强烈提示合谋。这是我认为最该做的一个实验。
(E3)跨基座规模的外部效度验证。 建议实验:在 3B / 7B / 32B 三档上重复主实验,检验 EMO-R3 − GRPO 的差距是否随规模衰减。假说:SET 的收益随规模衰减(大模型自发结构化),RER 的收益随规模上升(大模型自评更可靠)。若成立,说明两个组件应解耦部署而非绑定。
(E4)在线 / 流式情感理解的基准缺失。 现有基准全是静态离线单图分类。真实应用(陪伴机器人、内容审核、心理支持)中情感是随时间演化的。需要什么:一个流式基准,输入是时序片段,评测指标不是终点准确率而是判断修正的及时性(何时改变判断、改得对不对)。论文结论自己提到「序列或交互式任务设定」,但没有基准就无法评估。
(E5)成本-收益的可比报告。 本文报了「每步 +25%」但没报总 GPU 小时。建议规范:所有 RL-for-VLM 工作报告「每提升 1pp 所需的 GPU 小时」。以本文为例,边际成本是 0.25 × N × 600s × 8 GPU·s 换 1.26pp——但 N 未公开,算不出来。
(N1)把「解耦诊断」变成 RLVR 的准入检查。 具体主张:任何要把 RLVR 用到新领域的工作,都应先跑一遍 EMO-R3 图 1(b) 式的诊断——去掉输入与答案,只留推理,看能否复原答案。若一致率低于阈值(比如 70%),说明 accuracy reward 对推理无约束力,直接套用 GRPO 不合适。这可以成为一个社区规范。 值得先做的实证工作:在数学、代码、法律、医学诊断、审美评分五个领域上分别测这个一致率,画出「RLVR 适用性光谱」。
(N2)多模态自反奖励的对齐目标。 本文的 RER 只用了图像-文本一致性。具体问题:扩展到音频/视频后,R_cons 应该是「每个模态各判一次取平均」还是「跨模态联合判定」?前者可能奖励模态冗余,后者可能无法定位是哪个模态出了问题。R1-Omni 自述的 §5.3「音频线索利用不足」提示前者是危险的。
(N3)主观任务上「正确答案」的重新定义。 AffectGPT 已经撞上这堵墙。具体问题:能否用 RER 式的自反机制替代 accuracy reward,而不只是补充它?即令 λ₁ → 1、R_acc 权重 → 0,模型完全靠「推理自洽」学习。这在有 ground truth 时是浪费,但在没有 ground truth 的开放情感理解上可能是唯一出路。本文 λ₁ 只取 0.1 且没有扫描,该方向完全未被探索。
(N4)情感理解的伦理边界。 让模型更准确地推断人的情感,直接触及情感识别技术的伦理争议(招聘、教育、执法场景)。具体的技术问题:能否在 SET 的第三步引入弃权选项(「证据不足以判断」),并把弃权率作为独立报告指标?当前所有基准都强制模型输出一个类别,这在结构上鼓励了过度自信。
来自本期候选池(未被抽中展开)。CVPR 2026 条目标题来自官方 Highlighted Papers 页面(已验证可达);arXiv 条目 ID 来自 Hugging Face Trending Papers 列表,未逐一 fetch 验证正文,请以 arXiv 页面为准。
A Mixed Diet Makes DINO An Omnivorous Vision Encoder(2026.06,CVPR 2026 Highlight)
自监督视觉编码器的数据配方问题——在 VLM 大行其道的当下,重新回答「纯视觉表征还能不能靠数据混合再往前推一步」。本期候选池里少数不依赖语言监督的表征学习工作。
CVPR 2026 Highlights(arXiv:未找到)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM(2026,ICLR 2026 Oral)
把文本、音频、视频统一到一个表征空间并支持跨模态检索。与 EMO-R3 互补:一个处理「如何在单一模态上做可信推理」,一个处理「如何把多模态放进同一空间」。
ICLR 2026 Oral 列表(arXiv:未找到)
Vision-centric Token Compression in Large Language Model(2025.12,NeurIPS 2025)
视觉 token 压缩,直接关系到长上下文 VLM 的可用性。有正式 proceedings 与 OpenReview 双份记录,可复现性好。
OpenReview · NeurIPS PDF · Poster
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments(2026.06,CVPR 2026 Oral)
在多智能体环境中评测 VLM 的策略能力——与 EMO-R3 同属「给 VLM 找一个准确率之外的评价维度」这一潮流。
项目主页
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward(2026.05,arXiv 2605.12495)
与 EMO-R3 高度相关:同样在处理「可验证奖励在多模态上不够用」的问题,但走的是「把奖励分解」而非「自反打分」的路线。想深入本期主题的读者应该把这两篇对读。
arXiv
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture(2026.05,arXiv 2605.12500)
理解与生成统一架构,HF Daily Papers 上 140 upvotes,本期候选池中社区讨论度最高的一篇。
arXiv
MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction(2026.04,arXiv 2604.27393)
端侧全双工全模态交互。与 §6.2 的 E4(流式情感理解基准)直接相关——真正的实时交互场景正是当前情感基准最缺的部分。
arXiv
HumanNet: Scaling Human-centric Video Learning to One Million Hours(2026.05,arXiv 2605.06747)
百万小时级以人为中心的视频学习。若情感理解要走向视频与序列设定,这类规模的人本视频预训练是绕不开的基础设施。
arXiv
| 维度 | 结论 |
|---|---|
| 核心论文 | EMO-R3(CVPR 2026 Award Candidate,武汉大学 + 小米 MiLM Plus) |
| 一句话 | 在主观任务上答案管不住推理,所以要把「推理该长什么样」与「推理是否成立」分别做成奖励 |
| 最强证据 | SFT 让域外准确率从 45.71 掉到 29.09(−16.62pp),总均值比不训练还低 3.56pp |
| 最该记住的比例 | 域外增益的 95.2% 来自「换成 RL」,只有 4.8% 来自本文的两个新机制 |
| 方法收益 | A 60.42 vs GRPO 59.16(+1.26pp);消融中 RER 贡献是 SET 的 2.0 倍 |
| 成本 | 训练每步 +25%;推理零开销 |
| 最大软肋 | 增量折合约 25 个测试样本,却无标准差 / 置信区间;RER 自评无独立性对照 |
| 最该复用的东西 | 不是 SET 也不是 RER,而是 AI / AO 分离的 2×3 交叉评测协议 |
| 最该补的实验 | 训练前后的 think-answer 一致率(motivation 的指标从未出现在结果里) |