ML/AI 每日深度论文追踪:HEX
日期:2026-08-17 领域:LLM / NLP(推理与 test-time scaling)
核心论文:Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
作者:Jihoon Lee, Hoyeon Moon, Kevin Zhai, Arun Kumar Chithanar, Anit Kumar Sahu, Soummya Kar, Chul Lee, Souradip Chakraborty, Amrit Singh Bedi
出版:ICLR 2026 Conference Paper;arXiv:2510.05040v1,2025-10-06
一句话定位:扩散语言模型的推理能力并非只由权重决定;HEX 把“以何种顺序揭开 token”视作一组潜在半自回归专家,用跨块长共识替代单一路径的高置信度贪心,从而用额外推理计算解锁已存在但被错误调度压住的能力。
0. 链接验证表
以下 URL 均在 2026-08-17 实际访问。版本日期以 arXiv submission history 为准;“未公开”表示论文或作者主页未给出官方资源,而非断言互联网上不存在第三方实现。
| 论文 | 会议主页 / 正式论文 | arXiv(具体版本) | Code 仓库 | 数据集 / 权重 | 项目主页 / 视频 |
|---|---|---|---|---|---|
| HEX(核心) | ICLR 2026 PDF / OpenReview | 2510.05040v1,2025-10-06 | junos-ai-org/Test-Time-Scaling | LLaDA-8B-Instruct 权重;评测集沿用公开 GSM8K/MATH/ARC-C/TruthfulQA | 独立项目页/视频未找到;HF Papers |
| Train for the Worst, Plan for the Best | ICML 2025 OpenReview | 2502.06768v3,2025-08-19 | 官方代码未找到(第三方实现不列作官方) | 论文中的 Sudoku 等合成任务;权重未公开 | 作者主页条目;视频未找到 |
| Large Language Diffusion Models(LLaDA) | ICLR 2025 DeLTa Workshop Oral | 2502.09992v3,2025-10-18 | 官方项目与代码入口 | LLaDA-8B-Instruct | 项目主页;视频未找到 |
| d1: Scaling Reasoning in Diffusion LLMs via RL | NeurIPS 2025 | 2504.12216v2,2025-06-03 | 项目页代码入口 | d1 模型入口 | 项目主页;视频未找到 |
| Self-Consistency Improves Chain of Thought Reasoning | ICLR 2023 OpenReview | 2203.11171v4,2023-03-07 | 官方代码未找到 | 使用公开 GSM8K、SVAMP、AQuA、StrategyQA、ARC-C 等;权重未公开 | 独立项目页/视频未找到 |
1. 选题过程与候选池
运行日为星期一,因此限定在 LLM/NLP 的推理、test-time
scaling、post-training 与评测。去重索引显示最近 14 天已覆盖
EPG、EARL-BO、DuoAttention、SAE canonicalization 与
DPLM2.1;它们与本期“扩散语言模型的推理解码调度”不重复。候选来自 ICLR
2026、NeurIPS 2025、ACL 2026 官方页面或
OpenReview/arXiv,按“正式主会优先、近 12 个月优先”筛选,共 33 篇。执行
shuf -i 1-33 -n 1 得到
5;资料完整,无重抽。
| # | 候选工作 | 出版/状态 |
|---|---|---|
| 1 | Plan and Budget: Effective and Efficient Test-Time Scaling | ICLR 2026 |
| 2 | Post-training LLMs for Diverse High-Quality Reasoning Traces | ICLR 2026 |
| 3 | ConfRAG: Confidence-Guided Retrieval-Augmented Generation | ACL 2026 |
| 4 | Diversity-Aware Policy Optimization for LLM Reasoning | NeurIPS 2025 |
| 5 | Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts | ICLR 2026;抽中 |
| 6 | Towards a Unified View of LLM Post-Training | ICLR 2026 |
| 7 | METER: A Benchmark for Causal Reasoning | ACL 2026 |
| 8 | Advancing LLM Reasoning Across All Domains | NeurIPS 2025 |
| 9 | Efficient Test-time Scaling via Iterative Deepening | ICLR 2026 |
| 10 | Representation-Based Exploration for Language Models | ICLR 2026 |
| 11 | Reasoning Gets Harder for LLMs Inside A Dialogue | ACL 2026 |
| 12 | Reasoning Planning for Language Models | NeurIPS 2025 |
| 13 | Extending Test-Time Scaling: A Three-Dimensional Perspective | ICLR 2026 |
| 14 | Buffer Matters: Improving LLM Reasoning with BAPO | ICLR 2026 |
| 15 | SATQuest: A Benchmark for Satisfiability Reasoning | ACL 2026 |
| 16 | Enigmata: Scaling Logical Reasoning with Synthetic Verifiable Puzzles | NeurIPS 2025 |
| 17 | Tool-Integrated Verification for Test-Time Scaling | ICLR 2026 |
| 18 | Prompt Curriculum Learning for Efficient LLM Post-Training | ICLR 2026 |
| 19 | Training LLMs for Divide-and-Conquer Reasoning | ACL 2026 |
| 20 | Test-Time Scaling via Metric Geometry | ICLR 2026 |
| 21 | RL in Name Only? Analyzing Reinforcement Learning for Reasoning | ICLR 2026 |
| 22 | GPO: Learning from Critical Steps to Improve LLM Reasoning | NeurIPS 2025 |
| 23 | Crosslingual Reasoning through Test-Time Scaling | ICLR 2026 |
| 24 | How Long Reasoning Chains Influence LLM Judges | ACL 2026 |
| 25 | Language-Reasoning Disentanglement for Multilingual Reasoning | NeurIPS 2025 |
| 26 | Efficient Test-Time Scaling of Multi-Step Reasoning | ICLR 2026 |
| 27 | Learning to Reason on Hard Problems with Privileged On-Policy Data | ICLR 2026 |
| 28 | MINTQA: Multi-hop Question Answering with Temporal Reasoning | ACL 2026 |
| 29 | Training Language Models to Reason Efficiently | NeurIPS 2025 |
| 30 | Faster Test-Time Scaling through Speculative Drafts | ICLR 2026 |
| 31 | Understanding Training Data in Test-Time Scaling | ICLR 2026 |
| 32 | J4R: Learning to Judge for Robust Reasoning Evaluation | ACL 2026 |
| 33 | Scaling Reasoning in Diffusion Language Models | NeurIPS 2025 |
2. 核心论文深度解析
2.1 Motivation:问题不是“模型不会”,而是“解码顺序把会的能力压坏了”
自回归语言模型只允许从左到右的一个拓扑;masked diffusion language model(MDM)则能从任意遮盖集合恢复 token。自由度看似是优势,却把推理时的关键决策从“下一个 token 是什么”扩展成“下一批先揭开哪些位置”。训练目标平均覆盖大量 mask pattern,而自然语言数据本身有强顺序偏置:前缀通常比“已知结尾、补中间”更常见、更可学习。于是均匀遮盖目标等价于要求一个有限容量模型同时解决组合数量巨大的条件生成子问题,其中不少条件几乎没有可识别上下文。
论文用反直觉失败量化这个错配。此前在 Sudoku 上,top-k margin
按置信度挑解码位置可把准确率从低于 7% 推近 90%;但在 GSM8K,作者的
Figure 2 显示 Random 为 50.87%,top-k margin 只有
24.72%,且超过 55.5% 的 top-k-margin
运行从序列尾部向前生成 [AfterEoT],形成灾难性塌缩。正式版
Table 1 更系统地给出:非半自回归基线在 GSM8K 的塌缩率
55.80%、准确率 22.52%;MATH 的塌缩率
29.80%、准确率
16.60%。换成左到右的半自回归块调度后,两项塌缩率都变为
0.00%,准确率分别升至 76.27% 与
32.80%。
因此新颖点不是又做一次 self-consistency,而是把“推理路径”从自然语言思维链扩展到 mask schedule / block size。同一组权重在不同块长下实现不同条件分布,像一组未显式训练标签的专家。作者的工程假设是:不同调度的错误具有差异,而正确答案更可能跨调度稳定出现;对这些结构性轨迹做边缘化,比相信单一路径的 token confidence 更稳。
这值得解决有三层原因。第一,dLLM 的并行生成价值只有在解码策略不把质量压垮时才成立。第二,post-training 很贵;若权重不变,仅靠测试时分配计算就能超过 GRPO,则“训练能力”与“调用能力”必须被分开研究。第三,解码调度是 dLLM 独有的控制轴,它把 test-time scaling 从样本数和推理长度扩展到生成拓扑。
2.2 论文故事线:从崩溃诊断到潜在专家,再到可控的计算旋钮
论文的论证并非“先提方法再跑榜”,而是四次推进。
第一步,作者写出 masked diffusion 的 any-order 训练目标,指出它把所有遮盖规模与位置组合混在同一损失中。训练自由度不是免费午餐:模型必须学习指数多的条件分布,而语言数据并不对所有条件提供同等信号。
第二步,作者观察到常见的 confidence-based unmasking
在复杂语言推理上反而比随机差。关键转折是 [AfterEoT]
崩溃:高置信度并不代表对最终答案有帮助,它可能只代表“尾部结束符容易预测”。这拆开了
token-level certainty 与 answer-level correctness。
第三步,作者限制调度为左到右的 semi-AR block。块长小,条件更像自回归前缀;块长大,并行度更高但上下文更稀。不同块长于是查询到同一模型在不同可见集合上的条件预测。论文把这些条件预测解释为“hidden experts”,并以多块长采样近似对潜在专家的边缘化。
第四步,作者不使用复杂 verifier,而是解析最终答案并多数投票。它牺牲总 FLOPs 换可靠性,但保留“无需训练”和易并行的特点。Table 7 还排除了“只要多采样即可”的简单解释:单一块长 32、25 个随机种子在 GSM8K 为 79.53%,五块长 × 五种子为 88.10%,结构多样性带来 +8.57pp;MATH 对应 35.80% → 40.00%,+4.20pp。
隐含权衡很清楚:HEX 没有找到每道题的最优 schedule,而是用并行枚举和投票规避错误选择;它用计算冗余换选择器的简单与免训练。其主张更接近“稳健集成”而非“智能路由”。
2.3 形式化定义与机制解剖
令序列 (x=(x_1,\ldots,x_n)\in\mathcal V^n),遮盖位置集合为 (M\subseteq[n]),可见位置为 (M^c)。MDM 学习条件去噪器 (p_\theta(x[M]\mid x[M^c]))。论文 Equation (1) 的训练目标可写成:
[ \theta^*\in\arg\min_\theta \mathbb E_{x\sim\mathcal D}\mathbb E_{\ell\sim\mathrm{Unif}([n])} \mathbb E_{M:|M|=\ell} \left[-\sum_{i\in M}\log p_\theta(x_i\mid x[M^c])\right]. ]
这意味着模型平均学习许多不同的可见集合 (U)。HEX 假定可见上下文定义潜在专家 (p_\theta(x_i=a\mid[x_{prompt},x[U]]))。理想混合需要遍历全部条件,实际用块调度集合 (\mathcal B) 做 Monte Carlo 近似(论文 Equation 4):
[ p_{mix}(x_i=a\mid x_{prompt})\approx \mathbb E_{b\sim\mathcal B} \left[p_\theta(x_i=a\mid[x_{prompt},x[U_b]])\right], \quad \hat a=\arg\max_a p_{mix}(x_i=a\mid x_{prompt}). ]
对长度 (n) 和块长 (b),第 (t) 个连续块为:
[ M_t={(t-1)b+1,\ldots,\min(tb,n)},\qquad T(b)=\lceil n/b\rceil. ]
块按左到右完成,块内仍用 diffusion 反复去噪。实际系统对每个块长生成完整文本,解析器 (f(\cdot)) 去掉 LaTeX 包装、空格与逗号,再对答案做众数:
[ \hat y=\operatorname{mode}{f(x_b^{(T)}):b\in\mathcal B, s\in\mathcal S}. ]
并列时选择最小块长产生的答案。流程如下:
prompt + [MASK] × L
│
├── block=8 ── diffusion denoise ── parse answer y₁
├── block=16 ── diffusion denoise ── parse answer y₂
├── block=32 ── diffusion denoise ── parse answer y₃
├── block=64 ── diffusion denoise ── parse answer y₄
└── block=128 ── diffusion denoise ── parse answer y₅
× independent seeds
│
frequency majority vote
│
tie → smallest block answer
▼
final answer
核心伪代码(忠实压缩 Algorithm 2):
outputs = []
for block schedule b in B:
x = [MASK] * L
for t = 1..T:
sample predictions for all masked positions from pθ(. | prompt, x)
fix positions allowed by U[t,b]
remask the remaining unresolved positions
outputs.append(parse(x))
return most_frequent(outputs); on tie choose earliest/smallest-block output
| 机制 / 维度 | 设计选择 | 动机 | 关键设置(正式版 §5.1 / Table 3) |
|---|---|---|---|
| 基座 | LLaDA-8B-Instruct | 固定权重隔离解码收益 | 8B instruct checkpoint |
| 输出长度 | 固定 token budget | 公平比较调度 | 主结果 L=256 |
| 去噪步数 | 每步揭开 2 token | 与基线一致 | T=128 |
| 隐专家 | 连续左到右块 | 保留自然前缀,块内并行 | b∈{8,16,32,64,128} |
| 随机性 | 每块长 5 个种子 | 同时提供结构与采样多样性 | 25 条轨迹,temperature=0.9 |
| 聚合 | 最终答案频数 | 避免 token NLL 错配 | majority vote |
| tie-break | 最小块长优先 | 大块长接近输出长度时退化 | Table 4 |
| 解析 | 数值规范化 | 合并等价表述 | 去 LaTeX、空白、逗号;官方评测脚本 |
工程上最重要的伏笔是解析器:多数投票只在可规范化答案空间中自然成立。数学短答案和多选题适合,开放式写作则必须先解决语义等价类,否则字符串众数会低估真正共识。
2.4 实验设计、基准与指标
| 基准 | 论文使用规模 | 能力维度 | 主指标 | 备注 |
|---|---|---|---|---|
| GSM8K | 1,319 | 小学数学文字题、多步算术 | Accuracy | Table 5 给出规模 |
| MATH | 500 | 竞赛级数学 | Accuracy | 论文图中称 MATH500 |
| ARC-C | 1,172 | 难科学问答、非关键词匹配 | Accuracy | Challenge set |
| TruthfulQA | 684 | 抵抗人类常见误解与虚假陈述 | Accuracy | d1 无可用训练数据/检查点,故缺该格 |
所有推理方法使用 LLaDA-8B-Instruct。主设置输出 256 token、128 步、每步揭开 2 token。Random 随机选两个位置;top-k 按最大概率;top-k margin 按 top-1 与 top-2 概率差挑两个位置;d1 是经 SFT/RL 的训练式对照。ARC-C 的 d1 数值由 HEX 作者训练 1 epoch 复现,GSM8K/MATH 采用 d1 报告最佳值,这一点使跨行比较并非完全统一的训练协议。
主结果完整矩阵
论文只报告四个基准,不能为满足“五基准”形式补造第五列。以下全取正式版 Table 3,第 Random 至 HEX ×5 seeds 各行;均为 Accuracy (%)。平均值只对有数值的列计算,属于本报告派生量。
| 方法 | GSM8K | MATH | ARC-C | TruthfulQA | 已报告列平均 |
|---|---|---|---|---|---|
| Random | 50.87 | 16.80 | 70.05 | 42.40 | 45.03 |
| top-k | 22.52 | 16.60 | 47.87 | 29.82 | 29.20 |
| top-k margin | 24.72 | 16.40 | 54.18 | 28.36 | 30.92 |
| d1 (GRPO) | 79.80 | 37.20 | 82.68 | 未报告 | 66.56 |
| NLL rerank | 76.72 | 34.40 | 60.84 | 28.07 | 50.01 |
| HEX ×1 seed | 82.18 | 38.40 | 74.57 | 45.91 | 60.27 |
| HEX ×5 seeds | 88.10 | 40.00 | 87.80 | 57.46 | 68.34 |
相对 top-k margin,HEX ×5 的绝对/相对提升分别为:GSM8K +63.38pp / +256.39%;MATH +23.60pp / +143.90%;ARC-C +33.62pp / +62.05%;TruthfulQA +29.10pp / +102.61%。相对 Random 则是 +37.23pp、+23.20pp、+17.75pp、+15.06pp。相对训练式 d1,三个可比任务为 +8.30pp(+10.40%)、+2.80pp(+7.53%)、+5.12pp(+6.19%)。
全文最有说服力的定量证据:不是单独的 88.10%,而是一个三联证据——top-k margin 在 GSM8K 发生 55.80% 塌缩;semi-AR 将塌缩清零并把准确率升至 76.27%;跨五种块长的 25 路结构化投票再升到 88.10%。它把“失败诊断—机制修复—集成收益”连成闭环。
2.5 消融、敏感性、相变与计算成本
逐层机制消融
严格说论文没有给出“同一训练流水线逐模块累加”的传统消融;它给的是可对应设计层次的推理解码对照。以下来自 Table 1、3、7:
| 配置 | GSM8K | MATH | 相对上一层 | 解释 |
|---|---|---|---|---|
| non-semi-AR / top-k(Table 1) | 22.52 | 16.60 | — | 高置信度调度发生尾部塌缩 |
| semi-AR,单块长 32(Table 7) | 76.27 | 32.80 | +53.75pp / +16.20pp | 前缀约束清除塌缩 |
| 单块长 32 ×25 seeds(Table 7) | 79.53 | 35.80 | +3.26pp / +3.00pp | 只有噪声多样性 |
| HEX:5 块长 ×5 seeds(Table 7) | 88.10 | 40.00 | +8.57pp / +4.20pp | 结构多样性贡献明显大于单块长多采样 |
频数与似然的消融同样关键。Table 3 中 ARC-C 的 Random 为 70.05%,NLL 只得 60.84%,低 9.21pp;同一候选集合用 HEX 频数投票为 74.57%,高 NLL 13.73pp。TruthfulQA 上 NLL 28.07%,甚至低于 Random 42.40% 达 14.33pp,而 HEX 为 45.91%。所以“模型自己给的 likelihood 能当 verifier”在这些设置里不成立。
动态轨迹数量敏感性
正式版 Table 2(GSM8K)给出可复核曲线:
| 动态轨迹数 | Accuracy | Tie rate |
|---|---|---|
| 5 | 81.96 | 3.87 |
| 10 | 82.34 | 3.18 |
| 15 | 82.49 | 1.59 |
| 20 | 82.79 | 1.59 |
| 25 | 83.47 | 1.52 |
| 30 | 84.15 | 1.06 |
从 5 到 30 条轨迹,准确率只增加 2.19pp(相对 +2.67%),tie rate 降 2.81pp(相对 -72.61%)。这是明显的边际收益递减,而非持续线性增益:主要价值在消除歧义,后续算力更多是在挤压少量尾部错误。
输出长度与块长相变
Table 8 显示 HEX ×5 在输出长度 128/256/512 上:GSM8K 81.05/88.10/88.40,MATH 33.40/40.00/47.60,ARC-C 88.40/87.80/87.12,TruthfulQA 53.80/57.46/59.80。长度增加对数学任务明显有利,但 ARC-C 从 128 到 512 反而下降 1.28pp,说明更长 scratchpad 并非普适。
更值得称为“相变”的是 Appendix Figure 10:作者以 16 为步长扫 block size,明确报告当块长进入 128–256 区间时性能急剧下降。图未提供每个点的可读精确表值,因此本报告不数字化猜测曲线;能可靠得出的结论是存在大块区间突降,而不能确定统一的最优阈值。
延迟与统计显著性
正式版 Table 5 给出 HEX ×1 seed(五块长、五样本)的单点延迟:GSM8K 11.03s 对 Random 2.09s(5.2648×);MATH 13.43s 对 2.56s(5.2461×);ARC-C 11.90s 对 2.27s(5.2473×);TruthfulQA 11.61s 对 2.21s(5.2455×)。HEX ×5 seeds 是 25 条轨迹,论文明确其 token-level 总推理成本约为单次 top-k 的 25×;可并行降低墙钟时间,但不能消除 FLOPs、能耗与显存吞吐成本。
论文未报告多次独立完整实验的均值±标准差、置信区间或显著性检验。表中的 “×5 seeds” 是把 25 个样本汇成一次投票,不是五次独立实验的方差估计。因此不能从现有数字推出跨硬件、跨随机批次的统计稳定性。按二项近似仅能粗略估计测试集抽样误差,但这不是论文报告值,本报告不把它冒充显著性结论。
2.6 真正贡献、可复用设计与迁移潜力
真正贡献不是多数投票本身,而是识别了 dLLM test-time compute 的第三个轴:除了生成更多样本、生成更长链条,还可以改变 变量揭示顺序。在自回归模型里 token order 被架构固定;在 MDM 中它是外露的控制变量。HEX 让研究者把同一权重看成由条件上下文集合索引的一族行为,而不是单一函数。
可单独复用的设计有三项。其一,先监测
[AfterEoT]、重复、逆向生成等轨迹级故障,再评价准确率,避免把解码病理误判成模型知识不足。其二,区分
噪声多样性 与 结构多样性;Table 7
证明后者更有价值,这可迁移到 tree search、speculative decoding、tool
routing。其三,用 schedule ensemble
作为免训练兜底:当无法重新训练基座时,少量离散控制参数可形成便宜的专家池。
其迁移潜力包括:图像离散 diffusion 中的像素/patch 揭示顺序,多模态 dLLM 中先视觉证据还是先文本结论,代码生成中先接口骨架还是先局部实现,以及长对话中按段落块修订。关键并非照搬块长集合,而是寻找任务中“可见变量集合”与训练分布偏置相匹配的结构族。
2.7 局限性
论文自述限制
- 推理计算更高:正式版 §6,第 9 页明确承认 HEX 需要更多 test-time compute;Appendix B.2 将 ×5 seeds 的总 token-level cost 量化为约 25×。
- 任务覆盖窄:§6,第 9 页说明主要评测 reasoning tasks;开放故事、图像生成、长对话仍未验证。
- 缺乏理论解释:§6,第 9 页明确表示尚未建立 HEX 的理论理解;当前“潜在专家”主要是经验解释。
补充批判(独立观察)
实验设计问题—“SOTA”高度依赖计算预算。 因为 HEX ×5 用 25 条轨迹,而 Random/top-k/top-k-margin 主表各用单样本;GSM8K 88.10% 对 50.87% 并不是等 FLOPs 比较,所以它证明的是 test-time scaling 有效,不能证明单位计算效率更优。真正公平的实验应让所有方法共享 25 条轨迹或相同 GPU-seconds。
缺乏关键竞品对比—未与等预算 self-consistency / verifier 搜索正面对齐。 因为 Table 7 只比较单块长 25 seeds 与五块长 25 samples,没比较 reward model、process verifier 或自适应 schedule selector 在相同 25×预算下的结果,所以“多数投票最合适”仍是未闭合主张。
论证缺口—“专家”可能只是条件分布切片。 因为 Table 6 只显示不同块长均值低于投票(例如 L=256,单专家均值 GSM8K 75.39%,HEX 82.18%),没有测量专家错误相关矩阵、互信息或专长分工,所以现有证据支持“集成多样性”,但不足以证明存在可辨识的专家结构。
实验设计问题—d1 比较协议不完全一致。 因为 GSM8K/MATH 采用 d1 论文最佳值,而 ARC-C 是 HEX 作者训练 1 epoch 的复现,TruthfulQA 又因无训练数据/检查点缺失,所以“超过 GRPO”只在三格成立,且三格不是同一 post-training 预算与实现条件。
指标有效性问题—字符串答案共识不等于语义共识。 因为解析器只去 LaTeX、空格和逗号,而 TruthfulQA 或开放文本可能有多个语义等价表达,所以 vote frequency 会把同义答案拆票。当前四个基准偏向可规范化答案,不能直接外推到论文自述的长对话/故事。
失手的子任务—更长输出在 ARC-C 不增反降。 因为 Table 8 的 HEX ×5 从 L=128 的 88.40% 降到 L=512 的 87.12%,而 MATH 同期从 33.40% 升到 47.60%,所以“增加推理预算单调改善”只对增加投票样本的 Figure 6 成立,不适用于增加 token 长度。
超参过拟合风险—块集合来自单一基座与四个基准。 因为主设置固定 {8,16,32,64,128}、L=256、temperature=0.9、每步 2 token,且只有 LLaDA-8B-Instruct 一个基座,所以无法区分这组超参是通用几何级数原则,还是对特定模型/长度调出的甜点区。
统计证据不足—“显著”缺少重复实验分布。 因为论文没有均值±标准差、置信区间或假设检验,且五 seeds 被聚合为一次预测,所以即使 +2.80pp 超过 d1 的 MATH 看似可观,也不能判定对随机推理轨迹是否稳定显著。
3. 相关工作回溯:问题与技术来源链
3.1 Self-Consistency — 2023.03,ICLR 2023
解决什么。 Self-Consistency 把 CoT 从单一贪心路径扩展为多条随机思维链,并按最终答案频数边缘化路径。论文报告相对普通 CoT 在 GSM8K、SVAMP、AQuA、StrategyQA、ARC-C 分别提升 17.9、11.0、12.2、6.4、3.9 个百分点(arXiv 摘要)。它建立了“无需改权重,用答案共识调用潜在推理能力”的基本范式。
遗留缺口。 它默认生成顺序仍是自回归的,路径差异来自 token sampling;无法处理 dLLM 独有的“先揭开哪个位置”自由度,也不区分采样噪声与结构调度多样性。
HEX 如何回应。 HEX 把 marginalize-over-reasoning-paths 改写成 marginalize-over-mask-schedules。最终答案多数票继承 Self-Consistency,但样本空间从语言表面轨迹提升到生成拓扑。
关键设计传递。 “多路径 → 答案解析 → 众数”几乎原样传递;HEX 的新增变量是 block schedule,Table 7 又证明同一 schedule 多种子不及跨 schedule 多样性。
3.2 Large Language Diffusion Models(LLaDA)— 2025.10 v3,ICLR 2025 DeLTa Workshop Oral
解决什么。 LLaDA 证明 masked diffusion 可以按预训练 + SFT 路线扩展到 8B,并在通用、数学、代码与 instruction following 上接近同规模自回归基线。其核心是随机 mask 的前向破坏和 Transformer 条件去噪,给 HEX 提供实际可用基座。
遗留缺口。 LLaDA 给出 any-order 生成自由,但标准推理仍须人工选择 mask schedule。灵活性在模型层建立了,却没有回答哪个顺序对推理最可靠;confidence heuristic 甚至可能触发结束符崩溃。
HEX 如何回应。 HEX 完全固定 LLaDA-8B-Instruct 权重,用半自回归块族显式探索该自由度。由此把“dLLM 能否生成”推进到“如何调用 dLLM 已学能力”。
关键设计传递。 LLaDA 的任意 mask 条件去噪器成为潜在专家共享参数;HEX 没新增 MoE 参数,而用不同可见集合在推理时激活不同条件行为。
3.3 Train for the Worst, Plan for the Best — 2025.08 v3,ICML 2025 Outstanding Paper
解决什么。 该工作形式化指出 MDM 训练需面对大量难 infilling 子问题,但推理时能通过自适应 token ordering 绕开难条件;在 Sudoku 上,置信度自适应顺序把准确率从 <7% 推到约 90%,甚至超过参数多 7× 的 ARM(arXiv 摘要)。
遗留缺口。 Sudoku 的约束传播使局部 confidence 与全局可解性较一致;复杂自然语言推理中,结束符可能高置信却无助于答案。它没有解释为何同一 heuristic 从 Sudoku 的巨大收益反转为 GSM8K 的崩溃。
HEX 如何回应。 HEX 首先复现这种反转:GSM8K Random 50.87%,top-k margin 24.72%。然后用 prefix-compatible semi-AR 约束替代纯置信度选择,并用多 schedule 共识规避单一调度风险。
关键设计传递。 “推理顺序是可优化变量”直接传递;选择原则从逐 token 的局部 margin,进化为候选 schedule 族的 answer-level consensus。
3.4 d1 — 2025.06 v2,NeurIPS 2025
解决什么。 d1 把 reasoning post-training 引入 diffusion LLM:masked SFT 蒸馏推理数据,再以 critic-free diffu-GRPO 做在线强化学习。它证明 dLLM 也能吸收 SFT+RL 的推理增益,给出 GSM8K 79.80%、MATH 37.20% 等强基线(数值由 HEX Table 3 引用)。
遗留缺口。 d1 需要数据、训练与新 checkpoint;它优化模型参数,却没有系统利用推理时 mask order。TruthfulQA 没有相应训练数据/公开 checkpoint,HEX 主表因此无法给 d1 数值。
HEX 如何回应。 HEX 走互补方向:不更新参数,用 25 路 schedule/sample 集成在 GSM8K/MATH/ARC-C 达 88.10/40.00/87.80,分别高 d1 8.30/2.80/5.12pp。
关键设计传递。 d1 把“能力提升”归于策略学习;HEX 表明部分增益也可以来自更好的能力调用。后续自然组合是先用 diffu-GRPO 训练,再用 schedule ensemble 或学习式 router 推理。
4. 技术演进脉络
2022–2023 Self-Consistency [AR;采样多条 CoT;答案众数]
│
├────────────── 共识聚合的技术来源 ──────────────┐
│ │
2025 LLaDA [8B masked diffusion;any-order 条件去噪] │
│ │
├── Train for the Worst [token order 可优化;Sudoku 上 margin 有效]
│ │ │
│ └── 暴露问题:局部置信度能否迁移到语言推理? │
│ │
└── d1 [masked SFT + diffu-GRPO;训练式推理增强] │
│ │
├── 形成强训练基线 │
▼ ▼
2026 HEX [semi-AR prefix 约束 + 多块长隐专家 + 最终答案投票]
├─ 修复 AfterEoT collapse
├─ 把结构多样性与随机种子多样性分开
└─ 将 mask schedule 变成 test-time scaling 新坐标轴
内在推动力是从“模型权重承载全部能力”转向“训练后还需设计调用策略”。Self-Consistency 首先证明同一 AR 模型的多条路径可通过共识提纯;LLaDA 又增加了 token order 自由;Train for the Worst 展示顺序选择的巨大潜力;d1 证明训练可以强化 dLLM 推理;HEX 最终把两条线汇合成 schedule-level self-consistency。
关键转折有两个。其一,从随机采样到结构采样:种子只改变噪声,块长改变条件上下文。其二,从
token confidence 到 answer consensus:局部置信度在
[AfterEoT]
上会失真,而多轨迹最终答案的一致性更贴近任务指标。社区关注也从“dLLM
能否媲美 AR”转向“其非自回归自由度怎样在质量、并行度和算力间定价”。
| 工作 | 发表年月 | 会议/出版 | 核心贡献 | 代表性指标 | 与 HEX 的关系 |
|---|---|---|---|---|---|
| Self-Consistency | 2023.03 | ICLR 2023 | 多 CoT 路径答案共识 | GSM8K +17.9pp | 聚合原则来源 |
| LLaDA | 2025.10 v3 | ICLR 2025 DeLTa Workshop Oral | 8B masked diffusion LLM | 与同规模 ARM 有竞争力(原文多任务) | HEX 基座与 any-order 能力来源 |
| Train for the Worst | 2025.08 v3 | ICML 2025 | 自适应 token order | Sudoku <7%→≈90% | 提出顺序优化,但语言推理上 heuristic 反转 |
| d1 | 2025.06 v2 | NeurIPS 2025 | masked SFT + diffu-GRPO | GSM8K 79.80% | 训练式强基线 |
| HEX | 2026(会议) | ICLR 2026 | 跨 semi-AR schedule 的免训练集成 | GSM8K 88.10%;MATH 40.00% | 汇聚点 |
5. 开放挑战与可操作研究机会
5.1 理论层面
- 何时多数票必然优于最佳单专家? 在固定 25 次调用下,记录五种块长的错误相关矩阵与条件准确率,用相关 Bernoulli ensemble bound 预测投票收益;再比较预测值与 GSM8K/MATH 实测值。若只看平均专家准确率,Table 6 无法区分真正互补与偶然分散。
- mask schedule 的最小覆盖集。 在 L=256 下穷举或贝叶斯优化候选块长,比较 {8,16,32,64,128} 与等规模自适应集合;目标是在准确率下降不超过 1pp 时最小化总 FLOPs。这个问题把“隐专家”变成可验证的集合覆盖。
- confidence 失效的校准理论。 对位置级 margin、answer NLL、最终正确性做 reliability diagram 和 ECE;在 Sudoku 与 GSM8K 上用同一评估协议做 head-to-head,以确定何种约束结构使局部置信度成为有效路由信号。
5.2 工程与应用层
- 等预算公平对照。 在相同 25 次 forward-equivalent、相同 L=256、相同 LLaDA 权重下比较 HEX、单块长 self-consistency、NLL rerank、学习式 verifier、early-stop adaptive consistency;同时报告 accuracy、GPU-seconds、joules、峰值显存和 Pareto frontier。
- 在线提前停止。 用投票后验或 sequential probability ratio test,在共识达到阈值时停止增加轨迹;与固定 5/10/15/20/25/30 轨迹比较。目标是在 GSM8K 保持 88.10%±0.5pp 时,把平均样本数从 25 降到多少。
- 跨基座复现。 在 LLaDA-8B、Dream-7B 与至少一个适配式 diffusion LLM 上原样运行同一块集合;若最优块区间随模型变化,则进一步比较绝对块长与相对比例 b/L 两种参数化。
- 开放答案语义投票。 在长对话或故事续写中比较字符串众数、embedding clustering、LLM judge clustering 与事实单元投票;使用人工偏好和事实一致性双指标,量化解析器造成的拆票误差。
5.3 新兴方向
- 训练—推理联合路由。 以 d1 checkpoint 为起点,比较“仅 GRPO”“仅 HEX”“GRPO+HEX”“训练一个 per-instance schedule router”四组,在相同训练数据与总推理 FLOPs 下测三任务;这直接判定 post-training 与 schedule scaling 是互补还是替代。
- 多模态揭示顺序。 在视觉问答中设置先解 mask 的视觉 token 比例与文本 token 比例,比较单模态先行、交错和 HEX 式多调度投票;评价 answer accuracy 与视觉 grounding,避免只看语言答案。
- 安全与共识性幻觉。 构造训练语料中高频但错误的诱导集,比较 HEX 与 NLL/Random 是否会让多个 schedule 对同一流行谬误形成“错误共识”。TruthfulQA 57.46% 仍意味着 42.54% 错误,不能把 consensus 直接等同于 truth。
6. 其他值得关注的近期工作
- Plan and Budget: Effective and Efficient Test-Time Scaling(ICLR 2026)— 把规划与预算分配联合起来,适合与 HEX 的固定 25 路预算做自适应 early-stop 对照。OpenReview
- Diversity-Aware Policy Optimization for LLM Reasoning(NeurIPS 2025)— 直接优化推理轨迹多样性,能检验“结构多样性”是否也可在训练阶段内化。NeurIPS
- Enigmata: Scaling Logical Reasoning with Synthetic Verifiable Puzzles(NeurIPS 2025)— 用可验证合成谜题扩展逻辑推理,适合测试 HEX 是否只对数学短答案有效。NeurIPS
- GPO: Learning from Critical Steps to Improve LLM Reasoning(NeurIPS 2025)— 聚焦关键步骤信用分配,与 HEX 的纯最终答案投票形成训练时/推理时对照。NeurIPS
- RFG: Test-Time Scaling for Diffusion LLM Reasoning with Reward-Free Guidance(2025-09-29,arXiv)— 同期直接针对 dLLM 的 reward-free guidance,是 HEX 最应补做的同预算竞品。arXiv
- Training Language Models to Reason Efficiently(NeurIPS 2025)— 把答案质量和推理长度共同纳入训练,提醒 HEX 的 25×预算必须同时报告效率。NeurIPS
- d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning(NeurIPS 2025)— 从训练角度扩展 diffusion reasoning,与 HEX 的解码角度构成自然组合。NeurIPS
7. 结论
HEX 最值得记住的不是“一个 8B 模型又涨了多少分”,而是它把生成顺序提升为 test-time scaling 的一等变量。高置信度 token 选择在 GSM8K 上可以因 55.80% 的结束符塌缩而彻底失败;加上前缀式 semi-AR 约束后塌缩清零,再以跨块长结构共识把 76.27% 推到 88.10%。这说明 dLLM 的能力评估不能脱离调度。
但报告也不应把 88.10% 当作免费午餐:最终配置约需 25× 总推理计算,主表不是等预算比较,也没有误差条。因而最重要的下一步不是继续堆更多 schedules,而是在相同 GPU-seconds 下比较自适应路由、早停、verifier 与 schedule ensemble,寻找准确率—计算成本 Pareto 前沿。
数据追溯与坦诚性说明
- 核心论文数据均来自 ICLR 2026 正式版:Figure 2、5、6、10;Table 1–8;§5.1、§6、Appendix B.1–B.7。报告中所有派生 pp 与相对百分比均由对应表值直接计算。
- 论文没有第五个主基准、独立重复实验标准差或置信区间;本报告明确保留缺失,未补造。
- 相关工作中的数字来自各论文 arXiv 摘要或 HEX 对其 Table 3 的引用;未把第三方实现误标为官方代码。
- HTML 已通过 Warm Editorial 结构校验(0 warning);运行环境可调用
Playwright,但
/usr/bin/chromium、/opt/pw-browsers及系统 PATH 均无 Chromium 可执行文件,且按要求未运行playwright install,因此本期无法完成浅色/深色/移动端截图式目视复核。响应式表格滚动、移动端 SVG 横向容器与双主题颜色均已在源码层检查,但这不等同于真实浏览器截图验证。 - 索引已在本次交付时更新;若远端同步出现异常,以随附报告和当前索引文件为准。