ML/AI 每日深度论文追踪 · 周三 · 生成模型
A Unified Transformer for Complete 3D Modeling from Partial Observations
三维表示不必是点云、不必是高斯、也不必是三平面 —— 它可以就是重建网络自己的 KV-Cache。RnG 只加了一个 0/1 注意力掩码和两个输出头,就让 CVPR 2025 最佳论文 VGGT 从「只能重建看得见的」变成「能生成看不见的」:Chamfer Distance 降低 10×,速度比扩散式统一模型快 317×。但论文最有意思的地方在于,它自己的消融数据显示:那个写进标题的因果掩码,在 10 项质量指标里输掉了 8 项。
| 项 | 内容 |
|---|---|
| 日期 / 星期 | 2026-08-05,周三(date +%u = 3) |
| 轮转领域 | 生成模型 —— 扩散 / 流匹配、自回归生成、3D 生成、世界模型 |
| 候选池 | 27 篇(ICLR 2026 Oral 9 · CVPR 2026 Highlight 7 · ICML 2026 Oral 4 · arXiv 2026 7) |
| 抽取方式 | shuf -i 1-27 -n 1 → 命中 #14,重抽 0 次 |
| 核心论文 | RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations(CVPR 2026 Highlight) |
✅ = 本次运行实际抓取并确认可达;⚠️ = 来源可信但本次未能独立打开。
| 论文 | 出版 / 会议页 | arXiv | Code | 数据 / 权重 | 项目页 |
|---|---|---|---|---|---|
| 核心:RnG CVPR 2026 Highlight |
CVPR 2026 Highlights ✅ | 2603.01194 ✅ HTML 全文 ✅ |
github.com/XiangMochu/RnG ⚠️ |
Objaverse-LVIS 113.5K;hf.co/MochuXiang/RnG ⚠️ |
npucvr.github.io/RnG ✅ |
| DUSt3R CVPR 2024 |
CVF PDF ✅ | 2312.14132 ✅ | naver/dust3r ✅ | Habitat / MegaDepth / ScanNet++ 混合 | CVPR Poster ✅ |
| LRM ICLR 2024 |
ICLR PDF ✅ · OpenReview ✅ | 2311.04400 ✅ | 官方未开源;OpenLRM ✅ | Objaverse + MVImgNet | 未找到 |
| LVSM ICLR 2025 Oral |
ICLR Proceedings ✅ · Oral 页 ✅ | 2410.17242 ✅ | haian-jin/LVSM ✅ | Objaverse、RealEstate10K | 项目页 ✅ |
| VGGT CVPR 2025 Best Paper |
CVF Open Access ✅ | 2503.11651 ✅ | facebookresearch/vggt ✅ | VGGT-1B(非商用)/ VGGT-1B-Commercial(Co3D AUC@30 90.37 vs 89.98) | vgg-t.github.io ✅ |
| Matrix3D CVPR 2025 |
CVF Open Access ✅ pp.11250–11263 | 2502.07685 ✅ | 见项目页 | CO3D 等 | nju-3dv ✅ |
| RayZer ICCV 2025 BSP-HM |
ICCV CVF PDF ✅ | 2505.00702 ✅ | hwjiang1510/RayZer ✅ | — | 项目页 ✅ |
这句话里最关键的不是「KV-Cache 很快」,而是「重建网络的中间激活本身已经编码了它从未被监督过的那部分几何」。RnG 的全部工程都是为了把这条假设变成可查询、可渲染、可导出的东西。
前馈式可泛化三维重建(DUSt3R → VGGT 这条线)在两年内把「稀疏图像 → 三维」压到亚秒级,但它们在训练目标上就只被要求恢复可见区域的几何。
论文没有用抽象的「不完整率」,而是用 Chamfer Distance(CD) 作为全篇判决指标。表 2:VGGT 作为纯重建模型,源视角深度 Rel 只有 5.960(已很强),但完整三维 CD = 0.0260;RnG 的 CD = 0.0067,低 74.2%(3.88×)。这就是「可见几何做得再好,也换不来完整几何」的定量表述。
更有说服力的是反向对照:Matrix3D 是当时唯一能生成不可见区域的统一模型,其无位姿设置下 CD = 0.0670 —— 比完全不做生成的 VGGT(0.0260)还差 2.58×。截至 RnG 之前,社区面对的是一个非此即彼的困境:
| 路线 | 代表 | 可见几何 | 不可见几何 | 实时性 |
|---|---|---|---|---|
| 判别式重建 | VGGT | 极强(Rel 5.960 / CD 0.0260) | 不建模 | ✅ < 1 s |
| 生成式统一 | Matrix3D | 弱(Rel 9.430 / CD 0.0670) | 可生成但不一致 | ❌ 27 s |
过去两年主流做法是「给生成模型(扩散)打上几何补丁」(Zero-1-to-3、Matrix3D、Gen3R 皆属此类);RnG 走的是「给重建模型开一个生成出口」。
论文的论证不是「我们提出模块 X,效果好」,而是一条有明确转折点的推理链:
这是全文的支点。它可证伪 —— 如果为真,只需要一个解码器就能读出完整几何,而不需要重训生成模型。
关键推论:要验证「隐空间里已经有完整三维」,就必须保证加入目标视角查询这件事本身不能改变重建结果。否则你无法区分「隐空间里本来有」与「目标视角把答案偷渡进来了」。这直接推出了因果掩码。
一旦源视角的 K/V 与目标视角无关,它们就可以被缓存。于是「隐式三维表示」= 缓存的 K/V 张量,查询新视角 = 一次跨注意力。表 4:FLOPs 12.26 T → 2.29 T(5.35×),单视角 85 ms,比 Matrix3D 的 27 s 快 317.6×。
RnG 不引入扩散、不引入 GAN、不引入 3DGS/NeRF、不引入新的三维表示。它只加了一个 0/1 掩码和两个输出头。
论文没明说但表 2/3 写得很清楚:用纹理细节换几何完整性与速度。RnG 的 PSNR 26.276 低于 LVSM-100K 的 27.522(−1.246 dB),LPIPS 0.0975 差于 0.0895。换来的是 CD 从「不可得」变成 0.0067,以及 317× 的加速。
设 {s} 为源视角 token 下标集合,{t} 为目标视角 token 下标集合:
语义:源视角 query 禁止访问目标视角 key。这不是标准的自回归下三角因果掩码,而是一个任务级的单向屏障 —— 「重建」这一侧对「生成」这一侧完全免疫。论文称之为 reconstruction-guided。
阶段一 · 重建与缓存(与目标视角无关,可离线做一次):
对每一层、每个源视角 token 缓存 K/V。这组张量就是场景的三维表示。
阶段二 · 生成与查询(每个新视角只做这一步):
目标视角的 Plücker 射线经线性投影得到 Q_t,直接查询缓存,完全跳过源视角分支的前向计算。
| 机制 / 维度 | 设计选择 | 动机 | 关键超参 / 数值 |
|---|---|---|---|
| 骨干 | 继承 VGGT 架构 与权重 | 复用「隐空间已含完整三维」的先验 | L = 24 层,交替 frame/global attention |
| 源视角编码 | DINO ViT patch token | 沿用 VGGT 预训练分布 | 256×256,patch 8 → 1024 token/view |
| 目标视角编码 | Plücker ray map + Linear | 与 LVSM 同构;把「视角」变成可查询 token | 6 维射线 → d_model |
| 任务分离 | 二值因果掩码 M | 保证重建对目标视角不变 → 才能缓存 | 0/1,无参数 |
| 三维表示 | 24 层 K/V 缓存 | 无需显式几何,读取即渲染 | 4 view × 1024 token × 24 层 × (K,V) |
| 几何输出 | 像素对齐点图 D_pmap | 继承 DUSt3R/VGGT 的 pointmap 范式 | 逐像素 3D 坐标 |
| 外观输出 | D_RGB | 直接回归,无扩散 | MSE + 感知损失 |
| 世界系锚定 | 首个源视角钉死 | 隐式定义世界坐标 | ĝ_{s=1} = [I₃ₓ₃ | (0,0,−1)ᵀ] |
L_pmap 第二项是梯度域监督(法向 / 边界锐度),第三项 −α log Σ_t 是不确定性正则,防止网络把所有区域的 Σ 压到 0 逃避监督。
| 项 | 取值 | 项 | 取值 |
|---|---|---|---|
| 硬件 | 8 × A800 | 训练步数 | 40 K(主结果)/ 15 K(消融) |
| Batch | 96 = 6 物体 × 3 目标视角 × 2 梯度累积 | 分辨率 / patch | 256 × 256 / 8 |
| 损失权重 | λ_pmap = 0.2,λ_c = 1,λ_p = 0.5,α = 0.2 | 学习率 | 峰值 6e-4,3000 步 warmup + cosine |
| 训练数据 | Objaverse LVIS 子集,113.5 K 物体 | 推理 | 重建 ≈ 0.2 s;每新视角 < 0.1 s |
| 用途 | 数据集 | 规模 | 说明 |
|---|---|---|---|
| 训练 | Objaverse(LVIS 子集) | 113.5 K 物体 | 合成物体,环视轨迹 |
| 主评测 | Google Scanned Objects (GSO) | 1,030 物体 | 真实扫描的合成渲染,零样本 |
| 泛化 | CO3D | — | ⚠️ 仅定性(Fig. 10),无定量表 |
| 分组 | 指标 | 含义 |
|---|---|---|
| 重建 · 位姿 | RA@5↑ / RT@5↑ / AUC@30↑ | 旋转、平移在 5° 内的准确率;位姿 AUC |
| 重建 · 源视角深度 | Rel↓ / a1↑ | 相对误差(%);δ<1.25 内点率(%) |
| 生成 · 新视角深度 | Rel↓ / a1↑ | 同上,但对未观测视角 |
| 生成 · 新视角合成 | PSNR↑ / SSIM↑ / LPIPS↓ | 外观质量 |
| 完整三维 | CD↓ | Chamfer Distance —— 全文唯一的「完整性」判据 |
表 2 原文 caption:"Quantitative comparison. We evaluate the reconstruction and generation ability of all models on the GSO dataset. '—' means that the model is not capable of delivering that result."
| 方法 | RA@5↑ | RT@5↑ | AUC@30↑ | 源 Rel↓ | 源 a1↑ | 新 Rel↓ | 新 a1↑ | PSNR↑ | SSIM↑ | LPIPS↓ | CD↓ |
|---|---|---|---|---|---|---|---|---|---|---|---|
| (A)已知位姿设置 | |||||||||||
| LVSM [18] (100K) | — | — | — | — | — | — | — | 27.522 | 0.902 | 0.0895 | — |
| LGM [44] | — | — | — | 13.704 | 85.646 | 16.804 | 82.205 | 16.677 | 0.751 | 0.2248 | 0.1130 |
| Matrix3D [30] (posed) | — | — | — | 8.782 | 95.383 | 8.897 | 93.858 | 19.941 | 0.803 | 0.1684 | 0.0580 |
| pixelSplat [4] | — | — | — | 33.594 | 33.241 | 39.819 | 20.723 | 12.904 | 0.718 | 0.4514 | 0.4898 |
| (B)无位姿设置 —— RnG 的正式赛道 | |||||||||||
| MUSt3R [3] ※ | 21.683 | 21.683 ※ | 33.490 | 10.941 | 92.663 | — | — | — | — | — | 0.7757 |
| VGGT [50] | 74.239 | 65.680 | 77.234 | 5.960 | 97.723 | — | — | — | — | — | 0.0260 |
| VGGT [50] + LVSM [18] | 74.239 | 65.680 | 77.234 | 5.960 | 97.723 | — | — | 19.394 | 0.796 | 0.1980 | 0.0260 |
| Matrix3D [30] (unposed) | 43.770 | 65.922 | 66.389 | 9.430 | 92.261 | 9.964 | 90.282 | 18.736 | 0.786 | 0.1930 | 0.0670 |
| RnG (Ours) | 85.146 | 86.019 | 86.942 | 0.584 | 99.929 | 0.717 | 99.850 | 26.276 | 0.891 | 0.0975 | 0.0067 |
※ MUSt3R 的 RA@5 与 RT@5 数值相同,疑为原文排版或本次 HTML 解析问题,未能核对 PDF。
图 1 · GSO 新视角合成 PSNR 对比
数据来源:论文表 2 与表 3。悬停查看具体数值。注意 RnG 是唯一无需真值位姿却达到 26+ dB 的方法。
图 2 · 完整三维 Chamfer Distance(对数刻度)
数据来源:论文表 2 最后一列。两年内 CD 下降约 73×,且下降不平滑 —— VGGT 与 RnG 各贡献一次数量级跳变。
| 对比对象 | 位姿 RA@5 | 源深度 Rel | PSNR | CD |
|---|---|---|---|---|
| vs VGGT(最强纯重建) | +10.907 pp(+14.7 %) | 5.960 → 0.584,降低 90.2 %(10.21×) | — | 0.0260 → 0.0067,降低 74.2 %(3.88×) |
| vs VGGT + LVSM(拼接管线) | 同上 | 同上 | +6.882 dB | 同上 |
| vs Matrix3D(unposed,最强统一模型) | +41.376 pp | 降低 93.8 % | +7.540 dB | 降低 90.0 %(恰好 10.0×) |
| vs Matrix3D(posed) | — | 降低 93.3 % | +6.335 dB | 降低 88.4 %(8.66×) |
| vs LGM | — | 降低 95.7 % | +9.599 dB | 降低 94.1 %(16.87×) |
| vs LVSM-100K(唯一败绩) | — | — | −1.246 dB | — |
这个数字之所以关键,在于 RnG 继承的正是 VGGT 的权重。同一套骨干、同一批初始化,仅仅换了训练目标与领域,可见几何误差就掉了 90.2 %。它同时支撑与削弱论文的主张:
| 配置 | RA@5↑ | RT@5↑ | AUC@30↑ | 源 Rel↓ | 源 a1↑ | 新 Rel↓ | 新 a1↑ | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|---|---|---|---|---|---|---|
| LVSM-100K(对照) | — | — | — | — | — | — | — | 27.522 | 0.902 | 0.0895 |
| LVSM-40K(等步数对照) | — | — | — | — | — | — | — | 24.619 | 0.864 | 0.1544 |
| Ours-40K(完整) | 85.146 | 86.019 | 86.942 | 0.584 | 99.929 | 0.717 | 99.850 | 26.276 | 0.891 | 0.0975 |
| Ours-15K | 81.650 | 82.233 | 82.631 | 0.742 | 99.884 | 0.882 | 99.788 | 24.856 | 0.873 | 0.1243 |
| Ours-15K-scratch(无预训练) | 8.252 | 17.184 | 33.654 | 2.331 | 99.475 | 2.331 | 99.364 | 20.784 | 0.819 | 0.2035 |
| Ours-15K-w/o cam(去 L_cam) | — | — | — | 0.739 | 99.890 | 0.878 | 99.789 | 24.850 | 0.873 | 0.1235 |
| Ours-15K-FullAttn(去因果掩码) | 82.718 | 81.456 | 82.686 | 0.727 | 99.906 | 0.892 | 99.792 | 24.861 | 0.874 | 0.1193 |
| 增量 | 位姿 RA@5 | 源深度 Rel | PSNR | 解读 |
|---|---|---|---|---|
| scratch → 预训练(15K) | +73.398 pp | 2.331 → 0.742(−68.2 %) | +4.072 dB | VGGT 预训练是绝对主导因素 |
| 15K → 40K(训练量 ×2.67) | +3.496 pp | 0.742 → 0.584(−21.3 %) | +1.420 dB | 收益递减但仍显著 |
| FullAttn → 因果掩码 | −1.068 pp | 0.727 → 0.742(变差 2.1 %) | +0.005 dB(噪声级) | ⚠️ 见下 |
| 有 L_cam → 无 L_cam | (失去位姿输出) | 0.742 → 0.739(略优) | −0.006 dB | L_cam 对质量零贡献 |
图 3 · 设计选择对 PSNR 的增量贡献分解
从 Ours-15K-scratch 的 20.784 dB 出发,逐项叠加。数据来源:论文表 3。
对比 Ours-15K(因果掩码)与 Ours-15K-FullAttn(全注意力),逐指标差值(FullAttn 减 Causal):
| 指标 | Causal | FullAttn | 差值 | 谁赢 |
|---|---|---|---|---|
| RA@5↑ | 81.650 | 82.718 | +1.068 | FullAttn |
| RT@5↑ | 82.233 | 81.456 | −0.777 | Causal |
| AUC@30↑ | 82.631 | 82.686 | +0.055 | FullAttn |
| 源 Rel↓ | 0.742 | 0.727 | −0.015 | FullAttn |
| 源 a1↑ | 99.884 | 99.906 | +0.022 | FullAttn |
| 新 Rel↓ | 0.882 | 0.892 | +0.010 | Causal |
| 新 a1↑ | 99.788 | 99.792 | +0.004 | FullAttn |
| PSNR↑ | 24.856 | 24.861 | +0.005 | FullAttn |
| SSIM↑ | 0.873 | 0.874 | +0.001 | FullAttn |
| LPIPS↓ | 0.1243 | 0.1193 | −0.0050 | FullAttn |
全注意力在 10 项中赢 8 项。 论文题目和摘要都把 "reconstruction-guided causal attention" 作为一级贡献,但它的价值完全不在质量维度,而在两件事上:(1)架构级的目标视角不变性保证;(2)使 KV-Cache 成为可能,从而拿到 5.35× FLOPs 削减。这两点都成立且重要,但论文的叙述方式容易让读者误读为掩码提升了效果。
诚实的表述应该是:「我们用 8/10 项指标上 0.01–1.07 的微小退化,换来了 5.35× 的推理加速与一个可缓存的三维表示」 —— 这个 trade-off 极其划算,但它是 trade-off,不是免费午餐。
caption:"Efficiency comparison of models with and without KV-Cache for inferring a single novel-view appearance and geometry."
| 方法 | 峰值显存 | FLOPs | 单视角耗时 |
|---|---|---|---|
| Matrix3D [30] | 11.31 G | 2228 T | 27 s |
| RnG w/o KV-Cache | 8.12 G | 12.26 T | 213 ms |
| RnG w/ KV-Cache | 7.10 G | 2.29 T | 85 ms |
| 比较 | FLOPs | 时间 | 显存 |
|---|---|---|---|
| KV-Cache 开启 vs 关闭 | 5.35× ↓ | 2.51× ↓ | 12.6 % ↓ |
| RnG (cache) vs Matrix3D | 972.9× ↓ | 317.6× ↓ | 37.2 % ↓ |
| 输入视角数 | PSNR↑ | SSIM↑ | LPIPS↓ | ΔPSNR |
|---|---|---|---|---|
| 1 | 19.452 | 0.811 | 0.1821 | — |
| 2 | 23.403 | 0.860 | 0.1249 | +3.951 |
| 4(训练设置) | 26.276 | 0.891 | 0.0975 | +2.873 |
| 8 | 27.608 | 0.903 | 0.0857 | +1.332 |
衰减结构:增益比 = 2.873/3.951 = 0.727,1.332/2.873 = 0.464,呈明显几何衰减。若以后段比率 r ≈ 0.464 外推,剩余可获收益 ≈ 1.332 × r/(1−r) ≈ 1.15 dB,渐近线约 28.7–28.8 dB。
图 4 · PSNR 随输入视角数的变化与外推
数据来源:论文表 5。增益比 0.727 → 0.464 呈几何衰减,暗示存在容量天花板。论文停在 8 视角,未做 16/32 视角实验来证伪这一外推。
不是「又一个统一模型」,而是重新定义了「三维表示」的候选空间。 过去五年,三维表示的演进是 显式网格 → 体素 → NeRF → 3DGS → 三平面 latent → 结构化 latent。这些全都是为三维专门设计的数据结构。RnG 的主张是:一个通用 transformer 的中间激活可以直接充当这个角色 —— 只要你保证它对查询不变。这个主张的分量在于它把三维表示问题归约成了一个注意力掩码设计问题。
| 可复用件 | 复用方式 | 适用范围 |
|---|---|---|
| 任务级因果掩码 | 在任何「A 任务不应被 B 任务污染」的多任务共享骨干里,用 0/1 掩码切断单向信息流 | 远超三维:多模态理解+生成、检索+重排、感知+规划 |
| KV-Cache 即表示 | 凡「一次编码、多次查询」的任务,把编码侧 K/V 缓存当作可导出的中间产物 | 视频世界模型的场景记忆、长文档 QA、具身智能的空间记忆 |
| 重建先验 → 生成的方向反转 | 不必训生成模型,而是给判别式基座开解码出口 | 检测/分割/深度基座 → 相应的生成任务 |
| Plücker ray 查询接口 | 把「视角」token 化,使查询数量与模型结构解耦 | 任意需要连续参数化查询的渲染/仿真任务 |
| 不变性作为可缓存性的前提 | 「先证明不变,再缓存」这条推理模式 | 系统层的通用设计原则 |
RnG 打开的研究空间可以按「缓存的语义」来组织:
最后一条与本周领域(生成模型 / 世界模型)的连接最紧:视频世界模型的长时一致性问题本质上就是「记忆该以什么形式存在」,而 RnG 给出了一个答案 —— 以重建网络的 KV 形式存在。
对应数据:LPIPS 0.0975 vs LVSM 0.0895(差 8.9 %),PSNR −1.246 dB。
即:单次查询得到的是像素对齐点图(2.5D),要得到闭合三维仍需多次查询 + 融合。所谓「完整三维」是查询后拼出来的,不是一次前向出来的。
表 3 中 Ours-15K-FullAttn 在 10 项指标里 8 项优于或持平 Ours-15K(LPIPS 0.1193 vs 0.1243,差距 0.0050,是 15K→40K 训练量翻倍所带来 LPIPS 改善 0.0268 的 18.7 %)。论文摘要将因果注意力列为核心创新并暗示其带来性能,但证据只支持「它不损害性能且使缓存成为可能」。
论文用 LVSM-40K(24.619)而非 LVSM-100K(27.522)来支撑自己更数据高效(+1.657 dB)。但 RnG 从 VGGT 权重初始化,而 VGGT 本身在大规模多数据集上预训练过。论文自己的 Ours-15K-scratch 给出了这个先验的量级:PSNR 20.784(−4.072 dB)、RA@5 8.252(−73.398 pp)。把预训练算力计入后,「同为 40K 步」的说法失去意义。
缺失的对照组:把 LVSM 也从 VGGT 权重初始化,或把 VGGT 按原目标在同样的 Objaverse 上微调 40K 步后再接 LVSM。前者能分离「RnG 的架构」与「VGGT 的先验」,后者能分离「读出了隐藏几何」与「适配了更简单的分布」。
Ours-15K-w/o cam 与 Ours-15K:PSNR 24.850 vs 24.856(−0.006),LPIPS 0.1235 vs 0.1243(更优),源深度 Rel 0.739 vs 0.742(更优)。也就是说 λ_c = 1(三项中最大权重)的位姿损失,对外观和几何的贡献严格为零甚至略负。合理推断:位姿能力已完全由 VGGT 预训练权重承载,L_cam 只是在保持而非学习。
论文既没讨论这一现象,也没做 λ_c 的敏感性扫描。如果 λ_c 可以降到 0.1 甚至 0.01 而不损失位姿精度,那么外观项能分到更大的有效梯度预算,批判 1 里的「细节缺失」或许能部分缓解。
所有定量结论建立在 GSO(1,030 个物体级、干净背景、环视轨迹的合成渲染) 之上,训练集是同类型的 Objaverse-LVIS。CO3D 只有一张定性图,论文自承 "predictions may be misaligned with the ground truth"。与此同时论文宣称面向 "real-time interactive applications"。一个每视角 85 ms 但只在合成物体上验证过的模型,其「实时交互」的实用性主张缺乏证据。 场景级(室内、街景)、手持轨迹、强遮挡、非朗伯材质 —— 这四类真实条件一个都没有数字。
论文把世界原点问题归为可通过 "improving the data-processing pipeline" 解决。但看架构:ĝ_{s=1} = [I₃ₓ₃ | (0,0,−1)ᵀ] 把第一个源视角钉死为世界系,物体中心只能由「所有源视角光轴的交点」隐式定义。训练数据里所有相机都 look-at 世界中心,这个隐式定义恰好成立 —— 因此模型学到的是数据集采集协议,而非几何不变量。
表 4 显示计算量削减 5.35× 但墙钟只快 2.51×,2.13× 的缺口指向访存瓶颈。当前配置:256×256、patch 8 → 每视角 1024 token;4 源视角 × 24 层的 K/V 缓存约数百 MB。若按论文展望扩展:
| 扩展方向 | token 数变化 | 缓存规模 | 后果 |
|---|---|---|---|
| 512×512 分辨率 | ×4 | ×4(~1.6 GB) | 带宽先于算力饱和 |
| 8→16 源视角 | ×4 | ×4 | 同上 |
| 加入时间维(动态场景) | ×T | ×T | 线性爆炸 |
KV-Cache 作为三维表示的最大弱点恰恰是它的规模与观测量成正比 —— 而好的三维表示应该与场景复杂度成正比,与观测量无关。 一个 3DGS 场景不会因为你多拍了 100 张照片就变大 100 倍。论文没有讨论缓存压缩、剪枝或去冗余。
表 5 的增益比 0.727 → 0.464 呈几何衰减,外推渐近线约 28.7 dB。这意味着即使给到 16 或 32 个视角,RnG 也难以显著超越 LVSM-100K 的 27.522。若属实,瓶颈就不在观测量,而在(a)解码器 D_RGB 的容量、(b)256×256 的分辨率上限、或(c)无生成先验导致的高频细节上限(与论文自述的 "Lack of details" 一致)。论文停在 8 视角,一个 16 视角的数据点就能区分「几何衰减(有天花板)」与「对数增长(无天花板)」。
以下五篇构成一条清晰的问题传递链,而非平行罗列。每一篇解决了链条上的一个维度,同时留下了下一篇要接手的缺口。
传统 MVS/SfM 管线要求已知或先估计相机内外参,一旦位姿估计失败整条管线崩溃。DUSt3R 把成对图像的三维重建重新表述为 pointmap 回归:网络直接输出每个像素在共同坐标系下的三维坐标,"relaxing strict projective camera model constraints"。核心贡献一句话:用一个回归任务吞掉了整条几何管线。
(a)本质上是成对的 —— N 张图需 O(N²) 次前向再加昂贵的全局对齐优化,破坏了「前馈」的纯粹性;(b)尺度歧义;(c)只建模可见 —— pointmap 是像素对齐的,没有像素就没有几何,这是表示形式内生的限制。
RnG 完全继承 pointmap 作为几何输出格式(D_pmap 头、L_pmap 损失),但对缺口 (c) 给出了一个巧妙的绕过而非解决:既然 pointmap 只能覆盖有像素的地方,那就让查询视角提供像素。目标视角的 Plücker 射线在不可见区域也有射线,于是 D_pmap 在那里输出的就是「推测的」几何。
pointmap + 异方差不确定性加权损失从 DUSt3R 经 VGGT 一路传到 RnG,形式几乎未变。这是本链条上最稳定的技术遗产。
在 LRM 之前,单图到三维几乎全靠 per-scene 优化(SDS),一个物体要跑几十分钟。LRM 证明了大规模前馈回归可以取代优化:大 Transformer + Objaverse 规模数据,5 秒出一个三平面 NeRF。核心贡献一句话:把三维重建变成一个「大模型问题」而非「优化问题」。
(a)单图设置下「重建」与「生成」在概念上被混同了 —— 单张图的背面必然是生成的,但 LRM 没有任何机制去区分「我看到了所以确信」和「我没看到所以在猜」;(b)三平面 NeRF 的几何精度受限;(c)需要规范化的相机。
缺口 (a) 是 RnG 的直接靶心。因果掩码在架构层面把两者切开:源视角分支只做重建(且被证明与目标视角无关),目标视角分支才做生成。「区分确信与猜测」这件事,从 LRM 的「无机制」变成了 RnG 的「架构保证」。
「前馈大模型 + Objaverse 训练协议」这个范式,以及 GSO 作为零样本评测集的惯例,都始自 LRM 这条线。RnG 的 113.5 K Objaverse-LVIS + GSO 1,030 物体评测正是它的直接延续。
即便到了 LRM 之后,新视角合成仍普遍依赖 3D 归纳偏置:NeRF/3DGS 的显式表示、epipolar 约束、plane sweep。LVSM 把它们全部删掉,只留一个纯 Transformer:输入图像 token + 目标视角的 Plücker 射线 → 输出像素。结果是相对此前 SOTA +1.5 ~ 3.5 dB PSNR,且 1–2 张 GPU 就能超过所有此前方法。核心贡献一句话:证明三维归纳偏置不是必需品,数据和规模可以替代它。
LVSM 有两个变体,对理解 RnG 至关重要:Encoder-Decoder 把输入压成固定数量的 1D latent token 作为场景表示(一个「学出来的隐式三维表示」);Decoder-Only 完全去掉中间表示,质量更好但更贵。
(a)必须有真值相机位姿 —— RnG 为了对比不得不用 VGGT 给它补位姿,得到 "VGGT + LVSM" 这个拼接基线,PSNR 只有 19.394,比 LVSM 自己的 27.522 掉了 8.1 dB,说明拼接管线的误差传播极其严重;(b)不输出任何几何;(c)Encoder-Decoder 的 latent 虽是「隐式三维」,但它是为渲染新学的,与任何重建任务都不对齐,因此无法从中读出几何。
D_pmap 头,同一份 token 同时出 RGB 与几何。极其直接:Plücker ray map 作为目标视角查询接口,RnG 与 LVSM 完全同构。可以把 RnG 理解为「把 LVSM 的编码器换成 VGGT,并把 latent token 换成 KV-Cache」。RnG 也诚实地把 LVSM 列为纹理细节缺失问题的同病相怜者。
DUSt3R 的成对限制与全局对齐开销。VGGT 用一个前馈网络、交替的 frame-attention 与 global-attention,从任意数量视角同时推出相机参数、深度图、点图与三维点轨迹,< 1 秒,且无需任何后处理优化即超过带优化的方法。核心贡献一句话:三维感知的所有任务可以由一个网络一次前向全部输出。
一个,但很大:它是纯判别式的,输出是「观测的函数」而非「场景的模型」。(a)只建模可见区域,CD = 0.0260 里没有任何背面信息;(b)没有任何生成能力;(c)—— 这一点是 RnG 的洞察 —— 它的隐空间可能已经知道答案,只是没有出口。
RnG 的回应是最小侵入式的:不改架构、不改预训练权重的初始化、不加新模块,只加(i)一个 0/1 注意力掩码、(ii)两个输出头、(iii)目标视角的射线输入,然后微调 40 K 步。结果是 VGGT 的所有能力被保留并增强(RA@5 74.239 → 85.146,源深度 Rel 5.960 → 0.584),同时获得了生成能力。
传递的是权重本身,这是本链条上唯一一处「继承」而非「借鉴」。也正因如此,Ours-15K-scratch 的崩塌(PSNR −4.072 dB、RA@5 −73.4 pp)才是全文最重要的消融 —— 它量化了这份遗产的价值。从技术传递的角度说,RnG 的贡献不是「造了一个新模型」,而是「发现了 VGGT 里一个没人用的出口」。 这既是它的优雅之处,也是批判 2 的根源。
Matrix3D 是第一个把「统一重建 + 生成」明确设为目标的工作。它用多模态 DiT 把图像、相机参数、深度图三种模态统一进一个扩散过程,配合 mask learning 策略「enables full-modality model training even with partially complete data」。核心贡献一句话:用扩散模型的模态补全能力,把摄影测量的所有任务变成同一个「填空」问题。
RnG 是对 Matrix3D 的方向反转式回答。Matrix3D 说:拿一个生成模型(扩散),教它做重建。RnG 说:拿一个重建模型(VGGT),给它开一个生成出口。结果是全面碾压:CD 降低 10.0×(恰好一个数量级)、PSNR +7.540 dB、速度 317.6×。
传递的是问题定义与评测协议,而非技术模块。Matrix3D 定义了「统一模型该被怎样评价」(位姿 + 深度 + NVS + 完整三维四维度同时报),RnG 的表 2 结构就是这个协议的直接继承 —— 只是把每一格的数字都改写了。这是一种「批判式继承」:接受对手的评价标准,然后在对手的标准上击败它。
每一步都在削弱「三维表示必须是专门设计的数据结构」这个前提。RnG 是目前这条线的终点:表示不再被设计,而被复用。
| 阶段 | 主导思路 | 代表 | 结果 |
|---|---|---|---|
| 2023–2024 | 各自为政 | LRM(重建)/ Zero-1-to-3(生成) | 两条独立技术栈 |
| 2025 上半 | 给生成模型加几何 | Matrix3D | 能生成,但慢且不一致(CD 0.0670) |
| 2025 下半 | 重建基座成熟 | VGGT(Best Paper) | 判别侧封顶,生成侧空白 |
| 2026 | 给重建模型开生成出口 | RnG | 快 317×、CD 降 10× |
阶段间的关键转折点有两个:
社区关注点的转移:早期关注精度(PSNR、Chamfer),中期关注泛化(零样本、跨数据集),当前正转向表示的可操作性 —— 能不能编辑、压缩、拼接、加时间维。RnG 的 KV-Cache 恰好把这些问题变成了熟悉的 LLM 系统问题(KV 压缩、缓存复用、注意力剪枝),这可能是它最大的溢出价值。
| 工作 | 年月 | 会议 / 出版 | 核心贡献 | 关键指标 | 与 RnG 的关系 |
|---|---|---|---|---|---|
| LRM | 2023.11 | ICLR 2024 | 前馈大模型取代 per-scene 优化 | 单图 → 三平面 NeRF,~5 s | 提供范式与 Objaverse/GSO 评测协议 |
| DUSt3R | 2023.12 | CVPR 2024 | pointmap 回归,免位姿成对重建 | 深度/相对位姿多项 SOTA | 提供 pointmap 输出格式与不确定性损失 |
| LVSM | 2024.10 | ICLR 2025 Oral | 删除全部 3D 归纳偏置 | GSO PSNR 27.522(需真值位姿) | 提供 Plücker ray 查询接口;唯一在 PSNR 上胜过 RnG 的方法 |
| Matrix3D | 2025.02 | CVPR 2025 | 多模态 DiT 统一重建+生成 | CD 0.0670 / PSNR 18.736 / 27 s | 定义问题与评测协议;RnG 的主要打击目标 |
| VGGT | 2025.03 | CVPR 2025 Best Paper | 一次前馈出全部 3D 属性 | RA@5 74.239 / Rel 5.960 / CD 0.0260 | 架构与权重的直接来源;RnG 的性能地板 |
| RayZer | 2025.05 | ICCV 2025 (BSP-HM) | 完全自监督,无位姿无几何标注 | 与有位姿方法可比 | 表 1 中列为「无几何重建」的对照 |
| Gen3R | 2026.01 | arXiv (v2 2026.03) | VGGT 适配器 + 视频扩散 latent 对齐 | 单/多图条件场景生成 SOTA | 平行路线:同基于 VGGT,但耦合扩散 |
| NOVA3R | 2026.03 | arXiv | 非像素对齐 ViT 做 amodal 3D | — | 平行路线:直接攻击 pointmap 的可见性限制 |
| ★ RnG | 2026.03 | CVPR 2026 Highlight | KV-Cache 即隐式三维表示 + 任务级因果掩码 | RA@5 85.146 / Rel 0.584 / PSNR 26.276 / CD 0.0067 / 85 ms | 汇聚点 |
不是泛泛地「研究表示能力」,而是:在固定的 L 层 × N token × d 维缓存预算下,可无损重建的场景复杂度上界是多少? 可操作实验:固定 RnG 骨干,对缓存做低秩截断(保留 top-r 奇异值)或 token 剪枝(保留 k% token),画出「缓存压缩率 vs CD/PSNR」曲线。若存在明显拐点(相变),那就是这个表示的信息容量;若曲线平滑,说明缓存高度冗余。这是本方向高价值低门槛的第一空白 —— 不需要重训,推理时就能做。
表 3 显示 FullAttn 在质量上并不更差 —— 说明即使不做架构保证,网络也自发学到了近似的不变性。可操作实验:在 FullAttn 模型上直接测量「同一组源视角在不同目标查询下的重建输出差异」,若该差异 < 0.1 % 相对变化,那么因果掩码就是一个可以事后验证而非事前强加的性质。这个实验会直接改变对本文核心贡献的定性。
RnG 证明了 VGGT 的隐空间含有未被监督的完整几何。这是普遍现象还是三维任务特有?可操作对照:对分割基座(SAM 系)、深度基座、检测基座做同样的手术 —— 加查询接口 + 生成头 + 少量微调,看是否也能读出「未被监督的能力」。
具体空白:判定「RnG 优于 LVSM」缺乏 head-to-head 的公平实验。建议在相同硬件、相同数据预算、相同初始化下做三组对比:(i) LVSM from scratch;(ii) LVSM 从 VGGT 权重初始化;(iii) RnG。若 (ii) 追平 (iii),则 RnG 的增益主要来自预训练而非架构。这是下一步最关键的单一实验。
具体空白:建议社区统一报告 accuracy / completeness 分解 + 可见区域 / 不可见区域分别统计的四格矩阵。对 RnG 而言最有信息量的是「不可见区域的 accuracy」—— 那才是「生成得对不对」的唯一诚实指标。当前的总 CD 无法区分「补全得准」与「补全得多」。
具体空白:需要一个「不完整几何」的场景级基准:室内房间的手持视频,标注被家具遮挡的墙面/地板真值。评测协议应直接对准「遮挡区域的几何精度」,而非整体 CD。没有这个基准,「完整三维建模」在真实场景里就无法被证伪。
具体空白:当观测流式到来(机器人边走边看),缓存必须增量更新。新观测应该追加为新的 KV 条目,还是与旧条目融合? 追加导致线性增长(批判 7 的瓶颈),融合会引入信息损失。可操作研究:设计缓存准入/淘汰策略(类比 LLM 的 H2O、StreamingLLM),用「加入该视角后 CD 的改善量」作为准入分数,测量固定缓存预算下的 CD-预算曲线。
具体空白:可操作的第一步实验:屏蔽对应某个物体区域的源视角 token 的 K/V,看渲染结果是否干净地删除该物体(而非产生伪影)。这个实验一天就能做完,而它的成败会决定「KV-Cache 是表示还是仅仅是加速缓冲」这个定性问题。
具体空白:当前视频世界模型的长时一致性依赖各种外挂记忆机制,其表示形式大多是启发式设计的。RnG 提示了另一种可能:用三维重建骨干的 KV-Cache 作为世界模型的空间记忆,视频生成器每帧向它查询。研究问题:几何一致的记忆 vs 外观一致的记忆,哪个对长时一致性更关键? 可操作对照:在同一视频生成器上分别接入(a)RnG 式几何缓存、(b)纯视觉特征缓存、(c)两者拼接,测量 1000 帧后的漂移量。
具体空白:能否设计一个与源视角选择等变的世界系定义? 可操作方案:以预测点云质心作为原点、以点云主轴作为朝向做规范化,并在训练中加入随机源视角置换的一致性损失。评测指标:同一物体在不同源视角子集下的重建结果之间的 CD(越低越等变)。这个指标目前根本没有人报告。
具体空白:如果 400 MB 的 KV-Cache 能压到 10 MB 且 CD 退化 < 5 %,它就成了一种可传输的三维资产格式,且天然支持「解压即渲染」。研究问题:三维内容的 rate-distortion 曲线在神经缓存表示下是什么形状? 与 3DGS 压缩、网格压缩直接对标。
具体空白:RnG 的 L_pmap 里已经有 aleatoric 不确定性项 Σ_t,但论文从未把它作为输出使用。研究问题:Σ_t 能否作为「这块几何是看到的还是猜的」的可靠指示? 可操作实验:在 GSO 上按真值可见性把像素分成两组,检验 Σ_t 的分布是否可分(AUROC)。若可分,RnG 就免费获得了一个「置信度感知的完整三维」输出 —— 这对下游物理仿真是刚需。这个能力论文已经训出来了,只是没有拿出来用。
与 RnG 同样基于 VGGT,但选择耦合视频扩散而非纯前馈:训练适配器把 VGGT 的几何 latent 与视频扩散的外观 latent 对齐,同时生成 RGB 视频与几何。是「场景级」路线的代表。值得看的理由:它证明了 VGGT 隐空间可复用这件事不止一条实现路径。
arXiv | HTML
直接攻击 pointmap 表示的根本限制:像素对齐意味着「没有像素就没有几何」。NOVA3R 放弃像素对齐,用非对齐 ViT 做 amodal(含遮挡部分)三维重建。与 RnG 是同一问题的两种解法 —— RnG 用「让查询视角提供像素」绕过,NOVA3R 用「不再需要像素」正面解决。
arXiv HTML
三维生成的另一极:不走「从图像重建」而走「原生三维 latent 扩散」。与 RnG 形成表示层面的直接对立 —— 一个主张「专门设计的结构化 latent」,一个主张「复用通用 transformer 的 KV」。两条路线的 rate-distortion 对比会是接下来两年的核心争论。
arXiv | 项目页
实时流式交互世界模型,核心难点正是长时记忆的表示形式。与 RnG 的 KV-Cache 思路可直接对话(见 9.3-N1)。值得看:它给出了「实时 + 长时一致」这组约束下当前工程实践的上界。
arXiv | 项目页
提出可适配任意步数转移的生成目标,把「少步生成」从蒸馏问题变回训练目标问题。与本期主线正交但相关:如果扩散能真正做到少步,RnG 相对 Matrix3D 的 317× 速度优势会被侵蚀多少?
CVPR 2026 Highlights
用测试时训练处理长上下文的自回归三维重建。与 RnG 的缓存扩展性问题(批判 7)直接相关:当观测数超出模型训练配置时,是扩缓存还是做 TTT?
CVPR 2026 Highlights
完全去掉位姿与几何监督,只用 2D 图像自监督,唯一的三维先验是射线结构。值得看:如果 RnG 的路线要摆脱对 VGGT 预训练的依赖(批判 2),RayZer 的自监督框架是最可能的替代方案。
arXiv | Code | 项目页
它至今仍是 GSO PSNR 上的最强方法(27.522),且代码完全开源。 任何声称在新视角合成上超越前人的工作,都应当与 LVSM-100K 而非 LVSM-40K 做对比。
arXiv | Code | ICLR Proceedings
| 维度 | 结论 |
|---|---|
| 一句话 | 三维表示可以就是重建网络自己的 KV-Cache |
| 最强证据 | 源深度 Rel 5.960(VGGT)→ 0.584(RnG),同一骨干同一权重,降低 90.2 % |
| 最大反差 | 标题级贡献「因果掩码」在表 3 的 10 项质量指标中输掉 8 项;其价值全在 5.35× FLOPs 削减与架构不变性保证 |
| 唯一败绩 | PSNR 26.276 < LVSM-100K 的 27.522(−1.246 dB),论文自承细节表现力不足 |
| 最被低估的结果 | 8 输入视角时 RnG(27.608)无位姿反超 LVSM-100K(27.522)有位姿 |
| 最大方法论缺陷 | 世界原点由「源视角光轴交点」隐式定义 → 学到的是数据集协议而非几何不变量 → CO3D 无定量结果 |
| 最该补的实验 | LVSM 从 VGGT 权重初始化的对照组;CD 的 accuracy/completeness 分解;16/32 视角外推 |
| 最大溢出价值 | 把三维表示问题翻译成了 LLM 系统问题(KV 压缩、缓存复用、注意力剪枝) |