ML/AI 每日深度论文追踪 · 周三 · 生成模型

RnG:把 KV-Cache 当作隐式三维表示

A Unified Transformer for Complete 3D Modeling from Partial Observations

CVPR 2026 Highlight 2026-08-05 arXiv:2603.01194 · v1 · 2026-03-01 候选池 27 篇 · shuf 随机命中 #14 · 重抽 0 次 索引未自动更新(见脚注)

三维表示不必是点云、不必是高斯、也不必是三平面 —— 它可以就是重建网络自己的 KV-Cache。RnG 只加了一个 0/1 注意力掩码和两个输出头,就让 CVPR 2025 最佳论文 VGGT 从「只能重建看得见的」变成「能生成看不见的」:Chamfer Distance 降低 10×,速度比扩散式统一模型快 317×。但论文最有意思的地方在于,它自己的消融数据显示:那个写进标题的因果掩码,在 10 项质量指标里输掉了 8 项。

0. 本期元信息与坦诚性声明

内容
日期 / 星期2026-08-05,周三(date +%u = 3)
轮转领域生成模型 —— 扩散 / 流匹配、自回归生成、3D 生成、世界模型
候选池27 篇(ICLR 2026 Oral 9 · CVPR 2026 Highlight 7 · ICML 2026 Oral 4 · arXiv 2026 7)
抽取方式shuf -i 1-27 -n 1 → 命中 #14,重抽 0
核心论文RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations(CVPR 2026 Highlight)
坦诚性声明(前置)。 本报告基于 arXiv HTML 全文(v1,2026-03-01)、项目主页与 CVPR 2026 Highlight 页面。以下三点是本次分析的已知盲区,正文会再次点名:
  1. 代码仓库(GitHub)与权重(Hugging Face)链接由项目页给出,但本次抓取工具因来源白名单限制未能独立打开验证,表中标注为「未独立验证」。
  2. 论文的 CO3D 实验没有任何定量表格,只有定性图(Fig. 10),因此关于真实场景泛化的判断只能是推断。
  3. 表 2 中 MUSt3R 一行的 RA@5 与 RT@5 数值完全相同(21.683 / 21.683),这在两个独立指标上是罕见巧合,疑为原文排版或 HTML 解析问题,我无法核对 PDF 原始排版。

1 · 链接验证表

✅ = 本次运行实际抓取并确认可达;⚠️ = 来源可信但本次未能独立打开。

论文出版 / 会议页arXivCode数据 / 权重项目页
核心:RnG
CVPR 2026 Highlight
CVPR 2026 Highlights 2603.01194
HTML 全文
github.com/XiangMochu/RnG ⚠️ Objaverse-LVIS 113.5K;hf.co/MochuXiang/RnG ⚠️ npucvr.github.io/RnG
DUSt3R
CVPR 2024
CVF PDF 2312.14132 naver/dust3r Habitat / MegaDepth / ScanNet++ 混合 CVPR Poster
LRM
ICLR 2024
ICLR PDF ✅ · OpenReview 2311.04400 官方未开源;OpenLRM Objaverse + MVImgNet 未找到
LVSM
ICLR 2025 Oral
ICLR Proceedings ✅ · Oral 页 2410.17242 haian-jin/LVSM Objaverse、RealEstate10K 项目页
VGGT
CVPR 2025 Best Paper
CVF Open Access 2503.11651 facebookresearch/vggt VGGT-1B(非商用)/ VGGT-1B-Commercial(Co3D AUC@30 90.37 vs 89.98) vgg-t.github.io
Matrix3D
CVPR 2025
CVF Open Access ✅ pp.11250–11263 2502.07685 见项目页 CO3D 等 nju-3dv
RayZer
ICCV 2025 BSP-HM
ICCV CVF PDF 2505.00702 hwjiang1510/RayZer 项目页

2 · 核心论文深度解析

2.1 一句话定位

三维表示不必是点云、不必是高斯、也不必是三平面 —— 它可以就是重建网络自己的 KV-Cache。

这句话里最关键的不是「KV-Cache 很快」,而是「重建网络的中间激活本身已经编码了它从未被监督过的那部分几何」。RnG 的全部工程都是为了把这条假设变成可查询、可渲染、可导出的东西。

2.2 Motivation 与问题论证

痛点的精确形式

前馈式可泛化三维重建(DUSt3R → VGGT 这条线)在两年内把「稀疏图像 → 三维」压到亚秒级,但它们在训练目标上就只被要求恢复可见区域的几何

"their representations are often confined to observed regions, leaving unseen geometry un-modeled." —— Abstract

"Most 3D reconstruction pipelines are explicitly trained to recover geometry only for regions visible in the input camera views. Consequently, their geometric outputs are incomplete, hindering downstream applications that demand a complete object representation, such as physics simulation or content generation." —— Introduction

痛点如何被量化

论文没有用抽象的「不完整率」,而是用 Chamfer Distance(CD) 作为全篇判决指标。表 2:VGGT 作为纯重建模型,源视角深度 Rel 只有 5.960(已很强),但完整三维 CD = 0.0260;RnG 的 CD = 0.0067,低 74.2%(3.88×)。这就是「可见几何做得再好,也换不来完整几何」的定量表述。

更有说服力的是反向对照:Matrix3D 是当时唯一能生成不可见区域的统一模型,其无位姿设置下 CD = 0.0670 —— 比完全不做生成的 VGGT(0.0260)还差 2.58×。截至 RnG 之前,社区面对的是一个非此即彼的困境:

路线代表可见几何不可见几何实时性
判别式重建VGGT极强(Rel 5.960 / CD 0.0260)不建模✅ < 1 s
生成式统一Matrix3D弱(Rel 9.430 / CD 0.0670)可生成但不一致❌ 27 s

为什么值得解决

"Although prior work has focused on adapting generative priors for reconstruction, we demonstrate that the reverse direction of transferring reconstruction priors to generation is viable and effective." —— Related Work

过去两年主流做法是「给生成模型(扩散)打上几何补丁」(Zero-1-to-3、Matrix3D、Gen3R 皆属此类);RnG 走的是「给重建模型开一个生成出口」。

2.3 论文的故事线(论证结构)

论文的论证不是「我们提出模块 X,效果好」,而是一条有明确转折点的推理链:

第一步:提出一个可证伪的假设

"feed-forward 3D reconstruction foundation models, while primarily trained to recover visible geometry, may possess the potential to infer a more complete 3D representation within their latent space"

这是全文的支点。它可证伪 —— 如果为真,只需要一个解码器就能读出完整几何,而不需要重训生成模型。

第二步:设计一个「只加读取通道、不改写表示」的架构

关键推论:要验证「隐空间里已经有完整三维」,就必须保证加入目标视角查询这件事本身不能改变重建结果。否则你无法区分「隐空间里本来有」与「目标视角把答案偷渡进来了」。这直接推出了因果掩码。

这是全文最漂亮的一步: 因果掩码在这里首先是一个科学控制变量的手段,其次才是一个工程优化。

第三步:从科学控制里收获工程红利

一旦源视角的 K/V 与目标视角无关,它们就可以被缓存。于是「隐式三维表示」= 缓存的 K/V 张量,查询新视角 = 一次跨注意力。表 4:FLOPs 12.26 T → 2.29 T(5.35×),单视角 85 ms,比 Matrix3D 的 27 s 快 317.6×

第四步:用「不做什么」来定义贡献

RnG 不引入扩散、不引入 GAN、不引入 3DGS/NeRF、不引入新的三维表示。它只加了一个 0/1 掩码和两个输出头。

隐含的设计权衡

论文没明说但表 2/3 写得很清楚:用纹理细节换几何完整性与速度。RnG 的 PSNR 26.276 低于 LVSM-100K 的 27.522(−1.246 dB),LPIPS 0.0975 差于 0.0895。换来的是 CD 从「不可得」变成 0.0067,以及 317× 的加速。

2.4 方法论与机制解剖

2.4.1 整体流程

┌────────────── 源视角 (S 张, 无需位姿) ──────────────┐ 输入 │ I_1 ... I_S ──DINO ViT──▶ patch tokens (1024/view)│ └──────────────────────────┬─────────────────────────┘ │ + camera tokens │ + register tokens 目标视角查询 Plücker ray map ──Linear──┤ (任意视角, 可无限多) │ ▼ ┌────────────────────────────────────┐ │ L = 24 层 交替 (frame ↔ global) │ │ attention,global 层施加因果掩码 M │ │ │ │ 源→源 ✅ 源→目标 ❌(被 M 屏蔽) │ │ 目标→源 ✅ 目标→目标 ✅ │ └───────────┬────────────┬───────────┘ │ │ 源视角 token │ │ 目标视角 token ▼ ▼ ┌────────────┐ ┌──────────────────┐ │ camera head│ │ D_RGB → Î_t │ │ → ĝ_s │ │ D_pmap → P̂_t │ └────────────┘ └──────────────────┘ │ 多视角查询累积 ─┴─▶ 完整 3D 点云

2.4.2 核心机制:重建引导的因果注意力

{s} 为源视角 token 下标集合,{t} 为目标视角 token 下标集合:

M_{i,j} = 0, 若 i ∈ {s} 且 j ∈ {t} M_{i,j} = 1, 其余情况 Out = softmax( (M ⊙ QKᵀ) / √d_k ) V

语义:源视角 query 禁止访问目标视角 key。这不是标准的自回归下三角因果掩码,而是一个任务级的单向屏障 —— 「重建」这一侧对「生成」这一侧完全免疫。论文称之为 reconstruction-guided

2.4.3 KV-Cache 作为隐式三维表示

阶段一 · 重建与缓存(与目标视角无关,可离线做一次):

K'_s = Cache(K_s), V'_s = Cache(V_s)

对每一层、每个源视角 token 缓存 K/V。这组张量就是场景的三维表示。

阶段二 · 生成与查询(每个新视角只做这一步):

Out_t = softmax( Q_t · [K'_s ; K_t]ᵀ / √d_k ) · [V'_s ; V_t] Î = D_RGB(Out_t) # 新视角 RGB P̂ = D_pmap(Out_t) # 像素对齐点图(含不可见区域的推测几何)

目标视角的 Plücker 射线经线性投影得到 Q_t,直接查询缓存,完全跳过源视角分支的前向计算

2.4.4 关键机制汇总

机制 / 维度设计选择动机关键超参 / 数值
骨干继承 VGGT 架构 与权重复用「隐空间已含完整三维」的先验L = 24 层,交替 frame/global attention
源视角编码DINO ViT patch token沿用 VGGT 预训练分布256×256,patch 8 → 1024 token/view
目标视角编码Plücker ray map + Linear与 LVSM 同构;把「视角」变成可查询 token6 维射线 → d_model
任务分离二值因果掩码 M保证重建对目标视角不变 → 才能缓存0/1,无参数
三维表示24 层 K/V 缓存无需显式几何,读取即渲染4 view × 1024 token × 24 层 × (K,V)
几何输出像素对齐点图 D_pmap继承 DUSt3R/VGGT 的 pointmap 范式逐像素 3D 坐标
外观输出D_RGB直接回归,无扩散MSE + 感知损失
世界系锚定首个源视角钉死隐式定义世界坐标ĝ_{s=1} = [I₃ₓ₃ | (0,0,−1)ᵀ]

2.4.5 训练目标

L = L_RGB + λ_pmap · L_pmap + λ_c · L_cam L_RGB = ‖I_t − Î_t‖₂ + λ_p · Perceptual(I_t, Î_t) L_pmap = ‖Σ_t ⊙ (P_t − P̂_t)‖ + ‖Σ_t ⊙ (∇P_t − ∇P̂_t)‖ − α · log Σ_t L_cam = Σ_s |g_s − ĝ_s|_ε (Huber)

L_pmap 第二项是梯度域监督(法向 / 边界锐度),第三项 −α log Σ_t 是不确定性正则,防止网络把所有区域的 Σ 压到 0 逃避监督。

2.4.6 工程细节与超参

取值取值
硬件8 × A800训练步数40 K(主结果)/ 15 K(消融)
Batch96 = 6 物体 × 3 目标视角 × 2 梯度累积分辨率 / patch256 × 256 / 8
损失权重λ_pmap = 0.2,λ_c = 1,λ_p = 0.5,α = 0.2学习率峰值 6e-4,3000 步 warmup + cosine
训练数据Objaverse LVIS 子集,113.5 K 物体推理重建 ≈ 0.2 s;每新视角 < 0.1 s
埋点提示。 注意 λ_c = 1 是三项里权重最大的。第 2.7 节批判 #4 会回到这一点 —— 权重最大的那一项,在消融里对下游指标的贡献是 0

3 · 实验设计与定量结果

3.1 基准与协议

用途数据集规模说明
训练Objaverse(LVIS 子集)113.5 K 物体合成物体,环视轨迹
主评测Google Scanned Objects (GSO)1,030 物体真实扫描的合成渲染,零样本
泛化CO3D⚠️ 仅定性(Fig. 10),无定量表
分组指标含义
重建 · 位姿RA@5↑ / RT@5↑ / AUC@30↑旋转、平移在 5° 内的准确率;位姿 AUC
重建 · 源视角深度Rel↓ / a1↑相对误差(%);δ<1.25 内点率(%)
生成 · 新视角深度Rel↓ / a1↑同上,但对未观测视角
生成 · 新视角合成PSNR↑ / SSIM↑ / LPIPS↓外观质量
完整三维CD↓Chamfer Distance —— 全文唯一的「完整性」判据

3.2 主结果矩阵(表 2,GSO,4 输入视角)

表 2 原文 caption:"Quantitative comparison. We evaluate the reconstruction and generation ability of all models on the GSO dataset. '—' means that the model is not capable of delivering that result."

方法 RA@5↑RT@5↑AUC@30↑ 源 Rel↓源 a1↑ 新 Rel↓新 a1↑ PSNR↑SSIM↑LPIPS↓CD↓
(A)已知位姿设置
LVSM [18] (100K)27.5220.9020.0895
LGM [44]13.70485.64616.80482.20516.6770.7510.22480.1130
Matrix3D [30] (posed)8.78295.3838.89793.85819.9410.8030.16840.0580
pixelSplat [4]33.59433.24139.81920.72312.9040.7180.45140.4898
(B)无位姿设置 —— RnG 的正式赛道
MUSt3R [3] 21.68321.683 33.49010.94192.6630.7757
VGGT [50]74.23965.68077.2345.96097.7230.0260
VGGT [50] + LVSM [18]74.23965.68077.2345.96097.72319.3940.7960.19800.0260
Matrix3D [30] (unposed)43.77065.92266.3899.43092.2619.96490.28218.7360.7860.19300.0670
RnG (Ours)85.14686.01986.9420.58499.9290.71799.85026.2760.8910.09750.0067

※ MUSt3R 的 RA@5 与 RT@5 数值相同,疑为原文排版或本次 HTML 解析问题,未能核对 PDF。

图 1 · GSO 新视角合成 PSNR 对比

数据来源:论文表 2 与表 3。悬停查看具体数值。注意 RnG 是唯一无需真值位姿却达到 26+ dB 的方法。

RnG(本文,无位姿) 基线方法
0 5 10 15 20 25 30 pixelSplat 12.904 LGM 16.677 Matrix3D (unposed) 18.736 VGGT + LVSM 19.394 Matrix3D (posed) 19.941 LVSM-40K 24.619 RnG (Ours) 26.276 LVSM-100K 27.522 PSNR (dB) — 越高越好

图 2 · 完整三维 Chamfer Distance(对数刻度)

数据来源:论文表 2 最后一列。两年内 CD 下降约 73×,且下降不平滑 —— VGGT 与 RnG 各贡献一次数量级跳变。

RnG(本文) 基线方法
0.005 0.01 0.02 0.05 0.1 0.2 0.5 pixelSplat 0.4898 LGM 0.1130 Matrix3D (unposed) 0.0670 Matrix3D (posed) 0.0580 VGGT 0.0260 RnG (Ours) 0.0067 Chamfer Distance(对数刻度)— 越低越好

3.3 相对提升汇总

对比对象位姿 RA@5源深度 RelPSNRCD
vs VGGT(最强纯重建)+10.907 pp(+14.7 %)5.960 → 0.584,降低 90.2 %(10.21×)0.0260 → 0.0067,降低 74.2 %(3.88×)
vs VGGT + LVSM(拼接管线)同上同上+6.882 dB同上
vs Matrix3D(unposed,最强统一模型)+41.376 pp降低 93.8 %+7.540 dB降低 90.0 %(恰好 10.0×)
vs Matrix3D(posed)降低 93.3 %+6.335 dB降低 88.4 %(8.66×)
vs LGM降低 95.7 %+9.599 dB降低 94.1 %(16.87×)
vs LVSM-100K(唯一败绩)−1.246 dB
⭐ 全文最有说服力的定量证据:源视角深度相对误差从 VGGT 的 5.960 降到 0.584 —— 一个数量级(10.21×)。

这个数字之所以关键,在于 RnG 继承的正是 VGGT 的权重。同一套骨干、同一批初始化,仅仅换了训练目标与领域,可见几何误差就掉了 90.2 %。它同时支撑与削弱论文的主张:

  • 支撑:证明 VGGT 的隐空间确实「没有被榨干」,还有大量几何信息未被原目标读出 —— 这正是论文核心假设的直接证据。
  • 削弱:如此巨大的落差也说明这里有领域适配的成分。VGGT 在通用场景训练,RnG 在物体级合成渲染上微调并在同分布的 GSO 上评测。5.960 → 0.584 里有多少是「读出了隐藏信息」、多少是「换了个更容易的分布」,论文没有做拆解实验。这是我认为全文最重要的一个缺失对照组。

3.4 消融研究(表 3)

配置RA@5↑RT@5↑AUC@30↑源 Rel↓源 a1↑新 Rel↓新 a1↑PSNR↑SSIM↑LPIPS↓
LVSM-100K(对照)27.5220.9020.0895
LVSM-40K(等步数对照)24.6190.8640.1544
Ours-40K(完整)85.14686.01986.9420.58499.9290.71799.85026.2760.8910.0975
Ours-15K81.65082.23382.6310.74299.8840.88299.78824.8560.8730.1243
Ours-15K-scratch(无预训练)8.25217.18433.6542.33199.4752.33199.36420.7840.8190.2035
Ours-15K-w/o cam(去 L_cam)0.73999.8900.87899.78924.8500.8730.1235
Ours-15K-FullAttn(去因果掩码82.71881.45682.6860.72799.9060.89299.79224.8610.8740.1193

逐层增量分解

增量位姿 RA@5源深度 RelPSNR解读
scratch → 预训练(15K)+73.398 pp2.331 → 0.742(−68.2 %)+4.072 dBVGGT 预训练是绝对主导因素
15K → 40K(训练量 ×2.67)+3.496 pp0.742 → 0.584(−21.3 %)+1.420 dB收益递减但仍显著
FullAttn → 因果掩码−1.068 pp0.727 → 0.742(变差 2.1 %+0.005 dB(噪声级)⚠️ 见下
有 L_cam → 无 L_cam(失去位姿输出)0.742 → 0.739(略优)−0.006 dBL_cam 对质量零贡献

图 3 · 设计选择对 PSNR 的增量贡献分解

从 Ours-15K-scratch 的 20.784 dB 出发,逐项叠加。数据来源:论文表 3。

VGGT 预训练权重 训练量 15K→40K 因果掩码(≈ 0)
20 21 22 23 24 25 26 27 scratch 20.784 +4.072 +1.420 Ours-40K = 26.271 ≈ 26.276 PSNR (dB) — 各设计选择的增量贡献分解(表 3)
⚠️ 相变式的反直觉发现:标题级贡献在质量维度上是负收益

对比 Ours-15K(因果掩码)与 Ours-15K-FullAttn(全注意力),逐指标差值(FullAttn 减 Causal):

指标CausalFullAttn差值谁赢
RA@5↑81.65082.718+1.068FullAttn
RT@5↑82.23381.456−0.777Causal
AUC@30↑82.63182.686+0.055FullAttn
源 Rel↓0.7420.727−0.015FullAttn
源 a1↑99.88499.906+0.022FullAttn
新 Rel↓0.8820.892+0.010Causal
新 a1↑99.78899.792+0.004FullAttn
PSNR↑24.85624.861+0.005FullAttn
SSIM↑0.8730.874+0.001FullAttn
LPIPS↓0.12430.1193−0.0050FullAttn

全注意力在 10 项中赢 8 项。 论文题目和摘要都把 "reconstruction-guided causal attention" 作为一级贡献,但它的价值完全不在质量维度,而在两件事上:(1)架构级的目标视角不变性保证;(2)使 KV-Cache 成为可能,从而拿到 5.35× FLOPs 削减。这两点都成立且重要,但论文的叙述方式容易让读者误读为掩码提升了效果。

诚实的表述应该是:「我们用 8/10 项指标上 0.01–1.07 的微小退化,换来了 5.35× 的推理加速与一个可缓存的三维表示」 —— 这个 trade-off 极其划算,但它是 trade-off,不是免费午餐。

3.5 效率分析(表 4)

caption:"Efficiency comparison of models with and without KV-Cache for inferring a single novel-view appearance and geometry."

方法峰值显存FLOPs单视角耗时
Matrix3D [30]11.31 G2228 T27 s
RnG w/o KV-Cache8.12 G12.26 T213 ms
RnG w/ KV-Cache7.10 G2.29 T85 ms
比较FLOPs时间显存
KV-Cache 开启 vs 关闭5.35× ↓2.51× ↓12.6 % ↓
RnG (cache) vs Matrix3D972.9× ↓317.6× ↓37.2 % ↓
注意 5.35× 与 2.51× 之间的 2.13× 缺口。 计算量削减了 5 倍多,墙钟只快了 2.5 倍,说明缓存查询路径已经从计算受限转为访存受限。粗算:24 层 × 4 源视角 × 1024 token × d_model(VGGT-1B 量级约 1024)× K/V 两份 × 2 字节 ≈ 400 MB 量级的缓存需在每次查询时被完整读过。这对 RnG 宣称的 "real-time interactive" 有直接影响 —— 见批判 #7。

3.6 输入视角数敏感性(表 5)

输入视角数PSNR↑SSIM↑LPIPS↓ΔPSNR
119.4520.8110.1821
223.4030.8600.1249+3.951
4(训练设置)26.2760.8910.0975+2.873
827.6080.9030.0857+1.332

衰减结构:增益比 = 2.873/3.951 = 0.727,1.332/2.873 = 0.464,呈明显几何衰减。若以后段比率 r ≈ 0.464 外推,剩余可获收益 ≈ 1.332 × r/(1−r) ≈ 1.15 dB,渐近线约 28.7–28.8 dB

三个值得单独高亮的观察:
  1. 8 视角时 RnG(27.608)反超 LVSM-100K(27.522) —— 且 RnG 是无位姿的,LVSM 需要真值位姿。这是论文里被低估的一个结果。
  2. 1 视角的 RnG(19.452)已经超过 4 视角的 VGGT+LVSM(19.394)和 Matrix3D-unposed(18.736) —— 用 1/4 的观测打平/超越竞品的 4 视角结果。
  3. 模型完全没有在 1/2/8 视角上训练过(训练固定 4 源视角 × 3 目标视角),却单调、平滑地泛化。这是对「KV-Cache 是良定义的三维表示」的间接支持:缓存条目数变化不破坏语义。

图 4 · PSNR 随输入视角数的变化与外推

数据来源:论文表 5。增益比 0.727 → 0.464 呈几何衰减,暗示存在容量天花板。论文停在 8 视角,未做 16/32 视角实验来证伪这一外推。

RnG(无位姿) LVSM-100K 参考线(需真值位姿) 几何衰减外推渐近线
18 20 22 24 26 28 30 1 2 4 8 LVSM-100K = 27.522 (需真值位姿) 外推渐近线 ≈ 28.8 19.452 23.403 26.276 27.608 +3.951 +2.873 +1.332 输入源视角数(对数刻度) PSNR (dB)

3.7 统计显著性

⚠️ 论文未报告任何标准差、置信区间或多次运行结果。 表 2/3/5 均为单次运行的点估计。这在 PSNR 差异达 6–9 dB 的主结果上无伤大雅,但对表 3 中 FullAttn vs Causal 的 0.005 dB 差异是致命的 —— 该差异几乎肯定落在随机种子噪声内。因此上文「全注意力赢 8/10」应理解为「两者在质量上无法区分」,而非「全注意力确实更好」。这个更弱的表述反而更有利于论文:因果掩码是免费的(不损失质量),而不是有代价的。

4 · 价值分析

真正的贡献是什么

不是「又一个统一模型」,而是重新定义了「三维表示」的候选空间。 过去五年,三维表示的演进是 显式网格 → 体素 → NeRF → 3DGS → 三平面 latent → 结构化 latent。这些全都是为三维专门设计的数据结构。RnG 的主张是:一个通用 transformer 的中间激活可以直接充当这个角色 —— 只要你保证它对查询不变。这个主张的分量在于它把三维表示问题归约成了一个注意力掩码设计问题。

可以脱离本文单独复用的设计

可复用件复用方式适用范围
任务级因果掩码在任何「A 任务不应被 B 任务污染」的多任务共享骨干里,用 0/1 掩码切断单向信息流远超三维:多模态理解+生成、检索+重排、感知+规划
KV-Cache 即表示凡「一次编码、多次查询」的任务,把编码侧 K/V 缓存当作可导出的中间产物视频世界模型的场景记忆、长文档 QA、具身智能的空间记忆
重建先验 → 生成的方向反转不必训生成模型,而是给判别式基座开解码出口检测/分割/深度基座 → 相应的生成任务
Plücker ray 查询接口把「视角」token 化,使查询数量与模型结构解耦任意需要连续参数化查询的渲染/仿真任务
不变性作为可缓存性的前提「先证明不变,再缓存」这条推理模式系统层的通用设计原则

对后续工作的启发

RnG 打开的研究空间可以按「缓存的语义」来组织:

最后一条与本周领域(生成模型 / 世界模型)的连接最紧:视频世界模型的长时一致性问题本质上就是「记忆该以什么形式存在」,而 RnG 给出了一个答案 —— 以重建网络的 KV 形式存在

5 · 局限性

第一类:论文自述(第 5 节,原文引用)

(1)细节缺失

"Unlike diffusion-based image generators that produce eye-catching images with very rich details (although they can be wrong), RnG has difficulties in representing intricate textures. This is also an issue in LVSM [18]. Introducing image-generation pretraining or auto-encoding components might resolve this issue."

对应数据:LPIPS 0.0975 vs LVSM 0.0895(差 8.9 %),PSNR −1.246 dB。

(2)世界原点定义

"For object-level reconstruction task, an ideal world origin would be the object center. However, in data preparation, all cameras look at the world center, which may confuse the network to regard the intersection of source views' optical axes as the world origin. This also limits model's real-world applications, where multiview images captured by hand-held devices have to look at a common 3D point to get the best result."

(3)多视角三维累积

"Although our model generates highly consistent point maps from viewpoint queries, it requires to accumulate multi-view observations to obtain a complete 3D. Multi-view geometry integration might also introduce noise and conflicts."

即:单次查询得到的是像素对齐点图(2.5D),要得到闭合三维仍需多次查询 + 融合。所谓「完整三维」是查询后拼出来的,不是一次前向出来的。

第二类:补充批判(独立观察,8 点)

批判 1 · 论证缺口 —— 标题级贡献在质量维度上无正收益,论文未如实定位

表 3 中 Ours-15K-FullAttn 在 10 项指标里 8 项优于或持平 Ours-15K(LPIPS 0.1193 vs 0.1243,差距 0.0050,是 15K→40K 训练量翻倍所带来 LPIPS 改善 0.0268 的 18.7 %)。论文摘要将因果注意力列为核心创新并暗示其带来性能,但证据只支持「它不损害性能且使缓存成为可能」。

批判 2 · 缺乏关键竞品的公平对比 —— 「40K vs 40K」不是 compute-matched

论文用 LVSM-40K(24.619)而非 LVSM-100K(27.522)来支撑自己更数据高效(+1.657 dB)。但 RnG 从 VGGT 权重初始化,而 VGGT 本身在大规模多数据集上预训练过。论文自己的 Ours-15K-scratch 给出了这个先验的量级:PSNR 20.784(−4.072 dB)、RA@5 8.252(−73.398 pp)。把预训练算力计入后,「同为 40K 步」的说法失去意义。

缺失的对照组:把 LVSM 也从 VGGT 权重初始化,或把 VGGT 按原目标在同样的 Objaverse 上微调 40K 步后再接 LVSM。前者能分离「RnG 的架构」与「VGGT 的先验」,后者能分离「读出了隐藏几何」与「适配了更简单的分布」。

批判 3 · 指标有效性 —— CD 是「完整性」的唯一证据,但协议不透明且未做分解

批判 4 · 实验设计问题 —— 权重最大的损失项贡献为零

Ours-15K-w/o camOurs-15K:PSNR 24.850 vs 24.856(−0.006),LPIPS 0.1235 vs 0.1243(更优),源深度 Rel 0.739 vs 0.742(更优)。也就是说 λ_c = 1(三项中最大权重)的位姿损失,对外观和几何的贡献严格为零甚至略负。合理推断:位姿能力已完全由 VGGT 预训练权重承载,L_cam 只是在保持而非学习

论文既没讨论这一现象,也没做 λ_c 的敏感性扫描。如果 λ_c 可以降到 0.1 甚至 0.01 而不损失位姿精度,那么外观项能分到更大的有效梯度预算,批判 1 里的「细节缺失」或许能部分缓解。

批判 5 · 评测覆盖不均 —— 真实场景零定量结果

所有定量结论建立在 GSO(1,030 个物体级、干净背景、环视轨迹的合成渲染) 之上,训练集是同类型的 Objaverse-LVIS。CO3D 只有一张定性图,论文自承 "predictions may be misaligned with the ground truth"。与此同时论文宣称面向 "real-time interactive applications"。一个每视角 85 ms 但只在合成物体上验证过的模型,其「实时交互」的实用性主张缺乏证据。 场景级(室内、街景)、手持轨迹、强遮挡、非朗伯材质 —— 这四类真实条件一个都没有数字。

批判 6 · 论证缺口 —— 世界原点歧义是方法论缺陷,不是数据处理问题

论文把世界原点问题归为可通过 "improving the data-processing pipeline" 解决。但看架构:ĝ_{s=1} = [I₃ₓ₃ | (0,0,−1)ᵀ] 把第一个源视角钉死为世界系,物体中心只能由「所有源视角光轴的交点」隐式定义。训练数据里所有相机都 look-at 世界中心,这个隐式定义恰好成立 —— 因此模型学到的是数据集采集协议,而非几何不变量

这构成一条自洽的证据链:架构上的隐式假设(批判 6)→ 训练协议与真实采集不匹配 → CO3D 上出现对齐偏差(论文自述)→ 因此 CO3D 无法给出定量表(批判 5)。三个现象是同一个根因。 换数据处理管线不能解决它,需要的是显式的、与源视角选择无关的世界系定义

批判 7 · 可扩展性论证缺失 —— 5.35× FLOPs 只换来 2.51× 加速

表 4 显示计算量削减 5.35× 但墙钟只快 2.51×,2.13× 的缺口指向访存瓶颈。当前配置:256×256、patch 8 → 每视角 1024 token;4 源视角 × 24 层的 K/V 缓存约数百 MB。若按论文展望扩展:

扩展方向token 数变化缓存规模后果
512×512 分辨率×4×4(~1.6 GB)带宽先于算力饱和
8→16 源视角×4×4同上
加入时间维(动态场景)×T×T线性爆炸

KV-Cache 作为三维表示的最大弱点恰恰是它的规模与观测量成正比 —— 而好的三维表示应该与场景复杂度成正比,与观测量无关。 一个 3DGS 场景不会因为你多拍了 100 张照片就变大 100 倍。论文没有讨论缓存压缩、剪枝或去冗余。

批判 8 · 论证缺口 —— 存在容量天花板的迹象,论文未证伪

表 5 的增益比 0.727 → 0.464 呈几何衰减,外推渐近线约 28.7 dB。这意味着即使给到 16 或 32 个视角,RnG 也难以显著超越 LVSM-100K 的 27.522。若属实,瓶颈就不在观测量,而在(a)解码器 D_RGB 的容量、(b)256×256 的分辨率上限、或(c)无生成先验导致的高频细节上限(与论文自述的 "Lack of details" 一致)。论文停在 8 视角,一个 16 视角的数据点就能区分「几何衰减(有天花板)」与「对数增长(无天花板)」。

我自己分析的不完备之处

6 · 相关工作回溯

以下五篇构成一条清晰的问题传递链,而非平行罗列。每一篇解决了链条上的一个维度,同时留下了下一篇要接手的缺口。

6.1 DUSt3R — 2023.12(arXiv)/ CVPR 2024

解决了什么问题

传统 MVS/SfM 管线要求已知或先估计相机内外参,一旦位姿估计失败整条管线崩溃。DUSt3R 把成对图像的三维重建重新表述为 pointmap 回归:网络直接输出每个像素在共同坐标系下的三维坐标,"relaxing strict projective camera model constraints"。核心贡献一句话:用一个回归任务吞掉了整条几何管线。

遗留了什么缺口

(a)本质上是成对的 —— N 张图需 O(N²) 次前向再加昂贵的全局对齐优化,破坏了「前馈」的纯粹性;(b)尺度歧义;(c)只建模可见 —— pointmap 是像素对齐的,没有像素就没有几何,这是表示形式内生的限制。

核心工作如何回应

RnG 完全继承 pointmap 作为几何输出格式(D_pmap 头、L_pmap 损失),但对缺口 (c) 给出了一个巧妙的绕过而非解决:既然 pointmap 只能覆盖有像素的地方,那就让查询视角提供像素。目标视角的 Plücker 射线在不可见区域也有射线,于是 D_pmap 在那里输出的就是「推测的」几何。

关键设计的传递

pointmap + 异方差不确定性加权损失从 DUSt3R 经 VGGT 一路传到 RnG,形式几乎未变。这是本链条上最稳定的技术遗产

6.2 LRM — 2023.11(arXiv)/ ICLR 2024

解决了什么问题

在 LRM 之前,单图到三维几乎全靠 per-scene 优化(SDS),一个物体要跑几十分钟。LRM 证明了大规模前馈回归可以取代优化:大 Transformer + Objaverse 规模数据,5 秒出一个三平面 NeRF。核心贡献一句话:把三维重建变成一个「大模型问题」而非「优化问题」。

遗留了什么缺口

(a)单图设置下「重建」与「生成」在概念上被混同了 —— 单张图的背面必然是生成的,但 LRM 没有任何机制去区分「我看到了所以确信」和「我没看到所以在猜」;(b)三平面 NeRF 的几何精度受限;(c)需要规范化的相机。

核心工作如何回应

缺口 (a) 是 RnG 的直接靶心。因果掩码在架构层面把两者切开:源视角分支只做重建(且被证明与目标视角无关),目标视角分支才做生成。「区分确信与猜测」这件事,从 LRM 的「无机制」变成了 RnG 的「架构保证」。

关键设计的传递

「前馈大模型 + Objaverse 训练协议」这个范式,以及 GSO 作为零样本评测集的惯例,都始自 LRM 这条线。RnG 的 113.5 K Objaverse-LVIS + GSO 1,030 物体评测正是它的直接延续。

6.3 LVSM — 2024.10(arXiv)/ ICLR 2025 Oral

解决了什么问题

即便到了 LRM 之后,新视角合成仍普遍依赖 3D 归纳偏置:NeRF/3DGS 的显式表示、epipolar 约束、plane sweep。LVSM 把它们全部删掉,只留一个纯 Transformer:输入图像 token + 目标视角的 Plücker 射线 → 输出像素。结果是相对此前 SOTA +1.5 ~ 3.5 dB PSNR,且 1–2 张 GPU 就能超过所有此前方法。核心贡献一句话:证明三维归纳偏置不是必需品,数据和规模可以替代它。

LVSM 有两个变体,对理解 RnG 至关重要:Encoder-Decoder 把输入压成固定数量的 1D latent token 作为场景表示(一个「学出来的隐式三维表示」);Decoder-Only 完全去掉中间表示,质量更好但更贵。

遗留了什么缺口

(a)必须有真值相机位姿 —— RnG 为了对比不得不用 VGGT 给它补位姿,得到 "VGGT + LVSM" 这个拼接基线,PSNR 只有 19.394,比 LVSM 自己的 27.522 掉了 8.1 dB,说明拼接管线的误差传播极其严重;(b)不输出任何几何;(c)Encoder-Decoder 的 latent 虽是「隐式三维」,但它是为渲染新学的,与任何重建任务都不对齐,因此无法从中读出几何。

核心工作如何回应

关键设计的传递

极其直接:Plücker ray map 作为目标视角查询接口,RnG 与 LVSM 完全同构。可以把 RnG 理解为「把 LVSM 的编码器换成 VGGT,并把 latent token 换成 KV-Cache」。RnG 也诚实地把 LVSM 列为纹理细节缺失问题的同病相怜者。

6.4 VGGT — 2025.03(arXiv)/ CVPR 2025 Best Paper

解决了什么问题

DUSt3R 的成对限制与全局对齐开销。VGGT 用一个前馈网络、交替的 frame-attention 与 global-attention,从任意数量视角同时推出相机参数、深度图、点图与三维点轨迹,< 1 秒,且无需任何后处理优化即超过带优化的方法。核心贡献一句话:三维感知的所有任务可以由一个网络一次前向全部输出。

遗留了什么缺口

一个,但很大:它是纯判别式的,输出是「观测的函数」而非「场景的模型」。(a)只建模可见区域,CD = 0.0260 里没有任何背面信息;(b)没有任何生成能力;(c)—— 这一点是 RnG 的洞察 —— 它的隐空间可能已经知道答案,只是没有出口。

核心工作如何回应

RnG 的回应是最小侵入式的:不改架构、不改预训练权重的初始化、不加新模块,只加(i)一个 0/1 注意力掩码、(ii)两个输出头、(iii)目标视角的射线输入,然后微调 40 K 步。结果是 VGGT 的所有能力被保留并增强(RA@5 74.239 → 85.146,源深度 Rel 5.960 → 0.584),同时获得了生成能力。

关键设计的传递

传递的是权重本身,这是本链条上唯一一处「继承」而非「借鉴」。也正因如此,Ours-15K-scratch 的崩塌(PSNR −4.072 dB、RA@5 −73.4 pp)才是全文最重要的消融 —— 它量化了这份遗产的价值。从技术传递的角度说,RnG 的贡献不是「造了一个新模型」,而是「发现了 VGGT 里一个没人用的出口」。 这既是它的优雅之处,也是批判 2 的根源。

6.5 Matrix3D — 2025.02(arXiv)/ CVPR 2025

解决了什么问题

Matrix3D 是第一个把「统一重建 + 生成」明确设为目标的工作。它用多模态 DiT 把图像、相机参数、深度图三种模态统一进一个扩散过程,配合 mask learning 策略「enables full-modality model training even with partially complete data」。核心贡献一句话:用扩散模型的模态补全能力,把摄影测量的所有任务变成同一个「填空」问题。

遗留了什么缺口

核心工作如何回应

RnG 是对 Matrix3D 的方向反转式回答。Matrix3D 说:拿一个生成模型(扩散),教它做重建。RnG 说:拿一个重建模型(VGGT),给它开一个生成出口。结果是全面碾压:CD 降低 10.0×(恰好一个数量级)、PSNR +7.540 dB、速度 317.6×

关键设计的传递

传递的是问题定义与评测协议,而非技术模块。Matrix3D 定义了「统一模型该被怎样评价」(位姿 + 深度 + NVS + 完整三维四维度同时报),RnG 的表 2 结构就是这个协议的直接继承 —— 只是把每一格的数字都改写了。这是一种「批判式继承」:接受对手的评价标准,然后在对手的标准上击败它。

7 · 技术演进脉络

7.1 演进树(非线性)

2023.11 LRM [前馈大模型范式 · 单图→三平面NeRF · Objaverse协议] │ 缺口:重建/生成不分 · 需规范位姿 │ 2023.12 DUSt3R [pointmap回归 · 免位姿 · 成对] │ 缺口:O(N²)+全局对齐 · 只建模可见 │ ┌───────────┴─────────────────────────────────┐ │ 「怎么把观测变成几何」 「怎么把观测变成新视角」 ▼ ▼ 2025.03 VGGT (CVPR'25 Best Paper) 2024.10 LVSM (ICLR'25 Oral) [多视角一次前馈出 位姿/深度/点图/轨迹] [删除全部3D归纳偏置] [交替 frame ↔ global attention · <1s] [Plücker ray 查询 · latent as scene] │ 缺口:纯判别式,无生成 │ 缺口:需真值位姿、无几何输出 │ 隐空间「有答案但无出口」 │ latent 与重建任务不对齐 │ │ │ 2025.02 Matrix3D (CVPR'25) │ │ [多模态DiT + mask learning] │ │ [首次明确「统一重建+生成」] │ │ 缺口:27s不可实时 · 3D一致性差 │ │ (CD 0.0670 > VGGT 0.0260 ❗) │ │ │ │ │ │ ── 定义了问题与评测协议 ── │ │ ▼ │ └────────────▶●◀──────────────────────────────┘ │ 2026.03 ★ RnG (CVPR'26 Highlight) —— 汇聚点 ├─ 继承 VGGT 的架构 + 权重 (几何先验) ├─ 继承 LVSM 的 Plücker ray 查询 (生成接口) ├─ 继承 DUSt3R 的 pointmap 输出 (几何格式) ├─ 继承 LRM 的 Objaverse/GSO 协议 (评测惯例) ├─ 继承 Matrix3D 的问题定义 (四维度评测矩阵) └─ 新增:任务级因果掩码 M → KV-Cache 即三维表示 CD 0.0067 · PSNR 26.276 · 85 ms/view ─────────── 平行的其他汇聚尝试(2026) ─────────── Gen3R (2601.04090) [VGGT适配器 + 视频扩散 latent 对齐 → 场景级] NOVA3R (2603.04179) [非像素对齐 ViT → amodal 3D,绕开 pointmap 的可见性限制]

7.2 演进的内在逻辑

推动力一:表示的「去专用化」

显式网格/体素 → NeRF(隐式场) → 3DGS(显式基元) → 三平面 latent → LVSM 的 1D latent token(学出来的) → RnG 的 KV-Cache(借来的)

每一步都在削弱「三维表示必须是专门设计的数据结构」这个前提。RnG 是目前这条线的终点:表示不再被设计,而被复用。

推动力二:监督的「去标注化」

需要位姿+深度真值 → DUSt3R 去掉位姿 → RayZer 连位姿监督也去掉(自监督) → VGGT 用海量混合数据把几何先验做成基座 → RnG 只需 RGB + pointmap 微调 40K 步

推动力三:判别与生成的合流,以及方向的反转

阶段主导思路代表结果
2023–2024各自为政LRM(重建)/ Zero-1-to-3(生成)两条独立技术栈
2025 上半给生成模型加几何Matrix3D能生成,但慢且不一致(CD 0.0670)
2025 下半重建基座成熟VGGT(Best Paper)判别侧封顶,生成侧空白
2026给重建模型开生成出口RnG快 317×、CD 降 10×

阶段间的关键转折点有两个:

  1. VGGT 的出现(2025.03)改变了力量对比。 在它之前,重建模型不够强,「给生成模型加几何」是合理的;在它之后,重建基座的几何精度远超任何扩散模型,方向反转成为必然。RnG 只是第一个明确说出这件事的工作。
  2. 「不变性 → 可缓存性」的推理(2026.03)把科学问题变成了系统红利。 RnG 引入因果掩码本是为做控制变量,却顺手拿到了 5.35× 的 FLOPs 削减。这类「因为要严谨所以变快了」的巧合,在系统与算法交界处并不常见,值得单独记下。

社区关注点的转移:早期关注精度(PSNR、Chamfer),中期关注泛化(零样本、跨数据集),当前正转向表示的可操作性 —— 能不能编辑、压缩、拼接、加时间维。RnG 的 KV-Cache 恰好把这些问题变成了熟悉的 LLM 系统问题(KV 压缩、缓存复用、注意力剪枝),这可能是它最大的溢出价值。

8 · 相关工作表格对标

工作年月会议 / 出版核心贡献关键指标与 RnG 的关系
LRM2023.11ICLR 2024前馈大模型取代 per-scene 优化单图 → 三平面 NeRF,~5 s提供范式与 Objaverse/GSO 评测协议
DUSt3R2023.12CVPR 2024pointmap 回归,免位姿成对重建深度/相对位姿多项 SOTA提供 pointmap 输出格式与不确定性损失
LVSM2024.10ICLR 2025 Oral删除全部 3D 归纳偏置GSO PSNR 27.522(需真值位姿)提供 Plücker ray 查询接口;唯一在 PSNR 上胜过 RnG 的方法
Matrix3D2025.02CVPR 2025多模态 DiT 统一重建+生成CD 0.0670 / PSNR 18.736 / 27 s定义问题与评测协议;RnG 的主要打击目标
VGGT2025.03CVPR 2025 Best Paper一次前馈出全部 3D 属性RA@5 74.239 / Rel 5.960 / CD 0.0260架构与权重的直接来源;RnG 的性能地板
RayZer2025.05ICCV 2025 (BSP-HM)完全自监督,无位姿无几何标注与有位姿方法可比表 1 中列为「无几何重建」的对照
Gen3R2026.01arXiv (v2 2026.03)VGGT 适配器 + 视频扩散 latent 对齐单/多图条件场景生成 SOTA平行路线:同基于 VGGT,但耦合扩散
NOVA3R2026.03arXiv非像素对齐 ViT 做 amodal 3D平行路线:直接攻击 pointmap 的可见性限制
★ RnG2026.03CVPR 2026 HighlightKV-Cache 即隐式三维表示 + 任务级因果掩码RA@5 85.146 / Rel 0.584 / PSNR 26.276 / CD 0.0067 / 85 ms汇聚点
读表要点: 沿时间轴看 CD 一列 —— pixelSplat 0.4898 → LGM 0.1130 → Matrix3D 0.0670 → VGGT 0.0260 → RnG 0.0067,两年内下降约 73×,且下降不平滑:VGGT(判别式基座)与 RnG(在基座上开生成出口)各贡献了一次数量级跳变。

9 · 开放挑战与研究机会

9.1 理论层面

T1 · KV-Cache 作为三维表示的容量下界是什么?

不是泛泛地「研究表示能力」,而是:在固定的 L 层 × N token × d 维缓存预算下,可无损重建的场景复杂度上界是多少? 可操作实验:固定 RnG 骨干,对缓存做低秩截断(保留 top-r 奇异值)或 token 剪枝(保留 k% token),画出「缓存压缩率 vs CD/PSNR」曲线。若存在明显拐点(相变),那就是这个表示的信息容量;若曲线平滑,说明缓存高度冗余。这是本方向高价值低门槛的第一空白 —— 不需要重训,推理时就能做。

T2 · 目标视角不变性是否是「表示」的充要条件?

表 3 显示 FullAttn 在质量上并不更差 —— 说明即使不做架构保证,网络也自发学到了近似的不变性。可操作实验:在 FullAttn 模型上直接测量「同一组源视角在不同目标查询下的重建输出差异」,若该差异 < 0.1 % 相对变化,那么因果掩码就是一个可以事后验证而非事前强加的性质。这个实验会直接改变对本文核心贡献的定性。

T3 · 「重建先验 → 生成」的可迁移边界

RnG 证明了 VGGT 的隐空间含有未被监督的完整几何。这是普遍现象还是三维任务特有?可操作对照:对分割基座(SAM 系)、深度基座、检测基座做同样的手术 —— 加查询接口 + 生成头 + 少量微调,看是否也能读出「未被监督的能力」。

9.2 工程与应用层

E1 · 缺失的对照组必须被补上(承批判 2)

具体空白:判定「RnG 优于 LVSM」缺乏 head-to-head 的公平实验。建议在相同硬件、相同数据预算、相同初始化下做三组对比:(i) LVSM from scratch;(ii) LVSM 从 VGGT 权重初始化;(iii) RnG。若 (ii) 追平 (iii),则 RnG 的增益主要来自预训练而非架构。这是下一步最关键的单一实验。

E2 · CD 的分解报告应成为该子领域的规范(承批判 3)

具体空白:建议社区统一报告 accuracy / completeness 分解 + 可见区域 / 不可见区域分别统计的四格矩阵。对 RnG 而言最有信息量的是「不可见区域的 accuracy」—— 那才是「生成得对不对」的唯一诚实指标。当前的总 CD 无法区分「补全得准」与「补全得多」。

E3 · 从物体级到场景级的基准缺失(承批判 5)

具体空白:需要一个「不完整几何」的场景级基准:室内房间的手持视频,标注被家具遮挡的墙面/地板真值。评测协议应直接对准「遮挡区域的几何精度」,而非整体 CD。没有这个基准,「完整三维建模」在真实场景里就无法被证伪。

E4 · 动态在线设置下的缓存策略

具体空白:当观测流式到来(机器人边走边看),缓存必须增量更新。新观测应该追加为新的 KV 条目,还是与旧条目融合? 追加导致线性增长(批判 7 的瓶颈),融合会引入信息损失。可操作研究:设计缓存准入/淘汰策略(类比 LLM 的 H2O、StreamingLLM),用「加入该视角后 CD 的改善量」作为准入分数,测量固定缓存预算下的 CD-预算曲线。

E5 · 缓存的可编辑性

具体空白:可操作的第一步实验:屏蔽对应某个物体区域的源视角 token 的 K/V,看渲染结果是否干净地删除该物体(而非产生伪影)。这个实验一天就能做完,而它的成败会决定「KV-Cache 是表示还是仅仅是加速缓冲」这个定性问题。

9.3 新兴方向

N1 · 时间维度:KV-Cache 作为世界模型的显式记忆

具体空白:当前视频世界模型的长时一致性依赖各种外挂记忆机制,其表示形式大多是启发式设计的。RnG 提示了另一种可能:用三维重建骨干的 KV-Cache 作为世界模型的空间记忆,视频生成器每帧向它查询。研究问题:几何一致的记忆 vs 外观一致的记忆,哪个对长时一致性更关键? 可操作对照:在同一视频生成器上分别接入(a)RnG 式几何缓存、(b)纯视觉特征缓存、(c)两者拼接,测量 1000 帧后的漂移量。

N2 · 世界系的等变性(承批判 6)

具体空白能否设计一个与源视角选择等变的世界系定义? 可操作方案:以预测点云质心作为原点、以点云主轴作为朝向做规范化,并在训练中加入随机源视角置换的一致性损失。评测指标:同一物体在不同源视角子集下的重建结果之间的 CD(越低越等变)。这个指标目前根本没有人报告。

N3 · 缓存压缩与三维资产的「神经格式」

具体空白:如果 400 MB 的 KV-Cache 能压到 10 MB 且 CD 退化 < 5 %,它就成了一种可传输的三维资产格式,且天然支持「解压即渲染」。研究问题:三维内容的 rate-distortion 曲线在神经缓存表示下是什么形状? 与 3DGS 压缩、网格压缩直接对标。

N4 · 不确定性的显式建模

具体空白:RnG 的 L_pmap 里已经有 aleatoric 不确定性项 Σ_t,但论文从未把它作为输出使用。研究问题:Σ_t 能否作为「这块几何是看到的还是猜的」的可靠指示? 可操作实验:在 GSO 上按真值可见性把像素分成两组,检验 Σ_t 的分布是否可分(AUROC)。若可分,RnG 就免费获得了一个「置信度感知的完整三维」输出 —— 这对下游物理仿真是刚需。这个能力论文已经训出来了,只是没有拿出来用。

10 · 其他值得关注的近期工作

Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction(2026.01,v2 2026.03,arXiv)

与 RnG 同样基于 VGGT,但选择耦合视频扩散而非纯前馈:训练适配器把 VGGT 的几何 latent 与视频扩散的外观 latent 对齐,同时生成 RGB 视频与几何。是「场景级」路线的代表。值得看的理由:它证明了 VGGT 隐空间可复用这件事不止一条实现路径。
arXivHTML

NOVA3R: Non-pixel-aligned Visual Transformer for Amodal 3D Reconstruction(2026.03,arXiv)

直接攻击 pointmap 表示的根本限制:像素对齐意味着「没有像素就没有几何」。NOVA3R 放弃像素对齐,用非对齐 ViT 做 amodal(含遮挡部分)三维重建。与 RnG 是同一问题的两种解法 —— RnG 用「让查询视角提供像素」绕过,NOVA3R 用「不再需要像素」正面解决。
arXiv HTML

TRELLIS.2 / Native and Compact Structured Latents for 3D Generation(2025.12,arXiv:2512.14692)

三维生成的另一极:不走「从图像重建」而走「原生三维 latent 扩散」。与 RnG 形成表示层面的直接对立 —— 一个主张「专门设计的结构化 latent」,一个主张「复用通用 transformer 的 KV」。两条路线的 rate-distortion 对比会是接下来两年的核心争论。
arXiv项目页

Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory(2026.04,arXiv:2604.08995)

实时流式交互世界模型,核心难点正是长时记忆的表示形式。与 RnG 的 KV-Cache 思路可直接对话(见 9.3-N1)。值得看:它给出了「实时 + 长时一致」这组约束下当前工程实践的上界。
arXiv项目页

Transition Models: Rethinking the Generative Learning Objective(CVPR 2026 Highlight)

提出可适配任意步数转移的生成目标,把「少步生成」从蒸馏问题变回训练目标问题。与本期主线正交但相关:如果扩散能真正做到少步,RnG 相对 Matrix3D 的 317× 速度优势会被侵蚀多少?
CVPR 2026 Highlights

tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction(CVPR 2026 Highlight)

用测试时训练处理长上下文的自回归三维重建。与 RnG 的缓存扩展性问题(批判 7)直接相关:当观测数超出模型训练配置时,是扩缓存还是做 TTT?
CVPR 2026 Highlights

RayZer: A Self-supervised Large View Synthesis Model(ICCV 2025,Best Student Paper HM)

完全去掉位姿与几何监督,只用 2D 图像自监督,唯一的三维先验是射线结构。值得看:如果 RnG 的路线要摆脱对 VGGT 预训练的依赖(批判 2),RayZer 的自监督框架是最可能的替代方案。
arXivCode项目页

LVSM(ICLR 2025 Oral)—— 值得单独重申

它至今仍是 GSO PSNR 上的最强方法(27.522),且代码完全开源。 任何声称在新视角合成上超越前人的工作,都应当与 LVSM-100K 而非 LVSM-40K 做对比。
arXivCodeICLR Proceedings

11 · 一页速览

维度结论
一句话三维表示可以就是重建网络自己的 KV-Cache
最强证据源深度 Rel 5.960(VGGT)→ 0.584(RnG),同一骨干同一权重,降低 90.2 %
最大反差标题级贡献「因果掩码」在表 3 的 10 项质量指标中输掉 8 项;其价值全在 5.35× FLOPs 削减与架构不变性保证
唯一败绩PSNR 26.276 < LVSM-100K 的 27.522(−1.246 dB),论文自承细节表现力不足
最被低估的结果8 输入视角时 RnG(27.608)无位姿反超 LVSM-100K(27.522)有位姿
最大方法论缺陷世界原点由「源视角光轴交点」隐式定义 → 学到的是数据集协议而非几何不变量 → CO3D 无定量结果
最该补的实验LVSM 从 VGGT 权重初始化的对照组;CD 的 accuracy/completeness 分解;16/32 视角外推
最大溢出价值把三维表示问题翻译成了 LLM 系统问题(KV 压缩、缓存复用、注意力剪枝)