2026-08-06 · 周四 · 强化学习 / Agent / 具身智能
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
一句话定位:长视野工具智能体的 RL 配方不是一组固定超参,而是一个以模型容量为自变量的函数——1.5B 需要的东西恰恰是 7B 应当避免的。
ml-report-index.md 无法访问,14 天去重检查未能执行。候选池 25 篇,shuf -i 1-25 -n 3 → [3, 17, 15],取 #3。重抽次数:0。以下链接均已实际访问确认可达(2026-08-06)。核实不到的项目明确标注「未找到」。
| 论文 | 会议 / OpenReview | arXiv | Code | 数据集 / 权重 |
|---|---|---|---|---|
| 核心 · Agent-STAR | 未找到 | 2603.21972v1 · HTML | WxxShirley/Agent-STAR | TravelDataset · TravelDatabase · 6 checkpoints |
| TravelPlanner | ICML 2024 Spotlight · 项目主页 | 2402.01622v4 | 见项目主页 | 1,225 intent + ~4M 记录 |
| Search-R1 | OpenReview | 2503.09516v5 | PeterGriffinJin/Search-R1 | checkpoint 已开源 |
| DAPO | 未找到独立会议页 | 2503.14476v2 | 基于 verl 开源 | 数据集已开源 |
| ARPO | ICLR 2026 Poster · iclr.cc · OpenReview | 2507.19849 | RUC-NLPIR/ARPO | 已开源 |
| Planner-R1 | ICLR 2026 Under review | 2509.25779v2 | 未找到 | 未找到 |
论文指向的不是笼统的「agent 很难训」,而是一组具体到刺眼的数字:
| 轴 | 变量 | 取值 |
|---|---|---|
| 奖励塑形 | reward function | Sum / Macro / Success / Curriculum |
| 模型规模 | params | 1.5B / 3B / 7B |
| 数据组成 | difficulty mix & size | Easy / Medium / Hard / Mixed × 100 / 1K / 2K |
| 算法选择 | RL algorithm | GRPO / DAPO / ARPO |
| 环境稳定性 | tool failure rate | 0% / 5% / 10% |
前驱的共同缺陷是单轴优化:Search-R1 只调奖励,DAPO 只调算法,Planner-R1 只调 reward shaping。4×3×4×3×3 的完整网格不可能跑完,STAR 的做法是逐轴消融(固定其余轴)——这既是它能完成的原因,也是它最大的方法论软肋(见 2.6 批判 ⑥)。
STAR 的论证不是「我们提出 X → X 有效」,而是一条被逼出来的排除法链条:
r_sum 在 micro = 1 处不连续(跳变 +1)。这创造了一个「临门一脚」的强激励,也可能在优化面上造成阶跃。论文对此没有分析。
| 机制 / 维度 | 设计选择 | 动机 | 关键超参 / 数值 |
|---|---|---|---|
| 冷启动 | 教师蒸馏 + 拒绝采样 | base 成功率 0.0%,RL 无梯度 | 5K → 1,198(24.0%) |
| 奖励密度 | 四档阶梯 | 密度与规模的交互是研究对象 | [0,5] / {0..3} / {0,1} |
| 数据难度配比 | Mixed 4:3:3 | 全 hard 奖励稀疏;全 easy 无挑战 | 4:3:3 |
| 数据规模 | 1K prompts | in-domain 与 OOD 的折中点 | 100 / 1K / 2K |
| RL 算法 | GRPO + KL-free + clip-high | 去掉 KL 释放探索空间 | G = 8,5 epochs |
| 超长轨迹 | 排除 loss,保留归一化 | 避免长度惩罚污染梯度但保留信号 | 30K / 32K |
| 格式违规 | 硬置 reward = 0 | 强制 ReAct 协议合规 | — |
| 环境噪声 | 随机注入工具失败 | 模拟真实 API 不稳定 | 0% / 5% / 10% |
| 方法 | 1.5B | 3B | 7B | 1.5B→7B 增益 |
|---|---|---|---|---|
| Base(未训练) | 0.0 | 0.0 | 0.1 | — |
| SFT | 6.9 | 12.2 | 19.7 | +12.8pp |
| Sum(密集) | 33.1 | 47.0 | 62.8 | +29.7pp |
| Macro(半稀疏) | 30.1 | 48.2 | 58.9 | +28.8pp |
| Success(稀疏) | 33.8 | 46.6 | 60.9 | +27.1pp |
| Curriculum(阶梯) | 34.9 | 49.9 | 57.0 | +22.1pp |
| 该规模最优 | Curriculum 34.9 | Curriculum 49.9 | Sum 62.8 | — |
图 1 · 奖励设计的规模依赖翻转
TravelPlanner 测试集 Success(%)。Curriculum 在 1.5B / 3B 领先,在 7B 反被 Sum 反超 5.8pp。数据源:表 1。悬停查看数值。
| Scale | Method | CS Micro | CS Macro | HC Micro | HC Macro | Success |
|---|---|---|---|---|---|---|
| 1.5B | Base | 30.1 | 0.0 | 0.0 | 0.0 | 0.0 |
| 1.5B | SFT | 65.9 | 15.4 | 17.2 | 12.1 | 6.9 |
| 1.5B | Sum | 95.1 | 71.6 | 51.4 | 33.4 | 33.1 |
| 1.5B | Macro | 93.4 | 68.4 | 47.9 | 31.6 | 30.1 |
| 1.5B | Success | 93.9 | 68.2 | 51.0 | 34.7 | 33.8 |
| 1.5B | Curriculum | 93.9 | 70.2 | 51.0 | 35.4 | 34.9 |
| 3B | Base | 46.5 | 0.0 | 0.0 | 0.0 | 0.0 |
| 3B | SFT | 70.4 | 24.6 | 28.6 | 20.0 | 12.2 |
| 3B | Sum | 97.6 | 82.5 | 64.8 | 47.6 | 47.0 |
| 3B | Macro | 95.1 | 79.6 | 68.8 | 52.3 | 48.2 |
| 3B | Success | 90.6 | 76.1 | 62.6 | 47.7 | 46.6 |
| 3B | Curriculum | 95.3 | 83.0 | 67.6 | 51.0 | 49.9 |
| 7B | Base | 55.8 | 0.1 | 0.7 | 0.7 | 0.1 |
| 7B | SFT | 77.1 | 33.1 | 40.6 | 31.3 | 19.7 |
| 7B | Sum | 96.9 | 87.4 | 78.7 | 66.5 | 62.8 |
| 7B | Macro | 97.0 | 89.8 | 77.3 | 60.0 | 58.9 |
| 7B | Success | 91.4 | 78.3 | 73.4 | 64.0 | 60.9 |
| 7B | Curriculum | 96.1 | 85.1 | 76.6 | 60.4 | 57.0 |
工具环境替换为本地 Wikipedia 检索。这是一个工具形态相同、任务语义完全不同的迁移设定,考察「工具编排能力」而非「旅行知识」的可迁移性。
| Scale | Method | NQ | TriviaQA | PopQA | HotpotQA | 2Wiki | Musique | Bamboogle | Avg. |
|---|---|---|---|---|---|---|---|---|---|
| 1.5B | Base | 7.1 | 22.4 | 9.9 | 5.9 | 4.3 | 2.6 | 8.0 | 8.6 |
| 1.5B | SFT | 13.5 | 21.4 | 13.5 | 11.6 | 7.0 | 1.2 | 12.0 | 11.5 |
| 1.5B | Search-R1 | 39.4 | 51.0 | 39.7 | 14.6 | 24.4 | 2.2 | 4.0 | 25.0 |
| 1.5B | Sum | 32.1 | 44.5 | 30.9 | 26.0 | 14.8 | 5.3 | 16.8 | 24.3 |
| 1.5B | Macro | 29.6 | 45.1 | 28.8 | 26.9 | 19.4 | 6.3 | 23.2 | 25.6 |
| 1.5B | Success | 24.8 | 36.9 | 21.3 | 24.2 | 17.7 | 4.6 | 23.2 | 21.8 |
| 1.5B | Curriculum | 20.6 | 28.5 | 20.5 | 16.0 | 11.7 | 3.5 | 17.6 | 16.9 |
| 3B | Base | 10.6 | 28.8 | 10.8 | 14.9 | 24.4 | 2.0 | 2.4 | 13.4 |
| 3B | SFT | 35.1 | 52.5 | 31.3 | 32.0 | 24.4 | 9.0 | 30.4 | 30.7 |
| 3B | Search-R1 | 34.1 | 54.5 | 37.8 | 32.4 | 31.9 | 10.3 | 26.4 | 32.5 |
| 3B | Sum | 38.2 | 54.9 | 34.3 | 34.2 | 23.3 | 8.8 | 27.2 | 31.6 |
| 3B | Macro | 37.0 | 54.5 | 34.9 | 37.9 | 29.9 | 11.6 | 33.6 | 34.2 |
| 3B | Success | 37.5 | 54.1 | 34.0 | 33.7 | 19.4 | 10.3 | 32.0 | 31.6 |
| 3B | Curriculum | 41.0 | 56.8 | 36.2 | 39.5 | 27.7 | 12.4 | 32.0 | 35.0 |
| 7B | Base | 13.4 | 40.8 | 14.0 | 18.3 | 25.0 | 3.1 | 12.0 | 18.1 |
| 7B | SFT | 41.2 | 59.7 | 37.6 | 47.0 | 37.8 | 16.3 | 53.6 | 41.9 |
| 7B | Search-R1 | 39.3 | 61.0 | 39.7 | 37.0 | 41.4 | 14.6 | 36.8 | 38.5 |
| 7B | Sum | 35.5 | 54.5 | 34.8 | 44.8 | 34.6 | 15.4 | 37.6 | 36.7 |
| 7B | Macro | 42.2 | 61.2 | 39.6 | 48.8 | 38.3 | 17.4 | 52.8 | 42.9 |
| 7B | Success | 38.7 | 55.9 | 35.2 | 45.8 | 38.4 | 15.5 | 41.6 | 38.7 |
| 7B | Curriculum | 41.1 | 58.7 | 37.7 | 48.4 | 38.5 | 17.4 | 45.6 | 41.1 |
把「RL 相对 SFT 的 OOD 净贡献」按规模列出来,与同规模 in-domain 净贡献并排:
| 规模 | SFT 的 OOD Avg | 最优 RL 的 OOD Avg | RL 的 OOD 净贡献 | 同规模 in-domain RL 净贡献 |
|---|---|---|---|---|
| 1.5B | 11.5 | 25.6(Macro) | +14.1pp | +28.0pp(6.9→34.9) |
| 3B | 30.7 | 35.0(Curriculum) | +4.3pp | +37.7pp(12.2→49.9) |
| 7B | 41.9 | 42.9(Macro) | +1.0pp | +43.1pp(19.7→62.8) |
两条趋势的剪刀差意味着:随着模型变大,RL 越来越像是在做「任务特定的过拟合」,而不是在教会模型可迁移的工具编排能力。外推到 7B 以上,OOD 净贡献会跌破 0——事实上在 7B 上,如果研究者选了论文为 1.5B/3B 推荐的 Curriculum 或最强 in-domain 的 Sum,OOD 已经是负收益:
论文的 Takeaway 2 只说了「过密的奖励有 alignment tax」,但数据显示的是更强的命题:在 7B 上,四种奖励里有两种让 RL 的 OOD 净收益为负,剩下两种的正收益不超过 +1.0pp。换句话说,STAR 在 7B 上的 OOD 竞争力几乎全部来自 SFT 阶段的 DeepSeek-V3.2 蒸馏,而非 RL。
补充旁证:7B-SFT 的 OOD Avg(41.9)已经超过在 NQ+HotpotQA 上原生训练的 Search-R1(38.5)3.4pp。一个从未见过 QA 数据、只在旅行规划轨迹上蒸馏过的模型,OOD 打赢了 in-domain 训练的专用基线——这是蒸馏的胜利,不是 RL 的胜利。
图 2 · 剪刀差:RL 相对 SFT 的净贡献,in-domain vs OOD
单位 pp(百分点)。in-domain 净贡献随规模递增,OOD 净贡献随规模趋零。数据源:表 1 与表 2 推导。悬停查看数值。
| 配置 | CS Micro | CS Macro | HC Micro | HC Macro | Success | vs Mixed |
|---|---|---|---|---|---|---|
| Easy-1K | 92.8 | 79.7 | 62.8 | 46.9 | 45.3 | −4.6pp |
| Medium-1K | 94.9 | 69.2 | 66.2 | 49.0 | 41.1 | −8.8pp |
| Hard-1K | 90.0 | 48.4 | 65.5 | 47.2 | 25.9 | −24.0pp |
| Mixed-1K (4:3:3) | 95.3 | 83.0 | 67.6 | 51.0 | 49.9 | — |
r_sum 各分量未加权(系数全为 1)的隐患——论文从未讨论奖励分量的加权。
| Scale | 算法 | Success | GPU 小时 | 每步耗时 (min) | vs GRPO 性能 | vs GRPO 成本 |
|---|---|---|---|---|---|---|
| 1.5B | GRPO | 30.1 | 164 | 8.0 | — | — |
| 1.5B | DAPO | 36.9 | 183 | 8.2 | +6.8pp | +11.6% |
| 1.5B | ARPO | 37.5 | 195 | 9.5 | +7.4pp | +18.9% |
| 3B | GRPO | 48.2 | 176 | 8.6 | — | — |
| 3B | DAPO | 45.6 | 184 | 8.9 | −2.6pp | +4.5% |
| 3B | ARPO | 47.5 | 273 | 13.3 | −0.7pp | +55.1% |
| 7B | GRPO | 62.8 | 368 | 9.0 | — | — |
| 7B | DAPO | 58.4 | 390 | 9.5 | −4.4pp | +6.0% |
| 7B | ARPO | 58.3 | 547 | 13.3 | −4.5pp | +48.6% |
实践含义:ARPO 这类熵驱动的自适应 rollout 方法,其收益来源是「补偿小模型的探索不足」,而不是「改进了信用分配本身」。ARPO 原文(ICLR 2026 Poster)宣称在 13 个基准上以一半工具预算取得更优结果,但其实验主要在 7B 及以下——STAR 的表 4 实际上给 ARPO 的适用边界画了一条线,而这条线正好落在 ARPO 自己的实验规模附近。这是一个跨论文相互印证 / 相互限制的有趣案例。
| 训练 prompt 数 | In-domain Success | OOD Avg | 说明 |
|---|---|---|---|
| 100 | 37.5 | 未提取到 | — |
| 500 | 未提取到 | 未提取到 | 仅在图 5 中,位图无法读数 |
| 1K | 49.9 | 35.0 | 论文认定的 sweet spot |
| 2K | 50.8 | 32.2 | in-domain 更高,OOD 更低 |
论文文字描述:≤5% 工具失败率下「测试性能相对稳定,仅轻微波动」;10% 时「最终测试成功率显著下降,所有指标同步下滑」,训练曲线(图 6a)表现为收敛更慢、方差更大。
⚠ 我无法读取图 6 的具体数值(该结果没有对应表格)。Takeaway 7 的量化强度无法核实。这也是论文自身的呈现缺陷:五轴中唯一一个只有图没有表的轴。
不是「我们训出了 TravelPlanner SOTA」(62.8% 这个数字会很快被超越),而是建立了「agentic RL 的设计选择是模型容量的函数」这个命题,并用两条独立轴(奖励密度、算法选择)给出同向的经验证据。
这个命题改变了论文的阅读方式:此后再看到任何 agentic RL 论文声称「方法 X 优于 Y」,读者的第一个问题应当是「在什么规模上?」STAR 把一个隐含的、几乎从不被报告的实验维度(模型规模)提升为一等公民。
全文未见任何 std / CI / seed 数。Takeaway 4(1K sweet spot)的全部证据是 1K→2K 的 in-domain +0.9pp;作为对照,Takeaway 1 的效应量是 5.8pp。用同一套无方差报告的实验去支撑效应量差 6.4 倍的两个结论,可信度必然是分层的,但论文把七个 Takeaway 平铺并列,未做置信度区分。
数据链条:7B SFT OOD 41.9 → 最优 RL OOD 42.9(Macro)= +1.0pp;7B Sum 是 36.7 = −5.2pp。论文的 Takeaway 2 表述为「过密奖励带来 alignment tax」,这是一个弱化的、把责任归给单一奖励设计的表述。真实数据支持的是更强的命题:在 7B 上 RL 阶段对 OOD 的期望贡献接近于零,且有一半配置为负。论文用「Macro 提供最优平衡」的正面措辞覆盖了这个事实。
Planner-R1 被 STAR 在相关工作中引用,且做的是同一个基准的同一件事,报告 56.9% final-pass rate,仅用 180 条训练 query,8B 模型。STAR 的 7B 最优是 62.8%,代价是 1,198 条教师蒸馏 SFT 轨迹 + 1K 条 RL query ≈ 2,198 条样本——样本量是 Planner-R1 的 12.2 倍,只换来 +5.9pp。STAR 的表 1、表 4 中没有任何一行是 Planner-R1;声称「significantly outperforming leading LLMs」时,比较对象是通用 LLM(Kimi-K2.5 等)而非同类专用方法。
诚实标注:Planner-R1 用 8B 而 STAR 用 7B,SFT 设定也不同,严格意义上不是同一实验条件——但正因如此才更需要受控的 head-to-head,而不是各自报数。
表 1:1.5B 上 Curriculum 的 Success 是 34.9(第一名)。表 2:同一个 1.5B-Curriculum 的 OOD Avg 是 16.9,全部四种奖励里的最后一名,比第一名 Macro(25.6)低 8.7pp,甚至低于 Sum(24.3)7.4pp。Takeaway 1 建议「小模型用 staged rewards」,Takeaway 2 建议「避免过密奖励以保 OOD」——这两条建议在 1.5B 上直接冲突,且论文没有给出取舍准则。一个只读 Takeaway 不读表 2 的从业者,会为 1.5B 选择 Curriculum,从而拿到全表最差的泛化性。
STAR 的 GRPO 变体同时做了两处改动(移除 KL、clip-high),两者都会放大策略漂移。7B 上 Sum 的 OOD 退化(−5.2pp vs SFT)被归因于奖励密度,但没有 KL-on / KL-off 的对照。缺乏这个对照,「alignment tax 由奖励密度引起」是一个未被隔离验证的因果主张。
论文承认了单因素分析的局限,但低估了代价:表 3(数据难度)和附录表 9(数据规模)都只在 3B + Curriculum 下做。而按 Takeaway 1,Curriculum 恰恰不是 7B 的最优奖励。因此「Mixed 4:3:3」和「1K sweet spot」这两个结论是在一个已知对 7B 不最优的配置下得到的,其向 7B 的可迁移性缺乏任何证据。这不是抽象的「交互未探索」,而是具体的条件错配。
五轴中唯一没有表格的一轴。仅在 3B 上测试,仅测「全局随机工具调用失败」一种噪声。真实 API 的失效形态包括超时、部分返回、脏数据、限流——随机失败是「无信息」,脏数据是「错误信息」,后者对策略的毒害更大。Takeaway 7 作为工程指导,外部效度非常有限。
SFT 轨迹来自 DeepSeek-V3.2-Exp-Thinking,拒绝采样保留率 24.0%。但论文从未报告教师在 TravelPlanner 官方测试集上的成绩。7B-Sum 的 62.8% 究竟是「学生超越教师」还是「教师本来就更高」,读者无从判断。若教师本身能拿 60%+,STAR 的全部工作可以被重新描述为「把大模型能力压缩进 7B」,RL 的角色就从「能力创造」降级为「蒸馏效率优化」。
解决了什么问题。在 LLM agent 评估普遍依赖单步工具调用或短程 QA 的时期,TravelPlanner 构造了第一个同时要求长序列工具编排与多约束联合满足的真实感规划基准:1,225 条规划意图、近 400 万条沙箱记录、双维度评估协议。一句话:它把「LLM 能不能做真正的规划」这个模糊问题,变成了一个 0.6% 的数字。
遗留了什么缺口。这是一篇纯诊断论文。它证明了 0.6%,定性指出三类失败模式,但无意提供任何训练方法。留下的缺口极其明确:这个 0.6% 该怎么涨?更微妙的是,它设计的双维度四级评估协议本身是一个未被使用的资源——这套 micro/macro 分解在原文中只是评估工具,没人意识到它可以直接充当奖励函数的密度旋钮。
核心工作如何回应。STAR 做了两件事:把 0.6% 推到 62.8%;把 TravelPlanner 的评估协议直接重用为奖励基元。五个奖励分量全部是 TravelPlanner 原生的评估分量——四档奖励密度阶梯不是设计出来的,是从基准的评估协议里「读」出来的。
关键设计的传递。从「评估协议」到「奖励函数」的直接转译——一次功能重定义而非技术改进:同一组公式,2024 年是打分表,2026 年是训练信号。这条路径也解释了为什么 STAR 的奖励塑形「是 task-specific 的」。
解决了什么问题。把 R1 式纯 RL 训练首次系统性扩展到「推理与工具调用交错」场景。两个关键技术选择:retrieved token masking(检索回的 token 不参与 policy gradient,避免学会复述)与纯 outcome-based reward。7 个 QA 基准上 Qwen2.5-7B 相对提升 41%,3B 提升 20%。
遗留了什么缺口。两个,都致命于长视野场景:(1) 单工具、短视野——典型轨迹 1–3 次调用,outcome reward 能工作的前提是 base 初始成功率显著大于 0(QA 上 Qwen2.5-7B base 有 18.1%);在 TravelPlanner 上同样的 base 只有 0.1%,纯 outcome reward 直接退化为零梯度。(2) 奖励密度这一维度从未被审视——因为 outcome reward 在它的设定下够用了。
核心工作如何回应。STAR 的整条奖励密度轴本质上是对 Search-R1 隐含前提的正面攻击:outcome reward 的可用性取决于初始成功率,而初始成功率取决于任务视野长度。表 1 的 Success 列在三规模上是 33.8 / 46.6 / 60.9——它能工作,但必须先有 SFT 冷启动把成功率从 0.0% 抬到 6.9%–19.7%。这是对「纯 RL 无需 SFT」这一 R1 叙事的一个具体边界条件。同时 STAR 把 Search-R1 当作 OOD 基线,但如第三部分所指出,7B-SFT 单独就已经赢了,胜利归功于蒸馏而非 RL。
关键设计的传递。「outcome reward 作为默认起点」被继承,但被降级为四个选项之一——从「方法」到「设计维度」的抽象层级提升。
解决了什么问题。在 o1 / R1 技术细节被隐藏的背景下完整开源了一套大规模 RL 系统,Qwen2.5-32B base 在 AIME 2024 拿到 50 分,超过此前 SOTA DeepSeek-R1-Zero-Qwen-32B 的 47 分,且只用 50% 训练步数。四项核心技术:Clip-Higher(解耦裁剪边界,防熵坍缩)、Dynamic Sampling(过滤零梯度样本)、Token-Level Policy Gradient Loss、Overlong Reward Shaping。
遗留了什么缺口。四项技术全部为单轮长 CoT 数学推理设计。迁到多轮工具交互时每项前提都需重检:Clip-Higher 防的是熵坍缩,但多轮 agentic 场景的熵还来自工具返回的外部随机性,多给的探索空间可能被环境噪声吃掉;Overlong Reward Shaping 的软惩罚在 9.2 步轨迹上如何分配到各步,DAPO 没有答案。最关键:DAPO 的验证全部在 32B 上,从未回答「这套技术在 1.5B 上是否同样有效、在 7B 上是否已经多余」。
核心工作如何回应。两层。表层:DAPO 作为算法轴选项进表 4,得到「1.5B 上 +6.8pp,7B 上 −4.4pp」的规模依赖结论。深层:STAR 的 GRPO 基线本身就吸收了 DAPO 的两项技术(KL-free 与 clip-high 写进默认配置)——DAPO 在 STAR 里同时扮演对照组和基础设施两个角色。
关键设计的传递。Clip-Higher → STAR 默认配置(无条件继承);Overlong Reward Shaping → 「排除 loss / 保留归一化」(形态改变);Dynamic Sampling → 被 STAR 通过「数据难度均衡」在数据层而非算法层实现。第三条最有意思:同一个问题(零梯度样本浪费),DAPO 在算法里解决,STAR 在数据配比里解决。
解决了什么问题。最接近 STAR 问题域的前驱。关键观察是一个具体经验现象:LLM 在工具调用返回之后,紧接着的 token 熵会显著升高——工具返回是不确定性的注入点。据此设计 entropy-based adaptive rollout(高熵步动态增加 step-level 采样)配合 advantage attribution estimation。结果:13 个基准更优,且只用现有方法一半的工具调用预算。
遗留了什么缺口。整个设计建立在「探索不足是主要瓶颈」这个假设上。这个假设在它自己的实验规模(主要 7B 及以下)里成立,但 ARPO 没有把模型规模作为自变量来检验这个假设的边界,隐含地把「更聪明的探索」当成单调有益的东西。
核心工作如何回应。表 4 给出直接反例:1.5B +7.4pp(+18.9% 成本)→ 3B −0.7pp(+55.1% 成本)→ 7B −4.5pp(+48.6% 成本)。ARPO 的收益在 1.5B→3B 之间就已翻转为负。STAR 由此提出 Takeaway 6:「对复杂探索机制的需求,与模型能力成反比。」这是一个对抗性而非继承性的回应——STAR 不是在 ARPO 基础上改进,而是给 ARPO 的适用范围划了一条上界,而这条上界恰好落在 ARPO 自身实验规模的内部。
关键设计的传递。技术迁移形态:从「显式的步级探索调度」→「隐式的容量驱动探索」。
解决了什么问题。与 STAR 最直接对撞的工作:同一个基准、同一个主张。结果:56.9% final-pass rate,仅用 180 条训练 query;8B 模型达到与 32B 相当的性能,计算效率高 3.5 倍、显存效率高 1.5 倍;相对 GPT-5 的 21.2% 基线提升 2.7 倍;在 Multi-IF、NaturalPlan、τ-Bench 等 OOD 任务上「大体维持或超过基线」。
遗留了什么缺口。(1) 单一规模的验证——只有 8B 与 32B 两个采样点,无法刻画趋势形状;(2) 代码未公开(我未检索到公开仓库),可复现性存疑;(3) 主张「reward shaping 是主要杠杆」,但没有把 RL 算法选择作为对照轴,无法排除「收益其实来自算法而非奖励」。
核心工作如何回应。STAR 用三个采样点把 Planner-R1 的两点观察扩展为一条曲线,并在奖励轴之外补上算法轴、数据轴、环境轴——是 Planner-R1 的严格超集式验证。但也正因如此,STAR 不与 Planner-R1 做 head-to-head 是一个严重缺失:按公开报数,Planner-R1 用 180 条 query 拿 56.9%,STAR 用 ≈2,198 条样本拿 62.8%。若 Planner-R1 的样本效率属实,STAR 的「comprehensive recipe」在数据效率维度上是被同期工作压制的——而这个维度恰是 STAR 自己 Takeaway 4 所主张的核心价值。
关键设计的传递。「dense process-level reward 对小模型更有效」被 STAR 完整复现并精细化。迁移形态:从「两点对比的定性结论」→「三点曲线上的相变定位」。
推动力可以概括为一句话——从「让 agent 会做」到「让 agent 学会做」再到「知道该怎么教」。
| 工作 | 年月 | 会议 / 出版 | 核心贡献 | 关键指标 | 与核心工作的关系 |
|---|---|---|---|---|---|
| ReAct | 2022.10 | ICLR 2023 | 推理-行动交错范式 | — | 范式源头(仅在脉络中提及) |
| TravelPlanner | 2024.02 | ICML 2024 Spotlight | 长视野多约束基准 + 双维四级评估协议 | GPT-4 = 0.6%;1,225 intent | 问题来源;评估协议被重用为奖励基元 |
| Search-R1 | 2025.03 | arXiv(有 OpenReview) | RL + 检索交错;token masking | 7B +41% / 3B +20% | 技术来源 + OOD 基线 |
| DAPO | 2025.03 | arXiv(ByteDance Seed) | 四项大规模 RL 技术 | AIME24 50 vs 47,50% 步数 | 基础设施 + 对照组 |
| ARPO | 2025.07 | ICLR 2026 Poster | 熵驱动自适应 rollout + 优势归因 | 13 基准更优,半个工具预算 | 被 STAR 划定适用上界:1.5B +7.4pp → 7B −4.5pp |
| Planner-R1 | 2025.09 | ICLR 2026 Under review | TravelPlanner 上的 reward shaping | 56.9% @ 180 queries;8B ≈ 32B | 最直接竞品,但 STAR 未做 head-to-head |
| Agent-STAR | 2026.03 | arXiv 预印本 | 五轴受控消融;scale-dependent 配方 | 7B = 62.8%;ARPO 收益翻转 | 汇聚点 |
可直接执行的实验:在 1.5B / 3B / 7B / 14B / 32B 五个规模上,固定 SFT 数据与 RL 数据,只测「最优 RL 配置的 OOD 均分 − SFT 的 OOD 均分」。STAR 的三点已给出 +14.1 / +4.3 / +1.0,外推预测 14B 处为负。若交点确实在 10B 量级,工业界当前在 30B+ 模型上做 agentic RL 的 OOD 代价需要被定价。高价值、低门槛——复用 STAR 的开源 pipeline 即可,只需扩展两个规模档。
STAR 的 r_sum 五个分量系数全为 1。表 3 的 Hard-1K 显示,数据分布偏移时 CS Macro 崩塌 34.6pp 而 HC 分量几乎不动——暗示各分量的有效梯度权重是被数据分布而非奖励系数决定的。具体实验:固定 Mixed-1K,扫描 r = α·s_cs^micro + β·s_cs^macro + γ·s_hard^micro + δ·s_hard^macro + ε·s^success 的系数单纯形,看 Success 响应面是否存在优于 (1,1,1,1,1) 的点,以及最优点是否随规模移动。这能把「奖励密度」这个一维旋钮拆成五维,检验 Takeaway 1 是不是降维投影下的伪相变。
STAR 给出了现象,没给出机制。可操作检验:测量 1.5B / 3B / 7B 在 rollout 时的组内轨迹多样性(如工具调用序列的编辑距离方差)。若假说成立,7B 的 GRPO 组内多样性应已接近或超过 1.5B 的 ARPO 组内多样性。这是一个不需要新训练的直接测量。
全领域最明确的实验空白。建议设定:相同 base(Qwen2.5-7B)、相同 GPU 预算、相同测试划分,横轴为总监督样本预算(180 / 500 / 1K / 2198),纵轴为 Success 与 OOD 均分。两条曲线的交点位置将直接回答「reward shaping 的样本效率优势能撑到多大预算」。目前双方各自报数(56.9% @ 180 vs 62.8% @ 2198),无法判断是方法差异还是预算差异。
STAR 只测了「随机全局失败」。真实工具失效至少四种形态,毒性不同:
| 噪声形态 | 语义 | 预期毒性 |
|---|---|---|
| 随机失败(STAR 已测) | 无信息 | 低——模型可学会重试 |
| 超时 / 限流 | 无信息 + 时序耦合 | 中——影响规划节奏 |
| 部分返回(截断) | 不完整信息 | 中高——模型不知道自己不知道 |
| 脏数据(错误但格式正确) | 错误信息 | 高——直接污染约束校验 |
具体机会:构造可配置的噪声注入层,对四种形态各扫 0/5/10/20%,产出一张 4×4 的鲁棒性矩阵。这类「环境侧基准」目前完全空白,且门槛很低——STAR 的沙箱已开源。
现有全部工作都是离线固定数据集的设定。但真实 agent 部署是流式的——任务持续到来,难度分布随时间漂移。具体问题:当难度分布随时间漂移时,「Mixed 4:3:3」静态配比是否仍最优?还是需要一个自适应难度采样器(如按当前策略成功率反向加权)?可在 STAR 框架里直接实例化:把 1K prompts 拆成 10 个 batch 按不同难度序送入,对比静态混合与自适应采样。
接批判第 ⑧ 点。具体实验:报告 DeepSeek-V3.2-Exp-Thinking 在 TravelPlanner 官方测试集上的 Success,计算「蒸馏效率比」= 62.8% / 教师成绩。若比值 > 1,RL 确实创造了教师没有的能力;若 < 1,整个 pipeline 应被重新定位为压缩而非训练。成本极低,但对结论解释的影响极大。
STAR 的四级密度阶梯依赖「评估协议可分解为二值检查项」这个前提。在多模态 agent(GUI 操作、具身导航)里,成功判定往往是连续的或需要 VLM 裁判——micro/macro 的分解怎么定义?具体问题:当 macro 指示函数由一个有噪声的 VLM judge 给出时,指示函数的跳变会被 judge 噪声抹平,r_sum 的「临门一脚」激励是否失效?这是把 STAR 方法论迁到具身/GUI 领域必须先回答的问题。
STAR 只在 RL 阶段做了规模消融,SFT 阶段(1,198 条轨迹)对三个规模完全相同。但表 1 显示 SFT 后的起点差异巨大(6.9 / 12.2 / 19.7)。具体机会:对 1.5B 是否应该用更多但更简单的 SFT 轨迹,对 7B 是否应该用更少但更难的?即把「数据难度配比」轴从 RL 阶段前移到 SFT 阶段。
KL-free 训练意味着策略可任意漂离 SFT 分布。在 in-domain 提升 43.1pp 的同时,模型损失了什么?STAR 只测了 QA 类 OOD。具体机会:在 STAR 的 checkpoint 上跑安全性 / 指令遵循 / 拒答一致性评测(如 Multi-IF、有害指令拒绝率),量化 agentic RL 的「对齐漂移」。六个 checkpoint 已全部开源,这是一个可以在一天内完成的实验,且目前没有任何 agentic RL 论文报告过这类数据。
以下为本期候选池中未展开的工作。未深读,评价基于摘要与检索信息,请以原文为准。
本报告的相关工作之一,但作为独立方法仍值得单读:「工具返回后 token 熵升高」这个观察本身就是可复用的诊断信号,与 STAR 的批判并不冲突——ARPO 在小模型上的 +7.4pp 是真实的。
arXiv | Code | ICLR 页
与 STAR 同属「配方类」实证研究,但侧重多轮交互的一般设定而非单一基准。与 STAR 对读可检验 scale-dependence 结论的跨任务稳健性——这正是 STAR 自己承认的 OOD 评估局限。
arXiv | NeurIPS 页
从标题看是对 agentic RL 基本假设的系统性质疑,与本报告推导出的「RL 的 OOD 净贡献趋零」可能形成呼应。值得优先核实其是否报告了 OOD 对照数据。
arXiv
信用分配是 9.2 步长轨迹的核心难题,而 STAR 的整条奖励轴其实是在用「密度」绕开「分配」。这篇正面处理分配问题,是 STAR 的补集。
arXiv | HF Papers
把 STAR 的单 agent 长视野问题扩展到多 agent 编排。若 scale-dependence 在单 agent 上成立,多 agent 场景下「每个 agent 该多大」就成了一个新的设计维度。
arXiv
直接对应本报告 8.2 第 ⑤ 点提出的「环境噪声形态学」空白,只是场景在 GUI 而非工具 API。是那个研究机会的一个已有落点,值得先看它做到了哪一步。
arXiv
具身方向。与 STAR 共享同一种论证结构——「大家默认要做的事其实不必做」。两篇一起读,能看出 2026 年这一批实证研究共同的「减法」倾向。
arXiv
已在第五部分展开,此处重列因为它是验证 STAR 结论最直接的对照材料,其 180-query 的样本效率主张若成立,影响远超 TravelPlanner 一个基准。
arXiv | OpenReview