Contents

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning


作者Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji
机构Tsinghua University & Tencent LLM Department
发表arXiv 2606.11119  ·  2026-06-10
链接https://arxiv.org/abs/2606.11119

在固定 rollout 预算下,通过树结构分配——而非平铺均匀采样——将 outcome-only 奖励转化为更密集的对比信号,从而显著提升多轮 Agentic RL 的训练效率。

Figure 1
图 1:TRACE 将固定 rollout 预算重新分配到对比度丰富的 root 和 prefix,相比均匀分配能产生更多混合奖励对比与隐式逐步偏好对。

研究动机

1. 问题难在哪

RLVR(Reinforcement Learning with Verifiable Rewards)已成为训练 LLM 推理和 Agentic 能力的核心范式。然而在多轮 ReAct 风格的 Agent 任务中,rollout 代价极高(需要长链思考 + 环境交互),而学习信号却极度稀疏:

2. 现有方法的不足

方法类型策略局限
GRPO随机均匀采样大量 rollout 来自"无对比度"的 prompt,浪费预算
PCL(Prompt Curriculum Learning)按难度过滤 prompt只在 prompt root 层操作,忽略轨迹内部 prefix 的信息差异
TreePO树结构 rollout + 随机 branching引入了树结构但分支点选取随机,未利用 prefix 级别的不确定性

3. 核心 Insight

将 rollout 采样从"平铺"转化为树结构分配问题:prompt root 和轨迹中每个 turn 结束后的 prefix 都是候选"anchor",将预算分配给最可能产生混合终端奖励(既有成功又有失败)的 anchor,从而最大化奖励对比信号的密度。

V(1−V)anchor 对比潜力
2 阶段全局 Root + 局部 Prefix
1 个共享成功率预测器

核心方法

Figure 3
图 3:TRACE 框架概览。预测器对 prompt root 和 visited prefix 评分,TRACE 求解有预算约束的分配问题,所得 rollout 树再用于更新预测器和策略。

1. 形式化:多轮 RLVR 的 Prefix History

每个 ReAct turn 被建模为节点 \(n_t := \langle \tau_t, a_t, o_t \rangle\)(thought、action、observation),prefix history 为 \(H_t := (x, n_1, \ldots, n_t)\)。针对任意 prefix \(H_t\) 定义条件成功概率

\[ V_t^\pi := \mathbb{E}^\pi\bigl[r(H_T) \mid H_t\bigr] \]

这是 TRACE 中所有分配决策的核心评分量。

2. 混合奖励对比——统一分配原则

对于任意 anchor(root 或 prefix),分配 \(m\) 个 continuation 后产生混合奖励的概率为:

\[ \text{Contrast}(V, m) = 1 - V^m - (1-V)^m \]

该函数在 \(V=0.5\) 处最大,在 \(V \to 0\) 或 \(V \to 1\) 时趋近 0——只有中间难度的 anchor 才值得分配预算

命题 2 进一步证明,prefix 处的剩余对比潜力等于 Bernoulli 方差:\(\mathbb{E}^\pi[[Z]_{t:T} \mid H_t] = V_t^\pi(1 - V_t^\pi)\),从而为上述启发式提供了理论依据。

3. 阶段一:全局 Root 分配

给定候选 prompt 池 \(\{x_1,\ldots,x_B\}\),预测每个 prompt 的成功概率 \(\tilde{V}_\psi(x_i)\),求解如下整数规划:

\[ \max_{m_1,\ldots,m_B} \sum_{i=1}^{B} \bigl[1 - \tilde{v}_i^{m_i} - (1-\tilde{v}_i)^{m_i}\bigr] \quad \text{s.t.} \sum m_i = M,\ m_i \in \{0\} \cup \{2,\ldots,M\} \]

\(m_i=0\) 表示跳过该 prompt;\(m_i \geq 2\) 确保组内至少有两条 rollout 以支持 GRPO 式的组对比更新。动态规划求解,计算开销可忽略。

4. 阶段二:局部 Prefix 扩展

每个活跃 prompt \(x_i\) 完成 \(m_i\) 条 bare rollout 后,对每个已访问的 non-terminal prefix \(H_{i,j,t}\) 计算分配价值:

\[ V_{\text{pref}}(i,j,t,k) := 1 - \bigl[r_{i,j}\,\tilde{V}_\psi(H_{i,j,t}) + (1-r_{i,j})(1-\tilde{V}_\psi(H_{i,j,t}))\bigr]^k \]

即"再采样 \(k\) 条 continuation 后,至少有一条翻转已观察奖励"的概率。然后在局部预算 \(m_i N\) 下求解分配,不等待其他 prompt(prompt-local,系统友好)。

5. 共享成功率预测器

在线训练单个轻量 \(\tilde{V}_\psi(H_t)\),同时服务 root 评分和 prefix 评分。训练目标是树上的递归经验均值:

\[ \hat{V}(y) = \frac{1}{n_y} \sum_{c \in C(y)} n_c \hat{V}(c), \quad \mathcal{L}_{\text{value}} = \frac{1}{|\mathcal{S}|}\sum_{y\in\mathcal{S}} (\tilde{V}_\psi(y) - \hat{V}(y))^2 \]

root 样本更多,anchor prefix 样本较少,但实验表明预测器能将 prefix 难度迁移到从未见过的中间步骤上。

6. 系统整体流程

flowchart LR A[候选 Prompt 池] -->|预测 V| B[全局 Root 分配\n整数规划] B -->|m_i 条 bare rollout| C[轨迹树 Stage 1] C -->|访问过的 prefix| D[预测 V_prefix] D -->|局部预算分配| E[Prefix 扩展 Stage 2] E --> F[完整 rollout 树] F -->|递归均值目标| G[更新预测器 V_ψ] F -->|树感知 optimizer| H[更新策略 π_θ] G --> B H --> B
TRACE 每步训练的数据流,形成全局 root 分配 → prefix 扩展 → 预测器 + 策略更新的闭环。

7. 方法对比一览

方法Prompt 选择Root 预算Prefix 扩展树结构更新学习式分配
GRPO随机均匀×××
PCL预测式固定××仅 root
TreePO随机均匀随机×
TRACE预测式自适应预测式Root + Prefix
Success rate heterogeneity
(a) Anchor 成功率分布——大量 anchor 聚集在 0 或 1,对比度极低。
Contrast captured by budget
(b) 排名分配 vs 均匀分配——少量预算即可捕获大部分对比度。
Prefix-conditioned prediction
(c) 随 prefix 深度增加,预测 MSE 下降——更多观察带来更精准的条件估计。

主要实验结果

实验设置

准确率提升(vs GRPO 基线)

有效比率(Effective Ratio)提升

有效比率 = batch 中奖励组包含"成功 + 失败"的 prompt 比例。越高表明每次更新获得的对比信号越多。

详细数值对比

数学推理完整表格(Qwen3-8B & 14B)
模型方法AIME24AMC23MATH500MinervaOlympiadAvg↑MMLU-ProARC-cGPQAOOD Avg↑
8BReAct52.387.089.837.858.665.168.595.352.472.1
GRPO63.691.092.340.262.870.072.795.355.974.6
PCL64.091.592.840.763.070.472.995.456.274.8
TreePO64.391.392.640.963.170.473.095.256.474.9
TRACE63.991.293.441.265.871.173.495.756.975.3
14BReAct61.589.491.840.062.369.075.196.259.276.8
GRPO65.694.394.245.268.473.575.996.159.477.1
PCL66.295.195.045.167.673.976.196.259.777.3
TreePO66.495.094.845.467.874.076.096.459.877.4
TRACE66.194.794.947.371.574.976.596.560.477.8
Multi-Hop QA & Function Calling 完整表格
模型方法Hotpot2WikiMusiqBambQA Avg↑BaseMiss-FuncMiss-ParamLongFC Avg↑
8BReAct41.937.618.444.735.736.721.531.122.328.0
GRPO53.248.727.464.748.558.531.045.838.743.5
PCL53.649.227.965.048.959.032.146.839.344.3
TreePO54.049.728.465.949.558.932.046.539.444.2
TRACE55.750.929.566.350.661.234.448.840.446.2
14BReAct46.444.222.855.342.251.123.635.622.833.6
GRPO55.352.730.166.851.270.632.640.936.446.1
PCL55.652.930.267.251.570.031.841.440.445.9
TreePO55.155.331.070.653.070.833.043.239.446.6
TRACE57.853.133.771.354.072.434.844.640.248.0

消融实验

两阶段各自的贡献(Qwen3-8B Multi-Hop QA)

阶段一(Root 分配)阶段二(Prefix 扩展)Avg AccAvg Eff. Ratio
均匀均匀49.542.8%
Active均匀49.849.1%
均匀Active50.047.3%
ActiveActive50.652.3%

两阶段增益可叠加:root 分配筛出有对比潜力的 prompt,prefix 扩展进一步在轨迹内部发现对比点。

预算形状的影响(M × N,总预算 = M(1 + N/2))

MN总预算TreePO AccTRACE AccTreePO Eff%TRACE Eff%
5122102448.849.732.242.4
5126204849.450.337.747.8
10242204849.550.642.852.3

相同总预算下,更宽的 root 覆盖(M=1024, N=2)优于更深的 prefix 扩展(M=512, N=6)。瓶颈不只是 rollout 数量,而是预算能否覆盖奖励尚未确定的状态。

局限与展望