Contents

TMAX: A simple recipe for terminal agents


作者Hamish Ivison*, Junjie Oscar Yin*, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi
机构Allen Institute for AI & University of Washington
日期2026-06-22 (arXiv:2606.23321)
链接arxiv.org/abs/2606.23321  |  github.com/hamishivi/tmax

通过一个可组合的合成数据管线(9 个正交轴控制难度与多样性)+ 简单的 DPPO 强化学习配方,以 9B 参数在 Terminal-Bench 2.0 上达到 27%,超越所有公开 RL 方案和 32B 以下的先前工作。

14,600RL 环境实例 (TMAX-15K)
27.2%TB 2.0 @ 9B 参数
2.5×大于第二大终端数据集
+9.4ptSWE-Bench Verified 提升
TMAX Data Pipeline
图 2:TMAX 数据生成管线。每个任务通过从 9 个结构化轴层次采样生成,数据生成器输出 Dockerfile、单元测试验证器、源文件和任务指令。

研究动机

数据生成管线

1. 组合式采样框架

每个合成任务是从 9 个结构化轴的笛卡尔积中采样生成。前三个轴(Domain、Skill type、Primitive skills)借鉴 Nemotron-Terminal;其余六个轴由本文引入,专门针对多样性与难度控制。

来源 基数 示例值
DomainPi et al.9security, software_engineering, data_science, ...
Skill typePi et al.4–7/domainAlgorithmic, Systems, Web Security, ...
Primitive skillsPi et al.20–40/domaingraph traversal, cryptographic hashing, ...
Persona本文6–18/domain"红队操作员", "生物信息学分析师", ...
Language本文8Python, C, Bash, Rust, Go, multi-language
Task complexity本文4short / moderate / complex / intricate (30-60 cmd)
Command complexity本文3bash-only / bash+code / bash+code+services
Fixture本文7text_only / image / audio / video / binary / ...
Verifier本文5exact_text / metric_threshold / fuzz_equivalence / ...

2. 可扩展性:跳过教师验证

先前工作(TermiGen, TerminalTraj)需要昂贵的教师模型逐一验证生成质量。TMAX 直接跳过这一步——每个 domain 预构建 Docker 基础镜像,每个任务只需追加依赖即可执行。RL 的 soft filtering(过滤全零奖励样本)取代了显式验证;实践中每批过滤 <8 个样本,说明生成数据的有效率极高。

3. 难度校准

通过两个机制避免双峰分布:细粒度复杂度轴(均匀采样 4 个任务复杂度级别 × 3 个命令复杂度级别);渐进式验证器(metric_threshold 通过阈值提供连续难度旋钮,fuzz_equivalence 通过随机输入数量控制,multi_protocol 通过协议数控制)。

4. 管线流程图

TMAX 数据生成流程
flowchart LR subgraph Axes["9 个组合轴"] D[Domain] S[Skill type] P[Primitive skills] Pe[Persona] L[Language] TC[Task complexity] CC[Command complexity] F[Fixture] V[Verifier] end Axes -->|层次采样| Gen["Gemini-3-Pro\n生成器"] Gen --> Docker["Dockerfile\n+ 基础镜像"] Gen --> Tests["单元测试\n验证器"] Gen --> Src["源文件"] Gen --> Inst["任务指令"] Docker & Tests & Src & Inst --> Env["RL 环境实例\n(14,600 个)"] Env -->|mini-SWE-agent\nharness| Agent["模型 Rollout"] Agent -->|奖励 > 0?| Filter["Soft Filtering\n过滤全零梯度"] Filter --> Train["DPPO 训练"]

5. 数据集对比

与 6 个先前数据集相比,TMAX-15K 在领域均衡性(balance = 0.998)和绝对难度(pass@8 = 53%,最低)上均领先。

各数据集的领域均衡分数 vs Gemini-3-Flash pass@1(左上角 = 更难且更均衡)

RL 训练配方

1. DPPO 算法

使用 Divergence Proximal Policy Optimization (DPPO)——GRPO 的变体,基于 binary TV 散度近似遮蔽训练与推理 logprob 偏差过大的 token。相比原始 GRPO,DPPO 在长时序 agentic 场景下显著减少训练崩溃(见图 7)。

2. FP32 LM head

Qwen 3.5 的混合精度架构导致 vLLM (推理) 与 HuggingFace (训练) 之间的 logprob 差异频繁出现尖峰。将 LM head 保持 FP32 可将最大差异降低约 2–3×,从而避免数值不匹配触发的 KL 爆炸。

3. 大 group size

使用 group size = 32(即每个 prompt 32 次 rollout)。实验表明 group size 从 8 增至 32 可显著改善训练稳定性,减少训练中期的奖励崩溃频率(图 8)。

4. 超参数总览

类别超参数
算法RL objectiveDPPO (binary TV, threshold 0.1)
算法KL 系数 β0.0(无 KL penalty)
RolloutGroup size32
Rollout每批 unique prompts8
序列Max total response65,536 tokens
序列Max tool calls64
优化Learning rate1 × 10⁻⁶ (constant)
优化训练步数500
模型LM head 精度FP32
基础设施推理引擎vLLM (async)
基础设施沙箱Podman / Apptainer

5. Interleaved Thinking

在中间轮次保留模型的思考内容(称为 "interleaved thinking"),这已被 MiniMax-M2 证明可以改善 agentic 场景下的性能,并被本文采用为默认配置。

主要实验结果

1. Terminal-Bench 2.0 性能对比

Terminal-Bench 2.0 各模型得分(%)。TMAX-9B 以 9B 参数超越所有 32B 以下先前开放方案。

2. 数据集消融:TMAX-15K 最优

在相同的 Qwen 3.5 9B 基础上,用不同数据集做 RL 训练,TMAX-15K 在 Terminal-Bench Lite 达 57.2%,比第二名(OpenThinker-Agent data, 53.0%)高 4.2 分。

RL 数据集 TB Lite (%) TB 2.1 (%)
无(Qwen 3.5 9B baseline)41.9 ± 2.716.1 ± 3.7
TerminalTraj45.8 ± 2.718.0 ± 0.0
SWE-Smith47.2 ± 2.221.0 ± 0.5
TermiGen49.4 ± 1.525.1 ± 1.9
CLI-Gym50.7 ± 5.925.1 ± 1.4
Endless Terminals52.6 ± 1.425.5 ± 1.4
OpenThinker-Agent53.0 ± 0.725.1 ± 3.7
TMAX-15K(本文)57.2 ± 2.528.8 ± 1.4

3. 跨尺寸泛化

无需修改配方,TMAX RL 训练在 2B / 4B / 9B / 27B 四个规模上均提升基础模型,9B 提升幅度最大(+15.3 pt TB Lite)。

模型TB Lite (%)TB 2.0 (%)
Qwen 3.5 2B → TMAX-2B5.7 → 11.82.3 → 2.9
Qwen 3.5 4B → TMAX-4B31.8 → 42.616.6 → 18.9
Qwen 3.5 9B → TMAX-9B41.9 → 57.221.1 → 27.2
Qwen 3.6 27B → TMAX-27B70.8 → 68.639.6 → 42.7

4. 跨任务泛化(SWE-Bench & AIME)

TMAX RL 训练不是"harness fitting":SWE-Bench Verified +9.5pt(44.0 → 53.5%),AIME 2024/25 +17.8pt(73.3 → 91.1%),说明模型学到了真实的 terminal 使用能力。

5. 跨 harness 泛化

在 4 种 harness(本文、OpenHands、mini-SWE-agent、Terminus-2)上,TMAX-9B 均比 Qwen 3.5 9B 提升 ≥9 分,而最大收益仍来自本文 harness,表明训练在不同工具集和提示格式间泛化。

局限与展望