Contents

The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models


作者Zanlin Ni, Shenzhi Wang, Yang Yue, Tianyu Yu, Weilin Zhao, Yeguo Hua, Tianyi Chen, Jun Song, Cheng Yu, Bo Zheng, Gao Huang
机构Tsinghua University (LeapLab / NLPLab) · Alibaba Group
链接arxiv.org/abs/2601.15165
日期2026年6月(v4)

Diffusion LLM 的任意顺序生成看似扩展了解空间,但实际上会通过绕过高熵的逻辑分叉点导致解空间坍缩;简单地用标准 GRPO 以自回归顺序训练(JustGRPO)反而能更有效地激发推理能力,同时完整保留并行解码优势。

Figure 1
Figure 1:限制 dLLM 为标准自回归(AR)顺序反而扩大了推理解空间;JustGRPO 直接使用标准 GRPO 即可超越复杂的扩散专用 RL 方法。

研究动机

Flexibility Trap 现象

1. Pass@k 量化推理潜力

Pass@k 衡量从 \(k\) 次独立采样中至少生成一个正确解的概率,是 RL 可优化上界的代理指标:

\[ \text{Pass@k} = \mathbb{E}\!\left[1 - \frac{\binom{n-c}{k}}{\binom{n}{k}}\right] \]

如果模型无法在海量采样中找到正确解,RLVR 优化就无法获得正向信号,推理能力无从提升。

Figure 3
Figure 3:Pass@k 扩展曲线。任意顺序(AO)在 k=1 有竞争力,但随 k 增大曲线趋于平坦;AR 顺序展现出更强的解空间覆盖能力。

2. 解空间覆盖分析

Pass@1024 分析表明,任意顺序可解的问题绝大多数是 AR 顺序可解集合的子集——AO 独占解极少(HumanEval 仅 0.6%),而 AR 独占解显著更多(21.3%)。

Figure 4
Figure 4:Pass@1024 解覆盖韦恩图。任意顺序的解集是 AR 解集的近似子集。

3. 灵活性程度与推理潜力的单调负相关

Semi-autoregressive 块大小 \(B\) 控制解码自由度(\(B=1\) 为纯 AR,\(B\) 越大任意性越强)。实验表明 Pass@k 随 \(B\) 增大单调下降,灵活性越大反而潜力越低。

Figure 5
Figure 5:块大小扫描实验。Pass@k(k=8,32,128)随块大小增大单调降低。

熵退化机制

Figure 2
Figure 2:AR 顺序迫使模型在不确定处作决策(探索);任意顺序绕过高熵 token,等上下文确定后再回填,导致分叉点被提前消解。

逻辑分叉点(Forking Tokens)

推理过程高度不均匀:少量"逻辑连接词"("Therefore"、"Thus"、"Since")决定推理走向,在 token 熵分布上表现为尖峰。AR 顺序强制模型在这些分叉处作出采样决策,从而探索多条推理路径。

Figure 6
Figure 6:任意顺序最常跳过的恰好是逻辑连接词(Therefore、Thus、Since 等)——即推理的分叉点。

熵退化的量化证据

在 AR 顺序下,逻辑分叉词被解码时保持高熵,意味着多条推理路径仍处于开放状态。任意顺序下,这些词在被回填时熵显著降低——未来上下文已经锁定了答案,回填变成了"填空"而非"决策"。

Figure 7
Figure 7:熵退化可视化。逻辑分叉 token 在任意顺序中的解码熵(蓝柱)远低于 AR 顺序,而全局平均熵(虚线)相近——说明问题针对性地发生在推理关键节点。

任意顺序的灵活性本质上是在推理时以"开采"代替"探索":优先选择确定性高的 token,早早锚定推理轨迹,牺牲了 RL 优化所需的解覆盖多样性。

JustGRPO 方法

1. 现有方法的"灵活性税"

保留任意顺序带来三重障碍:

问题根源现有应对
Token 级信度归因模糊dLLM 无唯一条件概率分解近似重要性比
序列似然不可解轨迹空间 \(O(N!)\)ELBO 替代目标
采样器-学习器不匹配置信度采样 \(\neq\) 模型分布引入额外偏差

2. 核心思路:AR 顺序作为 RL 训练脚手架

既然任意顺序损害推理潜力,JustGRPO 在 RL 训练阶段完全放弃任意顺序,将 dLLM 视为 AR 策略。关键构造:给定历史 \(o_{<k}\),构造输入:

\[ \tilde{x}_k = [\underbrace{o_1,\ldots,o_{k-1}}_{\text{Observed}},\underbrace{[\texttt{MASK}],\ldots,[\texttt{MASK}]}_{\text{Masked}}] \]

仅取位置 \(k\) 的 logit 定义 AR 策略:

\[ \pi^\text{AR}_\theta(\cdot \mid o_{<k}, q) \triangleq \text{Softmax}(f_{\theta,k}(\tilde{x}_k, q)) \]

序列似然因此可精确分解,无需 ELBO 近似:

\[ \pi^\text{AR}_\theta(o \mid q) = \prod_{k=1}^{|o|} \pi^\text{AR}_\theta(o_k \mid o_{<k}, q) \]

3. 标准 GRPO 直接应用

AR 策略定义后,标准 GRPO 目标(无任何扩散专用修改)即可直接使用:

\[ J(\theta) = \mathbb{E}\left[\frac{1}{G}\sum_{i=1}^G \frac{1}{|o_i|}\sum_{k=1}^{|o_i|}\left(\min\!\left(\rho_{i,k}\hat{A}_{i,k},\,\text{clip}(\rho_{i,k},1\!-\!\varepsilon,1\!+\!\varepsilon)\hat{A}_{i,k}\right) - \beta D_\text{KL}\right)\right] \]

其中 \(\rho_{i,k} = \pi^\text{AR}_\theta(o_{i,k}\mid o_{i,<k},q) / \pi^\text{AR}_{\theta_\text{old}}(o_{i,k}\mid o_{i,<k},q)\)。

4. 关键:训练约束不改变推理架构

AR 约束仅在训练阶段生效,作为"脚手架"优化模型分布。模型本身不施加因果掩码,双向注意力和离散扩散结构完全保留,推理阶段可继续使用并行解码。

flowchart LR A[dLLM backbone\n双向注意力] -->|RL 训练| B[AR 策略 πAR\n构造掩码输入] B -->|标准 GRPO| C[优化模型分布\n无结构修改] C -->|推理阶段| D[并行解码\nEB-Sampler] C -->|推理阶段| E[AR 解码\n1 token/step]

5. JustGRPO-Fast:稀疏高熵位置加速

推理由稀疏分叉点驱动,因此重要性比 \(\rho_{i,k}\) 只需在 top-25% 高熵位置计算,消除 75% 的前向推理开销,在 wall-time vs. 精度权衡上进一步优于默认 JustGRPO。

主要实验结果

基准对比(LLaDA-Instruct,生成长度 256)

方法 GSM8K MATH-500 HumanEval MBPP
d181.138.6
LLaDOU†88.141.159.151.6
ESPO82.339.042.144.6
GDPO82.839.639.650.6
SPG86.140.0
JustGRPO89.145.149.452.4

† LLaDOU 使用额外辅助模块;LLaDA-1.5 使用私有大规模训练数据,不作直接比较。

并行解码兼容性

JustGRPO 训练后的模型完全兼容 EB-Sampler 并行解码,且随并行度增大,相对原始 LLaDA-Instruct 的增益反而更大(MBPP:1 token/step +10.6% → ~5 tokens/step +25.5%)。

Figure 8
Figure 8:JustGRPO 保留并行解码能力,且在高并行度下增益更明显,说明 AR 训练优化了底层模型分布而非过拟合特定轨迹。

训练效率

Figure 9
Figure 9:Wall-time vs. 准确率曲线(16×H100)。JustGRPO 精确计算似然虽有单步开销,但整体 accuracy/wall-time 优于近似方法 ESPO;JustGRPO-Fast 进一步加速。

统一配置复现对比

方法GSM8KMATH-500HumanEvalMBPP
d1*83.839.2
ESPO*84.740.342.144.6
SPG*86.941.8
JustGRPO89.145.149.452.4
89.1%GSM8K 准确率
45.1%MATH-500 准确率
0行扩散专用 RL 修改

局限与展望