一句话定位

SAO 是 GLM 系 long-horizon agentic RL 的异步优化论文:把 GRPO 的 group-wise sampling 改成 single-rollout + critic-based PPO,再用 rollout logprob 直接做 token 级双边 importance masking,解决异步 rollout 下 policy lag、off-policy 漂移和 GRPO 等慢样本的结构性问题。摘要明确称该方法已部署到 open GLM-5.2 (750B-A40B) 的 agentic RL pipeline。

团队归属确认

  • 作者:Zhenyu Hou、Yujiang Li、Jie Tang、Yuxiao Dong;单位标为 Tsinghua University,脚注说明前两位作者工作发生在 Z.AI internship
  • 与 GLM-5.2 关系:论文摘要写明 SAO “is successfully deployed in the agentic RL pipeline for training the open GLM-5.2 model (750B-A40B)”。
  • 因此归档为 GLM-5.2 团队/清华-Z.AI 后训练支撑论文,不是 GLM-5.2 主模型卡本身。

问题设定

同步 RL 管线通常先收完整 batch rollout,再训练;agentic coding / reasoning-with-tools 的 rollout 长度高度不均,短轨迹等长轨迹,GPU 利用率和 wall-clock 都受 straggler 拖累。异步 RL 允许 rollout 完成即入训练,但引入两类不稳定:

  • policy lag / off-policy drift:一条轨迹可能由多个旧 rollout policy 版本生成,训练时当前 policy 已更新。
  • GRPO group-wise sampling 不适配异步:GRPO 每 prompt 采一组 response,用组内 reward 做 advantage;同组必须等最慢样本,重新制造同步屏障,并让不同延迟样本带来更严重 off-policy。

论文的基本判断:agentic RL 的长轨迹、在线反馈、异步 rollout 环境下,GRPO 的组内相对优势假设开始失效,必须回到 critic-based single-rollout。

方法拆解

1. Direct Double-Sided Importance Sampling (DIS)

传统 decoupled PPO 可能维护 current policy、old policy、rollout policy 三者;异步场景下精确追踪所有历史 old policy checkpoint 成本很高。SAO 直接使用 rollout engine 记录的 token logprob 作为 behavior probability:

r_t(theta) = exp(log pi_theta(a_t | s_t) - log pi_rollout(a_t | s_t))

然后用严格双边 trust region:

f(x; eps_l, eps_h) = x, if 1 - eps_l < x < 1 + eps_h
                   = 0, otherwise

含义:ratio 超出区间的 token 直接从梯度中 mask 掉,而不是标准 PPO 那种只在特定 advantage 方向 clip surrogate。它牺牲一部分无偏性,换取不维护历史 policy ensemble,并显著降低极端 off-policy token 破坏训练的风险。

2. Single-rollout sampling

SAO 每个 prompt 只采一个 rollout,完成即训练;GRPO 则需同 prompt 多个 response 组成 group。single-rollout 的收益:

  • 无需等待同组最慢 response,天然适配异步 actor-learner。
  • batch 中 prompt diversity 更高,降低同 prompt 多样本被不同 policy lag 污染的问题。
  • 更贴近真实 online agent setting:环境常只给一次轨迹反馈,不可能为同一 prompt 采固定 group。

代价也明确:没有 group-relative baseline 后,gradient variance 类似 REINFORCE,需要更强 critic。

3. 更强的 value model 训练

SAO 成败取决于 critic。论文用了三项工程设计:

  • critic 更新更频繁:每次 policy update,对 value model 做 K=2 次更新,让 value 估计追上当前 policy。
  • Frozen-Attention value training:RL 阶段冻结 value model attention,只更新 MoE projections。作者观察 full attention 层梯度范数显著更大,是 critic 不稳定来源;冻结 attention 起到正则化作用。
  • 扩大 value pretraining:缓解 value cold start,否则 early RL 的 advantage 噪声会破坏 policy。

4. Skip-Observation Token-level GAE

agent trajectory 形如:

[a0, o0, a1, o1, ...]

其中 a_i 是模型 action,o_i 是环境反馈。observation 不是模型生成,若标准 token-level GAE 跨 action-observation 边界传播 value,会把环境噪声引入模型 token 的 credit assignment。SAO 在 action 末 token 与下一 action 首 token 之间跳过 observation:

A_hat(a_i,N) = delta + gamma * lambda * A_hat(a_{i+1,0})
delta = r_t + gamma * V(a_{i+1,0}) - V(a_i,N)

这比 step-level value 更细,论文附录显示 token-level 优于 step-level average / last-token 两种替代。

实验结论

主实验以 Qwen3-30B-A3B 系模型训练 math-with-python 和 coding agent。

  • Math reasoning:
    • AIME2025:SFT 80.4,GRPO 84.2,SAO 97.3
    • BeyondAIME:SFT 53.3,GRPO 54.8,SAO 74.8
    • HMMT Nov 2025:SFT 75.2,GRPO 76.0,SAO 88.3
    • IMOAnswerBench:SFT 53.3,GRPO 55.8,SAO 74.0
  • SWE-Bench Verified:
    • Qwen3-30B-A3B baseline 23.0
    • GRPO + DIS 27.0
    • SAO 29.8

训练曲线更关键:vanilla GRPO 约 160 steps 崩,vanilla VAPO 约 90 steps 崩;GRPO + DIS 能稳定,而 SAO 在约 400 steps 后拉开差距。这说明 DIS 主要救稳定性,single-rollout + critic 主要贡献后期增益

Ablation 读法

  • SAO:AIME 97.3 / BeyondAIME 74.8
  • 去掉 faster value update:95.0 / 69.8
  • 不冻结 attention:90.6 / 74.5
  • Vanilla VAPO without DIS:91.3 / 69.0
  • Running mean baseline:79.8 / 55.3

结论:single-rollout 本身不够,必须配 well-trained critic;running mean reward baseline 太粗,无法替代 state-dependent value。

局限 / 追问

  • 论文动机强调异步效率,但缺少充分 wall-clock speedup、GPU utilization、rollout/train overlap、trajectory length 分布下的吞吐分解;“更稳定/更强”证据比“更高效”更硬。
  • SAO batch 是 128 个 prompt × 1 rollout;GRPO 是 16 prompt × 8 rollout。收益一部分来自更高 prompt diversity,论文未完全拆分。
  • reward、训练数据、value pretraining 规模披露有限,复现难度高。
  • 引入 critic、K=2 value updates 和 value pretraining 后,总训练成本是否低于 GRPO 需要更细成本账。

对 GLM-5.2 的意义

GLM-5.2 model card / blog 中提到 long-horizon agentic RL 从 group-wise 转向 critic-based PPO,compact trajectory 和 token-level loss 是关键变化。SAO 给出其中 异步 agentic RL + single-rollout + DIS 的算法细节,是理解 GLM-5.2 agentic RL 稳定性的支撑论文之一。

原始链接

一手源存档(sources/)