一句话定位
SAO 是 GLM 系 long-horizon agentic RL 的异步优化论文:把 GRPO 的 group-wise sampling 改成 single-rollout + critic-based PPO,再用 rollout logprob 直接做 token 级双边 importance masking,解决异步 rollout 下 policy lag、off-policy 漂移和 GRPO 等慢样本的结构性问题。摘要明确称该方法已部署到 open GLM-5.2 (750B-A40B) 的 agentic RL pipeline。
团队归属确认
- 作者:Zhenyu Hou、Yujiang Li、Jie Tang、Yuxiao Dong;单位标为 Tsinghua University,脚注说明前两位作者工作发生在 Z.AI internship。
- 与 GLM-5.2 关系:论文摘要写明 SAO “is successfully deployed in the agentic RL pipeline for training the open GLM-5.2 model (750B-A40B)”。
- 因此归档为 GLM-5.2 团队/清华-Z.AI 后训练支撑论文,不是 GLM-5.2 主模型卡本身。
问题设定
同步 RL 管线通常先收完整 batch rollout,再训练;agentic coding / reasoning-with-tools 的 rollout 长度高度不均,短轨迹等长轨迹,GPU 利用率和 wall-clock 都受 straggler 拖累。异步 RL 允许 rollout 完成即入训练,但引入两类不稳定:
- policy lag / off-policy drift:一条轨迹可能由多个旧 rollout policy 版本生成,训练时当前 policy 已更新。
- GRPO group-wise sampling 不适配异步:GRPO 每 prompt 采一组 response,用组内 reward 做 advantage;同组必须等最慢样本,重新制造同步屏障,并让不同延迟样本带来更严重 off-policy。
论文的基本判断:agentic RL 的长轨迹、在线反馈、异步 rollout 环境下,GRPO 的组内相对优势假设开始失效,必须回到 critic-based single-rollout。
方法拆解
1. Direct Double-Sided Importance Sampling (DIS)
传统 decoupled PPO 可能维护 current policy、old policy、rollout policy 三者;异步场景下精确追踪所有历史 old policy checkpoint 成本很高。SAO 直接使用 rollout engine 记录的 token logprob 作为 behavior probability:
r_t(theta) = exp(log pi_theta(a_t | s_t) - log pi_rollout(a_t | s_t))然后用严格双边 trust region:
f(x; eps_l, eps_h) = x, if 1 - eps_l < x < 1 + eps_h
= 0, otherwise含义:ratio 超出区间的 token 直接从梯度中 mask 掉,而不是标准 PPO 那种只在特定 advantage 方向 clip surrogate。它牺牲一部分无偏性,换取不维护历史 policy ensemble,并显著降低极端 off-policy token 破坏训练的风险。
2. Single-rollout sampling
SAO 每个 prompt 只采一个 rollout,完成即训练;GRPO 则需同 prompt 多个 response 组成 group。single-rollout 的收益:
- 无需等待同组最慢 response,天然适配异步 actor-learner。
- batch 中 prompt diversity 更高,降低同 prompt 多样本被不同 policy lag 污染的问题。
- 更贴近真实 online agent setting:环境常只给一次轨迹反馈,不可能为同一 prompt 采固定 group。
代价也明确:没有 group-relative baseline 后,gradient variance 类似 REINFORCE,需要更强 critic。
3. 更强的 value model 训练
SAO 成败取决于 critic。论文用了三项工程设计:
- critic 更新更频繁:每次 policy update,对 value model 做
K=2次更新,让 value 估计追上当前 policy。 - Frozen-Attention value training:RL 阶段冻结 value model attention,只更新 MoE projections。作者观察 full attention 层梯度范数显著更大,是 critic 不稳定来源;冻结 attention 起到正则化作用。
- 扩大 value pretraining:缓解 value cold start,否则 early RL 的 advantage 噪声会破坏 policy。
4. Skip-Observation Token-level GAE
agent trajectory 形如:
[a0, o0, a1, o1, ...]其中 a_i 是模型 action,o_i 是环境反馈。observation 不是模型生成,若标准 token-level GAE 跨 action-observation 边界传播 value,会把环境噪声引入模型 token 的 credit assignment。SAO 在 action 末 token 与下一 action 首 token 之间跳过 observation:
A_hat(a_i,N) = delta + gamma * lambda * A_hat(a_{i+1,0})
delta = r_t + gamma * V(a_{i+1,0}) - V(a_i,N)这比 step-level value 更细,论文附录显示 token-level 优于 step-level average / last-token 两种替代。
实验结论
主实验以 Qwen3-30B-A3B 系模型训练 math-with-python 和 coding agent。
- Math reasoning:
- AIME2025:SFT 80.4,GRPO 84.2,SAO 97.3
- BeyondAIME:SFT 53.3,GRPO 54.8,SAO 74.8
- HMMT Nov 2025:SFT 75.2,GRPO 76.0,SAO 88.3
- IMOAnswerBench:SFT 53.3,GRPO 55.8,SAO 74.0
- SWE-Bench Verified:
- Qwen3-30B-A3B baseline 23.0
- GRPO + DIS 27.0
- SAO 29.8
训练曲线更关键:vanilla GRPO 约 160 steps 崩,vanilla VAPO 约 90 steps 崩;GRPO + DIS 能稳定,而 SAO 在约 400 steps 后拉开差距。这说明 DIS 主要救稳定性,single-rollout + critic 主要贡献后期增益。
Ablation 读法
- SAO:AIME 97.3 / BeyondAIME 74.8
- 去掉 faster value update:95.0 / 69.8
- 不冻结 attention:90.6 / 74.5
- Vanilla VAPO without DIS:91.3 / 69.0
- Running mean baseline:79.8 / 55.3
结论:single-rollout 本身不够,必须配 well-trained critic;running mean reward baseline 太粗,无法替代 state-dependent value。
局限 / 追问
- 论文动机强调异步效率,但缺少充分 wall-clock speedup、GPU utilization、rollout/train overlap、trajectory length 分布下的吞吐分解;“更稳定/更强”证据比“更高效”更硬。
- SAO batch 是 128 个 prompt × 1 rollout;GRPO 是 16 prompt × 8 rollout。收益一部分来自更高 prompt diversity,论文未完全拆分。
- reward、训练数据、value pretraining 规模披露有限,复现难度高。
- 引入 critic、K=2 value updates 和 value pretraining 后,总训练成本是否低于 GRPO 需要更细成本账。
对 GLM-5.2 的意义
GLM-5.2 model card / blog 中提到 long-horizon agentic RL 从 group-wise 转向 critic-based PPO,compact trajectory 和 token-level loss 是关键变化。SAO 给出其中 异步 agentic RL + single-rollout + DIS 的算法细节,是理解 GLM-5.2 agentic RL 稳定性的支撑论文之一。
原始链接
- alphaXiv: https://www.alphaxiv.org/abs/2607.07508
- arXiv: https://arxiv.org/abs/2607.07508
- PDF: https://arxiv.org/pdf/2607.07508
一手源存档(sources/)
- arxiv-2607.07508-sao.pdf (PDF 原文;本地落在
sources/llm/2026/,按仓库*.pdf规则不入 git)