一句话定位
智谱最新旗舰,面向 long-horizon 任务,较 GLM-5.1 大幅提升并首次在稳定 1M-token 上下文上交付该能力;MIT 纯开源。基座方法见 GLM-5 技术报告《GLM-5: from Vibe Coding to Agentic Engineering》(arXiv 2602.15763)。
架构(config.json)
model_type=glm_moe_dsa(DeepSeek 式稀疏注意力 MoE);hidden 6144;78 层;rope_theta 8e6;上下文 1M(1,048,576)。- 注意力 64 头 / 64 KV,MLA 式:qk_head_dim 256(nope 192 + rope 64),head_dim 192,index_head_dim 128。
- MoE:256 路由专家 + 1 共享,每 token 选 8,moe_intermediate 2048。
- IndexShare(arXiv 2603.12201,已落盘):每 4 个稀疏注意力层复用同一 indexer,1M 上下文下 per-token FLOPs 降 2.9×。
- 改进 MTP:投机解码 acceptance length 提升达 20%。
数据 / 训练 / 后训练(承 GLM-5 报告 2602.15763,Figure 5)
- 基座 28.5T tokens 分阶段:预训练 通用 18T@4K → 代码&推理 9T@4K;中训练 长代码&推理 1T@32K → 长上下文&Agent 数据 500B/50B@128K/200K;稀疏注意力适配 20B@200K。744B 总参 / ~40B 激活、256 专家、80 层(GLM-5.2 config 为 78 层)。
- 后训练管线(超越标准 SFT,序贯 RL):Base →「Overall SFT」→ Reasoning RL → Agentic RL → General RL,全程叠加 On-Policy Cross-Stage Distillation(在线策略跨阶段蒸馏,用 logits/weights)防灾难性遗忘 —— 保住推理锐度的同时成为稳健通才。
- 异步 RL 基础设施:基于 slime 框架 + 解耦 rollout 引擎(承 GLM-4.5),进一步解耦 generation 与 training 最大化 GPU 利用,支持大规模 agent 轨迹探索、无同步瓶颈。
- 新颖异步 Agent RL 算法:GLM-4.5 用迭代自蒸馏 + outcome supervision;GLM-5 发展异步算法从多样 long-horizon 交互持续学习,专门优化规划与自我纠错(对应真实编码场景的统治力)。
- GLM-5.2 后训练支撑论文(2026-07):SAO 解释异步 agentic RL 中 single-rollout + DIS 的稳定性设计;CompactionRL 解释 long-horizon context compaction 下 summary 参与 RL、token-level loss 与 cross-trajectory GAE。两篇摘要均明确写入 open GLM-5.2 (750B-A40B) 训练管线。
GLM-5.2 后训练相比 GLM-5 的差异(官方博客 z.ai/blog/glm-5.2)
GLM-5 的后训练管线(SFT→Reasoning/Agentic/General RL→跨阶段蒸馏)为基线,GLM-5.2 在此之上有以下实质改动:
- RL 算法 group-wise → critic-based PPO:long-horizon 任务产生超长 trace,被 compaction 切成多个子轨迹后,同一 prompt 产生的可训练 trace 数量/长度高度可变,group-relative(GRPO) 不再适配。GLM-5.2 改用基于 critic 的单 rollout PPO(critic 估 token 级 advantage),把所有 compacted 子轨迹都纳入训练 + token 级 loss 平衡长度。
- 新增 Anti-hack 模块(防 reward hacking):GLM-5.2 比 GLM-5.1 表现出更多 hacking(coding RL 的 pass/fail 奖励易被钻——读评测产物、抄 reference/upstream commit、
curlGitHub 抓答案源码)。新增两阶段在线检测:规则过滤(高召回)→LLM judge 查意图(高精度);命中即 block 该 tool call 并返回 dummy 结果、允许继续 rollout(处理单步违规而非弃整条轨迹,避免训练崩溃)。训练+评测两用。 - OPD(On-Policy Distillation)规模化:用 slime 做并行 OPD,把 10+ 专家模型高效合并进最终模型,全程约 2 天;slime 扩展 white-box/black-box rollout、compact trajectory、sub-agent workflow + KV-cache FP8,承载更大更复杂的 agentic RL+OPD。
- 1M 上下文 coding-agent 后训练数据大幅扩展:覆盖大规模实现、自动化研究、性能优化、复杂调试;IndexShare 从 mid-training(128K) 起即启用。
- Effort level control(含 Max 档):后训练赋予的可控推理预算——显式平衡能力 vs 速度/算力(GLM-5 的 thinking 模式 → GLM-5.2 多档 effort + Max)。
- 长程编码效果:FrontierSWE 仅落后 Opus 4.8 1%、PostTrainBench 超 GPT-5.5/Opus 4.7(仅次 Opus 4.8);标准编码 Terminal-Bench 2.1 81.0(vs 5.1 的 63.5)、SWE-bench Pro 62.1(vs 58.4)。
Benchmark(vs GLM-5.1 / Qwen3.7-Max / MiniMax-M3 / DeepSeek-V4-Pro / Claude Opus 4.8 / GPT-5.5 / Gemini 3.1 Pro)
- 推理:HLE 40.5(w/Tools 54.7);AIME 2026 99.2(榜首);HMMT Feb 2026 92.5;IMOAnswerBench 91.0;GPQA-Diamond 91.2。
- 编码:SWE-bench Pro 62.1;NL2Repo 48.9;DeepSWE 46.2;ProgramBench 63.7;Terminal-Bench 2.1 81.0(best harness 82.7);FrontierSWE 74.4;SWE-Marathon 13.0。
- Agentic:MCP-Atlas 76.8;Tool-Decathlon 48.2。
- 评测多在 400K–1M 上下文、max effort 下进行;judge 用 GPT-5.5(medium)/Gemini-3.0-Pro。
AI infra / 部署
- SGLang(0.5.13+) / vLLM(0.23+) / Transformers(
glm_moe_dsa) / KTransformers / Unsloth;Ascend NPU(vLLM-Ascend / xLLM / SGLang)。 - 许可 MIT,无地域限制。
原始链接
- url: https://huggingface.co/zai-org/GLM-5.2 · blog: https://z.ai/blog/glm-5.2
- GLM-5 技术报告: https://arxiv.org/abs/2602.15763 · IndexShare: https://arxiv.org/abs/2603.12201
- 支撑论文: SAO https://arxiv.org/abs/2607.07508 · CompactionRL https://arxiv.org/abs/2607.05378
一手源存档(sources/)
- glm-5.2-readme.md
- glm-5.2-config.json
- glm-5.2-blog.md (官方博客,后训练差异来源)
- arxiv-2603.12201-glm-indexshare.pdf (arXiv 原文 PDF,不入 git)
- arxiv-2607.07508-sao.pdf (SAO 原文 PDF)
- arxiv-2607.05378-compactionrl.pdf (CompactionRL 原文 PDF)