大模型技术演进调研 · 主汇总(GPT-3 2020-05 → 2026-06)

🌐 English: English

只收一手官方来源:arXiv 原文、官方技术报告/system card、官方博客、官方 GitHub/model card/HF 组织页。 不含任何第三方解读/翻译/二手总结/评测聚合。 五大分类:预训练数据 · 架构 · AI infra · 后训练 · agentic训练(每条至少命中其一,可多标)。


一、语料统计

  • 去重后来源532 条(解析自 667 篇结构化页,按原始 URL 去重)
  • 下载原文:约 760 份 / ~2.6 GB —— *.html/json 随库(sources/llm/<scope>/),*.pdf 走 HF private bucket jaczhao/ai-research-sources(存算分离,不入 git)
  • 开源模型深挖档案:14 份(deep-dive/,含「2026 调研后增量补录」段)
  • 分类汇总章节:6 篇(sections/,末尾附 2026 增量补录)

按年(去重):2018→1 · 2019→4 · 2020→36 · 2021→32 · 2022→58 · 2023→102 · 2024→136 · 2025→110 · 2026(H1)→53

按国别(去重):美国/西方 303 · 中国 196 · 欧洲 20 · 其它 ~13 —— 中美 top 公司全部覆盖

按分类(去重,可多标):架构 ~298 · 后训练 ~283 · AI infra ~180 · 预训练数据 ~178 · agentic训练 ~143


二、怎么读这份调研

按从”结论”到”原文”的粒度,四层:

  1. 五大分类汇总(核心,先读这个)sections/
  2. 开源模型深挖档案(要训练/数据/配比/RL/架构细节看这个)deep-dive/(见第四节)
  3. 全量来源索引(按年月,可点开每条)01-INDEX
  4. 单条结构化页2020/2026/themes/下载的原文sources/llm/<scope>/(html/json 随库,pdf 在 HF bucket)

三、五大分类脉络速览

1) 预训练数据 → 完整章节(173 条)

从 GPT-3 的 CommonCrawl 粗过滤(~300B token)→ 质量分类器与去重成为标配(The Pile、C4、RefinedWeb)→ 配方公开化(LLaMA 配比、Dolma/RedPajama 全开)→ 数据质量 > 数据量(Phi “教科书”、FineWeb-Edu edu 分类器、DCLM)→ 多阶段/退火与合成数据(MiniCPM WSD、Nemotron 合成、Llama 3 15T+退火)→ 万亿-十万亿 token、长上下文阶段、强 decontamination。

2) 架构 → 完整章节(291 条)

Decoder-only Transformer 定型 → 位置编码 RoPE/ALiBi/YaRN → 注意力省显存 MQA/GQA→MLA(DeepSeek-V2)→ MoE 主流化:GShard/Switch/GLaM → DeepSeekMoE 细粒度+共享专家 → 无辅助损失负载均衡 → 万亿稀疏(Kimi K2、Ling/Ring-1T、Pangu Ultra-MoE 718B)→ 线性/混合架构(Mamba、RWKV、RetNet、Jamba、Nemotron-H、MiniMax Lightning/Sparse、Kimi Linear、Falcon-H1)→ 原生多模态/omni 与 native sparse attention。

3) AI infra → 完整章节(175 条)

训练侧:Megatron-LM 张量并行 + DeepSpeed/ZeRO 显存分片 → 3D/序列并行、激活重算 → FP8 训练、MegaScale 万卡 → DeepSeek-V3 FP8+DualPipe 开源整套(开源周 FlashMLA/DeepEP/DeepGEMM/3FS)。推理侧:FlashAttention 1/2/3 → PagedAttention/vLLM → SGLang/RadixAttention → 量化(GPTQ/AWQ/SmoothQuant) → PD 分离/Mooncake/MegaScale-Infer。RL 训练系统:DeepSpeed-Chat→OpenRLHF→veRL/HybridFlow→DAPO/AReaL/ProRL。

4) 后训练 → 完整章节(276 条)

RLHF 奠基(Learning to summarize→InstructGPT)→ Constitutional AI/RLAIF → 离线偏好优化 DPO 及变体(IPO/KTO/ORPO/SimPO) → 可验证奖励 RLVR + GRPO(DeepSeekMath)→ 推理模型范式(o1 → DeepSeek-R1 纯 RL “顿悟”,Kimi k1.5)→ 过程奖励 PRM、长 CoT、on-policy 蒸馏、prolonged RL(ProRL)→ 全流程开放(Tülu 3、OLMo 2、MiMo、Nemotron Cascade)。

5) agentic 训练 → 完整章节(136 条)

prompt 时代(WebGPT/ReAct/Toolformer/Reflexion/Voyager/Generative Agents)→ tool-use 微调(ToolLLM/AgentTuning/CodeAct)→ 评测驱动(SWE-bench/WebArena/OSWorld/tau-bench)→ computer/browser use(Claude computer use、Operator/CUA、UI-TARS)→ 多轮 agent RL 爆发(2025)(Search-R1/ReTool/RAGEN/ToolRL/DeepResearcher/WebSailor)→ agentic 原生模型(Kimi K2、GLM-4.5 ARC、Qwen3-Coder、Tongyi DeepResearch、Seed2.0)。


四、开源模型训练配方深挖(deep-dive/

每份逐型号给出:架构精确 config · 预训练数据来源/token/配比 · 数据处理 pipeline(去重/质量过滤) · 训练(算力/并行/精度/阶段) · SFT · RL/对齐 · infra。横向对比见 open-model-recipes.md


五、年度时间线(里程碑精选,全条目见 01-INDEX

2020 — 缩放定律与 RLHF 萌芽

2021 — 规模化、MoE、指令微调起步

  • [Switch Transformer] · GLaM · [Gopher] · Megatron-Turing NLG 530B
  • FLAN / T0(指令微调)· [Codex] · [WebGPT] · Anthropic “A General Language Assistant”
  • 中国:ERNIE 3.0 · PanGu-α · Yuan 1.0 · Wudao 2.0 · RoPE · ALiBi · ZeRO-Infinity

2022 — Chinchilla、RLHF 产品化、CoT、开源潮

  • Chinchilla 计算最优 · PaLM · OPT · BLOOM · GLM-130B
  • InstructGPT(RLHF) · Chain-of-Thought · Self-Consistency · Emergent Abilities
  • FlashAttention · ReAct · Anthropic HH-RLHF + Constitutional AI · ChatGPT 发布

2023 — GPT-4、开源基座爆发、对齐与 agent 工具化

  • 美/西:[GPT-4] · LLaMA / Llama 2 · PaLM 2 · Claude 2 · Gemini · Mistral 7B · DPO · QLoRA · [vLLM/PagedAttention] · Mamba · Toolformer/Reflexion/Voyager · SWE-bench
  • 中国:Qwen · Baichuan 2 · InternLM · ChatGLM2/3 · Yi · DeepSeek LLM/Coder/MoE · Qwen-VL

2024 — 多模态旗舰、推理起步、MoE 工程化、数据全开

  • 美/西:Llama 3 Herd · [GPT-4o] · o1 推理 · Claude 3/3.5 · Gemini 1.5 · Gemma 2 · [OLMo+Dolma] · [FineWeb] · Tülu 3 · Nemotron-4 340B · SimPO/KTO/ORPO
  • 中国:[DeepSeek-V2(MLA)] · [DeepSeek-V3] · [DeepSeekMath GRPO] · Qwen2/2.5 · GLM-4 · MiniCPM · InternLM2 · Hunyuan-Large · Skywork-MoE

2025 — 推理模型规模化 + agentic RL 爆发 + 万亿开源 MoE

2026 H1 — 百万上下文、万亿 MoE 普及、原生 agentic/omni