具身智能技术演进调研 · 主汇总(2017 → 2026-H1)

覆盖具身智能(Embodied AI)机器人学习全栈:视觉-语言-动作(VLA)通用策略 · 操作策略学习 · 人形全身控制 · 足式运动与导航 · 数据与遥操 · 仿真与训练 infra · 评测 benchmark。 只收一手官方来源:arXiv 原文、官方技术报告 / system card、官方博客 / 产品发布、官方 GitHub / HuggingFace / ModelScope model card。不含第三方解读。 每个工作页按六维梳理:模型架构 · 数据 · 训练方法 · Infra · 评测 benchmark + 创新影响;landmark 代表作的数字经对抗式 verify 逐条对照一手源核查。


一、语料统计

  • 去重后一手来源294 个结构化工作页(按原始 URL / arXiv 去重)
  • 代表作精读(landmark):93 篇(opus 精读 + 独立对抗式 verify 二次核对数字);长尾 201 篇(sonnet 精读 + 自核查)
  • 横向综述:6 篇 sections/ + 5 篇 deep-dive/ 家族深挖
  • 一手源存档:官方博客 / model card / README 的 .md 快照随库(sources/embodied/<年>/,>600 份);arXiv PDF 只留 URL

按年(页数):2017→2 · 2018→2 · 2019→5 · 2020→4 · 2021→13 · 2022→17 · 2023→48 · 2024→98 · 2025→93 · 2026(H1)→12 —— 近三年(2023-2026)占约 85%,VLA 与人形两块 2024-2025 呈爆发。

按国别(去重):美国 ~183 · 中国 ~85 · 欧洲/UK ~17 · 其它少量 —— 美国在 VLA/仿真/数据基座领先,中国在 VLA 产品化(智元/银河/星海/自变量)与人形密集。

按类别(单标主类):VLA 59 · 操作 manipulation 55 · 数据 data 43 · 人形 humanoid 38 · 运动导航 locomotion-nav 33 · 仿真 infra sim-infra 31 · 评测 benchmark 21 · 综述 survey 14。


二、怎么读这份调研

从”结论”到”原文”四层:

  1. 六大横向章节(核心,先读)sections/
    • 架构演进 — RT-1 token → RT-2/PaLM-E 挂 VLM → OpenVLA/Octo/π0(动作头:离散 token / 连续回归 / 扩散 / 流匹配 / action-chunking)→ GR00T/Gemini-Robotics;扩散策略与人形控制器
    • 数据 — Open-X/RT-X · DROID · BridgeData · AgiBot/RoboMIND · 遥操硬件(ALOHA/UMI/DexCap)· 人类视频预训练 · 仿真数据 · 数据 scaling law
    • 训练方法 — 模仿(BC/ACT/扩散)vs RL(运动/人形)vs VLA 预训练+后训练;动作 tokenize(FAST 等)· web/人类协同训练 · 流匹配动作专家 · sim-to-real
    • Infra — 仿真平台(Isaac Gym/Lab/Sim · MuJoCo/MJX · Genesis · ManiSkill · Habitat · Newton)+ GPU 并行 RL;端上实时推理(控制 Hz · 延迟 · 边端硬件)
    • 评测 benchmark — CALVIN/RLBench/LIBERO/Meta-World/SimplerEnv/ManiSkill/VLABench/RoboArena/BEHAVIOR + 真机成功率与泛化协议
    • 范式对比 — 通用 VLA vs 专用扩散/3D 操作策略 vs 人形全身控制 vs 足式运动/导航:数据、目标与向基础策略收敛
  2. 家族深挖deep-dive/
    • VLA 谱系(RT-1→RT-2→OpenVLA→Octo→π0→GR00T→Gemini Robotics)
    • 操作策略族(Diffusion Policy · ACT/ALOHA · DP3/RVT/3D-Diffuser-Actor · 流/一致性策略 · VQ-BeT/BAKU)
    • 人形全身控制族(H2O · HumanPlus · OmniH2O · HOVER · ASAP · PHC · 人到人形重定向)
    • 足式运动与导航族(RMA · Walk-These-Ways · Parkour · GNM/ViNT/NoMaD · Mobility-VLA/NaVILA)
    • 仿真与数据生态(Isaac · MuJoCo/MJX · Genesis · ManiSkill · Open-X · DROID · 遥操)
  3. 全量来源索引(按年月,可点开每条)01-INDEX
  4. 单工作结构化页2017/2026/一手源快照sources/embodied/<年>/

三、主线速览(2017 → 2026)

2017-2020 — 表征、仿真与模仿地基roboturk/robonet/bridge-data-original 攒数据;domain-randomization/sim-to-real-agile-locomotion-quadruped 打通 sim-to-real;isaac-gym 开 GPU 大规模并行 RL;r3m/mvp-masked-visual-pretraining 用人类视频学视觉表征。

2021-2022 — 并行 RL 起飞 + 语言进机器人分钟级学走路/RMA 让足式落地;RT-1 用 Transformer 端到端多任务操作;SayCan/code-as-policies/inner-monologue 把 LLM 接入规划;BeT/IBCcalvin/meta-world/rlbench 立 benchmark。

2023 — VLA 与扩散策略双爆发RT-2 把 VLM 变成机器人策略、Open-X-Embodiment 汇聚跨本体数据;Diffusion Policy/ALOHA 重塑模仿学习;PerAct/rvt 走 3D 操作;极限跑酷GNM/ViNT/NoMaD 导航基础模型;RoboCat 自举。

2024 — 通用策略与人形元年:开源 OpenVLA/Octo、Physical Intelligence π0、字节 GR-2、清华 RDT-1B;3D 扩散策略 DP3/RVT-2/3d-diffuser-actor;人形全身控制井喷 H2O/OmniH2O/HumanPlus/HOVER;数据/遥操 DROID/UMI/Mobile ALOHA;仿真 Genesis/ManiSkill3

2025 — 基础策略平台化 + 新兴实验室π0.5/π*0.6、NVIDIA GR00T N1/N1.5Gemini Robotics/1.5、Figure Helix、智元 GO-1、自变量 WALL-OSSOpenVLA-OFT/SpatialVLA/SmolVLA/UniVLA;人形 ASAP/HuGWBC/TWIST/GMT;仿真数据 RoboVerse/RoboTwin;Skild、Dyna、Galaxea、1X 等新实验室登场。

2026-H1 — 深化与本体多样化π0.7GR-3Galaxea G0.5InternVLA-M1/A1RoboBrain 2.5RynnVLAWALL-OSS 0.5WholeBodyVLA;人形 getup/tracking(humanoid-getup/TWIST2/ResMimic/PhysHSI);一批 VLA/人形/灵巧操作综述与 RoboArena/robo-reward-bench 评测。


四、四条贯穿性技术主线(详见各 section)

  1. 动作表征演进:离散动作 token(RT-1/RT-2)→ 连续回归 → 扩散/流匹配动作专家(π0 系) → action-chunking + 快慢双系统;这是 VLA 从”能动”到”高频精细操作”的主轴。
  2. 数据金字塔:网络图文/人类视频(语义)→ 跨本体机器人数据(Open-X/DROID/AgiBot)→ 遥操高质量演示(ALOHA/UMI)→ 仿真/世界模型合成(GR00T-Dreams/RoboVerse);协同训练与 data scaling law 决定泛化。
  3. 两条学习路线并进:操作以模仿学习为主(数据驱动、扩散策略),运动/人形以大规模并行 RL + sim-to-real为主(Isaac/MJX/Genesis);2025+ 二者在”基础策略 + 后训练”框架下融合,并与 世界模型互补。
  4. 从仿真成功率到真机与泛化:LIBERO/SimplerEnv/CALVIN 之外,真机成功率、未见物体/任务泛化、以及 RoboArena 式标准化真机评测成为可信度关键;可复现性仍是公开难题。

维护:01-INDEX.md 由各页 frontmatter 经 scripts/build_index_omni.py research/embodied 自动生成。与 世界模型调研互为姊妹(世界模型是具身策略的”想象/规划”底座)。