具身智能技术演进调研 · 主汇总(2017 → 2026-H1)
覆盖具身智能(Embodied AI)机器人学习全栈:视觉-语言-动作(VLA)通用策略 · 操作策略学习 · 人形全身控制 · 足式运动与导航 · 数据与遥操 · 仿真与训练 infra · 评测 benchmark。 只收一手官方来源:arXiv 原文、官方技术报告 / system card、官方博客 / 产品发布、官方 GitHub / HuggingFace / ModelScope model card。不含第三方解读。 每个工作页按六维梳理:
模型架构 · 数据 · 训练方法 · Infra · 评测 benchmark+ 创新影响;landmark 代表作的数字经对抗式 verify 逐条对照一手源核查。
一、语料统计
- 去重后一手来源:294 个结构化工作页(按原始 URL / arXiv 去重)
- 代表作精读(landmark):93 篇(opus 精读 + 独立对抗式 verify 二次核对数字);长尾 201 篇(sonnet 精读 + 自核查)
- 横向综述:6 篇
sections/+ 5 篇deep-dive/家族深挖 - 一手源存档:官方博客 / model card / README 的
.md快照随库(sources/embodied/<年>/,>600 份);arXiv PDF 只留 URL
按年(页数):2017→2 · 2018→2 · 2019→5 · 2020→4 · 2021→13 · 2022→17 · 2023→48 · 2024→98 · 2025→93 · 2026(H1)→12 —— 近三年(2023-2026)占约 85%,VLA 与人形两块 2024-2025 呈爆发。
按国别(去重):美国 ~183 · 中国 ~85 · 欧洲/UK ~17 · 其它少量 —— 美国在 VLA/仿真/数据基座领先,中国在 VLA 产品化(智元/银河/星海/自变量)与人形密集。
按类别(单标主类):VLA 59 · 操作 manipulation 55 · 数据 data 43 · 人形 humanoid 38 · 运动导航 locomotion-nav 33 · 仿真 infra sim-infra 31 · 评测 benchmark 21 · 综述 survey 14。
二、怎么读这份调研
从”结论”到”原文”四层:
- 六大横向章节(核心,先读) —
sections/- 架构演进 — RT-1 token → RT-2/PaLM-E 挂 VLM → OpenVLA/Octo/π0(动作头:离散 token / 连续回归 / 扩散 / 流匹配 / action-chunking)→ GR00T/Gemini-Robotics;扩散策略与人形控制器
- 数据 — Open-X/RT-X · DROID · BridgeData · AgiBot/RoboMIND · 遥操硬件(ALOHA/UMI/DexCap)· 人类视频预训练 · 仿真数据 · 数据 scaling law
- 训练方法 — 模仿(BC/ACT/扩散)vs RL(运动/人形)vs VLA 预训练+后训练;动作 tokenize(FAST 等)· web/人类协同训练 · 流匹配动作专家 · sim-to-real
- Infra — 仿真平台(Isaac Gym/Lab/Sim · MuJoCo/MJX · Genesis · ManiSkill · Habitat · Newton)+ GPU 并行 RL;端上实时推理(控制 Hz · 延迟 · 边端硬件)
- 评测 benchmark — CALVIN/RLBench/LIBERO/Meta-World/SimplerEnv/ManiSkill/VLABench/RoboArena/BEHAVIOR + 真机成功率与泛化协议
- 范式对比 — 通用 VLA vs 专用扩散/3D 操作策略 vs 人形全身控制 vs 足式运动/导航:数据、目标与向基础策略收敛
- 家族深挖 —
deep-dive/- VLA 谱系(RT-1→RT-2→OpenVLA→Octo→π0→GR00T→Gemini Robotics)
- 操作策略族(Diffusion Policy · ACT/ALOHA · DP3/RVT/3D-Diffuser-Actor · 流/一致性策略 · VQ-BeT/BAKU)
- 人形全身控制族(H2O · HumanPlus · OmniH2O · HOVER · ASAP · PHC · 人到人形重定向)
- 足式运动与导航族(RMA · Walk-These-Ways · Parkour · GNM/ViNT/NoMaD · Mobility-VLA/NaVILA)
- 仿真与数据生态(Isaac · MuJoCo/MJX · Genesis · ManiSkill · Open-X · DROID · 遥操)
- 全量来源索引(按年月,可点开每条) — 01-INDEX
- 单工作结构化页 —
2017/…2026/;一手源快照 —sources/embodied/<年>/
三、主线速览(2017 → 2026)
2017-2020 — 表征、仿真与模仿地基:roboturk/robonet/bridge-data-original 攒数据;domain-randomization/sim-to-real-agile-locomotion-quadruped 打通 sim-to-real;isaac-gym 开 GPU 大规模并行 RL;r3m/mvp-masked-visual-pretraining 用人类视频学视觉表征。
2021-2022 — 并行 RL 起飞 + 语言进机器人:分钟级学走路/RMA 让足式落地;RT-1 用 Transformer 端到端多任务操作;SayCan/code-as-policies/inner-monologue 把 LLM 接入规划;BeT/IBC 与 calvin/meta-world/rlbench 立 benchmark。
2023 — VLA 与扩散策略双爆发:RT-2 把 VLM 变成机器人策略、Open-X-Embodiment 汇聚跨本体数据;Diffusion Policy/ALOHA 重塑模仿学习;PerAct/rvt 走 3D 操作;极限跑酷、GNM/ViNT/NoMaD 导航基础模型;RoboCat 自举。
2024 — 通用策略与人形元年:开源 OpenVLA/Octo、Physical Intelligence π0、字节 GR-2、清华 RDT-1B;3D 扩散策略 DP3/RVT-2/3d-diffuser-actor;人形全身控制井喷 H2O/OmniH2O/HumanPlus/HOVER;数据/遥操 DROID/UMI/Mobile ALOHA;仿真 Genesis/ManiSkill3。
2025 — 基础策略平台化 + 新兴实验室:π0.5/π*0.6、NVIDIA GR00T N1/N1.5、Gemini Robotics/1.5、Figure Helix、智元 GO-1、自变量 WALL-OSS、OpenVLA-OFT/SpatialVLA/SmolVLA/UniVLA;人形 ASAP/HuGWBC/TWIST/GMT;仿真数据 RoboVerse/RoboTwin;Skild、Dyna、Galaxea、1X 等新实验室登场。
2026-H1 — 深化与本体多样化:π0.7、GR-3、Galaxea G0.5、InternVLA-M1/A1、RoboBrain 2.5、RynnVLA、WALL-OSS 0.5、WholeBodyVLA;人形 getup/tracking(humanoid-getup/TWIST2/ResMimic/PhysHSI);一批 VLA/人形/灵巧操作综述与 RoboArena/robo-reward-bench 评测。
四、四条贯穿性技术主线(详见各 section)
- 动作表征演进:离散动作 token(RT-1/RT-2)→ 连续回归 → 扩散/流匹配动作专家(π0 系) → action-chunking + 快慢双系统;这是 VLA 从”能动”到”高频精细操作”的主轴。
- 数据金字塔:网络图文/人类视频(语义)→ 跨本体机器人数据(Open-X/DROID/AgiBot)→ 遥操高质量演示(ALOHA/UMI)→ 仿真/世界模型合成(GR00T-Dreams/RoboVerse);协同训练与 data scaling law 决定泛化。
- 两条学习路线并进:操作以模仿学习为主(数据驱动、扩散策略),运动/人形以大规模并行 RL + sim-to-real为主(Isaac/MJX/Genesis);2025+ 二者在”基础策略 + 后训练”框架下融合,并与 世界模型互补。
- 从仿真成功率到真机与泛化:LIBERO/SimplerEnv/CALVIN 之外,真机成功率、未见物体/任务泛化、以及 RoboArena 式标准化真机评测成为可信度关键;可复现性仍是公开难题。
维护:01-INDEX.md 由各页 frontmatter 经 scripts/build_index_omni.py research/embodied 自动生成。与 世界模型调研互为姊妹(世界模型是具身策略的”想象/规划”底座)。