一句话定位
MLM/世界模型时代第一篇以「赛博空间 ↔ 物理世界对齐」为主线的具身智能综述:把具身 AI 拆成机器人本体、模拟器、以及四大研究目标(具身感知 / 具身交互 / 具身智能体 / sim-to-real 适配),并顺带提出统一大规模机器人数据集标准 ARIO(约 300 万 episode)。已发表于 IEEE/ASME Transactions on Mechatronics 2025,配套 GitHub 论文清单是社区常用的规范化引用源。
背景与定位
- 作者:Yang Liu、Weixing Chen、Yongjie Bai、Xiaodan Liang、Guanbin Li、Wen Gao、Liang Lin(通讯),中山大学 HCP Lab + 鹏城实验室 + 北大数字媒体所。arXiv v1 = 2024-07-09,最新 v8 = 2025-08-25;2025-05-27 被 IEEE/ASME T-Mech 接收。
- 自我定位:现有具身综述多数出版于 MLM 时代(约 2023 起)之前而过时;2023 后仅有两篇(分别聚焦 VLA 模型、面向智能制造的具身系统),都未系统涵盖 MLM + WM + 具身智能体。本文号称「第一篇从赛博-物理空间对齐视角、基于 MLM 与 WM 的具身 AI 综述」。
- 沿用 ABC 框架(原文明确「first proposed in [18]」——即那篇面向智能制造的具身综述首次提出,本文用作图 1 的具身智能体概念框架,非本文原创):具身智能体 = AI brain(具身世界模型,理解虚拟-物理环境)+ Body(执行动作、与人交互、用工具)+ Cross-modal sensors(主动感知多模态元素)。全文正文实际按「机器人 / 模拟器 + 四大任务」taxonomy 组织。
- 相关工作脉络:代表性具身模型 rt-1 / rt-2 / rt-h / palm-e;感知侧牵出 SLAM、3D 场景理解、vision-language-navigation;sim-to-real 侧牵出 i-jepa、open-x-embodiment、NVIDIA cosmos-predict(作为可借鉴的具身世界模型平台被点名)。属「具身智能 taxonomy + benchmark 汇编」范式,非提出新模型/新架构(ARIO 数据集除外)。同类可参照 embodied-benchmark-survey。
模型架构
本文是综述,「架构」指其对具身智能体的技术分类框架,而非单一网络:
- 智能体执行流程:抽象任务 →(高层)Embodied Task Planning 分解为子任务 →(低层)Embodied Action Planning 逐步执行。任务规划属「行动前思考」,在赛博空间完成;动作规划须与环境交互并把反馈回传规划器。
- 机器人本体分类(第 II 节):固定基座(Franka Panda / Kuka iiwa / Sawyer)、轮式(Kiva / Jackal)、履带式、四足(Unitree A1/Go1、Boston Dynamics Spot)、人形、仿生(鱼形 / 昆虫形 / 软体)六类。
- **具身智能体大脑(VI 节)**三条任务规划路线:① 利用 LLM 涌现能力(Inner Monologue / ReAd / Socratic Planner,无需训练);② 融合感知模型的视觉信息(SayPlan / ConceptGraphs 用 3D 场景图);③ 用 VLM(EmbodiedGPT 的 Embodied-Former、LEO 把 2D egocentric + 3D 场景编码成 visual token)。动作规划两条路线:API 调用式(分层规划,LLM 调策略模型 / 工具库,如 Reflexion、DEPS)与 VLA 端到端式(感知-决策-执行紧耦合,降通信延迟,如 RT 系列 / PaLM-E)。
- 具身世界模型(VII-A)三分法:
- Generation-based:自编码框架学输入→输出空间变换,用生成模型(World Models、Sora、Pandora、3D-VLA、DWM)内化物理/因果规律;
- Prediction-based:在 latent space 训练更通用的世界模型(I-JEPA / MC-JEPA / A-JEPA / Point-JEPA / IWM;下游 iVideoGPT / IRASim / STP / MuDreamer),抽象解耦知识、提升泛化;
- Knowledge-driven:把人工构造的常识/物理知识注入模型(real2sim2real、ElastoGen、One-2-3-45、PLoT;结合 LLM 的 Holodeck / LEGENT / GRUtopia 自动生成场景)。
数据
- 本文自建贡献 ARIO(All Robots In One):一套统一数据标准 + 一个统一大规模数据集。用统一格式记录不同形态机器人的控制与运动数据,带精确时间戳;解决现有数据集的痛点——无单一数据集同时含图像/3D 视觉/文本/触觉/听觉,多机器人数据缺统一格式、控制对象表征不兼容、数据量不足、缺 sim+real 混合。ARIO 数据集 ≈ 300 万 episode,来自 258 series、321,064 个任务。
- 综述覆盖的真实世界数据源:open-x-embodiment(22 台机器人、527 skills、160,266 tasks)、UMI(手持夹爪采双臂动态数据)、Mobile ALOHA(全身移动操作)、人-智能体协作采集。
- 仿真数据:CLIPORT / Transporter Networks 用 PyBullet 数据训练后迁真实;GAPartNet(part-level 标注大规模数据集)、SemGrasp 的 CapGrasp(语义抓取)。
- 综述编制的数据集对照表覆盖各任务:VLN 数据集(R2R、R4R、VLN-CE、TOUCHDOWN、REVERIE、SOON、DDN、ALFRED、OVMM、Behavior-1K〔1,000 条长序列日常任务〕、CVDN、DialFRED);EQA 数据集(EQA v1、MT-EQA、MP3D-EQA〔1,136 问 / 83 家庭环境〕、IQUAD V1、VideoNavQA、SQA3D、K-EQA、OpenEQA〔首个开放词表 EQA〕、HM-EQA〔500 问 / 267 场景〕、S-EQA、EXPRESS-Bench〔777 探索轨迹 / 2,044 样本,最大探索感知 EQA〕)。
训练方法
本文综述而非训练单一模型,其「训练方法」维度即对具身训练范式的归纳:
- 世界模型从零在物理世界数据上训练预测下一状态(区别于 VLA:VLA 在大规模数据预训练 + 真实数据微调)。
- VLA / 具身多模态基础模型:RT 系列、PaLM-E、Matcha 等在大数据上训练以对齐视觉-文本特征。
- Sim-to-Real 五范式(VII-B3):Real2Sim2Real(数字孪生里 RL 学策略再迁真实)、TRANSIC(实时人工干预 + 残差策略)、Domain Randomization(随机化仿真参数覆盖真实分布)、System Identification(精确复刻真实场景)、Lang4Sim2Real(用自然语言描述桥接域、学不变图像表征)。
- 任务/动作规划:符号规划(PDDL)、搜索(MCTS / A*)到 LLM 规划(CoT 分解、记忆库技能复用、code-as-reasoning);分层规划把高层任务规划与底层动作执行解耦。
- 抓取训练:CLIPORT(CLIP + Transporter Net 端到端模仿学习)、F3RM / GaussianGrasper(把 CLIP 2D 语义抬升到 3D 场景做语言引导抓取)。
Infra(训练 / 推理工程)
- 作为综述,未披露具体训练 GPU 数量 / GPU-hours / 并行策略 / 精度 / 推理 FPS / 控制频率 / 边缘硬件等工程数字(ARIO 数据集本身的采集/存储 infra 亦未在正文给出具体规格)。
- 综述系统整理了模拟器基础设施作为具身 AI 的工程底座:11 个通用模拟器(Genesis〔可微物理 + 生成能力〕、Isaac Sim〔PhysX、实时光追〕、Isaac Gym、Gazebo、PyBullet、Webots、MuJoCo、Unity ML-Agents、AirSim、MORSE、V-REP/CoppeliaSim),按 HFPS/HQGR/RRL/DLS/LSPC/ROS/MSS/CP 8 维特性对比;8 个真实场景模拟器(SAPIEN、VirtualHome、AI2-THOR、iGibson、TDW、Matterport3D、Habitat、InfiniteWorld)。并列自动化场景生成工具 RoboGen / HOLODECK / PhyScene / ProcTHOR。
评测 benchmark
本文不做统一实验横评,而是汇编各子任务的数据集与指标;正文中被引用的具体量化结论有限,代表性一条:
- RoboGPT(任务规划):任务规划准确率达 96%,但整体任务完成率仅 60%——瓶颈在底层动作规划器;作者以此论证「从赛博空间『想象如何完成』到物理世界『交互并完成』」的关键在动作规划。
- VLN / EQA / 抓取各领域给出方法谱系与数据集规模对照(见「数据」),但未在正文给出统一 leaderboard 数字。
- 明确指出评测困境:大规模数据集稀缺、各数据集指标不统一致难以横向比较;即便有 LLM 加持,模型表现仍显著落后人类水平。
创新点与影响
- 首篇以「赛博-物理空间对齐」为主线、基于 MLM + WM 的具身 AI 综述;沿用 [18] 提出的 ABC(AI brain / Body / Cross-modal sensors)作图 1 概念框架,并给出「机器人 / 模拟器 + 四大任务」的细粒度 taxonomy(论文三大自陈贡献 = 首篇对齐视角综述 + 该 taxonomy + ARIO 数据集,未含 ABC)。
- 提出并开源 ARIO 数据标准 + ≈300 万 episode 统一数据集,直指 Open X-Embodiment 等现有数据「模态不全、格式不统一、sim/real 不混」的缺口,是文中唯一的实体化贡献。
- 配套 GitHub 论文清单(HCPLab-SYSU/Embodied_AI_Paper_List)持续更新至 2025–2026,成为社区规范化引用与检索入口;2026-03 关联发布 PhyAgentOS。
- 作者自陈局限/未来方向:高质量机器人数据获取难、需跨机构协作;长时程任务执行(如「打扫厨房」需数千低层动作)现有高层规划器不足;具身智能体在隐私敏感空间的安全性(LLM 易受 word injection / 场景操纵 / 知识注入等后门攻击,可致危险行为),呼吁安全 prompting、状态管理与安全校验。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2407.06886
- arXiv PDF(v8, 2025-08):https://arxiv.org/pdf/2407.06886
- GitHub 论文清单 / 项目主页:https://github.com/HCPLab-SYSU/Embodied_AI_Paper_List
- 期刊版:IEEE/ASME Transactions on Mechatronics, 2025(2025-05-27 accepted)
一手源存档(sources/)
- aligning-cyber-physical-embodied-ai-survey—github-readme — GitHub 论文清单 README 快照(intro + 仓库 taxonomy + citation,fetched 2026-07-16)
- arXiv HTML 全文(v8)已通读,正文 PDF 不入 git,见上方 arXiv 链接。