具身智能 Infra(仿真平台 · GPU 并行 RL · 端上实时推理)
这一页横切整个 embodied scope,只谈”数据/算力从哪来、动作往哪去”的工程底座:训练经验靠什么仿真器生成、GPU 并行 RL 怎么把腿足训练从集群天级压到单卡分钟级、以及训好的策略最终以什么频率、什么延迟、跑在什么芯片上闭环控制真机。
一句话主线:具身 infra 的演化是两个”瓶颈迁移”叠加的结果——训练侧,仿真吞吐的瓶颈从”物理/渲染”迁到”网络前向”再迁到”策略更新”,逼出了 GPU 端到端并行仿真这条主干;部署侧,推理的瓶颈从”控制器算力”迁到”大模型延迟”,把整个领域劈成”能上板的小策略高频闭环”与”上不了板的大 VLA 走云端/离板/异步”两条工程路线。
和 LLM infra 最根本的不同:LLM 的训练数据来自互联网现成语料,而具身策略的经验绝大多数要靠仿真器现场生成——所以”仿真器吞吐”在这个领域相当于 LLM 的”数据管线 + 预训练算力”合体,是第一性的基础设施。下面按三条轴线拆解:仿真平台、GPU 并行 RL 训练、端上实时推理。
一、仿真平台:从 CPU 渲染并行到 GPU 端到端
1.1 第一代:CPU / 渲染驱动的导航与交互仿真器(2017–2021)
第一代具身仿真器的核心竞争力是渲染吞吐(导航/感知任务不需要复杂接触物理),并行方式是 CPU 多进程 + 单 GPU 渲染。habitat 是这一代的分水岭:在单张 Titan Xp 上多进程渲染 RGB 峰值 >11,000 FPS,比 AI2-THOR/CHALET(数十 FPS)、MINOS/Gibson(约百 FPS)、House3D(约 300 FPS)快 2–3 个数量级。作者由此点破一个关键判断——仿真快到这个程度,训练瓶颈就从”跑仿真”迁移到了”网络前向优化”(多数网络前向比渲染慢 10–100×),“用 Habitat-Sim 生成图像比从磁盘读图还快”。
但跨仿真器比吞吐”出人意料地困难”(ai2-thor 作者语):动作空间复杂度不可比(带臂的 ManipulaTHOR 远慢于纯导航的 LoCoBot)、单进程速度有欺骗性、场景重置开销(换场景比走一步动作贵几个数量级)都会稀释原始仿真速度的价值。所以下表的数字仅供同类型任务的数量级参考,非同硬件同资产的严格对照:
| 仿真器 | 测试硬件 | 吞吐 | 任务类型 |
|---|---|---|---|
| ai2-thor | RTX 2080(渲染卡) | 导航训练 145–179 FPS | 交互导航 |
| habitat | Titan Xp ×1 | RGB 峰值 >11,000 FPS(5 进程) | 导航渲染 |
| igibson-2 | GTX 1080Ti | 125 SPS(均,较 1.0 提升 25%) | 家务交互 |
| sapien | RTX 2070(笔记本) | 引擎 5000 Hz / OpenGL 渲染 700 Hz | 部件级交互 |
| threedworld-tdw | GTX 1080 | 高质 256² 168 FPS / 纯物体数据 850 FPS | 多模态物理 |
| maniskill | RTX TITAN + i9 | state 53–113 FPS / 视觉 31–48 FPS | 操作 |
| rlbench | CoppeliaSim+PyRep | 未披露具体 FPS(1–60 SPS 量级) | 操作基准 |
这批仿真器多以 C++ 后端 + Python API 实现,支持 headless(EGL/Xvfb)离屏渲染以便上集群(habitat 用 Magnum,sapien 用 OptiX,rlbench 用 X server 选卡)。物理引擎侧,meta-world/maniskill 用 MuJoCo,igibson-2/habitat-2 用 PyBullet/Bullet,sapien 用 PhysX 4.1。而 mujoco 本身作为最经典的引擎,用纯 C 手工调优、线程安全、无动态内存分配,单台桌面机含接触动力学近 40 万次求值/秒,人形跑步步态合成时间步 15ms 下约 5000× 实时——比仅达实时的 ODE 类引擎快约 3 个数量级(作者拆解为”计算快 1 量级 + 并行满载 1 量级 + 大步长稳定 1 量级”)。
1.2 GPU 端到端并行:消灭 PCIe 瓶颈(2021–)
第二代仿真器的范式革命是 isaac-gym:物理仿真、观测/奖励计算、策略推理全部留在 GPU 上,消除 PCIe 数据搬运(PCIe 可比 GPU 计算慢 50 倍,见 learning-to-walk-in-minutes-massively-parallel-rl 的拆解)。单张 A100 内可并行 256→16384 个环境(同一 PhysX scene),Ant 有效 FPS 峰值 ~700K、Shadow Hand 峰值 150K。这条路线直接催生了后面第四节的”分钟级训练”革命。
同期 brax 走 JAX 路线(vmap + pmap + XLA JIT),把仿真扩到 8×8 TPUv3 上跑到数亿 steps/s,编译优化版 PPO 在 Ant 上约 10 秒跑出可用步态。mjx-mujoco-xla(DeepMind 用 JAX 重写 MuJoCo)则把这套并行能力接到 MuJoCo 生态:
| 仿真器 / 引擎 | 硬件 | 吞吐(steps/s 或 FPS) | 工程要点 |
|---|---|---|---|
| isaac-gym | A100 ×1 | Ant 峰值 ~700K,Shadow Hand 150K | 256–16384 env / PhysX GPU |
| brax | 8×8 TPUv3 | 数亿 steps/s | JAX vmap+pmap,JIT 编译可达分钟级 |
| mjx-mujoco-xla | A100(b=8192)/ TPU v5(b=16384) | 950K / 2.7M | 接触数增多则退化比 CPU 更快 |
| isaac-lab-orbit | RTX 3090,2048 env | RL 50–75K FPS,物理峰值 125K | 渲染短板:10 相机 640×480 仅 270 FPS |
| maniskill2 | RTX TITAN + 16 CPU | ~2000 FPS | gRPC 异步渲染服务器,资源跨场景共享 |
| maniskill3 | RTX 4090 | 30,000+ FPS(RGB+D+seg) | 比对手快 10–1000×,显存低 2–3× |
| madrona-engine | RTX 4090 | HideSeek 1.9M,Cartpole 3.4B | ECS 批量架构 + PGO(+35%) |
| mujoco-playground | A100 ×1 | Locomotion 2–4×10⁵ env steps/s | 全 JAX,8 周内部署到 6 个真实平台 |
| genesis-physics-engine | RTX 4090 ×1 | Franka >43M FPS(宣称 430,000× 实时) | ⚠️ 无配套 benchmark,社区质疑 |
| isaac-sim | RTX 5080 ×1 | Warehouse ~155 FPS,物理 ~33 Hz | 光追渲染,无 RT Core 的 A100/H100 被排除 |
| newton-physics-engine | NVIDIA GPU(Warp/CUDA) | 未给单一数字,宣称 >70× 加速 | Linux Foundation 治理,Apache-2.0 |
几个横向观察:
- 显存效率成了第二战场。maniskill3 在 Cartpole 640×480、128 并行环境下仅用 4.4 GB,isaac-lab-orbit 需 14.1 GB 且超 128 环境即 OOM——对维持 10⁵–10⁶ replay buffer 的 off-policy 算法(SAC/TD-MPC2),显存效率比纯速度更关键。maniskill2 靠 gRPC 异步渲染 + 中央资源管理器(任一模型/纹理只在 GPU 加载一份跨场景共享),在 64 环境下用 5.8G 显存,而 habitat-2 同设置直接 OOM。
- 加速器对分支代码不友好。mjx-mujoco-xla 明确指出:随场景内接触数增多,MJX-JAX 吞吐下降比 CPU MuJoCo 更快,因为 GPU 对 broad-phase 碰撞检测里的分支代码不友好;对单个
mjData实例,MJX-JAX 甚至比优化过的 CPU MuJoCo 慢 10×——只有批量到成千上万并行场景才有优势。 - JIT 编译时间是隐藏成本。brax 自陈复杂环境 JIT 可达数分钟、有时接近训练时间;mujoco-playground JIT 1–3 min;difftaichi 反过来是卖点——smoke 例子 JIT 仅 2 秒,而 JAX 需 2 分钟。
- Genesis 的宣称需要打标。genesis-physics-engine 官方称比 Isaac Gym/MJX 等快 10–80× “不牺牲精度”,但发布时无 apples-to-apples benchmark、无公开测试方法学,被社区(含 NVIDIA 研究者)质疑——研究库须明确标注这是官方宣称值。相对可信的是姊妹综述 embodied-intelligence-simulators-world-models-survey 引用的 2.70–11.79×(512–32,768 环境规模,对 Isaac Gym)。
1.3 房间 / 城市级场景仿真与数据生成
当任务从桌面操作扩到整屋移动操作乃至城市导航,仿真器要同时扛住大场景 + 多智能体 + 关节/流体,吞吐必然掉下来,这条线的工程重点转向**“用渲染真实度换速度”的可配置权衡**:
| 平台 | 测试硬件 | 吞吐 | 场景 / 特色 |
|---|---|---|---|
| habitat-2 | 8×2080Ti | 26,000 SPS(8 GPU)/ 8,200(单 GPU) | 家庭重排,850× 实时 |
| habitat-3 | V100 ×1 | 单环境 140–250 SPS,16 环境 1,100–2,290 | 人机共居(SMPL-X 人形 + 机器人) |
| procthor | 8×RTX 8000 | 导航 3,208–8,599 FPS | 程序生成 10K 房屋(4×A5000 1 小时生成完) |
| behavior-1k | RTX 3080 ×1 | 全特性大场景 11 SPS,关流体/布料 26 SPS | 1000 日常任务,60fps 光追换真实度 |
| robocasa | RTX A5000 + EPYC | 带渲染 25.2 FPS(≈实时) | 厨房,MimicGen 数据生成 |
| metaurban | V100 ×1 | RGB 50 FPS / Depth 60 / LiDAR 120 FPS | 城市微出行 |
| grutopia | Isaac Sim 4.5 | 未披露 FPS | 城市级,NPC LLM 驱动 |
数据生成基础设施是这条线的另一半故事——既然仿真便宜,就用它规模化造数据。这里的算力开销往往比训练模型本身还大:
- graspvla 用 160 张 RTX 4090 连续跑 10 天(约 3.84 万 GPU-h)生成 10 亿规模的 SynGrasp-1B 抓取数据。
- dreamgen-groot-dreams 用 1,500 张 L40 跑 54 小时生成 24 万条神经轨迹(作者明确列为当前主要成本瓶颈)。
- groot-n1 的神经轨迹生成用 3,600 张 L40 约 1.5 天(~105k L40 GPU-h),另有 DexMimicGen 生成 78 万条仿真轨迹仅 11 小时。
- genmanip 的后续套件披露过压力测试规模:1,500 个并发 Isaac Sim 实例跑在 500×RTX 4090 上。
- 更轻量的路线是演示回放式增广:mimicgen 每个 run 单张 V100,dexmimicgen(RoboSuite+MuJoCo)、robotwin/robotwin-2(SAPIEN/ManiSkill3 + cuRobo 跨本体规划)、roboverse(统一多仿真器)、genie-sim(Isaac Sim 5.x + cuRobo)都属这一类。
二、可微物理与 GPU 运动规划
有两类”非训练”的 GPU 基础设施值得单列,它们不是被训练的模型、也不是纯仿真器,而是把优化/规划本身搬上 GPU 并行:
- 可微物理:difftaichi 用 Taichi DSL 做可微编程,diffmpm 基准上比手写 CUDA 短 4.2× 而速度几乎相同(0.92× vs 1.00×)、比 TensorFlow 快 188×。brax 是可微刚体引擎。warp(NVIDIA 的 Python GPU 框架,Apache-2.0)则是 newton-physics-engine 和 anymal-parkour-agile-navigation 自研 raycasting CUDA 内核的底座。
- GPU 运动规划:curobo 把每次优化迭代录制为 CUDA Graph 重放(实测提速 10×),完整运动生成管线在桌面 4090 上 50ms 均值(比 Tesseract 快 60×),IK 在 batch=1000 时 37,134 次/秒(23× 快于 TracIK),碰撞查询比 PyBullet 快至多 16,000×,MPPI 控制频率可跑到 421Hz。它在 Jetson AGX Orin 边缘端 MAXN/15W 下也能 0.22s/0.48s 完成规划(15W 模式甚至比 Tesseract 跑在桌面 i7 上还快),是 robotwin-2/genie-sim/rekep 等数据生成与操作栈的通用运动规划底座。
三、GPU 并行 RL:腿足与人形的”分钟级训练”
这是具身 infra 最戏剧性的一段。isaac-gym 的端到端 GPU 并行让 RL 训练从”集群 + 数天”塌缩到”单张桌面 GPU + 分钟/小时”。标志性工作 learning-to-walk-in-minutes-massively-parallel-rl(Rudin 2022)在单张 RTX A6000 上把 ANYmal 平地行走训到 <4 分钟、崎岖地形 <20 分钟,相对前作(12h/82h/88h/120h)快数个数量级——核心卖点就是”不用集群”。它的工程优化很典型:时间步取 0.005s(4 子步/策略步,受 actuator 网络稳定性限制)、只保留必要碰撞体(脚/小腿/膝/基座)、把机器人在地形上铺开以减少 PhysX 检测的机器人间接触(训练早期挤一起 vs 后期分散,仿真时间差达 2 倍)。4096 机器人粗糙地形 headless 仅 6 GB 显存。
这套 legged_gym + rsl_rl(ETH)代码栈随后成了几乎所有腿足/人形 RL 工作的事实标准。下表是这条线的”训练时长塌缩史”:
| 工作 | 本体 | 仿真器 | 硬件 | 训练时长 |
|---|---|---|---|---|
| learning-quadrupedal-locomotion-challenging-terrain | ANYmal | RaiSim | i7-8700K + RTX 2080 | teacher 12h + student 4h |
| rma-rapid-motor-adaptation | Unitree A1 | RaiSim | 单 GPU | phase1 24h(1.2B 步)+ phase2 3h |
| learning-to-walk-in-minutes-massively-parallel-rl | ANYmal | Isaac Gym | RTX A6000 ×1 | 平地 <4min / 崎岖 <20min |
| isaac-gym | ANYmal | Isaac Gym | RTX A6000 ×1 | rough-terrain sim2real 20min |
| dreamwaq | Unitree A1 | Isaac Gym | RTX 3060Ti ×1 | ~1h(≈现实 46 天数据量) |
| agile-but-safe-legged-locomotion | Unitree Go1 | Isaac Gym | RTX 4090 ×1 | 敏捷策略 20min 收敛(<5GB 显存) |
| extreme-parkour-legged-robots | Unitree A1 | Isaac Gym | RTX 3090 ×1 | 全流程 <20h |
| dtc-deep-tracking-control | ANYmal | Isaac Gym | 4096 env | 可部署 1 天 / 完全收敛 2 周 |
| hover | Unitree H1 | IsaacGym/Lab | RTX 4090 | teacher 23.3h + student 0.27h |
| gmt | Unitree G1 | Isaac Gym | RTX 4090 ×1 | teacher 3 天 + student 1 天(68 亿样本) |
| hugwbc | Unitree H1 | Isaac Gym | RTX 4090 ×1 | ~16h(wall-clock) |
| homie | Unitree G1 | Isaac Gym | RTX 4090 ×1 | ~3h/策略 |
| kungfubot | Unitree G1 | Isaac Gym | RTX 4090 ×1 | 27h/动作(13 动作各训一个策略) |
| humanoid-getup | Unitree G1 | Isaac Gym | RTX 4090 / L40S ×1 | Stage I 5B 步 + Stage II 20K 步 |
几个规律:
- 绝大多数腿足/人形 RL 是单卡训练。上表几乎清一色单张消费级卡(3090/4090),4096 或 8192 并行环境,显存 <24GB。这是 Isaac Gym 端到端并行带来的直接民主化——phc-perpetual-humanoid-control 单张 A100 并行 1536 人形收集 100 亿样本,real-world-humanoid-locomotion-rl 4 张 A100 一天采 100 亿样本。
- 视觉观测是并行的天敌。多个工作(neural-volumetric-memory-visual-locomotion 特权高程图 40,000 fps → 深度图 1,000 fps 掉 40 倍;humanoid-parkour-learning 单卡 24h 仅 4.1M transitions vs 4 卡 432M;visualmimic”把视觉接入 IsaacGym 会显著拖慢仿真”)都因此走 teacher-student 两段式:先用特权信息训 teacher,再蒸馏出视觉 student。
- RL 采样吞吐反过来利好 on-policy 算法。dppo-diffusion-policy-policy-optimization/reinflow 在 IsaacGym 单卡跑 1000 并行环境,reinflow 单迭代墙钟比 DPPO 快 3.1–8.8×(去噪步 4 vs 10 + 更简单的似然计算)。
到 mujoco-playground 这一代,作者观察到又一次瓶颈迁移:PPO 训练回路里物理+渲染+推理只占 Cartpole 9% / Franka 43% 的总时间,其余全耗在 CNN 策略更新上——瓶颈从”采数据”彻底转到了”处理数据”。这与 habitat 当年”瓶颈从仿真迁到网络前向”的判断一脉相承,说明仿真吞吐已经不再是主要约束。
四、基础模型训练算力
操作臂/人形 VLA 大模型这条线的 infra 画风完全不同——它更接近 LLM 预训练,动辄几十上千张 A100/H100。但一个刺眼的事实是:大量 VLA 论文根本不披露训练算力(rt-1/rt-2/pi0/pi0-5/gr-1/bytedance-gr-2/bytedance-gr-3 均未给卡数卡时)。有明确披露的构成下表:
| 模型 | 训练硬件 | GPU-hours | 并行 / 精度 |
|---|---|---|---|
| openvla | 64×A100 | 21,500 A100-h(14 天) | FSDP + FlashAttention,bf16 |
| lapa-latent-action-pretraining | 8×H100 | 272 H100-h(34h) | 潜动作空间省 30–40× |
| univla | 32×A100 | ~960 A100-h(30h) | <1/20 OpenVLA |
| groot-n1 | ≤1024×H100 | ~50,000 H100-h | OSMO 编排 + Ray + Quantum-2 IB |
| groot-n1-5 | 1000×H100 | 未披露(batch 16384,250K 步) | — |
| molmoact | 256×H100(自建 Jupiter 集群) | 9,728 GPU-h(预训练 7B-D) | FSDP + SDPA,AMP bf16 |
| rdt-1b | 48×H100 | ~1 月(1M 步) | DeepSpeed ZeRO-2,buffer ≥400GB |
| spatialvla | 64×A100 | ~10 天 | DeepSpeed ZeRO-1 |
| villa-x | 128×A100(LAM)+ 64×A100(ACT) | 12,288 + 6,144 GPU-h | — |
| uniact | 64×A100 | ~10 天 | DeepSpeed,BFloat16 |
| psi-0-humanoid-loco-manipulation | 64×A100 | ~10 天(230k 步) | DeepSpeed 全量微调 |
| crossformer-cross-embodied-learning | TPU v5e-256 | 47h(或 80h,原文自相矛盾) | — |
| octo | TPU v4-128 | Base 14h / Small 8h | JAX |
| smolvla | 4×GPU | ~30,000 GPU-h(全项目) | bf16 + torch.compile |
| data-scaling-laws-imitation | 8×A800 | ~600 A800-h(最大策略 75h) | BFloat16 混合精度 |
| robobrain | 8×A800/节点,最多 176 卡 | 未披露 | DeepSpeed ZeRO-3 |
| robobrain-2-5 | NVIDIA 512 卡 / 摩尔线程 1024 卡 | 未披露 | 自研 FlagScale,跨加速器收敛差 <0.62% |
几个看点:
- “省算力”成了显式卖点。lapa-latent-action-pretraining(272 H100-h vs OpenVLA 21,500 A100-h,省 30–40× 还实机反超)、univla(<1/20 OpenVLA)、molmoact(自称比 GR00T N1 省 5.4×,但引言 9,216 与 Table 4 的 9,728 GPU-h 存在内部数字矛盾)、FAST(动作分词使预训练最多减 5×)都在比”每美元性能”。
- 训练框架分三派:PyTorch FSDP/DeepSpeed(openvla/molmoact/rdt-1b/cogact),JAX/TPU(octo/crossformer-cross-embodied-learning/gemini-robotics 的 ML Pathways),以及自研分布式框架(robobrain-2/robobrain-2-5 的 FlagScale,含非均匀流水线并行 + 动态显存预分配 + 跨加速器训练)。
- 国产加速器已进入千卡级训练。robobrain-2-5 在摩尔线程 1024 卡集群上完成端到端训练、收敛差距 <0.62%,MT checkpoint 迁到 NVIDIA 评测性能一致——这是具身大模型摆脱单一硬件依赖的一个信号。
五、端上实时推理
这是整个 infra 故事最见工程功力的地方,也是具身智能区别于纯感知/语言的硬约束:动作必须以足够高的频率、足够低的延迟闭环施加,否则真机会失稳或撞坏。领域被这条约束劈成两半——能上板的小策略走高频闭环,上不了板的大 VLA 走云端/离板/异步。
5.1 控制频率分层:策略 Hz vs PD kHz
腿足/人形的普遍范式是多频率解耦:神经策略以 50Hz 出目标关节位置,底层 PD/力矩控制器以 200Hz–1kHz 跟踪,视觉/感知编码器以更低的 10Hz 异步更新。aloha-act 专门做了 6 人用户研究证明高频的必要性——把控制从 50Hz 降到 5Hz,精细任务整体慢约 62%(p<0.001)。下表是端上分层的典型配置:
| 工作 | 策略 / 推理频率 | 底层 PD / 力矩 | 视觉更新 | 边缘硬件 |
|---|---|---|---|---|
| rma-rapid-motor-adaptation | base π 100Hz / adapt φ 10Hz | 固定 Kp=55/Kd=0.8 | 无(盲) | A1 板载 |
| learning-quadrupedal-locomotion-challenging-terrain | 400Hz(跟踪)/ 50Hz(生成) | — | 高程图 20Hz | 板载 i7-5600U CPU(TF C++) |
| extreme-parkour-legged-robots | base 50Hz | — | 深度 10Hz(强制 0.08s 延迟) | Jetson NX |
| robot-parkour-learning | 50Hz | SDK 100Hz | 深度 10Hz | Jetson NX |
| humanoid-parkour-learning | GRU 50Hz | PD 1000Hz,proprio 500Hz | 视觉 10Hz | 12 核 i7 NUC(无 GPU) |
| helpful-doggybot | 50Hz | proprio 500Hz | 深度 10Hz | Jetson Orin |
| exbody2 | 50Hz(延迟 18–30ms) | 500Hz | — | Jetson Orin NX |
| omnih2o | 50Hz(e2e 20ms) | PD 200Hz | ZED 60Hz | 2×Jetson Orin NX 16GB |
| sonic | 50Hz(前向 1–2ms) | PD 500Hz | 运动生成 10Hz | Jetson Orin + TensorRT+CUDA Graph |
| beyondmimic | <1ms/步(ONNX,机器人 CPU) | 状态估计 500Hz | — | 机器人 CPU |
| deep-whole-body-control | 50Hz | — | D435 10Hz | Raspberry Pi 4 + TX2 |
| idp3-improved-3d-diffusion-policy | 15Hz(仅板载 CPU) | — | L515 LiDAR | GR1 板载 CPU |
| figure-helix | S2 7–9Hz + S1 200Hz | — | 异步共享 latent | 双低功耗嵌入式 GPU |
| psi-0-humanoid-loco-manipulation | Control Loop 30Hz | 下位机 60Hz | 异步 | client/server 分离 |
值得注意的是,很多腿足策略网络小到不需要 GPU:humanoid-parkour-learning 主策略跑在无 GPU 的 12 核 i7 NUC 上,beyondmimic 用 ONNX Runtime 在机器人 CPU 上每步 <1ms,deep-whole-body-control 在 Raspberry Pi 4 上 50Hz 联合推理,idp3-improved-3d-diffusion-policy 靠稀疏 3D 表征在 GR1 板载 CPU 上 15Hz——这是”野外可部署”的关键。真机延迟工程也很讲究:anymal-parkour-agile-navigation 发现直接订阅点云消息延迟高达 250ms(对高速攀爬不可接受),改为订阅深度图在节点内投影降到 25ms;extreme-parkour-legged-robots 强制恒定深度延迟 0.08s 消抖动。
5.2 VLA 推理延迟与”大模型上不了板”
大 VLA 的核心矛盾是综述反复点名的一句话:部分大模型的推理时间仍不足以可靠实时上机器人。rt-2 55B 只能 1–3Hz,作者的方案是部署在多 TPU 云服务、机器人经网络查询;robovqa 更极端——PaLM-E-562B 推理约 30s、SayCan/PaLM-540B 覆盖 3 万个判断要 150h+,只能离线评测。下表是 VLA 推理效率的横向对比:
| 模型 | 参数 | 硬件 | 单次延迟 | 控制频率 | 部署形态 |
|---|---|---|---|---|---|
| rt-2 | 55B / 5B | 云 TPU | 330–1000ms | 1–3 / 5 Hz | 云端查询 |
| openvla | 7B | RTX 4090 | ~166ms(单动作;A6000 上 307ms) | 6 Hz | 本地 / REST API |
| openvla-oft | 7B | A100 | 0.073s(+PD&AC&L1) | 109.7 Hz | 并行解码 26× 加速 |
| cogact | Base | A6000 | 181ms(出 16 动作) | 5.5 Hz | 单认知 token→DiT |
| pi0 | 3.3B | RTX 4090 | 板载 73ms / 离板 86ms | 20–50 Hz | 消费卡可跑 |
| pi0-fast | 3B | RTX 4090 | 750ms(自回归 30–60 token) | ~1.3 Hz | 自回归短板 |
| pi-star-0-6 | — | H100 | 63ms(5 步去噪,3 相机) | 50 Hz | — |
| pi0-7 | Gemma3 4B | H100 | 最小 38ms(RTC) | 20–50 Hz | 世界模型另需 4×H100 |
| diffusion-vla | 2B / 7B | A6000 + vLLM | — | 82 / 42 Hz | vLLM 加速 |
| groot-n1 | 2.2B | L40 | 63.9ms(16 动作块) | S2 10Hz + S1 120Hz | 双系统异步 |
| groot-n1-5 | — | 单 H100 | 47.88ms | — | Jetson AGX Thor(FP8/FP4) |
| rdt-1b | 1.2B | RTX 4090 | — | 6Hz chunk / 381Hz action | DPM-Solver++ 5 步 |
| spatialvla | — | RTX 4090(8.5GB) | — | ~20 Hz | 单步 3 动作 token |
| gemini-robotics | 云 backbone | 云 + 机载 decoder | query <160ms,e2e ~250ms | 50 Hz | 蒸馏 backbone |
| figure-helix | S2+S1 | 双嵌入式 GPU | — | S2 7-9Hz + S1 200Hz | 全板载低功耗 |
| univla | — | RTX 4090 | 0.18s(对比 OpenVLA) | 10 Hz | — |
| internvla-a1 | 2B/3B | RTX 4090(torch.compile) | ~0.1s | ~13 Hz | 视频分支部署时丢弃 |
| wall-oss-0-5 | — | RTX 5090 | — | 21Hz@224 / 15Hz@448 | CUDA Graph + 融合 kernel |
从这张表能读出四条明确的加速工程路线:
- 架构选型出连续动作、砍自回归。openvla-oft 靠”并行解码 + 动作分块 + 连续 L1”把 OpenVLA 从 4.2Hz 拉到 109.7Hz(26×),cogact 用单认知 token 条件化 DiT 一次出 16 步动作(对比 OpenVLA 逐维自回归解码 7 个 token 慢 307ms),rynnvla-002 实测连续动作 chunk=10 达 48.20Hz、离散自回归只有 2.50–3.69Hz。pi0-fast 是反例——自回归 30–60 token + 完整 2B 主干拖到 750ms。
- 双系统异步解耦。groot-n1/figure-helix/gemini-robotics/leverb/hume-vla/wholebodyvla 把慢的 VLM(System 2,~10Hz 出 latent/子目标)与快的动作头(System 1,120–200Hz 闭环)拆到不同频率甚至不同芯片。figure-helix 是首个完全跑在板载嵌入式 GPU 上的 VLA,S2/S1 拆到各自专用 GPU,S1 维持 200Hz 控制回路。
- 云端 backbone + 机载 decoder。gemini-robotics 主 backbone 跑云端(query <160ms)、action decoder 上机载,端到端 250ms、有效 50Hz——这是”大模型能力”与”实时性”的折中主流方案。rt-2/uni-navid-video-vla-navigation/trackvla-embodied-visual-tracking 都走远端服务器 + Wi-Fi 异步上传图像/下发动作。
- 量化 / 早退 / 动态推理。deer-vla early-exit 单步 17.5ms vs 55ms(省 68%),tinyvla 比 OpenVLA 低 20× 延迟,groot-n1-5 在 Jetson AGX Thor 上 FP8+FP4 混合精度进一步压 DiT/LLM 延迟,robobrain-2 混合比特量化(视觉全精度 + 语言 INT8)降端到端延迟 ~30%。但 diffusion-vla/openvla 都观察到 VLA 对 4-bit/8-bit 量化异常敏感,需要专门设计的量化方法。
5.3 扩散 / 流策略的推理加速
扩散策略天生慢在迭代去噪,这条线的加速全靠压 NFE(Number of Function Evaluations):
| 方法 | 去噪步 / NFE | 推理延迟 | 硬件 |
|---|---|---|---|
| diffusion-policy | DDIM 10 步 | 0.1s | RTX 3080 |
| 3d-diffuser-actor | — | 600ms/6 位姿 = 10Hz | 2080Ti |
| dp3-3d-diffusion-policy | — | 12.7 FPS / Simple DP3 25.3 FPS | — |
| consistency-policy | NFE=1 | 1ms(仿真)/ 21ms(真机) | 3070Ti 笔记本 |
| manicm | NFE=1 | 17.3ms(vs DP3* 177.6ms,~1/10) | RTX 4090 |
| streaming-diffusion-policy | 缓冲区分块 | 0.07s(vs DP 0.13s) | — |
| one-step-flow-policy | 单步(warm-start) | 17.58ms(vs DP3 3225ms,183×) | A100 |
| adaflow | ~1.2 NFE(方差自适应) | 少 10× 步数 | — |
| mode-mixture-of-denoising-experts | — | 12.2ms(专家缓存省 >80% FLOPs) | A6000 |
核心手段有三类:蒸馏(consistency-policy 一致性蒸馏、manicm consistency model、one-step-flow-policy 自蒸馏 warm-start)把去噪压到 1 步;流匹配替代扩散(pi0/adaflow 变方差自适应 NFE);稀疏 3D 表征(dp3-3d-diffusion-policy/rise-3d-perception-imitation 用 60–80 稀疏 token 反而比 2D DP 快,颠覆”3D 策略必慢”的成见)。此外 diffusion-policy 发现滚动时域位置控制天然吸收延迟、可容忍 4 步延迟仍保持峰值——这让扩散策略在真机上更鲁棒。ATM 则揭示了另一层:轨迹级预测(1.56 TFLOPS/次、15ms)比像素级视频扩散(UniPi 39.29 TFLOPS、8.14s)便宜 8–25×,是唯一算得起闭环重规划的方案。
5.4 边缘硬件谱系
具身端上算力事实上收敛到几条产品线:
- Jetson 家族是腿足/人形板载推理的绝对主力:Jetson TX2(sim-to-real-agile-locomotion-quadruped/walk-these-ways)→ Jetson NX(extreme-parkour-legged-robots/robot-parkour-learning)→ Jetson Orin / Orin NX(helpful-doggybot/exbody2/omnih2o/sonic/hub-extreme-balance/physhsi/amo/being-0 的 AGX)→ 最新 Jetson AGX Thor(groot-n1-5 部署目标、onex-neo-redwood 的 NEO Cortex 达 2070 FP4 TFLOPS)。
- 消费级 4090/5090 工作站是操作臂 VLA 的默认推理平台(pi0/openvla/spatialvla/univla/internvla-a1/aloha-unleashed/mobile-aloha 的 3070Ti);真机往往通过 server/client(WebSocket + msgpack/ZeroMQ)远程调用桌面 GPU(agibot-world-colosseo/galaxea-g0-5/roboarena/wholebodyvla/umi-on-legs)。
- 嵌入式低功耗 GPU / 数据流架构是商业化人形的方向:figure-helix 双嵌入式 GPU、onex-neo-redwood NEO 板载(842Wh 电池 4 小时续航),把”完全跑在板载低功耗 GPU 上”当作可商用的门槛。
真机侧的通信中间件也自成一套:LCM(walk-these-ways/exbody2)、Cyclone DDS + ROS2(helpful-doggybot/humanoid-parkour-learning)、Redis 流(twist/twist2/dexcap)、ZeroMQ(wholebodyvla/gello)、UDP(deep-whole-body-control/extreme-parkour-legged-robots)——低延迟解耦”高层慢推理”与”低层快控制”是共同诉求。
空白与趋势
- 仿真吞吐的瓶颈已经不在仿真本身。从 habitat(瓶颈迁到网络前向)到 mujoco-playground(瓶颈迁到策略更新,物理+渲染只占 9–43%),GPU 并行仿真已经把”造数据”这一环做到过剩。下一个战场是显存效率(maniskill3 vs isaac-lab-orbit 的 2–3× 差距)和接触密集/软体的并行(mjx-mujoco-xla 承认接触多则退化、maniskill2 把向量化软体列为未来工作)。
- 跨仿真器 benchmark 缺乏公信力。ai2-thor 直言跨仿真器比吞吐”出人意料地困难”,genesis-physics-engine 的 10–80× 宣称因无公开方法学被质疑,madrona-engine/mujoco-playground 的对照也各用各的任务/硬件。领域缺一套像 MLPerf 那样的标准化具身仿真基准。
- “大模型上不了板”仍是最硬的墙。综述层面(foundation-models-in-robotics/efficient-vla-models-survey/vla-embodied-manipulation-survey/large-vlm-vla-manipulation-survey)反复指出:机器人本体算力远不及云端,Transformer/扩散推理成本与实时控制冲突。当前解法(双系统异步、云端 backbone、量化、蒸馏、NFE 压缩、线性复杂度 backbone 如 RoboMamba/Mamba)都在缓解而非根治,且量化对 VLA 异常敏感(diffusion-vla/openvla)。
- 训练算力披露严重不透明。大量 VLA 一手论文(rt-1/rt-2/pi0 系/bytedance-gr-2/bytedance-gr-3)完全不给 GPU 卡数卡时,个别披露的还存在内部矛盾(molmoact 9,216 vs 9,728、crossformer-cross-embodied-learning 47h vs 80h、sonic 9k/21k/32k GPU-h 三个值、dexvla 2.78× vs 5×)——横向比较”每美元性能”缺乏可信数据。
- 国产加速器与端侧芯片进场。robobrain-2-5 在摩尔线程千卡集群完成训练(收敛差 <0.62%),groot-n1-5 面向 Jetson AGX Thor 的 FP8/FP4 部署,onex-neo-redwood 的 NEO Cortex——训练与推理的硬件多元化是 2025–2026 的明确趋势,但对应的软件栈成熟度(如非 NVIDIA GPU 的仿真加速)仍是空白。
- 数据生成算力开始超过模型训练算力。graspvla(160×4090×10 天)、dreamgen-groot-dreams(1500×L40×54h)、groot-n1(3600×L40)的合成数据管线,其算力量级已逼近甚至超过下游模型训练本身——“仿真造数据”这条 infra 主干的成本重心正在从”训模型”向”造数据”转移。