具身智能 Infra(仿真平台 · GPU 并行 RL · 端上实时推理)

这一页横切整个 embodied scope,只谈”数据/算力从哪来、动作往哪去”的工程底座:训练经验靠什么仿真器生成、GPU 并行 RL 怎么把腿足训练从集群天级压到单卡分钟级、以及训好的策略最终以什么频率、什么延迟、跑在什么芯片上闭环控制真机。

一句话主线:具身 infra 的演化是两个”瓶颈迁移”叠加的结果——训练侧,仿真吞吐的瓶颈从”物理/渲染”迁到”网络前向”再迁到”策略更新”,逼出了 GPU 端到端并行仿真这条主干;部署侧,推理的瓶颈从”控制器算力”迁到”大模型延迟”,把整个领域劈成”能上板的小策略高频闭环”与”上不了板的大 VLA 走云端/离板/异步”两条工程路线。

和 LLM infra 最根本的不同:LLM 的训练数据来自互联网现成语料,而具身策略的经验绝大多数要靠仿真器现场生成——所以”仿真器吞吐”在这个领域相当于 LLM 的”数据管线 + 预训练算力”合体,是第一性的基础设施。下面按三条轴线拆解:仿真平台、GPU 并行 RL 训练、端上实时推理。


一、仿真平台:从 CPU 渲染并行到 GPU 端到端

1.1 第一代:CPU / 渲染驱动的导航与交互仿真器(2017–2021)

第一代具身仿真器的核心竞争力是渲染吞吐(导航/感知任务不需要复杂接触物理),并行方式是 CPU 多进程 + 单 GPU 渲染。habitat 是这一代的分水岭:在单张 Titan Xp 上多进程渲染 RGB 峰值 >11,000 FPS,比 AI2-THOR/CHALET(数十 FPS)、MINOS/Gibson(约百 FPS)、House3D(约 300 FPS)快 2–3 个数量级。作者由此点破一个关键判断——仿真快到这个程度,训练瓶颈就从”跑仿真”迁移到了”网络前向优化”(多数网络前向比渲染慢 10–100×),“用 Habitat-Sim 生成图像比从磁盘读图还快”。

但跨仿真器比吞吐”出人意料地困难”(ai2-thor 作者语):动作空间复杂度不可比(带臂的 ManipulaTHOR 远慢于纯导航的 LoCoBot)、单进程速度有欺骗性、场景重置开销(换场景比走一步动作贵几个数量级)都会稀释原始仿真速度的价值。所以下表的数字仅供同类型任务的数量级参考,非同硬件同资产的严格对照:

仿真器测试硬件吞吐任务类型
ai2-thorRTX 2080(渲染卡)导航训练 145–179 FPS交互导航
habitatTitan Xp ×1RGB 峰值 >11,000 FPS(5 进程)导航渲染
igibson-2GTX 1080Ti125 SPS(均,较 1.0 提升 25%)家务交互
sapienRTX 2070(笔记本)引擎 5000 Hz / OpenGL 渲染 700 Hz部件级交互
threedworld-tdwGTX 1080高质 256² 168 FPS / 纯物体数据 850 FPS多模态物理
maniskillRTX TITAN + i9state 53–113 FPS / 视觉 31–48 FPS操作
rlbenchCoppeliaSim+PyRep未披露具体 FPS(1–60 SPS 量级)操作基准

这批仿真器多以 C++ 后端 + Python API 实现,支持 headless(EGL/Xvfb)离屏渲染以便上集群(habitat 用 Magnum,sapien 用 OptiX,rlbench 用 X server 选卡)。物理引擎侧,meta-world/maniskill 用 MuJoCo,igibson-2/habitat-2 用 PyBullet/Bullet,sapien 用 PhysX 4.1。而 mujoco 本身作为最经典的引擎,用纯 C 手工调优、线程安全、无动态内存分配,单台桌面机含接触动力学近 40 万次求值/秒,人形跑步步态合成时间步 15ms 下约 5000× 实时——比仅达实时的 ODE 类引擎快约 3 个数量级(作者拆解为”计算快 1 量级 + 并行满载 1 量级 + 大步长稳定 1 量级”)。

1.2 GPU 端到端并行:消灭 PCIe 瓶颈(2021–)

第二代仿真器的范式革命是 isaac-gym物理仿真、观测/奖励计算、策略推理全部留在 GPU 上,消除 PCIe 数据搬运(PCIe 可比 GPU 计算慢 50 倍,见 learning-to-walk-in-minutes-massively-parallel-rl 的拆解)。单张 A100 内可并行 256→16384 个环境(同一 PhysX scene),Ant 有效 FPS 峰值 ~700K、Shadow Hand 峰值 150K。这条路线直接催生了后面第四节的”分钟级训练”革命。

同期 brax 走 JAX 路线(vmap + pmap + XLA JIT),把仿真扩到 8×8 TPUv3 上跑到数亿 steps/s,编译优化版 PPO 在 Ant 上约 10 秒跑出可用步态。mjx-mujoco-xla(DeepMind 用 JAX 重写 MuJoCo)则把这套并行能力接到 MuJoCo 生态:

仿真器 / 引擎硬件吞吐(steps/s 或 FPS)工程要点
isaac-gymA100 ×1Ant 峰值 ~700K,Shadow Hand 150K256–16384 env / PhysX GPU
brax8×8 TPUv3数亿 steps/sJAX vmap+pmap,JIT 编译可达分钟级
mjx-mujoco-xlaA100(b=8192)/ TPU v5(b=16384)950K / 2.7M接触数增多则退化比 CPU 更快
isaac-lab-orbitRTX 3090,2048 envRL 50–75K FPS,物理峰值 125K渲染短板:10 相机 640×480 仅 270 FPS
maniskill2RTX TITAN + 16 CPU~2000 FPSgRPC 异步渲染服务器,资源跨场景共享
maniskill3RTX 409030,000+ FPS(RGB+D+seg)比对手快 10–1000×,显存低 2–3×
madrona-engineRTX 4090HideSeek 1.9M,Cartpole 3.4BECS 批量架构 + PGO(+35%)
mujoco-playgroundA100 ×1Locomotion 2–4×10⁵ env steps/s全 JAX,8 周内部署到 6 个真实平台
genesis-physics-engineRTX 4090 ×1Franka >43M FPS(宣称 430,000× 实时)⚠️ 无配套 benchmark,社区质疑
isaac-simRTX 5080 ×1Warehouse ~155 FPS,物理 ~33 Hz光追渲染,无 RT Core 的 A100/H100 被排除
newton-physics-engineNVIDIA GPU(Warp/CUDA)未给单一数字,宣称 >70× 加速Linux Foundation 治理,Apache-2.0

几个横向观察:

  • 显存效率成了第二战场maniskill3 在 Cartpole 640×480、128 并行环境下仅用 4.4 GBisaac-lab-orbit14.1 GB 且超 128 环境即 OOM——对维持 10⁵–10⁶ replay buffer 的 off-policy 算法(SAC/TD-MPC2),显存效率比纯速度更关键。maniskill2 靠 gRPC 异步渲染 + 中央资源管理器(任一模型/纹理只在 GPU 加载一份跨场景共享),在 64 环境下用 5.8G 显存,而 habitat-2 同设置直接 OOM。
  • 加速器对分支代码不友好mjx-mujoco-xla 明确指出:随场景内接触数增多,MJX-JAX 吞吐下降比 CPU MuJoCo 更快,因为 GPU 对 broad-phase 碰撞检测里的分支代码不友好;对单个 mjData 实例,MJX-JAX 甚至比优化过的 CPU MuJoCo 慢 10×——只有批量到成千上万并行场景才有优势。
  • JIT 编译时间是隐藏成本brax 自陈复杂环境 JIT 可达数分钟、有时接近训练时间;mujoco-playground JIT 1–3 min;difftaichi 反过来是卖点——smoke 例子 JIT 仅 2 秒,而 JAX 需 2 分钟。
  • Genesis 的宣称需要打标genesis-physics-engine 官方称比 Isaac Gym/MJX 等快 10–80× “不牺牲精度”,但发布时无 apples-to-apples benchmark、无公开测试方法学,被社区(含 NVIDIA 研究者)质疑——研究库须明确标注这是官方宣称值。相对可信的是姊妹综述 embodied-intelligence-simulators-world-models-survey 引用的 2.70–11.79×(512–32,768 环境规模,对 Isaac Gym)。

1.3 房间 / 城市级场景仿真与数据生成

当任务从桌面操作扩到整屋移动操作乃至城市导航,仿真器要同时扛住大场景 + 多智能体 + 关节/流体,吞吐必然掉下来,这条线的工程重点转向**“用渲染真实度换速度”的可配置权衡**:

平台测试硬件吞吐场景 / 特色
habitat-28×2080Ti26,000 SPS(8 GPU)/ 8,200(单 GPU)家庭重排,850× 实时
habitat-3V100 ×1单环境 140–250 SPS,16 环境 1,100–2,290人机共居(SMPL-X 人形 + 机器人)
procthor8×RTX 8000导航 3,208–8,599 FPS程序生成 10K 房屋(4×A5000 1 小时生成完)
behavior-1kRTX 3080 ×1全特性大场景 11 SPS,关流体/布料 26 SPS1000 日常任务,60fps 光追换真实度
robocasaRTX A5000 + EPYC带渲染 25.2 FPS(≈实时)厨房,MimicGen 数据生成
metaurbanV100 ×1RGB 50 FPS / Depth 60 / LiDAR 120 FPS城市微出行
grutopiaIsaac Sim 4.5未披露 FPS城市级,NPC LLM 驱动

数据生成基础设施是这条线的另一半故事——既然仿真便宜,就用它规模化造数据。这里的算力开销往往比训练模型本身还大:

  • graspvla160 张 RTX 4090 连续跑 10 天(约 3.84 万 GPU-h)生成 10 亿规模的 SynGrasp-1B 抓取数据。
  • dreamgen-groot-dreams1,500 张 L40 跑 54 小时生成 24 万条神经轨迹(作者明确列为当前主要成本瓶颈)。
  • groot-n1 的神经轨迹生成用 3,600 张 L40 约 1.5 天(~105k L40 GPU-h),另有 DexMimicGen 生成 78 万条仿真轨迹仅 11 小时。
  • genmanip 的后续套件披露过压力测试规模:1,500 个并发 Isaac Sim 实例跑在 500×RTX 4090 上
  • 更轻量的路线是演示回放式增广mimicgen 每个 run 单张 V100,dexmimicgen(RoboSuite+MuJoCo)、robotwin/robotwin-2(SAPIEN/ManiSkill3 + cuRobo 跨本体规划)、roboverse(统一多仿真器)、genie-sim(Isaac Sim 5.x + cuRobo)都属这一类。

二、可微物理与 GPU 运动规划

有两类”非训练”的 GPU 基础设施值得单列,它们不是被训练的模型、也不是纯仿真器,而是把优化/规划本身搬上 GPU 并行

  • 可微物理difftaichi 用 Taichi DSL 做可微编程,diffmpm 基准上比手写 CUDA 短 4.2× 而速度几乎相同(0.92× vs 1.00×)、比 TensorFlow 快 188×。brax 是可微刚体引擎。warp(NVIDIA 的 Python GPU 框架,Apache-2.0)则是 newton-physics-engineanymal-parkour-agile-navigation 自研 raycasting CUDA 内核的底座。
  • GPU 运动规划curobo 把每次优化迭代录制为 CUDA Graph 重放(实测提速 10×),完整运动生成管线在桌面 4090 上 50ms 均值(比 Tesseract 快 60×),IK 在 batch=1000 时 37,134 次/秒(23× 快于 TracIK),碰撞查询比 PyBullet 快至多 16,000×,MPPI 控制频率可跑到 421Hz。它在 Jetson AGX Orin 边缘端 MAXN/15W 下也能 0.22s/0.48s 完成规划(15W 模式甚至比 Tesseract 跑在桌面 i7 上还快),是 robotwin-2/genie-sim/rekep 等数据生成与操作栈的通用运动规划底座。

三、GPU 并行 RL:腿足与人形的”分钟级训练”

这是具身 infra 最戏剧性的一段。isaac-gym 的端到端 GPU 并行让 RL 训练从”集群 + 数天”塌缩到”单张桌面 GPU + 分钟/小时”。标志性工作 learning-to-walk-in-minutes-massively-parallel-rl(Rudin 2022)在单张 RTX A6000 上把 ANYmal 平地行走训到 <4 分钟、崎岖地形 <20 分钟,相对前作(12h/82h/88h/120h)快数个数量级——核心卖点就是”不用集群”。它的工程优化很典型:时间步取 0.005s(4 子步/策略步,受 actuator 网络稳定性限制)、只保留必要碰撞体(脚/小腿/膝/基座)、把机器人在地形上铺开以减少 PhysX 检测的机器人间接触(训练早期挤一起 vs 后期分散,仿真时间差达 2 倍)。4096 机器人粗糙地形 headless 仅 6 GB 显存

这套 legged_gym + rsl_rl(ETH)代码栈随后成了几乎所有腿足/人形 RL 工作的事实标准。下表是这条线的”训练时长塌缩史”:

工作本体仿真器硬件训练时长
learning-quadrupedal-locomotion-challenging-terrainANYmalRaiSimi7-8700K + RTX 2080teacher 12h + student 4h
rma-rapid-motor-adaptationUnitree A1RaiSim单 GPUphase1 24h(1.2B 步)+ phase2 3h
learning-to-walk-in-minutes-massively-parallel-rlANYmalIsaac GymRTX A6000 ×1平地 <4min / 崎岖 <20min
isaac-gymANYmalIsaac GymRTX A6000 ×1rough-terrain sim2real 20min
dreamwaqUnitree A1Isaac GymRTX 3060Ti ×1~1h(≈现实 46 天数据量)
agile-but-safe-legged-locomotionUnitree Go1Isaac GymRTX 4090 ×1敏捷策略 20min 收敛(<5GB 显存)
extreme-parkour-legged-robotsUnitree A1Isaac GymRTX 3090 ×1全流程 <20h
dtc-deep-tracking-controlANYmalIsaac Gym4096 env可部署 1 天 / 完全收敛 2 周
hoverUnitree H1IsaacGym/LabRTX 4090teacher 23.3h + student 0.27h
gmtUnitree G1Isaac GymRTX 4090 ×1teacher 3 天 + student 1 天(68 亿样本)
hugwbcUnitree H1Isaac GymRTX 4090 ×1~16h(wall-clock)
homieUnitree G1Isaac GymRTX 4090 ×1~3h/策略
kungfubotUnitree G1Isaac GymRTX 4090 ×127h/动作(13 动作各训一个策略)
humanoid-getupUnitree G1Isaac GymRTX 4090 / L40S ×1Stage I 5B 步 + Stage II 20K 步

几个规律:

  • 绝大多数腿足/人形 RL 是单卡训练。上表几乎清一色单张消费级卡(3090/4090),4096 或 8192 并行环境,显存 <24GB。这是 Isaac Gym 端到端并行带来的直接民主化——phc-perpetual-humanoid-control 单张 A100 并行 1536 人形收集 100 亿样本,real-world-humanoid-locomotion-rl 4 张 A100 一天采 100 亿样本。
  • 视觉观测是并行的天敌。多个工作(neural-volumetric-memory-visual-locomotion 特权高程图 40,000 fps → 深度图 1,000 fps 掉 40 倍;humanoid-parkour-learning 单卡 24h 仅 4.1M transitions vs 4 卡 432M;visualmimic”把视觉接入 IsaacGym 会显著拖慢仿真”)都因此走 teacher-student 两段式:先用特权信息训 teacher,再蒸馏出视觉 student。
  • RL 采样吞吐反过来利好 on-policy 算法dppo-diffusion-policy-policy-optimization/reinflow 在 IsaacGym 单卡跑 1000 并行环境,reinflow 单迭代墙钟比 DPPO 快 3.1–8.8×(去噪步 4 vs 10 + 更简单的似然计算)。

mujoco-playground 这一代,作者观察到又一次瓶颈迁移:PPO 训练回路里物理+渲染+推理只占 Cartpole 9% / Franka 43% 的总时间,其余全耗在 CNN 策略更新上——瓶颈从”采数据”彻底转到了”处理数据”。这与 habitat 当年”瓶颈从仿真迁到网络前向”的判断一脉相承,说明仿真吞吐已经不再是主要约束。


四、基础模型训练算力

操作臂/人形 VLA 大模型这条线的 infra 画风完全不同——它更接近 LLM 预训练,动辄几十上千张 A100/H100。但一个刺眼的事实是:大量 VLA 论文根本不披露训练算力rt-1/rt-2/pi0/pi0-5/gr-1/bytedance-gr-2/bytedance-gr-3 均未给卡数卡时)。有明确披露的构成下表:

模型训练硬件GPU-hours并行 / 精度
openvla64×A10021,500 A100-h(14 天)FSDP + FlashAttention,bf16
lapa-latent-action-pretraining8×H100272 H100-h(34h)潜动作空间省 30–40×
univla32×A100~960 A100-h(30h)<1/20 OpenVLA
groot-n1≤1024×H100~50,000 H100-hOSMO 编排 + Ray + Quantum-2 IB
groot-n1-51000×H100未披露(batch 16384,250K 步)
molmoact256×H100(自建 Jupiter 集群)9,728 GPU-h(预训练 7B-D)FSDP + SDPA,AMP bf16
rdt-1b48×H100~1 月(1M 步)DeepSpeed ZeRO-2,buffer ≥400GB
spatialvla64×A100~10 天DeepSpeed ZeRO-1
villa-x128×A100(LAM)+ 64×A100(ACT)12,288 + 6,144 GPU-h
uniact64×A100~10 天DeepSpeed,BFloat16
psi-0-humanoid-loco-manipulation64×A100~10 天(230k 步)DeepSpeed 全量微调
crossformer-cross-embodied-learningTPU v5e-25647h(或 80h,原文自相矛盾)
octoTPU v4-128Base 14h / Small 8hJAX
smolvla4×GPU~30,000 GPU-h(全项目)bf16 + torch.compile
data-scaling-laws-imitation8×A800~600 A800-h(最大策略 75h)BFloat16 混合精度
robobrain8×A800/节点,最多 176 卡未披露DeepSpeed ZeRO-3
robobrain-2-5NVIDIA 512 卡 / 摩尔线程 1024 卡未披露自研 FlagScale,跨加速器收敛差 <0.62%

几个看点:

  • “省算力”成了显式卖点lapa-latent-action-pretraining(272 H100-h vs OpenVLA 21,500 A100-h,省 30–40× 还实机反超)、univla(<1/20 OpenVLA)、molmoact(自称比 GR00T N1 省 5.4×,但引言 9,216 与 Table 4 的 9,728 GPU-h 存在内部数字矛盾)、FAST(动作分词使预训练最多减 5×)都在比”每美元性能”。
  • 训练框架分三派:PyTorch FSDP/DeepSpeed(openvla/molmoact/rdt-1b/cogact),JAX/TPU(octo/crossformer-cross-embodied-learning/gemini-robotics 的 ML Pathways),以及自研分布式框架(robobrain-2/robobrain-2-5 的 FlagScale,含非均匀流水线并行 + 动态显存预分配 + 跨加速器训练)。
  • 国产加速器已进入千卡级训练robobrain-2-5摩尔线程 1024 卡集群上完成端到端训练、收敛差距 <0.62%,MT checkpoint 迁到 NVIDIA 评测性能一致——这是具身大模型摆脱单一硬件依赖的一个信号。

五、端上实时推理

这是整个 infra 故事最见工程功力的地方,也是具身智能区别于纯感知/语言的硬约束:动作必须以足够高的频率、足够低的延迟闭环施加,否则真机会失稳或撞坏。领域被这条约束劈成两半——能上板的小策略走高频闭环,上不了板的大 VLA 走云端/离板/异步。

5.1 控制频率分层:策略 Hz vs PD kHz

腿足/人形的普遍范式是多频率解耦:神经策略以 50Hz 出目标关节位置,底层 PD/力矩控制器以 200Hz–1kHz 跟踪,视觉/感知编码器以更低的 10Hz 异步更新。aloha-act 专门做了 6 人用户研究证明高频的必要性——把控制从 50Hz 降到 5Hz,精细任务整体慢约 62%(p<0.001)。下表是端上分层的典型配置:

工作策略 / 推理频率底层 PD / 力矩视觉更新边缘硬件
rma-rapid-motor-adaptationbase π 100Hz / adapt φ 10Hz固定 Kp=55/Kd=0.8无(盲)A1 板载
learning-quadrupedal-locomotion-challenging-terrain400Hz(跟踪)/ 50Hz(生成)高程图 20Hz板载 i7-5600U CPU(TF C++)
extreme-parkour-legged-robotsbase 50Hz深度 10Hz(强制 0.08s 延迟)Jetson NX
robot-parkour-learning50HzSDK 100Hz深度 10HzJetson NX
humanoid-parkour-learningGRU 50HzPD 1000Hz,proprio 500Hz视觉 10Hz12 核 i7 NUC(无 GPU
helpful-doggybot50Hzproprio 500Hz深度 10HzJetson Orin
exbody250Hz(延迟 18–30ms)500HzJetson Orin NX
omnih2o50Hz(e2e 20msPD 200HzZED 60Hz2×Jetson Orin NX 16GB
sonic50Hz(前向 1–2msPD 500Hz运动生成 10HzJetson Orin + TensorRT+CUDA Graph
beyondmimic<1ms/步(ONNX,机器人 CPU)状态估计 500Hz机器人 CPU
deep-whole-body-control50HzD435 10HzRaspberry Pi 4 + TX2
idp3-improved-3d-diffusion-policy15Hz(仅板载 CPUL515 LiDARGR1 板载 CPU
figure-helixS2 7–9Hz + S1 200Hz异步共享 latent双低功耗嵌入式 GPU
psi-0-humanoid-loco-manipulationControl Loop 30Hz下位机 60Hz异步client/server 分离

值得注意的是,很多腿足策略网络小到不需要 GPUhumanoid-parkour-learning 主策略跑在无 GPU 的 12 核 i7 NUC 上,beyondmimic 用 ONNX Runtime 在机器人 CPU 上每步 <1ms,deep-whole-body-control 在 Raspberry Pi 4 上 50Hz 联合推理,idp3-improved-3d-diffusion-policy 靠稀疏 3D 表征在 GR1 板载 CPU 上 15Hz——这是”野外可部署”的关键。真机延迟工程也很讲究:anymal-parkour-agile-navigation 发现直接订阅点云消息延迟高达 250ms(对高速攀爬不可接受),改为订阅深度图在节点内投影降到 25msextreme-parkour-legged-robots 强制恒定深度延迟 0.08s 消抖动。

5.2 VLA 推理延迟与”大模型上不了板”

大 VLA 的核心矛盾是综述反复点名的一句话:部分大模型的推理时间仍不足以可靠实时上机器人rt-2 55B 只能 1–3Hz,作者的方案是部署在多 TPU 云服务、机器人经网络查询robovqa 更极端——PaLM-E-562B 推理约 30s、SayCan/PaLM-540B 覆盖 3 万个判断要 150h+,只能离线评测。下表是 VLA 推理效率的横向对比:

模型参数硬件单次延迟控制频率部署形态
rt-255B / 5B云 TPU330–1000ms1–3 / 5 Hz云端查询
openvla7BRTX 4090~166ms(单动作;A6000 上 307ms)6 Hz本地 / REST API
openvla-oft7BA1000.073s(+PD&AC&L1)109.7 Hz并行解码 26× 加速
cogactBaseA6000181ms(出 16 动作)5.5 Hz单认知 token→DiT
pi03.3BRTX 4090板载 73ms / 离板 86ms20–50 Hz消费卡可跑
pi0-fast3BRTX 4090750ms(自回归 30–60 token)~1.3 Hz自回归短板
pi-star-0-6H10063ms(5 步去噪,3 相机)50 Hz
pi0-7Gemma3 4BH100最小 38ms(RTC)20–50 Hz世界模型另需 4×H100
diffusion-vla2B / 7BA6000 + vLLM82 / 42 HzvLLM 加速
groot-n12.2BL4063.9ms(16 动作块)S2 10Hz + S1 120Hz双系统异步
groot-n1-5单 H10047.88msJetson AGX Thor(FP8/FP4)
rdt-1b1.2BRTX 40906Hz chunk / 381Hz actionDPM-Solver++ 5 步
spatialvlaRTX 4090(8.5GB)~20 Hz单步 3 动作 token
gemini-robotics云 backbone云 + 机载 decoderquery <160ms,e2e ~250ms50 Hz蒸馏 backbone
figure-helixS2+S1双嵌入式 GPUS2 7-9Hz + S1 200Hz全板载低功耗
univlaRTX 40900.18s(对比 OpenVLA)10 Hz
internvla-a12B/3BRTX 4090(torch.compile)~0.1s~13 Hz视频分支部署时丢弃
wall-oss-0-5RTX 509021Hz@224 / 15Hz@448CUDA Graph + 融合 kernel

从这张表能读出四条明确的加速工程路线:

  1. 架构选型出连续动作、砍自回归openvla-oft 靠”并行解码 + 动作分块 + 连续 L1”把 OpenVLA 从 4.2Hz 拉到 109.7Hz(26×),cogact 用单认知 token 条件化 DiT 一次出 16 步动作(对比 OpenVLA 逐维自回归解码 7 个 token 慢 307ms),rynnvla-002 实测连续动作 chunk=10 达 48.20Hz、离散自回归只有 2.50–3.69Hz。pi0-fast 是反例——自回归 30–60 token + 完整 2B 主干拖到 750ms。
  2. 双系统异步解耦groot-n1/figure-helix/gemini-robotics/leverb/hume-vla/wholebodyvla 把慢的 VLM(System 2,~10Hz 出 latent/子目标)与快的动作头(System 1,120–200Hz 闭环)拆到不同频率甚至不同芯片。figure-helix 是首个完全跑在板载嵌入式 GPU 上的 VLA,S2/S1 拆到各自专用 GPU,S1 维持 200Hz 控制回路。
  3. 云端 backbone + 机载 decodergemini-robotics 主 backbone 跑云端(query <160ms)、action decoder 上机载,端到端 250ms、有效 50Hz——这是”大模型能力”与”实时性”的折中主流方案。rt-2/uni-navid-video-vla-navigation/trackvla-embodied-visual-tracking 都走远端服务器 + Wi-Fi 异步上传图像/下发动作。
  4. 量化 / 早退 / 动态推理deer-vla early-exit 单步 17.5ms vs 55ms(省 68%),tinyvla 比 OpenVLA 低 20× 延迟,groot-n1-5 在 Jetson AGX Thor 上 FP8+FP4 混合精度进一步压 DiT/LLM 延迟,robobrain-2 混合比特量化(视觉全精度 + 语言 INT8)降端到端延迟 ~30%。但 diffusion-vla/openvla 都观察到 VLA 对 4-bit/8-bit 量化异常敏感,需要专门设计的量化方法。

5.3 扩散 / 流策略的推理加速

扩散策略天生慢在迭代去噪,这条线的加速全靠压 NFE(Number of Function Evaluations)

方法去噪步 / NFE推理延迟硬件
diffusion-policyDDIM 10 步0.1sRTX 3080
3d-diffuser-actor600ms/6 位姿 = 10Hz2080Ti
dp3-3d-diffusion-policy12.7 FPS / Simple DP3 25.3 FPS
consistency-policyNFE=11ms(仿真)/ 21ms(真机)3070Ti 笔记本
manicmNFE=117.3ms(vs DP3* 177.6ms,~1/10)RTX 4090
streaming-diffusion-policy缓冲区分块0.07s(vs DP 0.13s)
one-step-flow-policy单步(warm-start)17.58ms(vs DP3 3225ms,183×A100
adaflow~1.2 NFE(方差自适应)少 10× 步数
mode-mixture-of-denoising-experts12.2ms(专家缓存省 >80% FLOPs)A6000

核心手段有三类:蒸馏consistency-policy 一致性蒸馏、manicm consistency model、one-step-flow-policy 自蒸馏 warm-start)把去噪压到 1 步;流匹配替代扩散pi0/adaflow 变方差自适应 NFE);稀疏 3D 表征dp3-3d-diffusion-policy/rise-3d-perception-imitation 用 60–80 稀疏 token 反而比 2D DP 快,颠覆”3D 策略必慢”的成见)。此外 diffusion-policy 发现滚动时域位置控制天然吸收延迟、可容忍 4 步延迟仍保持峰值——这让扩散策略在真机上更鲁棒。ATM 则揭示了另一层:轨迹级预测(1.56 TFLOPS/次、15ms)比像素级视频扩散(UniPi 39.29 TFLOPS、8.14s)便宜 8–25×,是唯一算得起闭环重规划的方案。

5.4 边缘硬件谱系

具身端上算力事实上收敛到几条产品线:

真机侧的通信中间件也自成一套:LCM(walk-these-ways/exbody2)、Cyclone DDS + ROS2(helpful-doggybot/humanoid-parkour-learning)、Redis 流(twist/twist2/dexcap)、ZeroMQ(wholebodyvla/gello)、UDP(deep-whole-body-control/extreme-parkour-legged-robots)——低延迟解耦”高层慢推理”与”低层快控制”是共同诉求。


空白与趋势

  • 仿真吞吐的瓶颈已经不在仿真本身。从 habitat(瓶颈迁到网络前向)到 mujoco-playground(瓶颈迁到策略更新,物理+渲染只占 9–43%),GPU 并行仿真已经把”造数据”这一环做到过剩。下一个战场是显存效率maniskill3 vs isaac-lab-orbit 的 2–3× 差距)和接触密集/软体的并行mjx-mujoco-xla 承认接触多则退化、maniskill2 把向量化软体列为未来工作)。
  • 跨仿真器 benchmark 缺乏公信力ai2-thor 直言跨仿真器比吞吐”出人意料地困难”,genesis-physics-engine 的 10–80× 宣称因无公开方法学被质疑,madrona-engine/mujoco-playground 的对照也各用各的任务/硬件。领域缺一套像 MLPerf 那样的标准化具身仿真基准。
  • “大模型上不了板”仍是最硬的墙。综述层面(foundation-models-in-robotics/efficient-vla-models-survey/vla-embodied-manipulation-survey/large-vlm-vla-manipulation-survey)反复指出:机器人本体算力远不及云端,Transformer/扩散推理成本与实时控制冲突。当前解法(双系统异步、云端 backbone、量化、蒸馏、NFE 压缩、线性复杂度 backbone 如 RoboMamba/Mamba)都在缓解而非根治,且量化对 VLA 异常敏感(diffusion-vla/openvla)。
  • 训练算力披露严重不透明。大量 VLA 一手论文(rt-1/rt-2/pi0 系/bytedance-gr-2/bytedance-gr-3)完全不给 GPU 卡数卡时,个别披露的还存在内部矛盾(molmoact 9,216 vs 9,728、crossformer-cross-embodied-learning 47h vs 80h、sonic 9k/21k/32k GPU-h 三个值、dexvla 2.78× vs 5×)——横向比较”每美元性能”缺乏可信数据。
  • 国产加速器与端侧芯片进场robobrain-2-5 在摩尔线程千卡集群完成训练(收敛差 <0.62%),groot-n1-5 面向 Jetson AGX Thor 的 FP8/FP4 部署,onex-neo-redwood 的 NEO Cortex——训练与推理的硬件多元化是 2025–2026 的明确趋势,但对应的软件栈成熟度(如非 NVIDIA GPU 的仿真加速)仍是空白。
  • 数据生成算力开始超过模型训练算力graspvla(160×4090×10 天)、dreamgen-groot-dreams(1500×L40×54h)、groot-n1(3600×L40)的合成数据管线,其算力量级已逼近甚至超过下游模型训练本身——“仿真造数据”这条 infra 主干的成本重心正在从”训模型”向”造数据”转移。