一句话定位

X Square Robot 开源的 4B VLA:3B 的 Qwen2.5-VL 主干上挂一个 Action Expert,用”梯度桥接协同训练”(离散动作 token 交叉熵 + 多模态交叉熵 + 连续 flow matching 三目标联合)把预训练本身做成可以在真实机器人上直接零样本部署评测的策略,而不只是下游微调的初始化。

背景与定位

传统 VLA 论文几乎都只报告微调后的效果,预训练 checkpoint 本身能否直接执行从未被系统检验——本报告称此为”deployment-oriented VLA pretraining”,把预训练策略当作可直接测试、可直接部署的能力来源,而非单纯的初始化。方法上正面处理离散/连续动作表征之争:pi0 系列(pi0-5)把 flow matching 的 Action Expert 与主干解耦并用 stop-gradient 隔离梯度,代价是连续动作信号对主干的塑形作用很弱;RT-2/OpenVLA 走纯离散 token 路线,语义强但精度不足。Wall-OSS-0.5 是前代 wall-oss(WALL-OSS,2025-09,静态路由 MoE + unified cross-level CoT + FAST tokenizer)的迭代:保留 VLM 主干路线,但把”离散动作 token 交叉熵”重新定位为连接 VLM 语义先验与连续控制的”梯度桥”,同时用 Mixture-of-Transformers 路由取代此前的静态 MoE 路由,用可学习的 Vision-Aligned RVQ tokenizer 取代 FAST 规则化压缩。同一时期的世界模型路线(GR-2、DreamZero)通过视频生成学习世界动态再迁移到动作预测,属于并行的另一范式,本报告以 DreamZero 作为微调基线之一对照。

模型架构

  • 主干与路由:从 Qwen2.5-VL-3B-Instruct 初始化,扩展为 Mixture-of-Transformers(MoT),新增 Action Expert 与连续动作头的投影层,整体参数量超过 4B。视觉、语言、本体感觉(proprioception)、离散动作 token 四路 token 流经 VL Expert;带噪的连续动作 token 经 Action Expert(训练目标是 flow-matching 生成)。两个 Expert 共享同一 attention 上下文,注意力掩码使离散/连续动作 token 在前向中互不可见(可独立训练评估),但梯度并未在共享注意力路径上被阻断——这是”路由拆分”而非”梯度隔离”。
  • Vision-Aligned RVQ Action Tokenizer:用可学习的 Residual Vector Quantization 取代规则化的 FAST tokenizer。结构为 Encoder–RVQ–Decoder:编码器用时序 cross-attention 压缩以观测为条件的动作片段;RVQ 码本前几层捕获粗粒度运动结构、后几层捕获细粒度残差;解码器以观测状态为条件重建动作序列。除重建损失外还联合三个目标:视觉-动作对齐(把动作隐向量拉向 VLM 视觉特征)、下一帧预测(让 token 编码动作后果)、DCT 域重建(抑制高频抖动)。
  • 动作接口:VLM 对话式序列——[System] 具身提示 [User] Observation: {camera}⟨image tokens⟩… Instruction Proprioception: ⟨proprio tokens⟩ [Assistant] ⟨action_ar_token⟩⟨action_flow_token⟩×N;离散 token 只服务于训练期梯度桥,推理时不解码,Action Expert 通过多步 flow-matching 去噪生成连续动作块。本体感觉离散化为文本数字 token,训练中随机丢弃/扰动以降低对无噪状态的依赖。
  • 动作空间:26 维——每臂相对 3D 位置 + 相对 6D 旋转(相对当前末端位姿,6D 表示法避免 SO(3) 不连续/万向锁)+ 1D 夹爪(双臂共 20D),外加 3D 移动底盘速度、1D 升降高度、2D 头部动作。离散/连续两条通路都预测 1 秒动作时域,帧数按各数据源控制频率调整。
  • 优化器:Muon 应用于每个 Expert 的 2D 参数,AdamW 处理视觉嵌入与 LM head;自研 DMuon 分布式 Muon 运行时——按 Longest-Processing-Time-first 负载均衡把每个矩阵参数分配给唯一 owner rank,owner 上做矩阵级 Newton–Schulz 更新,reduce-to-owner 通信后异步 post-step 广播(专用 CUDA stream,与下一次前向重叠),并用对称感知 kernel + 形状感知自动调优加速 owner 本地计算;使 Muon 引入的额外优化器开销从朴素实现约 2× 前向+反向时间降到约 0.02×(约 100× 降低)。
  • 配置:预训练有效全局 batch size 8192,bf16 混合精度,梯度裁剪 1.0,cosine 学习率 + 线性 warmup,峰值学习率 1e-4;图像等比缩放、长边固定 448 像素;微调学习率 5e-5、全部模块可训练。

数据

  • 规模:单个 epoch 采样后含 100 万+ 条轨迹,覆盖 20+ 种具身形态,约 60% 自采集 + 40% 开源(任务平衡采样后)。多模态语料共约 9000 万样本 = 7800 万开源 + 1200 万从动作轨迹自动构造的”embodied bridge”样本。动作:多模态按 9:1 的 batch 采样比例混合。
  • 自采集数据:桌面双臂系统 + 移动操作平台,外加自研的无具身形态采集设备 XRZero-G0,覆盖非结构化真实场景(家庭/工业/办公)与受控采集室;任务按操作复杂度、轨迹时长、特殊属性(空间推理、可变形物体交互)三轴标注;每条轨迹标注”目标级简要指令”与”含中间子目标的详细指令”两种粒度,并用 LLM 扩写复述;长轨迹进一步切分为原子子目标的时序连贯子片段并各自标注指令;累计产生数千条基础指令与数万条复述变体。
  • 开源多具身数据:整理 10 个保留子集(含 Open X-Embodiment、DROID、RoboMIND v1/v2、AgiBot World、BridgeV2、RT-1 等),做格式对齐、元数据校验、跨源字段映射,并按时间戳连续性、动作-观测合理性、异常帧过滤。
  • 预处理管线:统一动作 schema(双臂末端位姿、关节位置、夹爪状态、移动底盘运动、升降/腰部动作、头部动作);仅提供关节状态的数据通过对应平台 URDF 做正向运动学恢复末端位姿;统一物理语义(x 前 y 左 z 上,零旋转=夹爪水平朝前张开,夹爪值越大开度越大);Euler 角仅在源端保留、训练前转换为 6D 表示;跨传感器按时间戳最近邻对齐视频与动作/状态帧;修正或剔除相机错映、末端位姿异常等录制错误;过滤观测近似静止但动作有噪声的”静止帧”以减少推理时的空转停顿;采用分组幂律采样(组内权重 w_i = n_i^p,p=0.5 即平方根采样)平衡组间(自采集 vs 开源相差数量级)与组内(任务长尾)不均衡,并设分组上限+迭代再分配防止大组独占预算。
  • 多模态语料:三类——通用视觉语言(CapsFusion、Cambrian、PixMo-Cap、COCO、VQAv2、PixMo-Point、OneThinker);具身感知(RoboPoint、SpaceThinker、OpenSpaces、SpaceOm、RefSpatial、CrossPoint、SenseNova-SI);具身认知(Robo2VLM、EO-Data、RoboVQA、Cosmos-Reason1)。Embodied bridge 数据分四层:物体理解(grounding/pointing/2D 轨迹/属性 VQA)、空间理解(物体间关系、多视角 pointing)、场景理解(场景描述/场景级 VQA)、任务理解(任务进度预测、可供性、下一步动作规划),坐标统一用文本格式 <box>[x1,y1,x2,y2]</box><point>[x,y]</point> 表达。

训练方法

  • 梯度桥接协同训练(gradient-bridged co-training):单阶段联合优化三个目标——离散动作 token 交叉熵(自回归预测 RVQ token,是主干与 Action Expert 之间的”梯度桥”,其梯度方向与 flow matching 正相关但强度远高于 flow matching)、多模态交叉熵(锚定指令跟随/视觉 grounding/场景理解,其更新方向与动作优化基本正交)、flow matching(训练部署时使用的连续动作生成器)。复合损失 L = L_flow + λ_act·L_act-CE + λ_mm·L_mm-CE,λ_act = λ_mm = 0.01(L_flow 在 Action-Space Supervision 下比交叉熵项小约两个数量级,该权重使二者量级可比)。与 π0.5 的 stop-gradient 设计不同,Wall-OSS-0.5 端到端保留梯度流。
  • Action-Space Supervision:flow matching 采用线性高斯概率路径 A_t^τ = τA_t + (1-τ)ε,时间步采样偏向高噪声区(u~Beta(1.5,1),τ=s(1-u),s=0.999,沿用 π0 做法)。不在速度场上直接监督,而是把损失定义在恢复出的动作上:Â = A^τ + (1-τ)·f_θ(A^τ,τ),L_A = E[‖Â-A‖²],等价于对速度场做 (1-τ)² 加权,从而突出高噪声步(决定轨迹低频全局形状的区域)。
  • 动作表征:相对位置/旋转(相对当前末端位姿)+ 6D 旋转表示,避免 Euler 角/四元数在 SO(3) 上的不连续与歧义。
  • 微调:沿用同样的离散+连续联合目标,学习率 5e-5,全部模块可训练;消融显示相对纯 flow-only 微调有较大相对增益(Fig 10b)。
  • 消融验证(Section 5,从 VLM 主干权重出发训练至收敛):
    • 协同训练策略消融(5 个真实机器人任务,70k steps):co-training 平均任务进度 57.0%,优于 flow-only 36.6%、stop-gradient 31.9%(对应 ki2024 的知识隔离策略)、stop-gradient-to-co-training 两阶段热启动 49.6%;去掉三种信号中任一种都会使真实机器人表现下降 7.4–25.1 个百分点;stop-gradient 在 VQA 上略微领先,但动作任务得分在四种策略中最低(Action Expert 欠拟合,flow loss 收敛更慢、终值更高)。
    • Action-Space Supervision 消融(LIBERO 仿真,batch size 128,其余超参一致):action-space loss 在 25k steps 达到峰值平均成功率 96.5%,比 velocity-space loss 峰值高 6.2 个百分点;20k steps 即达 95.8%,而 velocity-space loss 跑满 35k steps 仍未突破 90.3%;20k 步后 action-space loss 稳定在 92.5%–96.5% 区间,velocity-space loss 波动更大。
    • RVQ tokenizer 消融(4 个真实机器人任务 + 1 个 VQA 任务,仅替换 tokenizer,其余协同训练设置不变,真实机器人评测用 flow-matching 生成的连续动作):VQA 准确率从 75.7% 提升到 77.5%;平均任务进度从 29.3% 提升到 48.1%。

Infra(训练 / 推理工程)

  • 训练:GPU 型号、数量、总 GPU-hours 未披露。分布式 Muon(DMuon):owner-rank 负载均衡分配(Longest-Processing-Time-first)+ owner 上矩阵级 Newton–Schulz 更新 + reduce-to-owner 通信 + 专用 CUDA stream 上与下一次前向重叠的异步 post-step 广播 + 对称感知 kernel/形状感知自动调优,把 Muon 额外开销从朴素实现的约 2× 前向+反向时间降到约 0.02×(约 100× 降低)。有效全局 batch size 8192,bf16 混合精度,梯度裁剪 1.0,cosine 学习率 + 线性 warmup,峰值学习率 1e-4。
  • 推理:把整个去噪步捕获为单个 CUDA Graph(去噪是访存受限、CPU dispatch 是瓶颈的 workload,消除 kernel 间的 GPU 空泡);把 RoPE、RMSNorm 等逐元素/归约类算子融合成自定义 CUDA kernel(寄存器内完成端到端计算,避免中间张量落地),带来 2–10× 加速。实测:单张 RTX 5090,三视角图像输入,224×224 分辨率下约 21 Hz,448×448 分辨率下约 15 Hz(标准去噪步数 T=10),相对 PyTorch eager-mode 基线整体 4× 端到端加速;448×448 下相对加速仍然显著(该分辨率下基线受 ViT 二次方开销与膨胀的 KV cache 制约最严重)。作者说明这只是优化空间的部分探索。

评测 benchmark

  • 零样本 17 任务真实机器人套件(12 个 seen + 5 个 unseen,覆盖语义理解/刚体操作/可变形物体操作/精细操作/长时程多步操作五个维度,每任务按预定义评分规则打分、max 100、10 条轨迹取均值):400k checkpoint 时 seen 均值 50.0%、unseen 均值 53.6%、整体均值 51.1%(对比 50k checkpoint 时分别为 26.1%/24.2%/25.5%)。6 个任务达到或超过 60% 进度阈值,含 4 个超过 80%:Block Sorting 100%、Fruit Sorting 96%、Ring Stacking 86%、Rope Tightening(unseen 可变形任务)82%;另 Cup Grasping 64%、Bean Pouring(unseen)60%。当前零样本仍难以触及(<20%):Towel Folding 10%、Table Setting 9%、Charger Plugging 9%。

  • 微调基线对比(15 个真实机器人任务 = 10 操作 + 5 推理,每任务约 500 条微调演示轨迹,三个模型均从各自官方预训练权重微调):

    ModelManipulation (10)Reasoning (5)Overall (15)
    Wall-OSS-0.561.159.360.5
    π0.535.058.943.0
    DreamZero33.732.733.4

    Wall-OSS-0.5 整体领先 π0.5 17.5 个百分点、领先 DreamZero 27.1 个百分点,在 15 个任务中的 10 个上取得最高分。操作子集单任务领先 ≥30pp 的例子:Color Block Sorting(96 vs 42)、Ring Stacking(91 vs 60)、Drawer Organization(52 vs 7)、Spoon-in-Bowl(80 vs 43);π0.5 仅在 Glasses Rack Placement(66 vs 87)上领先。推理子集 Wall-OSS-0.5 在 Shape Sorting(68 vs 63)、Earphone Sorting(82 vs 73)、Sequential Button Pressing(16 vs 13)上领先,π0.5 在 Fruit Basket Placement(86 vs 94)、Object Matching(44.5 vs 51.5)上领先。最难案例:Pencil Case Packing 仅 18.5%。

  • 多任务微调扩展性(5→10→19 任务,统一 6 epoch,同一预训练 checkpoint 出发):5 个共享简单任务均值 73.96%→74.75%→83.75%(端到端 +9.8pp);10 个共享任务(5 简单 + 5 高难/推理)均值 59.98%→64.78%(10→19,+4.8pp);19 任务配置新增的 9 个背景/具身分布不同的任务上也达到 65.59% 均值。

  • 具身多模态理解(backbone Qwen2.5-VL-3B 为基线):

    BenchmarkQwen2.5-VL-3BWall-OSS-0.5Δ
    RealWorld VQA59.2%44.2%-15.0
    ERQA38.3%32.8%-5.5
    EO-Bench20.8%24.7%+3.9
    Embodied Grounding(内部基准)9.0%30.8%+21.8
    Where2Place4.0%15.0%+11.0

    通用开放域 VQA 出现回退(RealWorld VQA、ERQA),但具身 grounding/场景理解/放置推理明显提升,作者将其解读为动作训练带来的”专业化”效应而非能力整体退化。

创新点与影响

  • 把 VLA 预训练重新定位为”可直接部署、可直接测试的能力来源”而非单纯的下游微调初始化(deployment-oriented VLA pretraining)。
  • 梯度桥接协同训练:论证离散动作 token 交叉熵才是塑造主干的主导梯度(flow matching 在训练早期之后对主干更新的贡献稳定在约 5%),从而在不采用 π0.5 式 stop-gradient 隔离的前提下同时保留 VLM 语义先验与连续控制精度。
  • 架构与训练设计的整体配套:MoT 路由(VL Expert + Action Expert 共享注意力而非梯度隔离)+ Vision-Aligned RVQ tokenizer(语义对齐而非单纯重建)+ Action-Space Supervision(针对机器人动作低频谱特性的重加权 flow matching 损失)。
  • 部署级推理工程:CUDA Graph + 融合 kernel 带来 4× 加速,在 448×448 高分辨率输入下仍达到 15 Hz 的实时控制频率。
  • 作者自陈局限(Section 7):(1) 梯度桥机制目前仅在 3B 规模 VLM 主干上验证,扩展到更大主干可能显著改变三种训练信号间的相对几何关系;(2) 当前模型仅用单帧图像输入,可能限制需要时序记忆与持久状态跟踪的长时程任务表现;(3) Vision-Aligned RVQ tokenizer 及配套训练管线目前绑定固定的 26 维动作表示,限制了向灵巧手等高自由度具身形态的直接适用性;(4) 任务评测仍依赖人工设计的评分规则,当前真实机器人基准尚未覆盖多机协作、长时程部署或更开放的真实世界交互场景。未来工作方向为扩展到更大 VLM 主干、引入时序观测与分层规划以支持长时程任务、探索适配更多机器人形态的更通用动作表征,并持续开源权重/训练代码/评测工具。

原始链接

一手源存档(sources/)