一句话定位
WALL-OSS 是深圳自变量机器人(X Square Robot)发布的开源具身基础模型:以 Qwen2.5-VL-3B 为主干,用”紧耦合 MoE + 静态路由”取代 pi0 式的松耦合双分支架构,配两阶段训练(先用 FAST 离散动作 token 注入粗粒度动作先验的 Inspiration 阶段,再用 flow matching 连续动作头做精细控制的 Integration 阶段),并提出 Unified Cross-Level CoT——把”指令→推理→子任务→连续动作”统一进单一可微框架,在长程、需推理的操作任务上超过 π0 与 Diffusion Policy 基线。
背景与定位
VLM 迁移到具身动作空间的主流做法分两条路线:一是 openvla、RT-2 式的”混合”设计,直接在原 VLM 上做离散或连续动作建模(next-token 范式),但动作监督会显著扰动 VLM 原有权重分布,损害指令跟随与泛化能力;二是 pi0 式的”解耦”设计,用独立分支做动作预测、通过注意力从 VLM 抽取信息,但视觉语言在其中只是动作生成的辅助信号,绑定较松,指令跟随能力弱。WALL-OSS 的定位是用 Mixture-of-Experts(MoE)给不同训练任务分配不同 FFN,形成”紧耦合”的跨模态结构,同时用 Uni-CoT 把 groot-n1、Hi Robot 等依赖”VLM 规划器 + 独立控制器”的流水线范式,收进单一端到端可微模型。论文的直接基线是 pi0(flow matching + VLM 初始化)和不带 VLM 初始化、从零训练的 Diffusion Policy。
模型架构
- 主干:Qwen2.5-VL-3B,作为函数 F_θ 编码视觉(第一人称 + 机械臂搭载相机视角)与语言指令,记编码结果 h = F_θ(c),c=(vision, instruction)。论文未披露 MoE 新增 Action FFN/Vision-Language FFN 部分的参数量,因此 WALL-OSS 整体总参数量未披露(仅主干 3B 已知)。
- 紧耦合 MoE + 静态路由:与常见 MoE 用可学习 softmax/top-k 路由不同,WALL-OSS 用静态路由——按 token 类型把动作相关特征导向 Action FFN、视觉语言特征导向 Vision-Language FFN,视觉、语言、动作表示之间仍通过统一的自注意力交互。
- 两阶段训练范式(Inspiration → Integration):
- Inspiration 阶段:复用预训练 VLM 原有 FFN,叠加 embodied VQA 目标(masked language modeling、图像/视频-文本对比学习、指令跟随、时序顺序/因果建模)强化具身空间推理;同时引入离散动作目标——用 FAST(DCT → 量化 → BPE)把连续动作轨迹 a 转成离散 token z₁:K,与文本 token 对齐训练:L_Inspiration = λ_VQA·Σ(-log p_θ(τ_t|τ_<t,c)) + λ_D·Σ(-log p_θ(z_k|z_<k,c))。这一阶段的输出包含 CoT 推理、子任务预测、离散 FAST 动作 token。
- Integration 阶段:用 flow matching 连续动作头替换离散动作预测,分两个子阶段:(1) 冻结 VLM,仅训练 Action FFN 下的 flow head,回归速度场 v_φ(x_t,h,t),损失 L_Integration = λ_C·E[w(t)‖v_φ(x_t,h,t)-(ε-x_0)‖²](x_t=(1-ρ(t))x_0+ρ(t)ε 为加噪样本);(2) 解冻 VLM,与动作分支联合优化(∂L/∂θ≠0 且 ∂L/∂φ≠0)。
- Unified Cross-Level CoT(Uni-CoT):把 narrow-sense CoT(LLM 里的逐步文本推理)泛化为跨越语义-感觉运动全谱的 broad-sense CoT:instruction → reasoning(CoT) → subtask plan → continuous actions。训练目标用 path-drop 形式 min_θ E[(ℓ_act(F_θ(v,x,c),a_{1:T}) + λ·ℓ_VQA(H_θ(v,x),y)],允许模型灵活跳过或使用中间推理步骤(既支持全链路推理,也支持直接 x→a 映射),推理时可自适应决定是否调用 CoT/子任务分解,甚至在继续推理的同时为已完成的子任务发出动作(异步执行)。
数据
- 规模:论文正文对总时长的表述存在前后不一致——数据构成小节(§4)开头称”corpus exceeds 10,000 hours”,而数据切分小节(§4.4)称”overall corpus exceeds tens of thousands of hours”(即至少 2 万小时以上);原文未进一步澄清具体总量,这里如实记录两处表述。
- 三大来源:
- 自采机器人动作数据:覆盖桌面臂、移动支架、轮式双臂系统、轮式人形等平台,第一人称/第三人称 + 机械臂搭载相机;场景含厨房清洁、穿衣/整理、移动式抓放、装配任务;任务谱系分短程(强调精度与泛化的显式指令操作)和长程(目标明确但流程隐含,需任务分解、进度追踪、实时决策)两类;标注上用多模型流水线做细粒度分步标注 + 人工抽检,做多传感器时间戳同步、异常值过滤、低质量/空闲帧剔除、规则校验 + 人工审核,以及光照/背景等自动增强。
- 开源动作数据:整合 AgibotWorld、DROID、BC-Z、RH20T、FurnitureBench、Fractal、Bridge Data V2、DobbE、UMI-biarm、Utaustin_Mutex、Stanford_Hydra、Austin_Sailor、FMB、Austin_Sirius、Taco_Play、Stanford_Kuka_Multimodal、Berkeley_Autolab_UR5、Jaco_Play、Viola、Berkeley_Fanuc_Manipulation、Berkeley_Cable_Routing、Austin_Buds、DLR_EDAN_Shared_Control、NYU_ROT 等公开数据集,并做统一规范:坐标系与单位统一(米/弧度)、跨单/双臂-轮式-人形的最大自由度模板做形态归一化(缺失关节用掩码/占位符)、相机内外参与时间戳对齐 + 帧率/分辨率重采样、控制频率标准化并把轨迹重采样/插值到 flow-matching 网格。
- 多模态 VQA 数据:通用流(CapsFusion、Cambrian、PixMo、RoboPoint、Robo2VLM、COCO、VQAv2 等,维持 VLM 通用语言-视觉能力)+ 具身流(在自采轨迹上自动生成的 Action Planning VQA、时空 QA(定位/顺序/进度)、Perception VQA、Cognition & Affordance,标签统一用
<box>/<point>/<mask>格式),另含 VQASynth-SpaceLLaVA、SpaceThinker、OpenSpaces、OpenSpaces_MC_R1、SpaceOm 等空间推理数据集。
- 训练期数据编排:按场景/物体/任务/形态分层,构造跨环境、跨形态的验证/测试集;长程与稀有技能做温度可控的重采样与难例上采样;两阶段训练中都按配额混合多源数据以兼顾 VLM 能力保持与连续控制提升;视觉流做轻量域随机化与遮挡扰动。
- 微调阶段联合采样比例:WALL-OSS 微调时按 1:15(非子任务 VQA : 动作样本)与 1:100(子任务样本 : 动作样本)的交错比例做动作-VQA 联合训练;子任务标注仅占训练帧的 1%,CoT 推理轨迹标注同样仅占 1%。
训练方法
- 目标函数:Inspiration 阶段是 VQA 交叉熵 + 离散动作 token(FAST)的交叉熵联合监督;Integration 阶段是 flow-matching 速度场回归(L2),分”冻结 VLM 训 flow head”和”解冻联合优化”两个子阶段。
- 动作离散化:借鉴 π0-FAST 的 DCT → 量化 → BPE 流程,把连续动作序列压成离散 token,与文本 token 同空间对齐,为后续连续动作建模提供粗粒度先验(“discrete priors → continuous control”)。
- CoT/子任务监督比例极低但泛化良好:仅用 1% 的训练帧标注子任务/CoT,模型在推理时仍能稳定生成高质量子任务指令与推理轨迹(体现在 Set-Table、Tidy-Bedroom、Place-by-Color、Block-Spell 等下游任务的微调阶段)。
- 消融设计(Table 3):对比 WALL-OSS(多模态 co-training:动作生成 + CoT/子任务生成 + 2D referring expression grounding 联合训练)、WALL-OSS(仅动作:只用子任务指令训练动作生成)、π0(仅动作:架构类似但只训练动作生成)三种微调配置,隔离多模态联合训练对细粒度指令跟随的贡献。
- 基线微调范式对照:为 π0 与 Diffusion Policy 分别实现 Flat(高层任务指令直接训练)和 GPT4-Subtask(人工标注子任务分解 + 推理时用 GPT-4 生成)两种范式,用于把”任务分解”这一因素与”架构创新”分离评估。
Infra(训练 / 推理工程)
- 训练 GPU 数量 / GPU-hours / 并行策略:论文未披露。
- 训练精度:论文未披露;GitHub 官方推理示例(
scripts/fake_inference.py)显式在 bfloat16 下跑validate模式做数值稳定性检查,可作为该模型系推理精度的参考,但不代表论文本身训练所用精度。 - 推理侧 FPS / 控制频率 / 端到端延迟:论文未披露具体数值。
- 依赖栈(来自 GitHub README):Python 3.10、PyTorch、FlashAttention 2.8.3、CUDA 12.x、Ubuntu 22.04;LeRobot(固定 commit
c66cd401767e60baece16e1cf68da2824227e076,--no-deps安装避免覆盖 Wall-X 的依赖版本锁定);仓库自带导出的 CUDA 算子源码(wall_x/model/core/ops/csrc/),安装时通过 PyTorchCUDAExtension编译。 - 推理服务:官方提供基于 WebSocket 的 serving 脚本(
scripts/run_serving.sh),默认返回原始动作 chunk(未序列化),可选--serialize-actions输出机器人可执行序列;配套开环评测脚本对比 WebSocket 预测与 LeRobot ground truth。
评测 benchmark
论文采用盲态第三方测评协议:由未参与模型开发/训练的第三方评测员,依据统一测试文档(环境设置、每任务初始状态、评分细则)在不知模型版本的情况下执行评测。
1) Embodied VQA 基准(自建,人工评测,对比 WALL-OSS 预训练模型 vs. 原始基座 Qwen2.5-VL-3B,Table 2):
| 模型 | Object Grounding | Scene Captioning | Action Planning |
|---|---|---|---|
| Qwen2.5-VL-3B | 46.1% | 57.7% | 59.8% |
| WALL-OSS | 91.6% | 87.6% | 69.0% |
2) 零样本指令跟随(pick-and-place,未参与微调,评估预训练后涌现的零样本泛化):预训练前见过的物体/容器指令下平均任务进度 85%,全新物体指令下降至 61%;失败多为对陌生物体抓取/放置姿态的小幅误差,而非语义误解。
3) 预训练对动作精度与泛化的提升(Collect-Waste,900 episodes 微调;Pick-Place-Cup,500 episodes 微调):
- Collect-Waste(ID):WALL-OSS 与 π0 均达到 100% 成功率,未预训练的 Diffusion Policy 仅 80%。
- Pick-Place-Cup(ID,数据更少、任务更复杂):预训练模型(WALL-OSS、π0)保持 90%+ 成功率,DP 跌至 20% 以下。
- Collect-Waste OOD(新环境):DP 成功率从 80% 跌到 0%(完全失败);WALL-OSS 与 π0 维持在 80%+。
4) 长程任务的子任务生成(Set-Table、Tidy-Bedroom,均为预训练未见的全新任务,均超过 5 个连续阶段,平均执行时间分别超过 3 分钟、5 分钟;1500/1000 episodes 微调):仅用 1% 训练数据标注子任务,WALL-OSS 在两个任务上均显著超过 π0 与 Diffusion Policy(论文以图 7 定性展示,未给出精确数值百分比);基线因缺乏子任务指引常出现阶段混淆(重复摆放餐具、遗漏后续步骤),在视觉相似但动作应不同的情形下难以消歧。
5) CoT 对推理型任务的提升(Place-by-Color、Block-Spell,各 500/1600 episodes 微调):直接视觉匹配(红色毛线球配红纸)下 CoT 收益很小;但在需文本推理的条件(毛线球配印有”red”字样的白纸)下,WALL-OSS 显著优于所有基线(定性描述,未给精确数值)。Block-Spell 任务下 Flat 设置的基线任务进度接近零;GPT-subtask 设置下 WALL-OSS 仍显著优于 GPT-subtask 基线(GPT-4 虽能给出正确子指令但缺乏实时性与情境适应性,尤其在第一人称视角被遮挡时)。
6) 多模态 co-training 对细粒度指令跟随的贡献(Block-Spell 任务,Table 3,三种微调配置对比正确选取指定字母/数字积木的准确率):
| 积木类型 | WALL-OSS(多模态 co-training) | WALL-OSS(仅动作) | π0(仅动作) |
|---|---|---|---|
| 字母 | 87% | 26% | 9% |
| 数字 | 95% | 80% | 35% |
π0(仅动作)在字母任务上的准确率(9%)已接近随机猜测,凸显缺乏多模态联合训练时细粒度指令-动作绑定的失败。
创新点与影响
- 贡献:(1)用紧耦合 MoE + 静态路由架构替代此前”混合”(动作监督直接扰动 VLM)与”解耦”(视觉语言仅作辅助信号)两条路线,用较小比例的新增参数同时提升具身 VL 理解与动作生成,论证二者并非零和权衡;(2)提出 Unified Cross-Level CoT,把指令-推理-子任务-动作四层映射统一进单一可微框架,支持前向任意映射(可跳过中间层,也可在继续推理的同时为已完成子任务异步发出动作);(3)验证极低比例的子任务/CoT 标注(仅 1% 训练帧)配合大规模预训练即可涌现稳定的分层推理能力;(4)开源完整训练代码与多个 checkpoint(Wall-X 仓库),并配套 embodied VQA 基准、LeRobot 数据接入与仿真/实机评测工具链。
- 改变了什么:为”VLM → VLA”迁移提供了一条可复现的架构 + 课程设计范式,证明具身 VL 理解(object grounding、scene captioning、action planning)与后续动作精度、长程规划、细粒度指令跟随高度相关,而非彼此独立的能力维度。
- 作者自陈局限(Discussion,§6):WALL-OSS 在 OOD 泛化上强于 Diffusion Policy,但在精细操作(precise manipulation)上 π0 仍更优;论文认为严格端到端 VL→A 映射与引入中间形态(如未来帧预测、3D 感知)是两条互相收敛而非互斥的路径,二者相对效率会随数据与算法演进动态变化;3D 数据稀缺仍是瓶颈,视频/3D 模态与动作的相关性高于纯文本-动作对但监督噪声更大。GitHub README 显示该系列此后(2026 年)又推出 Wall-OSS-0.5(可直接部署实机)与 WALL-WM(世界-动作模型),本页仅覆盖 2025-09 的 WALL-OSS 原始论文范围,不展开后续工作细节。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2509.11766
- 论文 PDF:https://arxiv.org/pdf/2509.11766
- GitHub(Wall-X 训练/推理代码):https://github.com/X-Square-Robot/wall-x
- HuggingFace(WALL-OSS-FLOW):https://huggingface.co/x-square-robot/wall-oss-flow
- HuggingFace(WALL-OSS-FAST):https://huggingface.co/x-square-robot/wall-oss-fast
- ModelScope(组织页):https://modelscope.cn/organization/X-Square-Robot
- 官方项目页:https://x2robot.com/en/research/68bc2cde8497d7f238dde690
一手源存档(sources/)
- wall-oss—github-readme.md — GitHub README 快照
- wall-oss—project-page.md — 官方项目页快照
- arXiv 2509.11766 全文:见上方 arXiv 链接(arXiv 原文 PDF,不入 git)