一句话定位
星海图(Galaxea)发布 500+ 小时单一本体真实世界移动操作数据集 Galaxea Open-World Dataset,并在此之上训练 G0——一个「VLM 做高层规划(System-2)+ VLA 做精细执行(System-1)」的双系统机器人策略,用三阶段课程(跨本体预训练 → 单本体预训练 → 任务后训练)验证了单本体高质量数据对最终性能的关键作用。
背景与定位
VLA 领域此前的动作生成范式分两派:自回归 token 预测(如 openvla、RT-2)擅长继承 VLM 的知识但推理慢,扩散/flow-matching 生成(如 pi0、groot-n1)吞吐高但可能损害 VLM 原有的语言/视觉能力;pi0-5 这类工作开始用两者混合的配方。G0 沿用 π0.5 同款「FAST 离散 token 自回归 + flow-matching 连续动作」混合训练法,但把重心放在另一个问题上:规划与执行的分工。继 SayCan(saycan,LLM 做 zero-shot 高层规划)之后,社区把 Kahneman 的 System-1/System-2 类比引入机器人策略架构,figure-helix 是同期另一个代表性的「VLM 慢思考 + VLA 快执行」双系统方案;G0 的做法是让 System-2(G0-VLM)单独可微调、可评测,用 Qwen2.5-VL 微调后与 Gemini-2.5-pro、GPT 级闭源模型直接打分对比,系统性回答「VLM 规划器要不要针对机器人任务做专门微调」。
数据集层面,论文把自己定位为对 open-x-embodiment、bridgedata-v2、droid(单本体但环境单一)与 agibot-world-colosseo、robomind(规模更大但仍偏受控/人造场景)的补充:Galaxea Open-World Dataset 的卖点是「单一本体 + 真实生活/工作场景 + 细粒度子任务语言标注」三者同时满足,专门用来做一个干净的「跨本体预训练到底有没有用」的对照实验。论文的核心发现相当反直觉:当预训练本体(OXE)与目标本体(R1 Lite)差距较大时,跨本体预训练对底盘、躯干等本体特有动作的迁移增益会消失甚至为负,单本体预训练(Stage-2)比跨本体预训练更关键。
截至 2026-07-16,GitHub 仓库 OpenGalaxea/GalaxeaVLA 已经演进到 G0Plus(2026-01)、G0Tiny(2026-02)乃至新一代统一自回归模型 G0.5(2026-06),本页聚焦于 arXiv 2509.00576 描述的 G0/G0-VLA 原始工作。
模型架构
G0-VLA(System-1,快执行):在时刻 t,以语言指令 l、三路相机视觉观测 o_t、机器人本体状态 s_t 为条件,生成动作 chunk A_t = a_{t:t+k}(horizon k)。VLM 先编码视觉+语言,随后一个 flow-matching 动作专家(action expert)以 VLM 的 KV cache 为条件生成连续动作。
- VLM 主干:从 PaliGemma 初始化,由 SigLIP 视觉编码器 + 单层 MLP projector + 标准 Transformer 组成;三路输入图像经视觉编码器/projector 转成一维 embedding 序列,与 tokenize 后的语言指令、本体状态、已生成动作 token 一起在 Transformer 内做 attention。
- 动作 tokenizer(Stage-1 用):FAST tokenizer,把连续动作 chunk 压缩成离散 token 序列,用标准交叉熵做下一动作 token 自回归预测:p(A_t^d) = ∏_i p(a_i^d | a_{<i}^d, o_t, l_t, s_t)。
- 动作专家(Stage-2/后训练用):Stage-2 阶段新初始化一个 action expert,在本体状态与 VLM 表征的条件下用 flow-matching 目标生成连续动作:最大化 E[log π_θ(A_t | o_t, l_t, s_t)],flow-matching 损失 L_flow(θ) = E‖v_θ(A_t^τ, τ, o_t, l_t, s_t) − u(A_t^τ|A_t)‖²,其中 A_t^τ = τA_t + (1−τ)ε 是插值噪声动作。
G0-VLM(System-2,慢规划):以开源 Qwen2.5-VL 为起点做指令微调,输入 k 帧历史图像观测(1 秒间隔采样)+ 历史动作,输出下一步子任务指令,供 System-1 执行;两套模型异步、不同频率运行。
机器人本体(Galaxea R1 Lite):论文披露的 23-DoF 构型 = 两条 6-DoF 机械臂 + 3-DoF 躯干(垂直升降+俯仰,扩展工作空间)+ 6-DoF vector-drive 全向底盘(最高时速 1.5 m/s);球形腕 + 平行夹爪,最大负载 5 kg,最大伸展 60 cm;整机尺寸高 1280 mm、底盘宽 600 mm、整体宽 670 mm。感知:立体 RGB 头部相机 + 双路 Intel RealSense D405 RGB-D 腕部相机(论文原文口径为”three cameras”);HF 上发布的 LeRobot 数据集则暴露 4 路 RGB 视频流:head_rgb/head_right_rgb(立体头相机对)+ left_wrist_rgb/right_wrist_rgb(仅 RGB,未含深度通道)。本体状态特征(HF schema):left/right_arm 各 6 维(+6 维速度)、torso 4 维(+4 维速度)、chassis 3 维(+3 维速度 +10 维 IMU)、left/right_gripper 各 1 维、left/right_ee_pose 各 7 维;动作特征:left/right_arm 各 6 维、left/right_gripper 各 1 维、chassis.velocities 6 维、torso.velocities 6 维。
采集方式采用「isomorphic teleoperation」——直接把人类操作员动作映射到机器人运动学,相比 VR 遥操作可保持机臂在可达姿态内、避免逆运动学失败、无需人机形态重定向。
数据
Galaxea Open-World Dataset:100K 条示范轨迹,覆盖 150 个任务类别、50 个真实场景(11 个物理场地,含住宅、餐饮、零售、办公四类空间)、1,600+ 独立物体、58 种操作技能;500+ 小时。全部用同一本体(R1 Lite)采集,保证感知-动作-语言标注对齐。对象来自真实零售供应商,食品等不宜反复操作的物品用高仿真替代品。采集准则三条:(1) 可观测性——关键物体全程在视野内;(2) 数据量与质量——简单任务约 100 条高质量示范即可,复杂任务先小规模试点再规模化采集;(3) 语言 grounding——每条示范按子任务分段标注结构化语言描述(固定 schema 选项而非自由文本,提升标注速度与一致性)。标注流程对每个 episode 做原子子任务切分,episode 级和 clip 级质量检查剔除操作失误、ROS topic 频率异常等不合格数据。公开版本为 LeRobot v2.1 格式,227 个任务级 tar.gz 归档,总大小 2.87 TB,视频用 AV1 编码、15 fps。
G0-VLA Stage-1(跨本体预训练)数据混合:约 1,000 小时 OXE 轨迹 + 500 小时 Galaxea Open-World Dataset(仅用高层任务描述,不用低层子任务标注)+ 200 小时自有数据(仅高层任务描述)——三者合计约 1,700 小时,只训练 VLM 部分(不训动作专家),理由:(1) 跨本体数据的标注质量与动作准确度参差不齐,动作专家学不到足够信息;(2) 模型尚未收敛到稳定表征前引入扩散/flow-matching 损失可能有害。
G0-VLA Stage-2(单本体预训练)数据:完整使用带子任务标注的 Galaxea Open-World Dataset;消融实验对比了仅用 200 小时与 400 小时两种规模(主结果 G0(Full) 采用 Stage-1 + 400 小时 Stage-2 数据)。
后训练(task-oriented):每个下游任务最多 100 条微调轨迹(每条 30 秒至 1 分钟);few-shot 消融进一步压到每任务 20 条轨迹。
G0-VLM 训练数据构造:从 Galaxea Open-World Dataset 采样 episode,对「子任务临近结束」或「夹爪状态变化」的关键帧给更高采样权重;抽取头部相机图像+子任务标注,构成 D_labeled(含任务名、o_{t-k..t}、l_{t-k..t});再用 DeepSeek-R1 作为推理 LLM,仅输入任务名+历史/当前/下一子任务的文本序列(不喂图像),合成拟人化的高层指令(如 “I am going to be seated, could you help pull the chair out?“)与机器人应答(如 “I am working on it!“),作为 SFT 监督信号。
训练方法
三阶段课程,Stage-1/Stage-2/后训练共享同一模型结构,仅训练目标与数据不同:
- Stage-1(VLM-only 自回归预训练):FAST tokenizer 离散化动作,标准交叉熵 next-token 预测,训练目标只更新 VLM(PaliGemma 初始化),动作专家未加入。
- Stage-2(单本体 flow-matching 预训练):VLA = 预训练 VLM + 新初始化 action expert,联合优化 flow-matching 回归目标(式 2、式 3),让模型专精目标本体的配置、动力学与运动学。
- 后训练(task-oriented fine-tuning):沿用 Stage-2 同款训练目标,仅在每任务 ≤100 条高质量示范上继续微调,掌握具体复杂技能。
G0-VLM 单独走 SFT 流程:Qwen2.5-VL 初始化,用上述人工子任务标注 + DeepSeek-R1 合成的拟人化高层指令数据做指令微调,学习「解析人类高层指令 → 结合场景理解 → 输出可执行的子任务原子指令」。
Infra(训练 / 推理工程)
- 预训练 GPU 数量 / GPU-hours / 并行策略 / 精度:论文正文未披露。
- 微调硬件门槛(来自 GitHub 仓库):单卡推理需 >8 GB 显存(推荐 RTX 3090 / RTX 4090);全量微调需 >70 GB 显存(A100 80GB 或 H20 96GB);多卡微调用
--nnodes/--nproc-per-node配置模型并行以降低单卡显存占用。 - 推理 FPS / 控制频率 / 边缘硬件延迟:论文未披露具体数值。
评测 benchmark
四个真实机器人基准任务(均用 progress score 打分,每任务重复 10 次取平均):
- Table Bussing(6 分):笔插笔筒、挂耳机、书放书架——每个动作按 pick+place 各 1 分。
- Microwave Operation(5 分):拿正确食物→放盘→开微波炉门→放入→关门。
- Bed Making(4 分):移动到床边→抬躯干抓被子→后倾躯干→移动铺平被子,考察底盘/躯干/机臂协同的整体控制。
- Blocks Stacking(6 分):按语言指令拼单词,每块 pick+stack 各 1 分。
5.1 预训练权重对比(G0(Stage-1)、G0(Stage-2 200h)、G0(Stage-2 400h)、G0(Full)、G0(Scratch,无动作预训练,仅初始化自 VLM 权重)、官方 π0 权重基线;统一微调 4 epoch):G0(Full) 平均 progress score 最高,在 Table Bussing、Microwave Operation、Bed Making 上的拾取类任务尤其突出;G0(Stage-2 400h/200h) 在语言跟随、动作一致性、整体控制上领先;G0(Stage-1) 在所有预训练变体中最差——说明单靠跨本体预训练不足以支撑良好的下游微调(原文以图表形式给出具体分数,未在正文文字中列出精确数值)。
5.2 Few-shot 迁移(每任务仅 20 条轨迹,10 epoch,测 Table Bussing 与 Microwave Operation):Stage-2 预训练模型显著优于其余配置,动作更平滑稳定;仅 Stage-1 预训练的模型相较从零训练没有明显优势——说明跨本体动作预训练本身不足以支撑 few-shot 快速适配新本体。
5.3 本体特有动作(Bed Making 逐技能拆解):Stage-2 单本体预训练显著提升底盘、躯干控制表现;跨本体预训练(Stage-1、π0)在底盘相关指令跟随与躯干控制精度上明显更弱,部分指标甚至不如从零训练——作者归因于 R1 Lite 与 OXE 训练本体间的巨大形态差异,阻碍了本体特有技能的正向迁移。
G0-VLM 规划器评测(Table 1,指令准确率 %,标准化 prompt 限定候选原子动作选项):
| Model | Table bussing | Microwave operation | Make the bed | Build blocks |
|---|---|---|---|---|
| Gemini-2.5-pro | 32.0 | 15.8 | 54.2 | 55.0 |
| Qwen2.5-VL-72B | 26.3 | 16.8 | 48.1 | 21.7 |
| Qwen2.5-VL-32B | 21.3 | 14.8 | 54.2 | 21.0 |
| Qwen2.5-VL-7B | 26.3 | 17.2 | 46.9 | 24.7 |
| G0-VLM | 83.3 | 74.2 | 78.2 | 75.6 |
G0-VLM(针对领域数据微调过的 Qwen2.5-VL)在四项任务上全面超过 Gemini-2.5-pro 与各尺寸 Qwen2.5-VL 基线,最大差距超 50 个百分点(如 Microwave Operation:74.2 vs. 最优基线 17.2)。论文据此论证:机器人任务需要的不只是通用视觉语言理解,还需针对本体动作原语做专门领域适配。
创新点与影响
- 核心贡献:(1) 一个单本体、真实生活/工作场景、细粒度子任务语言标注的 500+ 小时开放数据集,专为研究”跨本体 vs. 单本体预训练”提供干净的对照实验环境;(2) G0 双系统架构——VLM 高层规划(可独立微调评测)+ VLA 精细执行,并给出可复现的三阶段训练课程。
- 改变了什么:用受控实验直接证伪了”跨本体预训练总是有益”的默认假设——当预训练本体与目标本体形态差距大时,跨本体预训练对本体特有动作(底盘、躯干)的迁移可能不增反降,凸显单本体高质量数据在实际部署场景下的不可替代性;同时把 System-2 规划器(G0-VLM)当作独立可评测、可微调的组件,而非直接调用闭源 VLM zero-shot。
- 工程/生态影响:数据集与 G0-VLA 权重开源(Hugging Face / ModelScope 双发),带动 GalaxeaVLA 仓库后续演进出 G0Plus(2k+ 小时预训练)、G0Tiny(250M 边缘端)与新一代统一自回归 G0.5。
- 作者自陈的局限 / 待解决问题:跨本体预训练在何种条件下有效仍是开放问题(原文承认领域内对此存在”conflicting findings”);论文正文未给出预训练阶段的具体计算规模(GPU 数、GPU-hours)与真实机器人上的推理延迟/控制频率数据;VLA 基准的量化结果以图表(非文本表格)呈现,缺少与更多公开 VLA 基线的直接数值对比。
原始链接
- 论文(arXiv):https://arxiv.org/abs/2509.00576
- 论文 PDF:https://arxiv.org/pdf/2509.00576
- 项目主页:https://opengalaxea.github.io/G0/
- 代码仓库:https://github.com/OpenGalaxea/GalaxeaVLA
- 数据集(Hugging Face):https://huggingface.co/datasets/OpenGalaxea/Galaxea-Open-World-Dataset
- 数据集(ModelScope):https://www.modelscope.cn/datasets/Galaxea/Galaxea-Open-World-Dataset
- 模型权重(Hugging Face,G0-VLA):https://huggingface.co/OpenGalaxea/G0-VLA
一手源存档(sources/)
- galaxea-g0—github-readme.md — GitHub README 快照(固定在 G0-VLA 时期的提交,早于仓库后续演进为 G0Plus/G0.5)
- galaxea-g0—hf-dataset-card.md — Hugging Face 数据集卡快照(LeRobot schema、相机/状态/动作特征维度)
- galaxea-g0—hf-model-card.md — Hugging Face 模型卡快照(G0-VLA 权重说明)
- galaxea-g0—project-page.md — 官方项目页快照
- arXiv 2509.00576 全文:见上方 arXiv 链接(arXiv 原文 PDF,不入 git)