一句话定位
星海图(Galaxea)2026 年 6 月发布的 G0.5:把 VLA 拉回纯自回归路线——单一 Qwen3.5-2B 解码器在同一个 token 流、同一个交叉熵目标下同时吐推理 token 和动作 token,靠可学习的跨本体动作编解码器(ActionCodec)压掉离散化的效率代价,在 R1-Lite/R1-Pro 真机微调、BEHAVIOR-1K 长程移动操作、DROID 零样本、LIBERO/RoboTwin 2.0/SimplerEnv-Bridge 仿真等七个独立评测场景上全面追平或超过 π0.5、GR00T-N1.7 等”VLM 当编码器+独立动作专家”路线的模型。
背景与定位
VLA 领域这两年的主流架构是”VLM-as-Encoder”:一个预训练 VLM 只负责编码视觉语言条件,真正生成动作的是另一套参数、另一个目标函数训练出来的 flow-matching/diffusion 专家(pi0 引入分离式专家 + block-wise causal attention,pi0-5、groot-n1、smolvla 均沿用这一模板)。这条路线把动作效率做上去了,但代价是 VLM 不再是”决策者”,它的思维链推理、上下文学习、prompt 引导运动的能力,都要先经过一个压缩过的条件瓶颈才能间接影响动作。
G0.5 的论点是回到早期 rt-2、openvla、pi0-fast 的自回归路线——但去掉这条路线原本的低效根源:过度的动作离散化。论文特别引用 Knowledge Insulation(pi-knowledge-insulation)与 VLA-0 的证据——前者为了防止动作专家梯度污染 VLM 能力,反而要引入自回归动作预测作为辅助目标来”保护”VLM;后者证明未做修改的 VLM 直接自回归学动作 token,效果就能超过 π0.5-KI/OpenVLA-OFT/SmolVLA。G0.5 把这个信号当真,全面押注自回归路线到底,flow-matching 头只保留作为可选的推理加速器。
跨本体动作离散化上,G0.5 与 Being-H0.5、Green-VLA、HEX 等同属”结构对齐”思路(不是在动作向量层面对齐,而是把结构对齐做进 tokenizer 本身);思维链设计上最接近 ECoT(自回归解码器里训练前置推理),但用 bounding box + 子任务文本 + 2D 末端轨迹三种原语组成可在推理期任意开关的 prompt 模板。视觉记忆模块沿用 pi0-7 与 MEM(Torne et al. 2026)的分解式时空注意力设计。前代模型是 2025 年 9 月的 galaxea-g0(双系统 PaliGemma+Qwen2.5-VL 架构、flow-matching 动作专家),G0.5 是彻底转向纯自回归的下一代。
模型架构
Backbone:从 Qwen3.5-2B(视觉-语言模型)初始化,提供视觉编码器、共享多模态词表、自回归解码器。整个模型是单一 transformer 解码器——没有独立的动作头/动作专家参数,动作与推理共用同一套权重、同一个下一 token 交叉熵目标。
序列模板(Fig. 2):所有输入输出序列化进一条自回归序列,分两段:
- 条件段(user 角色,无损失):多视角 RGB(K 路相机,经视觉 tokenizer 展开为
<image_image>token)+ 本体标识符(如 r1pro/r1lite)+ 自然语言任务指令(截断到 200 token)+ 本体感知状态s_t(关节位置 + 夹爪状态),以<EOC>结束。 - 生成段(assistant 角色,计算交叉熵损失):可选的思维链片段(
<EOV>之前)+ 动作码(<EOV>之后),以<eos>结束。
ACTION-conditioning / 动作头:主路径是离散 token 自回归——跨本体动作编解码器 ActionCodec(沿用 FASTer 的动作分组策略 + ActionCodec 训练配方)把每个机器人的动作拆成独立运动部件(左臂/右臂/下肢等),每部件 pad 到共享最大维度后,训练残差向量量化(RVQ)模型,并加一个时序对比目标提升相邻动作的 token 一致性。序列展开为 R 轮残差量化,每轮含当前激活的 DoF-组标记(<left_control_r>、<right_control_r>,可选 <lower_body_control_r>)+ 每组 8 个动作码;不激活的部件(如静止的右臂)整组标记直接从序列中省略,不占用 padding token。R 的具体轮数论文未给出数值。可选地叠加一个 flow-matching 头,接在自回归 trunk 之上,用于对延迟敏感的部署场景做动作精修(该头的参数量、结构细节论文未披露)。真机部署(GitHub README)用 --action_steps 16 作为执行动作块长度。
统一跨本体动作空间:27 维,划分为 left_control(9) | left_gripper(1) | right_control(9) | right_gripper(1) | lower_body(7);某本体不驱动的槽位在合并时填 noop token,因此不同形态机器人共享同一输出头,无需逐机器人适配器。每个 embodiment 的动作归一化方式(z-score 尾部截断,或 q01/q99 分位缩放)与逐通道动作滤波单独设置。
原生思维链(Native CoT):生成段动作码之前可选插入四类自描述推理目标——Subtask:(原子子任务文本)、BBox:(关键物体 bounding box)、Trace:(2D 末端轨迹,灵感来自 TraceVLA)、ActionHint:(帧级夹爪动作提示)——训练时每步从 8 种组合(含无 CoT 基线)里加权随机采样一种,子任务文本权重更高。CoT token 与动作 token 共享解码器、上下文与目标:不是外挂模块,也不是仅训练期用的辅助监督,而是同一生成过程里耦合的阶段,且可在推理期用 prompt 模板任意切换开关而无需重训。
视觉记忆:跟随 π0.7 与 MEM,每 4 层 ViT 插入分解式空间+时间注意力模块,按时间步和空间 patch 依次混合历史信息;为限制延迟,历史 token 在最后一层被丢弃;训练期以 30% 概率随机丢弃全部历史帧防止过拟合;用连续状态嵌入替代离散文本 tokenizer 表示本体状态,使其与对应视觉帧严格同步。预训练观测窗口:6 帧、采样间隔 1 秒、跨度 5 秒(含当前帧)。
编码器/跨本体:预训练覆盖 14 个本体(真实 + 仿真,含单臂、双臂移动操作平台、全尺寸人形),Fig. 4 给出各本体在预训练数据里的相对占比饼图(论文未给出逐本体具体百分比数字)。真机部署验证过的本体包括 R1-Lite(两条 6-DoF 臂 + 3-DoF 躯干 + 全向移动底盘)、R1-Pro(两条 7-DoF 臂 + 4-DoF 躯干 + 全向移动底盘,人形上半身)、DROID/Franka Research 3 + Robotiq 2F-85、SO-100/101;仿真侧覆盖 LIBERO(Franka)、robotwin-2(双臂)、SimplerEnv-Bridge(WidowX)。
数据
机器人数据:14 个本体的真实+仿真示范数据混合,统一投影进 27 维动作空间;具体总小时数/episode 数/轨迹数论文未披露聚合规模(仅给出各基准的微调子集规模,见下)。
自动标注流水线:规则式时序切分找候选动作段/关键帧后,调用 Gemini 3、Doubao Seed 2.0 Pro 等多模态模型 API 生成动作提示、原子任务描述、episode 级指令;视觉定位用多模态基础模型 + SAM3 追踪生成逐帧 bounding box 与分割掩码;2D 末端轨迹用正运动学从关节位姿计算双臂末端位置,再投影到头部相机图像平面。
Web 与 VQA 联合训练:约 **1 亿(100M)**样本量级的视觉-语言混合数据,构成为约 5000 万通用 web VQA(如 LLaVA-NeXT/OneVision 类数据)+ 5000 万具身 VQA(RoboPoint、MolmoAct、RoboBrain 类数据)+ 500 万自标注流水线产出的 in-house VQA(覆盖子任务分解、物体 bbox、机器人场景常识 VQA)。预训练期 VQA 样本与动作样本按 VQA:动作 = 1:4 比例混合,两类样本用同一个下一 token 交叉熵目标监督。
CoT 监督分配:每条机器人样本分配恰好一种 CoT 格式,从 8 种候选(无 CoT 基线、原子任务/高层任务文本、子任务文本、子任务+动作提示、2D 轨迹、bounding box 等变体)按加权随机采样抽取;子任务文本格式权重更高,评测统一用无 CoT 格式。
下游各评测的具体微调数据规模(sim-vs-real、后训练规模数字均来自各实验小节):
- PP Bench(R1-Lite):采集 50 小时台面操作数据,每场景 5–20 个随机摆放物体;构造 1H/10H/50H 三个嵌套子集,分别训练 12/8/4 个 epoch。
- RoboTwin 2.0:2,500 条干净场景示范 + 25,000 条强场景随机化示范,微调 4 epoch,学习率 4×10⁻⁵,全局 batch size 1024。
- Bridge-SimplerEnv:在 BridgeData V2 上后训练 80K 梯度步,学习率 3×10⁻⁵,state-free 策略输入(不喂本体状态)。
- LIBERO:微调 100K 步,学习率 1×10⁻⁵,权重衰减 1×10⁻²。
- BEHAVIOR-1K Challenge:官方提供 10,000 条远程操作专家示范,累计 1,100+ 小时,平均单条 episode 6.6 分钟、最长 14 分钟;50 个任务示范联合共训(单一策略覆盖全部 50 任务)。
- R1-Lite/R1-Pro 真机微调:towel folding、carton folding(两本体共享)、pencil-case packing(仅 R1-Lite)、box transfer and stacking(仅 R1-Pro),四个任务实例化为六个”任务-本体”组合,每组合 15 条真实评测 episode(训练数据规模未披露)。
训练方法
预训练目标:单一下一 token 交叉熵损失,只作用于生成段(Eq. 1,L(θ) = -Σ log p_θ(x_i | x_<i),i 属于生成段 token 集合 G)。这一个损失同时监督 CoT 生成与动作生成,预训练阶段无辅助回归目标、无专家蒸馏。
优化器/超参:AdamW(β=(0.9, 0.95),权重衰减 1×10⁻²),基础峰值学习率 1×10⁻⁵;调度为 4,000 步线性 warmup → 常数阶段维持到 92% 训练进度 → 余弦衰减到峰值的 30%(衰减到一个 floor 而非 0,且视觉塔全程不冻结)。训练约 120K 步。
动作 tokenization 训练:ActionCodec 采用 FASTer 的动作分组策略 + 时序对比目标训练残差 VQ;跨本体统一动作层,编解码器一次训练、跨本体复用,新增本体无需 tokenizer/动作头新增参数。
推理期解码器切换:同一预训练权重支持在推理期切换 AR 离散 token 解码 vs. flow-matching 头精修(§5.6 探针实验的核心设计——不改任何参数,只切推理配置)。
下游微调:各基准按上文”数据”小节列出的步数/学习率/batch size 微调(LIBERO 100K 步 lr1e-5;RoboTwin 4 epoch lr4e-5 bs1024;Bridge 80K 步 lr3e-5;BEHAVIOR-1K 与 R1-Lite/R1-Pro 未单独给学习率/步数,只给 epoch 数与算力对齐方式)。
Infra(训练 / 推理工程)
- 预训练算力(GPU 型号/数量/GPU-小时/并行策略):论文未披露——120K 步预训练未给出集群规模或总训练时长。
- 下游微调对齐算力:R1-Lite/R1-Pro 真机微调实验中,G0.5、π0.5、GR00T-N1.7 均用 16 张 H20 GPU、按具体设置训练 4–10 小时(wall-clock 对齐,非 step 对齐),确保基线间比较公平。
- 推理部署(GitHub README):真机推理走 server/client 架构——GPU 机跑策略 server,机器人端 client 经 WebSocket + msgpack 收发观测/动作块。单卡显存需求:推理 >8GB(RTX 3090 / 推荐 RTX 4090),全量微调 >70GB(A100 80GB 或 H20 96GB)。真机部署动作块长度
--action_steps 16;R1-Pro 部署额外开model_weights_to_bf16=true、use_torch_compile=true、attn_implementation=sdpa。 - 控制频率 / 端到端推理延迟(FPS/Hz):论文与代码仓库均未给出具体数值(前代 G0Tiny 250M 曾披露 R1 Pro Orin 边缘端 TensorRT 推理达 10Hz,但 G0.5 本身未给出对应数字)。
- 模型体积:每个 G0.5 checkpoint 约 11GB,动作 tokenizer 共享文件
action_tokenizer.pt约 484MB,Qwen3.5-2B 处理器约 22MB。 - 多 GPU 微调:
scripts/run/finetune.sh用 torchrun 数据并行(每卡完整模型副本,非模型并行);多机由WORLD_SIZE/RANK/MASTER_ADDR/MASTER_PORT控制。
评测 benchmark
论文覆盖 7 个独立评测场景,全部数字取自技术报告正文表格:
DROID 零样本(Franka Research 3 + Robotiq 2F-85,10 个台面任务/8 种场景设置,无该机器人专属微调):G0.5 平均 82.5%,对比 π0.5-DROID 57.5%(+25.0pt)、MolmoAct2-DROID 52.0%(+30.5pt),10 个任务全部领先。白色半透明抽屉柜体因视觉对比度低是薄弱点(无标记时 towel-insertion 仅 60%,加高对比度标记后升到 100%)。
LIBERO(Spatial/Object/Goal/Long 四套件,各 10 任务×50 条示范,50 次 rollout/任务):G0.5 平均 98.9%(Spatial 98.4 / Object 100.0 / Goal 98.6 / Long 98.6),对比 π0 94.4、GR00T-N1.7 97.0、OpenVLA-OFT 97.1、π0.5 96.9、EO-1 98.4、Xiaomi-Robotics-0 98.7——G0.5 总分最高,Long 套件(长程操作)尤其领先。
RoboTwin 2.0(双臂协调操作,clean+randomized 场景各 100 次/任务):G0.5 93.3%(Clean 93.7 / Rand. 92.8),对比 π0 62.2、π0.5 79.8、StarVLA 88.3、Fast-WAM 91.8、LingBot-VA 92.2。
SimplerEnv-Bridge(WidowX,4 个 Bridge 风格任务,120 次评测/任务):G0.5 87.3%(Put Spoon on Towel 97.5 / Put Carrot on Plate 75.0 / Stack Green on Yellow Block 83.3 / Put Eggplant in Basket 93.3),对比 π0.5 57.1、GR00T-N1.5 61.9、MemoryVLA 71.9、Xiaomi-Robotics-0 79.2。
BEHAVIOR-1K Challenge(R1-Pro,50 个家庭长程移动操作任务,10 instance/任务,Task Success Score 为排名指标):RLC 冠军方案(4 个 checkpoint 集成)0.2605,Comet 亚军 0.1830,π0.5(4 epoch)0.2626,G0.5(1 epoch)0.2904,G0.5(4 epoch)0.3136。G0.5 单 checkpoint 训 1 epoch 即超过 π0.5 训 4 epoch +10.6%,训 4 epoch 优势扩大到 +19.4%;相对冠军方案 4-checkpoint 集成,G0.5 单 checkpoint 1 epoch 已领先 +11.5%,4 epoch 领先 +20.4%。G0.5 在 50 个任务中 29 个(58%)领先,π0.5 领先 15 个(30%),6 个相当。G0.5 在移动+操作交织的长程任务上优势明显(moving boxes to storage +0.35、picking up trash +0.30、loading the car +0.28),在预训练数据里欠采样的电器/柜体交互任务上落后(make microwave popcorn 0.55 vs π0.5 的 0.95;cook hot dogs 从 1-epoch 的 0.45 追到 4-epoch 的 0.90,逼近 π0.5 的 0.93)。
真机 R1-Lite/R1-Pro 微调(16×H20 GPU 对齐算力,六个任务-本体设置,各 15 episode):G0.5 平均成功率 76.7% / 过程分 129.2,对比 π0.5 53.3%/105.2、GR00T-N1.7 24.4%/68.9;6 项设置中 5 项 G0.5 领先,唯一例外是 R1-Pro box transfer and stacking(π0.5 93.3% vs G0.5 80.0%,过程分 148.0 vs 142.5 接近)。两本体共有的 towel/carton folding 四个组合上,G0.5 平均 75.0% vs π0.5 43.3% vs GR00T-N1.7 13.3%。按本体拆分:R1-Pro 75.6%/124.5,R1-Lite 77.8%/133.8。
Pick-and-Place Benchmark(PP Bench,自建):64 类物体 + 3 类容器,每次试验 16 个随机摆放物体/容器,分别报告语言遵循率与任务成功率。零样本(无 PP 专属后训练):语言遵循 65.6%,任务成功 59.4%。1H/10H/50H 后训练:语言遵循 62.5%/71.9%/84.4%,任务成功 57.8%/65.6%/75.0%。50H 设置下 G0.5 比 π0.5(68.8%/65.6%)高 15.6pt(语言遵循)/ 9.4pt(任务成功)。引用上下文消融(50H):仅物体名 84.4%/75.0%,+ 文本框坐标 85.9%/76.6%(无提升),+ 目标物体裁剪视觉 98.4%/84.4%(显著提升,尤其解决长尾物体视觉歧义)。
CoT × 动作头零样本探针(单一冻结 checkpoint,仅切换推理配置):PP Bench(单阶段)上 CoT 对 AR 语言遵循几乎无影响(65.6→67.2,+1.6pt),FM 59.4→60.9;但在自建的 Air Fryer / Cook Bacon 两个未见过的五阶段长程任务上(各 5 次 rollout),AR 进度分从 2.4→3.8(Air Fryer)、1.5→3.4(Bacon)随 CoT 开启显著提升,FM 头提升幅度小得多(Air Fryer 2.1→2.7,Bacon 1.2→2.0);语言遵循率同向(Air Fryer AR 72 vs FM 48,Bacon AR 64 vs FM 44)。人工评分 CoT 正确率约 PP Bench 90%、Air Fryer 85%、Bacon 80%,AR/FM 间无系统性差异——说明进度分差距来自解码接口本身(AR 动作 token 与 CoT 同流可直接 attend),而非推理内容质量。
创新点与影响
贡献:(1) 提出可学习的跨本体动作编解码器(学习式 RVQ + 结构化分组 + 时序对比目标),替代 FAST 类固定 DCT 管线,让自回归 VLA 能扩展到多本体、开放词汇任务;(2) 把思维链做成自回归训练的原生组件而非外挂/训练期辅助目标——四类推理原语共享解码器、上下文与目标,且推理期可任意开关组合;(3) 论证”涌现的 prompt 驱动行为控制”——因为推理与动作共享权重,prompt 措辞(副词修饰、空间线索、近义动词替换)能直接影响物理执行,这是 VLM-as-Encoder 架构结构性做不到的(作者仅在两个未见任务上做了小样本定性观察,未做系统研究)。
改变了什么:三组证据共同指向”自回归路线的优势是结构性的,不是偶然的”——① PP Bench 上零样本语言遵循率已超过后训练过的 π0.5,说明 AR 动作监督是在保护而非损害 VLM 的指令遵循能力;② BEHAVIOR-1K 上单 checkpoint 训 1 epoch 即超过 π0.5 训 4 epoch 和 4-checkpoint 冠军方案,说明预训练表征自带通用移动操作先验;③ 在算力对齐、协议一致的 R1-Lite/R1-Pro 真机微调下同样击败 π0.5 与 GR00T-N1.7,说明优势不是训练预算差异带来的假象。
作者自陈局限:抽屉插入/半透明柜体任务上两个 G0.5 变体都偏弱,说明感知瓶颈不是纯靠自回归就能解决的;视觉记忆只覆盖几秒历史,长程记忆仍是开放问题;统一动作空间里下肢驱动已表示但本工作未单独评测;prompt 级可控性目前只是初步探针观察,缺系统研究。
原始链接
- 项目页 / 技术博客:https://opengalaxea.github.io/G05/
- 技术报告 PDF:https://opengalaxea.github.io/G05/Galaxea_G0_5.pdf
- GitHub:https://github.com/OpenGalaxea/GalaxeaVLA
- Hugging Face(模型权重):https://huggingface.co/OpenGalaxea/G05
- 官方网站:https://galaxea-dynamics.com/
一手源存档(sources/)
- galaxea-g0-5—blog — 项目页/技术博客快照(sources/embodied/2026/galaxea-g0-5—blog.md)
- galaxea-g0-5—github-readme — GitHub README 快照(sources/embodied/2026/galaxea-g0-5—github-readme.md)
- 技术报告 PDF(https://opengalaxea.github.io/G05/Galaxea_G0_5.pdf,全文 PDF 不入 git,正文数字均取自该 PDF)