一句话定位
上海 AI Lab(Intern Robotics)的双系统 VLA:System2(Qwen2.5-VL-3B)先在 230 万条空间定位数据(点/框/轨迹)上做定位预训练,再用一段插在指令后的”空间提示”文本显式激活这份能力去指导 System1(DiT + 扩散策略动作头),使 SimplerEnv WidowX/Google-Robot 与 LIBERO 相对无空间引导的自身消融版本分别提升 17%/14.6%/4.3%。
背景与定位
InternVLA-M1 属于”双系统 VLA”谱系(System2 慢速语言/空间推理 + System1 快速动作执行),与 groot-n1-5 等工作同属一类范式,但切入点不同:GR00T N1.5 靠冻结语言塔 + FLARE 世界建模目标防止微调冲掉语言能力;InternVLA-M1 则把”空间定位”单列为连接指令与动作的显式中间层——用点/框/轨迹的 QA 式监督先把 VLM 训成一个空间定位专家,再在动作后训练阶段用一句插入指令末尾的”空间提示”(如”先想清楚怎么执行,再定位需要的关键物体”)把这份能力显式唤出,条件化给动作专家,而不是依赖模型在动作微调后自发保留空间理解。
论文将相关工作归为三类范式并将自己定位为”双系统”一支:(1) 单体 VLA(RT-2、OpenVLA、Magma 等直接把多模态输入映射到动作 token);(2) 统一双系统架构(π0、CogACT 等用 LLM/VLM 做高层语言指令分解再驱动生成式动作头,本文属于此类的延伸);(3) 世界模型范式(学习环境动力学做规划,如 GR00T N1.5 的 FLARE)。作者强调 InternVLA-M1 的独特之处在于”统一潜空间建模框架”——把空间引导直接整合进下游动作训练的端到端优化,而非依赖推理时生成显式文本/视觉中间表示(如 ECOT、RT-H 等做法),因此没有额外推理时开销。
数据合成侧复用了同实验室的 genmanip + Isaac Sim 仿真流水线来批量生产带空间标注(框/点/2D 末端执行器轨迹)的动作数据集 InternData-M1。GitHub 仓库还注明后续投稿版本为 ICLR 2026 论文《ST4VLA: Spatially Guided Training for Vision-Language-Action Models》(作者含 Jinhui Ye 等具名作者),应是本报告工作的会议评审版本,二者共享同一份空间引导训练配方。
模型架构
双系统(Dual-System)
- System 2(VLM Planner,慢速推理):Qwen2.5-VL-3B-Instruct 作为多模态编码器,负责捕捉空间先验。
- System 1(Action Expert,快速执行):扩散策略(diffusion policy,86M 参数)构成的 DiT 动作头;视觉侧用 DINOv2 编码器(21M 参数)+ 轻量状态编码器(0.4M 参数),组成一个紧凑的视觉-动作模型。
- 全模型合计约 4.1B 参数。
潜在规划的空间提示连接(Latent planning via spatial prompting)
- 用一个轻量 querying transformer(8.7MB)连接 VLM Planner 与 Action Expert:它是一个 k 层交叉注意力模块,可学习的固定数量 query token 去注意 VLM 的 k 个中间层(如 k=1 时只取最后一层),把变长输入 token 映射为定长 query,稳定动作专家的训练与推理。
- 空间提示(spatial prompting):在任务指令后追加一句辅助提示(例如”Figure out how to execute it, then locate the key object needed.“),显式激活预训练阶段学到的空间感知能力,为规划器提供更可靠的空间线索。
- 梯度衰减:为防止动作梯度直接回传扭曲 VLM 已学到的多模态知识(参考 π0.5、GR00T N1.5 等工作的教训),在 querying transformer 中引入梯度衰减因子(如 0.5),减弱从 Action Expert 传回 VLM 的梯度,兼顾语义推理保留与联合优化效果。
双监督(Dual-Supervision):每个训练 step 同时处理多模态数据 batch 和动作数据 batch,两路损失求和后做一次优化更新——VLM Planner 用真实+合成的空间定位数据(目标检测、可供性识别、视觉轨迹规划)对齐,Action Expert 用机器人示范数据学习具体的 embodiment 控制。
推理:单张 RTX 4090(约 12GB 显存)即可运行;配合 FlashAttention,VLM 部分推理速度约 10 FPS;动作执行可通过 action chunking 和 KV cache 进一步加速。
数据
预训练阶段(VLM 空间定位)总计 300 万+ 多模态样本,其中 230 万+ 为空间推理数据,分四类:
- General QA(约 63.7 万):采自 LLaVA-OneVision、InternVL3,覆盖图像描述、VQA、OCR、知识问答、创意写作。
- Box QA(约 87.9 万):RefCOCO、ASv2、COCO-ReM(经 InternVL3 整理)+ 本文合成的 InternData-M1 + 机器人专用的 RoboRefIt。
- Trajectory QA(约 68.4 万):A0 ManiSkill 子集(小物体随机械臂夹爪协同运动的轨迹,可近似为末端执行器运动)+ InternData-M1 路径点数据 + MolmoAct 数据集。
- Point QA(约 83.2 万):Pixmo-Points(过滤分辨率>1024px 的图像,每图最多保留 10 个点)、RoboPoint、RefSpatial、InternData-M1 点子集(优先抽取物体/区域指代数据以提升定位精度)。
- 所有点坐标统一转换为绝对坐标,预测坐标以 JSON/XML 格式输出。
合成数据引擎(Scalable Synthetic Data Engine):基于 genmanip + Isaac Sim 搭建全自动仿真流水线。
- 场景图求解器随机生成物体布局,基于物体网格计算候选抓取;每条候选轨迹在物理引擎中执行一次做闭环验证,场景图校验器确认任务目标达成,只保留物理可行且任务完整的轨迹。
- 规划与渲染解耦:规划器只记录关节状态、物体位姿、动作等结构化场景/轨迹数据,渲染器之后在随机化光照、材质、视角下重放,同时输出物体边界框、2D 末端执行器轨迹等中间信号,作为空间定位/可供性推理/轨迹预测的密集监督。
- 用 ArUco 标记标定相机内外参,使仿真视角几何与真实相机保持一致。
- 资产库规模:1.4 万个标注物体、211 张桌子、1600 种材质纹理、87 个穹顶光照(dome light)。
- 产出的 InternData-M1 数据集共 24.4 万条闭环样本(pick-and-place),复用与 InternVLA-M1-Interface Data 相同的物体集与位置分布,并引入随机化光照/纹理增强视觉多样性。
下游微调 / 真机数据:
- SimplerEnv:在 Open-X Embodiment 子集(
fractal_rt_1+bridge_v1)上后训练,同时与空间定位数据协同训练(co-train)。 - 200 任务大规模仿真 pick-and-place(Isaac-Sim):200 个物体互不相同的任务,含背景物体覆盖 3000+ 件物品/容器;每任务额外采集 5 条相同物体集但随机布局的轨迹用于后训练。
- 真实世界杂乱场景 pick-and-place:Franka Research 3 + Robotiq 2F-85 夹爪,60×90cm 工作台,23 个可见物体 + 5 个可见容器,采集 6 小时遥操作示范;对比”w/o co-train”(仅真机数据微调)与”w/ co-train”(真机数据 + InternData-M1 联合训练)。
- 长时程/推理任务:采集 22 小时高质量长时程与推理遥操作示范(约每任务 500 条演示),覆盖 5 类任务(见下);每条轨迹按子任务切分并标注对应原子动作,子任务片段间插入零动作向量 padding 帮助模型识别子任务完成/切换时机。
训练方法
两阶段 + 一个衔接期(Post-Pre-Training)的空间引导训练配方:
- Stage 1:空间定位预训练 —— 只优化 VLM,把所有机器人相关数据集统一重构为 QA 格式(框检测、轨迹预测、可供性识别、思维链推理),与网络规模数据对齐后用标准 SFT next-token prediction 训练。
- Post-Pre-Training(衔接阶段) —— 用 InternData-M1 的 24.4 万条合成 pick-and-place 闭环样本初始化动作头,让 Action Expert 在进入具体下游任务微调前先学到基础动作表征,弥合 VLM 预训练与 VLA 动作学习之间的鸿沟。
- Stage 2:空间引导的动作后训练 —— VLM 与 Action Expert 联合优化,两种策略并用:
- 空间提示:动作预测前在指令末尾插入空间线索提示(如”识别所有相关玩具及其与容器的空间关系”),VLM 不显式输出对该提示的回答,但提示的存在能提升空间感知与泛化。
- 与空间定位数据协同训练:训练在机器人轨迹数据与定位数据间交替;轨迹数据上 VLM 主干和 Action Expert 都用预测噪声与真值噪声的 L2 损失优化(扩散/流匹配式目标),定位数据上只用 next-token prediction 更新 VLM 主干。
动作建模:连续扩散策略(DiT 结构),非离散 token 化;SimplerEnv/200-任务仿真/真机实验统一采用 action chunk(分别为 16 或 8)。
关键消融证据(Projection-space Similarity,PSS):用 SVD 计算空间定位目标与动作目标之间的梯度子空间相似度——朴素协同训练(vanilla co-train,无空间提示引导)PSS 仅 0.25,而本文的空间引导训练把 PSS 提升到 0.42,对应空间感知能力保留更好、动作任务收敛更快(RefCOCO-g IoU@0.5 与 SimplerEnv-WidowX 成功率同步提升,见 Table 3/Figure 5)。
Infra(训练 / 推理工程)
- SimplerEnv 微调:16×NVIDIA A100,50K 步(约 2.5 epoch),batch size 256(机器人数据)/ 64(多模态数据),两路损失求和优化。
- LIBERO 微调:8×A100,batch size 128,action chunk 8,约 30K 步、耗时约 20 小时;每个任务套件独立微调,评测 500 次试验/套件。
- 200 任务仿真 pick-and-place:16×A100,batch size 256,action chunk 16,20K 步;delta joint space 控制;两路 224×224 RGB 输入。
- 真实世界杂乱场景 pick-and-place:16×A100,batch size 256,action chunk 16,20K 步;delta end-effector 控制;两路 224×224 RGB 输入。
- 长时程/推理真机任务:训练配方沿用短时程真机 pick-and-place(未单独披露额外 GPU 配置)。
- 推理:单张 RTX 4090(约 12GB 显存);FlashAttention 下 VLM 部分约 10 FPS;动作侧可用 chunking + KV cache 进一步加速(具体加速后 Hz 未披露)。
- 论文未披露具体的总 GPU-hours 或训练精度(bf16/fp16 等)配置。
评测 benchmark
SimplerEnv Google-Robot(Table 1):InternVLA-M1 平均 SR:Visual Matching 80.7、Variant Aggregation 76.0。对比 Vanilla VLA(同架构、无空间引导,Qwen2.5-VL-3B+DiT):VM 66.1→80.7(Δ+14.6),VA 63.5→76.0(Δ+12.5)。对比此前最强开源基线(VM 上 SpatialVLA 75.1、VA 上 SpatialVLA 70.7),论文正文称领先”5.9%(VM)/5.3%(VA)“(VA 与 76.0-70.7=5.3 吻合;VM 与逐项相减的 75.1→80.7=5.6 略有出入,应为原文四舍五入或对比口径差异)。其余基线:CogACT VM 74.8/VA 61.3,π0 VM 58.8/VA 54.8,π0-FAST VM 61.9/VA 59.0,GR00T N1.5 VM 35.2/VA 44.5,Magma(co-train)VM 52.9/VA 51.6。
SimplerEnv WidowX(Table 2):InternVLA-M1 平均 SR 71.7(Put Spoon on Towel 87.5、Put Carrot on Plate 67.9、Stack Green on Yellow Block 31.3、Put Eggplant in Basket 100.0)。对比 Vanilla VLA 54.7(Δ+17.0);对比此前最强基线 GR00T N1.5 61.9,领先 +9.8。其余基线:CogACT 51.3,SpatialVLA 42.7,π0 27.1,π0-FAST 48.3,Octo-Base 17.5,OpenVLA 4.2。
LIBERO(Franka,Table 4,各套件 500 次试验):InternVLA-M1 平均 95.9(Spatial 98.0、Object 99.0、Goal 93.8、Long 92.6)。对比 Vanilla VLA 91.6(Δ+4.3);对比此前最强基线 π0.5-KI 94.3(Long 项 85.8),InternVLA-M1 在 Long 项 92.6 领先明显。其余基线:GR00T N1 93.9,π0 94.2,π0-FAST 85.5,SpatialVLA 78.1,CoT-VLA 83.9,OpenVLA 76.5。
训练策略消融(Table 3,多模态理解 + 空间定位 + 机器人操作三线对比):
| 指标 | Vanilla VLA | Vanilla co-train | InternVLA-M1 |
|---|---|---|---|
| MME | - | 1106 | 1411 |
| MMVet | - | 19.2 | 23.3 |
| TextVQA | - | 20.5 | 28.6 |
| POPE | - | 78.0 | 86.2 |
| COCO Caption BLEU/ROUGE | - | 10.4/15.1 | 13.0/13.4 |
| RefCOCO-g Box IoU@0.5 | - | 47.1 | 71.2 |
| Refit-testB Box IoU@0.5 | - | 66.7 | 74.3 |
| Where2place Point Acc | - | 21.4 | 25.5 |
| A0-maniskill Traj. MAE↓ | - | 6.4 | 5.1 |
| Google-Robot VM/VA | 66.1/63.5 | 70.2/66.5 | 80.7/76.0 |
| WidowX | 54.7 | 61.1 | 71.7 |
200 任务大规模仿真 pick-and-place:四种泛化设置(In-distribution、Unseen Object、New Background、Unseen Instruction)下,“w/ mid-train”(先用 InternData-M1 做 Post-Pre-Training 再微调)版本相对 GR00T N1.5 平均提升 +6.2%(具体各设置数值仅见 Figure 7,正文未列表格)。
真实世界杂乱场景 pick-and-place:5 种设置(In-Distribution、Unseen Objects、Unseen Position、Unseen Orientation、Unseen Instructions),每模型 300 次 rollout。正文给出的聚合数字:整体相对基线提升 +7.3%;引入 InternData-M1 协同训练后在未见物体/新布局上提升 +20.6%(各设置逐项数值仅见 Figure 10,未列表格)。
VLM Planner 任务调度能力(Table 5,长时程/推理型任务的子任务规划准确率,非最终机器人成功率):
| 模型 | Sort into Drawers | Make Sandwiches | Desktop Sorting | Math | Goods Purchase |
|---|---|---|---|---|---|
| Gemini-2.5 Pro | 57 | 62 | 83 | 53 | 61 |
| GPT-5 | 75 | 67 | 62 | 79 | 82 |
| GPT-4o | 37 | 57 | 35 | 39 | 41 |
| Qwen2.5-VL-72B | 31 | 71 | 34 | 33 | 29 |
| Qwen2.5-VL-3B | 30 | 49 | 52 | 41 | 38 |
| Ours-3B(InternVLA-M1) | 90 | 91 | 91 | 93 | 92 |
即:仅 3B 参数、经过任务规划+动作联合后训练的统一模型,在子任务调度准确率上全面超过 GPT-5、Gemini-2.5-Pro、GPT-4o 等更大规模的通用 VLM。真机长时程任务执行(含物理干扰、任务重规划场景)的具体成功率仅见 Figure 12,正文摘要称”长时程推理密集场景下超越已有工作 10% 以上”。
创新点与影响
- 把”空间定位”作为连接语言指令与动作执行的显式中间层,用点/框/轨迹 QA 数据先训练 VLM 成为空间定位专家,再用文本形式的”空间提示”在动作后训练阶段把这份能力显式唤出并条件化给动作头,无需在推理时生成额外的显式中间表示(区别于 ECOT、RT-H 等生成式规划做法),不增加推理开销。
- 用 PSS(梯度子空间相似度)证实了”空间提示”式协同训练相比朴素联合训练能显著提升定位与动作两个目标的优化一致性(0.25→0.42),并同时保留了多模态理解能力(MME/MMVet/TextVQA/POPE 全面优于朴素联合训练)——为”VLA 微调会牺牲预训练多模态能力”这一常见问题提供了一种缓解方案。
- 复用/搭建了物理与渲染解耦的可扩展仿真数据引擎(基于 genmanip + Isaac Sim),能在生成动作轨迹的同时自动产出框/点/2D 轨迹等空间监督信号,用一套流水线同时服务 VLM 空间定位预训练和 VLA 动作学习两种数据需求。
- 证明单一 3B 统一模型(无需外挂更大 LLM 做任务规划)即可在长时程、需数值/常识推理的多步操作任务子任务调度准确率上超过 GPT-5、Gemini-2.5-Pro 等通用大模型基线。
- 论文自述局限:Discussion/Conclusion 部分未设专门的局限性小节;从消融实验的强调可以读出隐含局限——朴素联合训练(无空间提示引导)会导致空间定位能力快速退化、操作任务收敛更慢,说明该方法对训练配方(提示设计、梯度衰减系数、协同训练节奏)较为敏感,脱离这套配方的直接联合微调效果明显更差。多数细粒度对比(200 任务仿真、真机杂乱场景、长时程执行的分设置成功率)仅以图表形式给出,正文未提供逐项数值表格。
原始链接
- arXiv: https://arxiv.org/abs/2510.13778
- PDF: https://arxiv.org/pdf/2510.13778
- GitHub: https://github.com/InternRobotics/InternVLA-M1
- HF 模型: https://huggingface.co/InternRobotics/InternVLA-M1
- HF 模型合集: https://huggingface.co/collections/InternRobotics/internvla-m1-68c96eaebcb5867786ee6cf3
- HF 数据集 InternData-M1: https://huggingface.co/datasets/InternRobotics/InternData-M1
- 项目主页: https://internrobotics.github.io/internvla-m1.github.io/
一手源存档(sources/)
- internvla-m1—github-readme — GitHub README 快照(sources/embodied/2025/internvla-m1—github-readme.md)
- internvla-m1—hf-card — HuggingFace 模型卡快照(sources/embodied/2025/internvla-m1—hf-card.md)
- arXiv 原文 PDF(2510.13778),不入 git,引用见上方原始链接