一句话定位

1X Technologies(原挪威 Oslo 团队,现总部美国)面向消费家庭市场直接预售($200 定金)的人形机器人 NEO,由端到端学习的 Redwood AI 控制栈驱动,并配套自研的 1X World Model(1XWM)——2025 年 6 月发布时定位为「离线策略评测器」,2026 年 1 月演进为「视频生成即策略」的直接控制器——是「整机厂商自研 VLA + 世界模型闭环」这一路线在人形全身操作上最具体的产品化案例之一。

背景与定位

人形 VLA 赛道 2024-2025 年出现多条并行路线:把 VLM 直接接动作 token 的 figure-helix(System1/2 双系统)、groot-n1-5pi-star-0-6 等大厂/创业公司的通用策略,普遍依赖大规模遥操作/自主 rollout 数据 + 视觉-语言预训练迁移。1X 走的是另一条相对少见的路径:整机+控制栈+评测器三者都自研,且直接绑定消费级家庭场景(而非实验室 benchmark 或 B 端仓储/工厂)。

Redwood(2025-06 发布)本身是一个较标准的「VLM 编码 + 扩散策略解码」VLA,其差异化在于把 locomotion 与 manipulation 放进同一个策略联合预测(多数系统仍是导航栈 + 操作栈分离)。真正的技术焦点在 1XWM:它最早(2025-06)的定位不是策略本身,而是用视频世界模型替代昂贵的真机 A/B 评测,用于 checkpoint 选择与架构决策;这与用世界模型做 model-based RL 训练(如 Dreamer 系)或做数据增广(如 dreamgen-groot-dreams、UniPi)的思路不同,1X 强调的是「评测」这个此前少被系统化研究的子问题。到 2026-01,1X 把同一个 1XWM 直接升级为策略生成器——文本条件视频扩散模型「想象」未来帧,再用一个反向动力学模型(IDM)把想象的视频转译成动作序列执行,这一「WM+IDM」两阶段结构承袭自 NVIDIA 的 DreamGen(GR00T Dreams)与更早的 UniPi,1X 的说法是它能不依赖大规模机器人预训练数据或遥操作演示、仅靠网络视频 + 少量本体数据就泛化到未见任务。

需要说明:本页信源全部为 1X 官方博客与一份配套技术报告(非 arXiv 论文,无同行评审),confidence 标记为 low——多数量化结果(尤其 2026-01 那篇的 per-task 成功率、best-of-N 曲线)仅以交互式图表呈现在官网页面上,文本抓取无法还原精确数值,本页如实注明「图表可见、文本不可提取」而非编造读数。

模型架构

Redwood(VLA 策略,2025-06)

  • Backbone:跨具身(EVE + NEO 共用)架构——预训练语言 embedding + 预训练 ViT 出的视觉 token + 由关节位置与关节施力序列编码出的本体感觉(proprioception)embedding,三者融合后过若干 transformer block,抽出一个 latent 表征向量。
  • 动作头:该 latent 经**扩散策略(diffusion policy,沿用 Columbia diffusion-policy 范式)**解码为 EVE 或 NEO 的连续动作。
  • 认知辅助头:除动作预测外,Redwood 同时预测「NEO 双手与相关物体在图像空间中的当前位置」等「认知」辅助目标,用于在小模型尺寸下改善对未见环境的泛化。
  • 全身联合输出:单一策略同时预测手臂/手部指令、行走指令与骨盆姿态指令,实现 locomotion 与 manipulation 联合决策(如顶开重门时借助手撑墙的多接触行为)。
  • 关键配置数字160M 参数,onboard 嵌入式 GPU 上跑约 5 Hz
  • 语音接口:离板(offboard)语音-语音 LLM 从对话上下文中抽取用户意图,经 sentence encoder 转成向量,作为条件输入喂给 Redwood(Redwood 训练时见过数千条此类文本 embedding)。

Mobility RL 控制器(2025-06,locomotion 底层)

  • 两阶段结构:高层「运动学规划器」(监督学习,把摇杆方向等粗粒度指令转成人类动捕重定向出的精细运动学参考轨迹,并负责行为切换间的平滑过渡)+ 底层 RL 跟踪控制器(在仿真中以摩擦力/质量/传感器噪声等域随机化训练,追踪该运动学参考轨迹同时维持平衡)。
  • 楼梯模式纯视觉:无 ToF 深度传感器/激光雷达,直接从双目 RGB 立体像对回归深度,融合本体感觉历史判断落脚点。
  • 覆盖全向行走、侧移、坐/站/跪/地面起身、上下楼梯,统一在单一控制器内。

1XWM v1(评测器,2025-06):生成式视频模型——时序图像编码器把初始帧编入 latent 空间,动作编码器单独编码输入动作,两者共同喂入 backbone 预测未来 4 秒片段的 latent 状态,再解码出未来帧图像 + 一个状态价值(state-value)头(监督信号为按时间折扣插值出的 ±1 成功/失败标签)。在 latent 空间操作使其可跨 EVE/NEO 具身联合训练;分辨率灵活,训练用了 256×256 与 512×512 两档;先在网络规模视频上预训练,再在 1X 机器人数据上后训练。

1XWM v2(策略,2026-01):backbone 升级为 14B 参数的文本条件视频扩散模型;配一个独立的反向动力学模型(IDM)负责把 WM 生成的视频帧转译为动作——IDM 用 Depth Anything 深度骨干 + 独立的 flow-matching 头(而非单一 diffusion transformer),滑动窗口 W=8 帧,t 与 t+W 时刻的帧经深度骨干编码后作为 flow-matching 头的条件;推理时对一批初始噪声与滑动窗口做逐时刻平均以平滑轨迹。Checkpoint 选择用 IDM 还原动作序列与真实动作序列间的动态时间规整(DTW)距离作为筛选指标(而非仅看视频观感)。

硬件平台(NEO 本体):身高 5’6”,重 66 lbs;举升 154 lbs、搬运 55 lbs、单臂负载 18 lbs;双手 22×2 自由度(product spec,2025 年口径)、双臂 7×2、颈 3、脊柱 2、腿 6×2;手部速度 8.0 m/s,最大奔跑速度 6.2 m/s,行走速度 1.4 m/s;电池 842 Wh、续航 4h、每小时续航快充 6 分钟;算力芯片 1X NEO Cortex(Nvidia Jetson Thor),最高 2070 FP4 TFLOPS;双目 8.85MP 90Hz 鱼眼相机,4 麦克风波束阵列。2026-07 另发布下一代 25 自由度(22 手指/手掌 + 3 腕部)腱驱动手,5:1–15:1 低传动比实现全 25 自由度力透明/可反驱,与产品页「22×2」口径未见官方明确对账,本页两处数字均照原文如实记录。

数据

  • Redwood:训练数据为 EVE 与 NEO 在「1X 办公室 + 员工家中」采集的遥操作 + 自主 rollout 混合episode(强调「员工家庭」是为了让模型在真实家居的杂乱、非重复布局上泛化);博客未披露具体小时数/episode 数。
  • 1XWM v1(评测器)scaling 实验数据:Airfryer(NEO 任务:右手抓炸锅拉篮把手拉出→左手抓取砧板上物体放入拉篮→右手推回拉篮)、Arcade(EVE:抓取目标物投入站台开口)、Shelf(EVE:四象限货架间语言指令式取放,常需双手交接)三个任务,各自从 10% 到 100% 抽样规模做数据 scaling;跨任务迁移量化:仅 Shelf(约 2.16 亿 video token)held-out 对齐率 63.06%;加入 Arcade 语料(约 14.6 亿 video token)联合训练后对齐率提升到 71.17%
  • 数据来源消融:自主策略 rollout(尤其是其中的失败样本)被发现对提升世界模型对齐度最关键——缺失失败数据会让生成结果出现「乐观偏差」(物体自动挪到更好抓的位置、抓取半径估计错误、遮挡建模不足);人为刻意制造的遥操作失败样本因带有明显偏差,不如自主 rollout 中自然出现的失败样本有效。
  • 1XWM v2(策略)训练数据:Egocentric 人类第一视角视频 mid-training 900 小时;NEO 机器人本体数据微调 70 小时;IDM 训练用 400 小时未过滤机器人数据(含随机玩耍数据与无对应任务的动作,用于让 IDM 能跟踪 NEO 任意运动);后训练数据构成中桌面抓取放置(pick-and-place,过滤为双手入镜的桌面场景)占比高达 98.5%
  • 未披露:Redwood 与 1XWM v2 的具体 episode/帧总数、sim-vs-real 比例、精确的任务配比表。

训练方法

  • Redwood:多任务目标 = 扩散策略动作损失 + 「认知」辅助预测损失(手/物体图像空间定位)联合训练;成功 episode 同时监督动作扩散头与认知头,失败 episode 仅监督认知头(不监督动作头),以此让模型从失败交互中学习而不破坏动作分布。
  • Mobility RL:仿真域随机化 + 动捕轨迹重定向;高层运动学规划器用监督学习拟合「指令→精细运动学轨迹」的映射,替代逐方向手写 shaping reward;用该控制器对 Redwood 做了一次「带球奔跑」任务微调以验证可控性。
  • 语音:offboard 语音-语音 LLM 抽取意图 → sentence encoder 向量化 → 作为条件输入 Redwood(非端到端语音直接控制)。
  • 1XWM v1:视频+动作序列 → 预测未来 latent 状态 → 解码未来帧 + 状态价值头,价值标签由二值成功/失败经时间折扣插值获得。
  • 1XWM v2:两阶段训练——WM 先网络视频预训练,再 egocentric 人类视频 mid-training,再 NEO 本体数据微调;IDM 独立训练(两帧输入、W=8 滑窗、深度骨干+flow-matching 头),推理时用 IDM 指标 + 拒绝采样强制生成视频的运动学合理性;caption upsampling——many egocentric 数据集只有简短任务描述,用 VLM 生成更详细的描述性字幕再训练(借鉴 DALL-E 3「详细字幕提升 prompt 遵从度」的发现);探索了 best-of-N 测试时计算(对同一任务并行采样 1–8 个生成结果,挑最优执行),发现选 8 选 1 能提升任务成功率(具体数值仅见交互图表,未能从文本提取)。

Infra(训练 / 推理工程)

  • Redwood 推理:完全跑在 NEO 板载嵌入式 GPU 上,约 5 Hz 控制频率(未披露具体芯片型号/是否为同一颗 NEO Cortex Jetson Thor)。
  • Mobility RL 训练:博客描述该类基础站立/行走策略「用现成软件包 + 单张桌面 GPU,一小时内即可在仿真中训成」——这是对该技术路线通用性的描述,并非披露 NEO 最终版控制器的确切训练算力/时长。
  • 1XWM v1 训练规模:GPU 数量、GPU-hours、并行策略、精度均未披露
  • 1XWM v2 推理(明确披露):backbone 单次推理耗时 11 秒(多 GPU 推理,与 Verda 合作构建),每次推理生成 5 秒真实时长视频;IDM 从生成视频中抽取动作轨迹再耗时 1 秒。1X 自陈该延迟是当前「反应式/接触密集型任务」与长时序任务(>5 秒)的瓶颈,需要更快推理及带记忆的闭环重规划来解决漂移/部分可观测/恢复问题。
  • NEO 整机:842 Wh 电池、4 小时续航、每小时续航快充 6 分钟;1X NEO Cortex(Jetson Thor)最高 2070 FP4 TFLOPS 板载算力。
  • 训练 GPU 数量/总 GPU-hours:未披露。

评测 benchmark

  • 1XWM v1 对齐率(评测器自身准确度):Shelf-only(~2.16 亿 token)63.06% → Shelf+Arcade(~14.6 亿 Arcade token)71.17%(held-out 测试集上的成功/失败预测准确率)。
  • 评测器可靠性的核心量化主张(博客与技术报告重复强调):若两个策略间真实成功率差距为 15%,一个对齐度为 70% 的世界模型能以 90% 的准确率判断出哪个策略更优
  • 架构/checkpoint 选择案例(均在 Arcade 任务上做真机双盲 A/B 验证)
    • 是否输入本体感觉(proprioception)——1XWM 预测「+proprio 更优」,真机验证一致;
    • ViT-B vs. ViT-L 图像编码器——1XWM 预测「ViT-L 更优」,真机验证一致;
    • 四种基础架构(A–D)上比较推理时采样策略(max-confidence vs. mu-only)——四组架构上均观察到 mu-only 略优的一致小幅差距,真机验证同样成立。
  • Arcade 真机评测协议:连续跑 10 分钟,连续 3 次抓取失败或进入不可恢复状态则重置;评分 = (成功次数 − 3×重置次数 + 0.3×尝试次数) / 尝试次数,惩罚人工干预、奖励更高尝试频率;所有真机对比均为单机双盲 A/B(随机选模型跑,事后汇总)。
  • 对照的行业基线(非 1X 自身数据,技术报告引用作背景):真机自动化评测系统 AutoEval(Zhou et al. 2025)每日吞吐上限约 850 episode,且仅限固定桌面操作场景——用以说明为什么 1XWM 式离线评测有价值。
  • 1XWM v2(策略)真机成功率:对分布内(ID)/分布外(OOD) 任务各跑 30 次,报告”跨多种动作原语成功率稳定”,倒水、绘画等灵巧任务仍偏弱;精确的逐任务百分比仅以官网交互图表(“1XWM SUCCESS RATE BY TASK (±1 SE)“)呈现,文本抓取无法还原具体数值。“pull tissue” 任务的 best-of-1~8 并行生成对比同样只有图表、无可提取数字。
  • 消融真机验证(30 次/任务/变体,无测试时过滤,无盲评/checkpoint 挑选):在仅有的分布内任务「Grab chips」上,各变体表现相近;在最难任务「Scrub dish」上,只有同时具备 egocentric mid-training 与 caption upsampling 两项改进的完整版模型取得非零成功率,缺任一项的变体会误解指令。
  • 未见任何独立第三方 / 学术 benchmark(如 SimplerEnv、CALVIN 等)上的可比数字——所有结果均为 1X 自建任务集上的内部评测。

创新点与影响

  • 直接面向消费家庭市场预售的人形机器人:$200 定金开放预订,早期以「Expert Mode」(1X 员工远程监督完成模型不会的家务)弥补自主能力缺口,属于人形机器人赛道较早的直接 to-C 商业化尝试之一,而非停留在研究 demo 或 B 端试点。
  • Redwood 把 locomotion 与 manipulation 放进单一模型联合预测,官方称「是最早联合控制移动与操作的 VLA 之一」,支持顶门借力等多接触行为,是「全身控制」在量产级 VLA 上的具体实践。
  • 1X World Model 的角色演进本身就是叙事重点:2025-06 定位为「离线策略评测器」,核心贡献是把「哪个 checkpoint/架构更好」这一决策从「等真机跑几周积累统计显著样本」压缩为「世界模型秒级预测 + 70% 对齐度即可 90% 概率选对」;2026-01 直接升级为策略本身(WM 生成视频 + IDM 转译动作),呼应 DreamGen/UniPi 的「视频生成即控制」范式,并强调该路径号称不需要大规模机器人预训练数据或遥操作演示即可泛化到未见任务——如果成立,这是「世界模型作为通用策略」路线在人形全身操作尺度上少有的量化验证案例。
  • 1X 自陈的局限
    • 1XWM 对训练分布外物体(如未见过的植物)交互建模仍弱,容易产生「看起来对但违反物理」的幻觉;
    • locomotion 长时序预测因逐步位姿误差累积而不可靠,限制世界模型用于长程导航评测;
    • 单目预训练导致弱 3D grounding,真实机器人执行时常出现 under/over-shoot,即便生成视频「看起来成功」;
    • 灵巧类任务(倒水、绘画)成功率仍明显偏低;
    • v2 策略单次「想象+执行」需 12 秒(11 秒生成 + 1 秒 IDM 转译)生成 5 秒动作,被自陈为反应式/接触密集任务与长时序任务的瓶颈。
    • 本页 confidence 标记为 low:全部信源为厂商官方博客 + 一份非同行评审的配套技术报告,无 arXiv 论文、无开源代码/权重、无独立第三方复现,量化数值多数只以图表形式呈现,应作为厂商一方陈述看待。

原始链接

一手源存档(sources/)