一句话定位
Dyna Robotics(美国创业公司)用一个「奖励模型(RM)在环」的训练闭环,把一个双臂 VLA 打磨成可在真实商用场景连续 24 小时自主运行、零人工介入的折叠餐巾模型 DYNA-1,官方宣称在 24 小时压力测试中折叠 850+ 份餐巾、成功率 99.4%、达到人类速度约 60%;全部披露只见于官方博客与客户案例,没有配套论文或开源权重。
背景与定位
2024 年前后 VLA(Vision-Language-Action)范式(π0.5、Helix、GR-3 等)已证明单次演示级别的操作成功率可以做得很高,但 Dyna Robotics 指出行业共同的短板在于长时间连续自主运行:常规「更大模型 + 更多数据」的 VLA 在高难度灵巧操作上单次 episode 成功率仍停在约 80%,且运行 30 分钟以上后容易漂入无法恢复的失败状态——这正是商用场景(无人值守、按班次计费)真正需要解决的问题,而不是单次 demo 的成功率。
DYNA-1(Dynamism v1)是该公司给出的答案:不追求更大的基座或更多样的数据,而是围绕一个**可扩展的机器人奖励模型(reward model, RM)**构建「RM-in-the-loop」训练闭环,用它驱动自主探索、错误恢复和数据自动分段/打标,从而把同一个 VLA policy 从”能成功一次但 5 分钟后就崩”逐步打磨到”连续 24+ 小时高质量运行”。公司将其市场定位为”首个 99%+ 成功率的 VLA”和”首个商用级别(commercial-grade)自主灵巧操作系统”,此后陆续以博客形式披露了跨环境泛化版本 DYNA-1i(2025-12,见下「模型架构」「数据」节)与零样本灵巧基座模型的预训练进展(2025-11)。Dyna Robotics 由前 Caper AI(2021 年以 3.5 亿美元被 Instacart 收购)联合创始人 Lindon Gao 于 2024 年创立,2025 年 9 月完成 1.2 亿美元 A 轮融资。
模型架构
官方博客未披露 DYNA-1 policy 的具体骨干网络(VLM 型号、参数量、动作头形式如离散 token / 连续 / diffusion / flow)、也未提供论文或模型卡,只笼统称其为 “Vision-Language-Action (VLA) 模型”,并明确其”内部 VLA baseline”与 DYNA-1 共享同一类底层架构,DYNA-1 的优势并非架构创新,而在于训练闭环。可确认的架构/系统组件包括:
- 策略模型(policy):VLA,具体骨干、参数规模、输入分辨率、控制频率均未披露。
- 奖励模型(reward model, RM):官方称”首个可扩展的机器人基础奖励模型(scalable foundation reward model for robotics)“,能对复杂灵巧任务(餐巾折叠)给出细粒度的任务进度估计;其网络结构、训练数据、监督信号来源未披露。RM 被用于三处:(1) 自主探索(引导 policy 探索动作空间寻找有效策略)、(2) 有意错误恢复(识别错误并自主纠正)、(3) 高质量数据自动生成与筛选。
- 流式数据自动分段(auto-segmentation):由于连续部署下机器人数据没有天然的 episode 边界,官方开发了一套方法自动切分数据流并给出进度估计与子任务打标,用于提升模型对任务结构的理解,具体算法未披露。
- 硬件平台:博客与后续 CoRL 展示提到公司自研双臂机器人平台 “Dynasaur”,具体自由度、传感器配置(相机数量/位置、力反馈等)未披露。
- DYNA-1i(2025-12 跟进版本):在 DYNA-1 基础上改进跨环境泛化能力的版本,训练配方细节同样未披露,只披露其训练数据量级(见下)。
- 基座预训练模型(2025-11 跟进披露):官方称”最新基座模型”已能在完全没有任务后训练(post-training)的情况下、在从未见过的环境中执行洗衣折叠、包裹分拣等多种灵巧任务,行为”完全来自预训练,无需任务特定微调或环境特定数据”;架构细节同样未披露。
数据
官方博客未给出预训练数据总规模(小时数/episode 数/token 数均未披露),只披露了若干相对量级和迭代节奏:
- 餐巾折叠任务打磨节奏(RM-in-the-loop 迭代 6 周):第 1 周基座模型能完成单次成功但 5 分钟内崩溃;第 2 周可无人值守运行 1 小时但复合误差导致无法恢复;第 3 周可运行 8 小时但每小时仅完成 6-7 份(约 10 分钟/份);第 4 周首次跑满 24 小时但仅约 200 份、质量与速度都低;第 5 周 24+ 小时约 350 份、质量达到”过得去的商用级”;第 6 周 24+ 小时约 800 份、高商用级质量。
- 杯装任务(cup-filling)跨任务迁移:仅用了”完整训练数据集的 0.7%“,从任务发现到模型验证只用了 2 周,即可让 DYNA-1 走完任务全流程(内部 baseline 无法迈出第一步)——用于说明技能间正向迁移。
- DYNA-1i 跨环境泛化数据:官方强调训练配方”数据高效”,跨环境泛化的后训练数据仅为”几十小时(tens of hours)“,且全部在自家办公室内的”少数几个(a handful of)“机器人工位采集,之后即可零样本泛化到办公室大厅、停车场、CoRL 展会现场等此前完全未见过的场景。官方对比称,典型 VLA 的跨环境泛化通常需要在几十甚至几百个不同环境中采集数据。
- 零样本灵巧基座模型(2025-11 跟进):在洗衣折叠、包裹分拣等任务上做到零样本执行;在杯子堆叠、芹菜切段、早餐制作、桌垫准备等挑战性新任务上,仅用约 1 小时演示数据微调即可达到”约 100% 成功率”。
- 真实客户部署数据(Monster Laundry 案例,非训练数据但反映数据规模):部署 3 个月内为 10 个不同客户折叠超过 20 万件衣物。
- 所有数字均来自官方博客/客户案例的口径披露,具体数据来源(真人遥操 teleop / 自主探索采集 / 仿真)、混合配比、动作标注方式均未披露。
训练方法
官方未给出损失函数、多阶段训练的具体超参或蒸馏细节,披露的是训练范式:
- RM-in-the-loop 闭环:核心训练目标不是单纯模仿学习(imitation learning)成功率最大化,而是用奖励模型持续给 policy 的每次真实部署经验打分(不止”是否成功”,还包括鲁棒性与速度),驱动策略在真实/自主运行中探索、纠错、并回收高质量数据用于继续训练——本质是一个自举式(bootstrapping)的在线数据飞轮:部署 → RM 打分 → 筛选/分段 → 回流训练 → 再部署。
- 质量分级监督:官方设定 1-5 分的人工质量评分体系,明确区分”成功”(grade ≥3,达 98%)与”商用级质量”(grade ≥4,仅 75%),差距可小至折叠首道工序上不到 1/3 英寸的精度差异;这一细粒度质量信号被用作训练/评估的额外监督维度,而不仅仅是二元成功/失败。
- 跨任务/跨环境微调:DYNA-1i 通过在少量新环境采集的后训练数据上继续训练获得跨环境泛化能力;预训练基座模型则通过约 1 小时演示数据的微调即可在新任务上达到高成功率,暗示预训练阶段已经学到足够通用的灵巧操作先验。
- 强化学习算法细节、动作 token 化方式、蒸馏流程均未披露。
Infra(训练 / 推理工程)
官方博客未披露任何训练侧基础设施数字(GPU 型号/数量、GPU-hours、并行策略、精度)。推理侧信息:
- 训练/推理 GPU 数量、GPU-hours:未披露。
- 推理控制频率、延迟、边缘硬件:未披露。
- 唯一可推算的运行时性能是端到端任务吞吐:餐巾折叠 24 小时 850+ 份(约合每小时 35 份,约人类速度 60%);DYNA-1i 洗衣折叠约 40 件/小时(seen 与 unseen 环境一致);官方称内部”每周运行数百个模型变体的离线/在线评测”,具体评测集群规模未披露。
- 商业化部署侧:官方以 Robots-as-a-Service(RaaS)订阅模式交付,客户侧不涉及自建计算集群;官方在融资博客中提到整机全生命周期总拥有成本(TCO,含硬件、维护、停机)须低于约 5 万美元的门槛,否则人工仍更便宜——这是产品工程约束而非训练 infra 数字。
评测 benchmark
官方没有使用任何公开学术 benchmark(如 LIBERO、RoboCasa、SimplerEnv 等),全部评测数字来自自建真实世界压力测试与真实客户部署,且未见与其他命名 VLA baseline(如 π0、OpenVLA、RT-2)的直接量化对比表格,只以”内部 VLA baseline”泛指对照组:
| 评测 | 条件 | 结果 |
|---|---|---|
| 餐巾折叠 24 小时压力测试(DYNA-1,官方博客) | 连续 24 小时、真实摆盘环境 | 850+ 份完成、成功率 99.4%、零人工介入、速度约人类 60% |
| 折叠质量分级(DYNA-1,官方博客) | 1-5 分人工评分 | 98% 达到 grade≥3(近乎完美);仅 75% 达到 grade≥4-5(商用级) |
| 洗衣折叠跨环境泛化(DYNA-1i,2025-12 博客) | 30 分钟连续试验,seen(办公室)vs unseen(大厅/停车场/CoRL) | seen:22 件/30min(约 40/hr,质量约≥3);unseen:20 件/30min(约 40/hr,质量约≥3)——两者基本持平 |
| 新任务少样本微调(预训练基座,2025-11 博客) | 杯子堆叠/芹菜切段/早餐制作/桌垫准备,约 1 小时演示数据 | 约 100% 成功率(官方口径,无独立第三方验证) |
| 真实客户部署(Monster Laundry 案例,2025-10) | 3 个月、10 个客户、商用洗衣店 | 20 万+ 件衣物、质量验收率 99%、商业订单容量 +25%、门店客流 +15% |
官方明确说明这些数字均来自自评/客户口径,没有独立第三方复现或标准学术 benchmark 数字。
创新点与影响
贡献:DYNA-1 把行业关注点从”单次演示成功率”转向”可连续无人值守运行的商用可靠性”,并给出一个具体、可复现的产品化路径——奖励模型驱动的自举式训练闭环,而非单纯堆更大模型或更多数据。其客户案例(Monster Laundry)提供了少见的、附带真实营收/运营指标(订单容量、客流、质量验收率)的商用部署证据,而非纯研究环境的 demo。后续两次博客更新(DYNA-1i 的数据高效跨环境泛化、预训练基座的零样本灵巧能力)显示公司把研究重心逐步从”单任务打磨到商用级”转向”预训练阶段本身产出通用灵巧先验”。
官方自述的局限:
- 官方明确承认 DYNA-1 本身(初版)“在未出现在训练数据中的环境部署时仍会性能下降”,需要 DYNA-1i 的后续改进来解决——即最初版本并不具备开箱即用的跨环境泛化能力。
- 杯装(cup-filling)任务官方明确写”尚未完美(not perfect yet)“,只是好于内部 baseline。
- 折叠质量层面官方自己指出成功率高(98%)与商用级质量(75%)之间存在明显落差,说明”成功”不等于”达标”。
- 全部结果均无第三方论文/独立评测复现,也没有公开权重或代码,其数字口径(如”人类速度 60%“如何测量、“内部 VLA baseline”具体是什么模型)不可外部审计。
原始链接
- 官方研究博客(DYNA-1 首发):https://www.dyna.co/research/dyna-1
- 官方研究博客(DYNA-1i 跨环境泛化,2025-12):https://www.dyna.co/research/open-world-dexterity
- 官方研究博客(预训练进展,2025-11):https://www.dyna.co/research/pre-training
- 官方公司主页:https://www.dyna.co/
- 客户案例(Monster Laundry,2025-10):https://www.dyna.co/blog/monster-laundry
- A 轮融资博客(公司背景与第一性原理,2025-09):https://www.dyna.co/blog/dyna-robotics-closes-120m-series-a
一手源存档(sources/)
- dyna-1—blog.md — DYNA-1 首发研究博客全文(2025-06)
- dyna-1—open-world-dexterity-blog.md — DYNA-1i 跨环境泛化博客全文(2025-12)
- dyna-1—pretraining-blog.md — 预训练基座零样本灵巧进展博客全文(2025-11)
- dyna-1—series-a-blog.md — A 轮融资博客全文,含公司背景与第一性原理(2025-09)
- dyna-1—monster-laundry-case-study.md — 真实客户部署案例全文(2025-10)