
图片来自 humanoidsdaily.com 的相关报道,用于呈现概念方案或事件背景;当前产品尚未正式定型,不代表官方最终外观。 摄影/版权标识:humanoidsdaily.com。 来源:humanoidsdaily.com
教机器人干活,传统上要么靠人远程操控录制数据,要么让它在仿真里反复试错。Dyna Robotics走了条更‘偷懒’的路:让模型看人类视频。据公司技术报告,Dyna-2在一个包含100万小时第一人称人类操作视频的语料上预训练,先学会预测下一步画面和动作,再直接迁移到从未见过的机械臂和五指手上。客户现场测试中,它拿下87%通过率,而基于传统视觉-语言-动作架构的前代Dyna-1只有46%。换句话说,机器人可能不再需要被手把手‘喂’机器人数据,而是靠观察人类就习得物理直觉和灵巧操作。
目前能确认到哪一步
已发布并有限部署(announced):Dyna Robotics于2026年8月10日公开Dyna-2世界动作模型及技术报告,并在部分客户现场完成真实环境部署测试。当前信息主要来自厂商官方声明与媒体报道,属于公司自述,尚未经独立第三方复现或审核。
机器人数据太贵,人类视频来凑?
机器人学习的老大难是数据。通过遥操作采集的数据带动作标签、质量高,但需要人一小时一小时地物理引导机器人,成本极高。互联网上人类操作视频倒是取之不尽,可人手与机械爪的形态差异——业内常说的“具身鸿沟”——让模型很难把人类动作迁移到机器人上。Dyna-2的策略是用规模硬闯:公司把第一人称人类操作视频按相同配比切成从1000小时到100万小时的嵌套子集,分别预训练模型。
评估时,模型在39个不同的双臂操作任务上做零样本测试——也就是事先完全没见过这些机器人硬件。结果令人意外:随着人类视频数据量从1000小时增至100万小时,任务成功率单调上升,尤其在1万到10万小时之间出现了明显拐点。Dyna Robotics因此宣称首次发现人类到机器人的迁移缩放定律:只要人类视频足够多,跨本体知识会自然涌现。
不追VLA,改赌“世界动作模型”
过去一年,机器人基础模型的主流是“视觉-语言-动作”架构,也就是把大语言模型嫁接到机械控制上。Dyna-2却押注另一条路:以视频生成为核心的“世界动作模型”。预训练时,它同时预测下一帧画面和下一个动作,相当于先在脑海里推演物体怎么移动、接触力怎么产生,再输出控制指令。Dyna Robotics声称,这种设计给了机器人传统VLA模型缺乏的空间推理与接触物理直觉。
公司还拿出了与自家前代Dyna-1的对比测试。Dyna-1正是VLA路线,已在商业场景跑过一年多。在匹配训练步数和数据集的前提下,Dyna-2在剁食材、清理工作台等灵巧任务中表现更好;当外界物理扰动打断动作时,Dyna-2能自行恢复继续完成,Dyna-1则常常卡死、需要人工重置。此外,一个视频协同训练算法让指令跟随得分提升了133%。
不只发论文,客户现场先打了一架
Dyna系列并非实验室里的空想。据Dyna Robotics材料,采用Dyna-1的机器人已经在酒店、餐厅、洗衣房和健身房投入生产,能连续16小时运行,24小时无故障成功率超过99%。Dyna-2就站在这套商业底盘之上,客户现场成了它最硬的试验场。公司在发布中给出数据:Dyna-2在真实客户部署中通过率87%,而Dyna-1只有46%;用13分钟本地数据,就能教会一双五指机械手拧开瓶盖。
下一步,Dyna Robotics把目标定在1000万小时人类视频。若缩放曲线延续,数据瓶颈将从“搭建遥操作采集团队”变成“收集更多视频”,这会极大降低机器人模型扩张的成本。不过,1百万小时的成果只证明曲线存在,10倍之后是否还能保持线性增长仍是开放问题。而且这些对比全部来自厂商自测,尚未有第三方复现。Dyna-2是真颠覆还是又一次营销神话,需要真正的独立验证。
资料线索
• humanoidsdaily.com
• unite.ai
本文是基于公开页面整理的 AI 硬件情报,不是本站实测或购买建议。图片发布副本增加 waoo.ai 水印,原摄影者和来源标识保留。


交流讨论
最新评论
查看全部评论(1)