美国机器人公司Dyna Robotics发布机器人基础模型DYNA-2。该公司表示,模型在预训练阶段未使用机器人实操数据,而是基于约100万小时人类第一视角视频进行训练,试图破解通用机器人研发中长期存在的训练数据短缺难题。
据区块链媒体Cryptopolitan当地时间11日报道,Dyna Robotics此次公布的DYNA-2,核心思路是让机器人从人类操作物体的视频中学习动作与物理交互规律,而非依赖传统的机器人数据采集流程。
在通用机器人研发中,行业常见做法是通过人工遥操作机器人采集训练数据,由操作人员直接控制机械臂或人形机器人反复执行特定任务,以此积累样本。但这一流程通常成本高、耗时长,一旦任务类型增加或机器人形态发生变化,往往还需要重新采集数据,扩展效率也因此受限。
与此不同,Dyna Robotics选择绕开机器人数据采集环节,直接利用人类与物体交互的视频进行预训练。DYNA-2学习的数据规模约为100万小时。公司称,这一规模相当于约170年连续的人类行为经验。
Dyna Robotics联合创始人Jason Ma表示,真正稀缺的是动作数据,而视频资源本身并不缺乏,机器人可以借助人类视频学习物理直觉。按照公司的说法,即使没有数百万小时的机械臂实操数据,机器人仍可通过人类抓取、移动物体的画面,学习完成物理交互所需的信息。
从效果来看,Dyna Robotics披露,在精密制造任务中,模型成功率已由约20%提升至80%—90%。此外,在15项基准任务评估中,学习更多人类视频的模型,整体表现持续优于学习较少视频的模型。
在模型架构上,DYNA-2并未采用常见的视觉-语言模型(VLM)路线,而是引入基于视频生成的World-Action Model。公司称,模型在预训练过程中不仅要理解视频内容,还要同时预测下一帧画面和下一步动作。
Dyna Robotics认为,这种训练方式有助于机器人在内部建构对物体接触、物理变化及空间关系的表征,从而提升对真实操作场景的理解能力。
公司还强调,DYNA-2的目标并非适配单一硬件,而是提升跨平台迁移能力。按照其说法,即便是预训练阶段未直接使用过的固定式机械臂、人形机器人原型和多关节机器人手,也有望迁移从人类视频中获得的知识。
除预训练外,Dyna Robotics也希望缩短后续微调流程。公司表示,目标是将原本需要数周的微调周期压缩至数小时。其举例称,在仅追加13分钟数据后,机器人手便学会了拧瓶盖动作。
Dyna Robotics表示,公司并不打算将相关技术停留在研究阶段,而是已开始将机器人投向实际产业场景。其DYNA-1机器人据称已应用于酒店、餐厅、洗衣店和健身房等场所。资料显示,该公司由前Google DeepMind成员Linden Gao、York Yang、Jason Ma等联合创立。
下一阶段,Dyna Robotics计划将人类视频学习规模从100万小时扩大至1000万小时。公司认为,通用机器人的核心瓶颈不在于设备部署速度,而在于数据获取能力。相比投放数千台、数万台高成本机器人采集数据,直接利用互联网和现实世界中海量的人类行为视频,可能是更快扩大学习规模的路径。
不过,人类视频中学到的动作知识,能否在真实机器人环境中稳定复现,仍有待进一步验证。原因在于,人与机器人在身体结构、关节形式、力量输出和视野范围等方面都存在差异。
因此,DYNA-2的关键不只是“看了多少人类视频”,更在于能否把训练形成的物理直觉稳定迁移到不同机器人平台和真实作业环境中。Dyna Robotics推进的1000万小时视频学习计划,能否成为通用机器人数据获取的新路径,仍值得持续关注。