前DeepMind研究科学家发布具身模型,可在13分钟内适配新任务

时间:2026-08-11 17:25:19       来源:澎湃新闻


(相关资料图)

8月11日,由三位华人创办的美国具身智能公司DynaRobotics发布新一代机器人基础模型Dyna-2,高精度制造任务的成功率超过了80%。

执行任务的成功率和泛化能力是当下机器人的两大核心问题。这款基于超过 100 万小时的人类视频进行预训练的模型,只需约13分钟的真机遥操作示范数据,便能适配使用两只五指灵巧手拧瓶盖的新任务;且高精度制造任务的成功率从上一代模型Dyna-1的20% 提升至 80%-90%;在场景部署中,Dyna-2的通过率为87%,而上一代模型Dyana-1的通过率仅为46%。

DynaRobotics发布新一代机器人基础模型Dyna-2用了100万小时人类数据。

Dyna Robotics成立于2024年9月,是一家专注于研发通用型机器人公司,总部位于美国硅谷,在中国上海设有硬件研发中心,在上海的公司名为达纳灵动科技有限公司。该公司由连续创业者林顿·高(Lindon Gao)、约克·杨(York Yang)以及前DeepMind研究科学家马也骋(Jason Ma)共同创立。其中,林顿·高和约克·杨此前联合打造的智能购物车公司Caper AI于2021年以3.5亿美元的价格成功出售。

据了解,Dyna-2模型能力的提升源自于架构的变化。Dyna-1采用的是VLA(Vision-Language-Action,视觉-语言-动作模型架构),VLA通常根据机器人看到的画面和接收到的语言指令,直接生成下一步动作。Dyna-2采用的则是世界-动作模型(World-Action Model,WAM),能够从同一表征中联合预测下一帧视频和下一个电机指令。

发布模型信息。

简单来说,VLA主要解决“机器人下一步应该怎么动”,世界-动作模型还希望机器人理解“这样动了以后,世界会发生什么”。

DynaRobotics在技术报告中透露,世界动作WAM模型改善了跨本体泛化、环境鲁棒性、语言理解等问题。

目前,Physical Intelligence的π系列、英伟达GR00T和Google DeepMind的Gemini Robotics等模型仍主要沿着VLA方向发展。此前在上海出席2026WAIC相关论坛时,Dyna Robotics的联合创始人兼首席科学家马也骋曾公开表示,VLA和WAM所追求的能力也并非完全冲突,两条路线未来可能逐渐融合。无论采用哪种架构,模型都需要理解语言指令,并具备对未来状态进行预测和建模的能力。在不同任务中,两种架构各有优势,部分能力使用VLA实现可能更高效。

澎湃新闻记者 喻琰

标签: 机器人 dyna deepmind

消息推送