强化学习训练机器人
核心摘要
迪士尼如何用强化学习等前沿技术,让机器人角色在乐园中像真实生物一样自主互动、表达情感,从而提升沉浸式叙事体验。
干货提炼
主题一:强化学习训练机器人
- 【判断】 强化学习让机器人学习艺术家提供的动作并动态平衡,大幅缩短开发周期。证据:团队用模拟器训练10,000小时(相当于数天),以前需数年,现在数月即可完成;机器人在模拟中学会moonwalk等复杂动作,并能实时平衡。
- 【判断】 机器人从人类动作数据中提取情感和运动知识,实现任意动作的模仿。证据:通过重定向人类动作到机器人形态,即使数据不完美,RL仍能学到如何随时间演化情感并跟踪。
主题二:从原型到落地速度
- 【判断】 迪士尼将机器人从概念到公园落地的周期压缩至数月。证据:Herbie从概念到在迪士尼乐园出现仅3个月,与《神奇四侠》电影同步;BDX droids从原型到三部机器人在公园巡游不到一年。
- 【判断】 快速迭代依赖模块化设计和3D打印。证据:早期使用3D打印部件和现成执行器,先构建不完美系统,再通过软件理解行为;第一台执行器测试台后,RL行走首次即成功。
主题三:机器人自主性与感知
- 【判断】 通过摄像头和空间AI,机器人能理解环境、感知游客动作并做出反应。证据:BDX droids装备双摄像头,实时提取游客姿态(如举手、靠近),用于自主互动;机器人每250毫秒检查传感器,微调平衡以保持稳定。
- 【判断】 自主性使机器人能持续表演,无需人工干预。证据:在“droid录音工作室”中,创作者可编排脚本并测试,机器人现场回放;团队目标是让机器人自主完成表演并与最多游客互动。
主题四:跨公司合作推动技术突破
- 【判断】 与Nvidia、Google DeepMind合作开发模拟器牛顿(Newton),实现复杂机构精确模拟。证据:模拟器Kamino能建模闭链机构(如远程联动关节),支持机器人训练;迪士尼利用Nvidia的芯片和GPU,专注情感和连接,而非硬件底层。
- 【判断】 与Epic Games、Meta合作增强乐园体验。证据:千禧隼号使用Unreal Engine实时渲染,结合Nvidia硬件实现更高画质;与Meta合作利用Ray-Ban智能眼镜,为游客提供虚拟导游和信息查询,增强共享体验而不破坏沉浸感。
高光金句
- ❝ "The goal there is really to extend the simulator to all kinds of systems, basically being able to model any kind of mechanism with closed kinematic loops." ❞
- ❝ "If we're not failing, we're not really pushing the boundaries." ❞
- ❝ "We're not just using technology for technology's sake. We're using it in service of that story that we're really going for." ❞
提及资源
- 本集暂无提及外部资源
- 人物/公司/组织:Nvidia - 合作提供芯片和模拟技术;Google DeepMind - 合作开发牛顿模拟器;Epic Games - 合作优化Unreal Engine在多屏环境下的表现;Meta - 合作提供智能眼镜技术;ETH Zurich - 合作培养机器人学博士项目;Jon Favreau - 导演,将BDX droids引入《曼达洛人》电影。