【CoRL 2022】DayDreamer:物理机器人的世界模型学习|从机器人世界模型专家视角

发布时间:2026/10/1 12:16:08

【CoRL 2022】DayDreamer:物理机器人的世界模型学习|从机器人世界模型专家视角 摘要本文解读 CoRL 2022 论文《DayDreamer: World Models for Physical Robot Learning》。该论文提出把Dreamer 世界模型直接用于真实机器人在线学习通过融合潜在空间想象、异步 actor-learner 解耦与多传感器融合在无模拟器、无示范的条件下从零学习机器人行为其特别之处在于一个算法、一套超参数通吃 4 台机器人。实验表明四足机器人仅用 1 小时就学会从仰躺状态翻身、站立并行走双臂抓放 8–10 小时逼近人类水平为真实世界机器人强化学习建立了强基线。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景世界模型的四大组件方法细节实验设计与结果三个值得注意的定性发现潜在想象的可解释性附录 F结果对比总结关键发现局限性常见问题FAQDayDreamer 和 Dreamer 是什么关系为什么世界模型能减少真实试错同一套超参数真的能通吃所有任务吗机器人在学习过程中被推倒怎么办世界模型的潜在想象有什么实际用途参考链接论文基本信息项目内容标题英文DayDreamer: World Models for Physical Robot Learning标题中文DayDreamer物理机器人的世界模型学习作者Philipp Wu$^$ · Alejandro Escontrela$^$ · Danijar Hafner$^*$ · Ken Goldberg · Pieter Abbeel机构University of California, Berkeley会议CoRL 2022arXivhttps://arxiv.org/abs/2206.14176项目网站https://danijar.com/daydreamer背景与动机深度强化学习RL是机器人学习的常用方法但它需要大量试错才能学会行为在真实机器人上成本极高因此绝大多数机器人 RL 工作依赖模拟器。然而模拟器无法完全捕捉真实世界的复杂度且训练出的行为不会适应环境变化。主流路线有三类各有短板Sim2Real 域随机化在模拟器中大规模训练后部署Rusu 2016、Lee 2020、Rudin 2021或模拟预训练 真实微调Smith 2021——设计模拟任务耗时且模拟与真实存在鸿沟机器人群集采集QT-Opt / MT-Opt / Bridge Data 靠大量机器人并行收集经验——硬件成本高昂示范与任务先验VIKING、课程式 RL 等依赖人类专家示范——标注成本高。真正在物理世界端到端学习的先例很少Visual Foresight用像素级视频预测 在线规划但需要生成图像、计算昂贵且只适合短时域任务SOLAR 与 PDDM 学习潜在动力学做规划但未覆盖跨模态、稀疏奖励的复杂场景。DayDreamer 的答案是让机器人学习一个世界模型把试错搬进模型的潜在空间。世界模型从回放数据中学习环境动力学相当于机器人自学出的快速模拟器策略在想象中优化真实环境中的交互需求大幅减少——四足机器人只用 1 小时机械臂只用 8–10 小时。从技术脉络看附录 H世界模型从 2018 年 World Models 的像素级范式到 2019 年 PlaNet 提出 RSSM 潜在动力学、2020–2021 年 Dreamer / DreamerV2 在 Atari 上实现潜在想象 RL再到本文 2022 年首次登上物理机器人之后 DreamerV3 用单一配置征服 150 领域世界模型也成为 IRIS、UniPi、V-JEPA 2 等具身智能工作的基础设施——DayDreamer 正是这一迁移链条上从游戏到真实机器人的关键一环。研究主线从问题到结论图 12DayDreamer 研究主线Mermaid 流程图——问题 → 动机 → 设计 → 方法 → 实验 → 结论基准/方法设计DayDreamer 直接沿用 Dreamer 算法本身不做新算法创新而是解决如何在物理机器人上跑起来的系统问题世界模型学习基于循环状态空间模型RSSM由编码器、解码器、动力学网络、奖励网络四部分组成从回放缓冲区中监督学习行为学习actor-critic 在世界模型的潜在空间中想象 rollout 并优化策略不需要解码观测因此可以用 $1.6\times10^4$ 的大批量在单张 GPU 上并行训练异步解耦learner 线程持续训练神经网络actor 线程并行计算动作与环境交互——这是 20 Hz 高控制率四足环境可行的关键。图 1DayDreamer 在线学习流水线——策略采集经验 → 世界模型在回放数据上监督学习 → actor-critic 在潜在空间想象 rollout 优化行为分类全景世界模型的四大组件图 13世界模型系统四大组件Mermaid 分类图——编码器 / 动力学 / 解码器 / 奖励网络方法细节世界模型 可微的快速模拟器。因为感官输入是图像世界模型预测未来的潜在表示而非像素既减少累积误差又支持大规模并行训练。编码器把 RGB、深度、本体感知等多模态输入融合成离散码 $z_t$动力学网络用循环状态 $h_t$ 预测未来码序列解码器重建输入提供丰富学习信号并支持人类检查模型预测。图 2世界模型学习——encoder 融合多模态感官输入为离散码RSSM 在给定动作下预测未来码decoder 重建输入提供学习信号行为学习 潜在空间中的大规模想象。策略网络与价值网络从想象轨迹中学习奖励由学到的奖励网络预测。行为学习的目标是 $\lambda$-returns$V_t^{\lambda}r_t\gamma((1-\lambda)v(s_{t1})\lambda V_{t1}^{\lambda})$让策略能够学习超越想象视野 $H$ 之外的长期策略。图 3行为学习——在潜在空间以 16K 大批量并行想象 rollout训练策略网络与价值网络奖励由学到的奖励网络预测四个核心设计要素预测潜在表示而非像素减少累积误差支持单 GPU 16K 批量$\lambda$-returns 想象目标在想象视野之外仍能学习长期策略梯度估计器按任务选择连续控制用重参数化梯度离散动作用 Reinforce 梯度多模态传感器融合RGB / 深度 / 本体感知统一编码进随机表示免去人工状态估计。实现细节附录 A代码基于官方 DreamerV2 实现异步 actor-learner 架构中learner 持续训练、actor 并行采集所有实验使用相同超参数附录 BRSSM 512 维、32 个离散潜在变量、每类 32 个类别、批量 32×32、想象视野 $H15$、折扣 $\gamma0.95$、$\lambda0.95$、学习率 $10^{-4}$开箱即用到不同机器人本体。实验设计与结果实验覆盖4 台机器人、4 类任务横跨运动、操作与导航动作空间、观测模态与奖励结构各不相同任务动作 / 频率观测训练时长关键结果A1 四足行走连续 / 20 Hz关节姿态1 小时翻滚→站立→行走UR5 抓放离散 / 2 HzRGB本体8 小时2.5 件/分接近人类XArm 抓放离散 / 0.5 HzRGB-D本体10 小时3.1 件/分Rainbow 失败Sphero 导航连续 / 2 HzRGB2 小时距目标 0.15持平 DrQv2每台机器人对应当前类别最强的模型无关基线四足对SAC数据高效连续控制、双臂对Rainbow DQN / PPO像素离散控制另有人类操作员基线、轮式对DrQv2像素连续控制。图 4实验平台总览——Unitree A1 四足、UR5 与 XArm 双臂、Sphero 轮式机器人图 5A1 四足行走——前 5 分钟学会翻滚、20 分钟站立、约 1 小时走出步态SAC 在数据预算内只会翻滚图 6受扰适应——用长杆反复推倒机器人10 分钟在线学习后学会承受轻推、重推时快速翻身站起图 7UR5 多物体抓放——8 小时达到 2.5 件/分接近人类基线Rainbow DQN 与 PPO 只学会抓住就地丢下图 8XArm 抓放——10 小时达到 3.1 件/分可比人类Rainbow 收敛到同箱抓放的局部最优图 9Sphero 导航——2 小时学会到达并保持目标平均距离 0.15与 DrQv2 表现相当三个值得注意的定性发现渐进式里程碑A1 前 5 分钟学会翻身、20 分钟学会站立、约 1 小时走出 pronking 步态受推后仅 10 分钟就适应多模态行为涌现XArm 学会用绳子把软物体从角落拉出再抓取而不是只会直线抓取持续在线适应附录 E日出强光使 XArm 观测域剧变、性能骤降但约5 小时在线学习后恢复并反超原水平——快于从零重新训练。图 10XArm 光照适应——训练时夜间观测左与日出强光观测右差异巨大性能骤降后约 5 小时恢复并反超潜在想象的可解释性附录 F图 11潜在想象 rollout 可视化——每行一条想象轨迹UR5 场景中多个物体的动力学被世界模型建模Oral 信号分析附录 CDayDreamer 命中三个创新模式——P6 重新表述为可解对象真实机器人 RL → 学世界模型 潜在想象优化、P7 制造监督信号从回放数据自监督预测未来表示、P11 分解并委托求解器环境模拟委托世界模型、行为优化委托 actor-critic证据链来自跨平台泛化与稀疏奖励下的量化结果。结果对比总结图 14四机器人结果对比总结Mermaid 流程图——同一套超参全部学会关键发现样本效率数量级提升四足行走从模拟器数周训练缩短到真实世界1 小时双臂抓放 8–10 小时逼近人类无模拟器、无示范、无重置A1 四足直接从仰躺状态端到端学习这是此前从未实现的设定一套超参通吃 4 台机器人动作空间、观测模态、奖励结构各异的任务共用同一配置说明世界模型方法具有通用性基线全面落后SAC 只会翻滚不会站立行走Rainbow/PPO 只学会短视的抓住就地丢下DrQv2 在导航上与 Dreamer 持平在线学习 持续适应10 分钟适应推倒扰动、5 小时恢复光照剧变并反超天然支持持续学习设定潜在想象可视化解码想象轨迹可直接检查策略意图为世界模型调试提供了工具。局限性硬件磨损数小时在线学习对机器人本体损耗大可能需要人工干预甚至维修长时训练未探明Dreamer 与各基线在更长训练时间下的性能上限尚不清楚任务规模有限均为单任务、固定环境设定未涉及多任务复用与复杂场景作者展望把真实世界快速学习与模拟器加速结合是更具挑战性任务的未来方向。常见问题FAQDayDreamer 和 Dreamer 是什么关系DayDreamer 没有提出新算法而是把 Dreamer 世界模型算法首次系统性地搬到真实机器人上解决物理世界的在线学习问题验证了潜在空间想象在真实硬件上的可行性。为什么世界模型能减少真实试错世界模型从回放数据学习环境动力学策略在模型潜在空间中想象 rollout 并优化不需要在真实环境里反复尝试——四足 1 小时、双臂 8–10 小时即学会任务。同一套超参数真的能通吃所有任务吗能。A1连续控制、UR5/XArm离散控制 像素、Sphero连续控制 像素全部使用相同的超参数配置这也是论文被称为强基线的原因。机器人在学习过程中被推倒怎么办这正是论文的亮点之一推倒后机器人仅需10 分钟在线学习就能适应学会承受轻推、重推时快速翻身站起体现了持续在线学习的鲁棒性。世界模型的潜在想象有什么实际用途除了训练策略潜在想象还可以解码可视化——直接查看 actor 的意图和世界模型对多物体动力学的建模是理解和调试模型的重要工具。参考链接DayDreamer arXiv 论文2206.14176DayDreamer 项目网站视频与代码DreamerDream to ControlICLR 2020DreamerV2Mastering Atari with Discrete World ModelsICLR 2021PlaNetLearning Latent Dynamics for Planning from PixelsICML 2019DreamerV3Mastering Diverse Domains through World ModelsNeurIPS 2023给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
延伸阅读

更多相关文章

2026/9/30 12:05:15

CoSbTe节点线半金属的电子结构与物理性质

CoSbTe节点线半金属的电子结构与物理性质 PHYS. REV. B 113, 134406 (2026) CoSbTe节点线半金属的电子结构与物理性质 Electronic and Physical Properties of the Topological Nodal-Line Semimetal Candidate CoSbTe 导读 导读:节点线半金属是拓扑材料家族的重…

2026/9/30 13:19:41

如何快速优化macOS鼠标体验:Mac Mouse Fix完整配置指南

如何快速优化macOS鼠标体验:Mac Mouse Fix完整配置指南 【免费下载链接】mac-mouse-fix Mac Mouse Fix - Make Your $10 Mouse Better Than an Apple Trackpad! 项目地址: https://gitcode.com/GitHub_Trending/ma/mac-mouse-fix 你是否厌倦了在macOS上使用普…

2026/10/1 19:22:12

GEO工程化实践:从Schema标记到RAG链路与Agent编排

1. 从SEO到GEO:内容可见性的战场已经换了规则做了七八年搜索优化的人,最近一两年应该都有一个共同的感受:以前那套关键词密度、外链数量、页面加载速度的打法,放到今天越来越不灵了。不是这些手段失效了,而是用户获取信…

2026/10/1 19:22:12

金蝶KIS专业版V16.0安装:SQL2008配置与账套建立全攻略

简介:金蝶KIS专业版V16.0完整安装包,需先安装SQL2008数据库作为支撑;它面向小型工贸企业,用于落实财务、供应链、生产委外一体化管理,可解决数据割裂、核算低效、流程不规范等痛点,同时支持本地、私有云与公…

2026/10/1 19:22:12

Smart3D/CC生成OSGB倾斜模型全流程与南方CASS应用实操

Smart3D这个名字,老测绘和三维建模圈子里的人应该都不陌生。它就是现在Bentley旗下的ContextCapture,以前叫Acute3D,很多人习惯了叫它CC或者smart3D。这个软件干的事情很纯粹——把无人机拍的成千上万张照片,经过空三解算和密集匹…

2026/10/1 19:22:12

Win7运行Steam终极方案:Docker容器兼容舱实战指南

1. 问题本质与真实场景还原:这不是“下载失败”,而是Win7系统与Steam现代协议的结构性脱节 你点开Steam,选中《巫师3》或《空洞骑士》,点击安装——进度条卡在0%,右下角弹出红色提示:“下载内容不可用”&am…

2026/10/1 19:22:12

S32K342 MCAL下载安装配置全流程详解:从申请到代码生成

这阵子在帮项目组搭建S32K342的AUTOSAR基础软件环境,从NXP官网申请MCAL下载权限,到在EB Tresos里把外设驱动模块一个个配起来,整个过程踩了不少坑,也总结出了一些相对顺畅的操作顺序。S32K342作为S32K3家族里性价比不错的一款芯片…

2026/10/1 19:17:12

bcftools 实战:从 BAM 到 VCF 的变异检测与参数调优

1. 先把 bam to vcf 这条链路想明白干过几年测序分析的人大概都有个共识:拿到一个比对好的 BAM 文件,要把它变成能看、能筛、能注释的 VCF,这一步是整个变异检测流程里最容易被低估的环节。看起来只是一条命令,实际上它同时牵扯到…

2026/10/1 5:21:14

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/10/1 17:09:46

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 10:48:55

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑