发布时间:2026/8/6 17:55:34
【arXiv 2026】世界行动模型即零样本策略|从视频扩散世界模型视角 摘要本文解读 arXiv 2026 论文《World Action Models are Zero-shot Policies》。该论文提出DreamZero——一个 14B 参数的世界行动模型WAM通过融合预训练视频扩散骨干 Wan2.1、flow matching 联合去噪与自回归分块生成让机器人在异构非重复数据上同时学习未来帧预测与动作生成其特别之处在于视频作为世界演化的稠密表示直接决定动作天然继承物理动力学先验。实验表明零样本泛化 2 倍以上超越最先进 VLAAgiBot unseen 任务 39.5% vs 16.3%仅需 10–20 分钟视频即可跨本体迁移相对提升 42%并经 38× 推理加速实现 7Hz 实时闭环控制为具身智能基础模型提供了从预测世界到直接行动的重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么 VLA 学不会怎么做研究主线从问题到结论基准/方法设计什么是世界行动模型分类全景机器人策略学习的三大路线方法细节自回归分块扩散与闭环 KV 缓存实验设计与结果零样本泛化如何验证结果对比总结关键发现局限性常见问题FAQDreamZero 是什么WAM 与 VLA 有什么区别为什么视频数据能跨本体迁移DreamZero 训练需要多少数据7Hz 实时控制是怎么实现的DreamZero 的主要局限是什么参考链接论文基本信息项目内容标题英文World Action Models are Zero-shot Policies标题中文世界行动模型即零样本策略作者Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi Jim Fan, Joel Jang机构NVIDIA GEAR Lab会议arXiv 2026arXivhttps://arxiv.org/abs/2602.15922项目网站https://dreamzero0.github.io背景与动机为什么 VLA 学不会怎么做核心矛盾现有 Vision-Language-ActionVLA模型如 RT-2、OpenVLA、GR00T N1.6、$\pi_{0.5}$具备强大的语义泛化理解这是什么、任务是什么但缺乏物理运动泛化不知道手该怎么动、物体会怎么倒。原因在于它们学习的是观测→动作的直接映射而动作监督信号稀疏、重复示范成本高物理动力学先验只能从有限的动作标注中隐式习得。关键差异DreamZero 属于 World Action ModelWAM家族——学习视频动作的联合分布动作由预测的视觉未来隐含决定。与视频模型机器人策略UniPi、RoboDreamer、DreamGen——视频生成指导动作动作仍需逆动力学模型提取不同WAM 把视频预测与动作生成端到端联合建模天然继承网络级视频数据中的物理动力学先验。WAM 的历史演进附录 H从 2020–2023 的潜空间世界模型Dreamer、V-JEPA需测试时规划/搜索到 2024–2025 的生成式视频世界模型UniSim、Genie、DreamGen动作仍需逆动力学提取再到 2026 年 2 月 DreamZero 首次实现视频动作联合端到端建模14B 模型实时 7Hz 控制2026 年 3–7 月 GigaWorld、MotuBrain、Wall-WM、ABot-M0.5 等 1B–14B 多模态变体相继涌现WAM 家族全面爆发。为何 WAM 对机器人基础模型至关重要一是物理先验复用——网络级视频数据蕴含动力学动作学习只需逆映射二是数据宽容度——异构非重复数据即有效采集成本数量级下降三是跨本体通道——视频是本体无关表示人类视频可直接迁移到机器人。研究主线从问题到结论图 9研究主线 Mermaid 流程图从纯动作模仿缺乏物理泛化的问题出发经视频物理先验动机、WAM 联合设计、自回归分块方法到 2 倍超越 VLA 的实验与结论基准/方法设计什么是世界行动模型DreamZero 的核心设计是端到端联合建模视频与动作单模型同时输出未来视频帧与动作序列覆盖 AgiBot G1 双臂移动机器人与 Franka 单臂DROID两个本体。它基于预训练视频扩散骨干 Wan2.114B DiT冻结文本/图像编码器与 VAE仅训练 DiT 块与新增的状态/动作编解码器——视频生成质量即策略上限视频预测扮演隐式视觉规划器动作从看得见的未来中提取。图 1DreamZero 总览联合预测视频与动作继承世界物理先验实现异构数据学习、开放世界泛化、视频跨本体迁移与 few-shot 新本体适配分类全景机器人策略学习的三大路线图 10机器人策略学习分类树VLART-2/OpenVLA/GR00T N1.6/π0.5、视频模型策略UniPi/RoboDreamer/DreamGen与 WAM 联合视频-动作Cosmos/Genie/MIMICDreamZero 是 14B 端到端 WAM 代表方法细节自回归分块扩散与闭环 KV 缓存联合目标flow matching 同时去噪视频与动作隐变量通过共享去噪时间步保证模态对齐学习目标为 $p(\mathbf{o}{l:lH}, \mathbf{a}{l:lH} \mid \mathbf{o}_{0:l}, \mathbf{c}, \mathbf{q}_l)$——给定历史观测、语言指令与本体状态联合预测未来视频帧与动作。图 2模型架构视觉上下文VAE 编码、语言指令文本编码器、本体状态状态编码器经自回归 DiT 与 flow matching 联合预测未来视频帧与动作自回归分块每块 $K2$ 个隐帧、$M4$ 块teacher forcing 用干净历史块条件化当前噪声块。闭环推理时执行后把真值观测注入 KV 缓存替换预测帧消除自回归误差累积。为何自回归优于双向KV 缓存加速推理 3–4 倍保留原生帧率避免双向模型 FPS 扭曲带来的模态错位。消融附录 B显示 AR 与双向精度相当均 50%但 AR 动作更平滑且推理更快。DreamZero-Flash解耦视频/动作噪声调度视频 $t \sim \mathrm{Beta}(7,1)$ 偏向高噪声支持单步去噪单步去噪任务进度 74% vs 朴素 52%4 步 83%速度提升 2.33 倍。实时优化套件附录 A 全景CFG 双 GPU 并行、DiT 缓存16→4 步、torch.compile CUDA Graph、kernel/scheduler 优化、NVFP4 量化叠加 Flash 单步去噪总延迟从 5.7s 降至 150ms支撑 7Hz 闭环控制优化累积H100GB200基线1×1.1×CFG 双 GPU 并行1.9×1.8×DiT 缓存16→4 步5.5×5.4×torch.compile CUDA Graph8.9×10.9×kernel/scheduler 优化9.6×14.8×NVFP4 量化—16.6×DreamZero-Flash4→1 步—38×实验设计与结果零样本泛化如何验证评测协议默认unseen 环境 unseen 物体——训练与评估站点地理隔离天然检验分布外OOD泛化任务粒度 运动方式 × 物体类型。AgiBot 上评估 10 seen 10 unseen 任务DROID 上 2020 任务。基线为 GR00T N1.6 与 $\pi_{0.5}$各含 from-scratch / from-pretrained 两策略相同数据与算力预算。图 3AgiBot 评估设定默认 unseen 环境与 unseen 物体训练与评估站点地理隔离天然检验分布外泛化主表零样本评估零样本评估DreamZero最佳预训练 VLA提升AgiBot seen平均进度62.2%27.4%2.3×AgiBot unseen39.5%16.3%2.4×DROID unseen进度/成功率49% / 22.5%31% / 12.5%18pp跨本体 unseen9 任务基线视频迁移提升机器人→机器人YAM20 分钟38.3%55.4%44.7% 相对人类→机器人12 分钟38.3%54.3%41.8% 相对任务/数据规模AgiBot G1 使用约 500 小时遥操作数据22 个真实环境7.2K 幕每幕约 4.4 分钟、42 个子任务FrankaDROID使用开源异构数据集验证可复现性。图 4Seen 任务评估DreamZero 有效利用异构数据并泛化到新环境from-scratch VLA 接近零分预训练 VLA 仅中等表现图 5Unseen 任务零样本泛化解鞋带、熨衣、画画、握手等训练外任务DreamZero 在两个本体上均显著领先Q1 异构数据学习from-scratch VLA 在异构数据上几乎失败1%DreamZero 达到 62.2%——视频先验弥补了动作监督的不足。消融附录 B显示异构数据较重复数据 17pp33%→50%模型规模 14B 较 5B 29pp21%→50%而 VLA 从 5B 扩到 14B 仍为 0%。Q2 unseen 任务AgiBot 上 39.5% vs 16.3%DROID 上 49% vs GR00T 31% / $\pi_{0.5}$ 33%——VLAs 过度拟合 pick-and-place 主导行为遇到训练外任务解鞋带、熨衣、画画、握手表现骤降。Q3 后训练保持任务特化微调后环境泛化不损失fruit packing 任务显著优于 VLA。图 6后训练结果WAM 在三个下游任务上匹配或超越 VLA 基线环境泛化能力在微调后保留Q4 跨本体视频迁移视频是本体无关表示——仅 20 分钟 YAM 机器人视频44.7% 相对提升或 12 分钟人类视频41.8% 相对提升即可显著提升 unseen 任务表现。图 7跨本体迁移YAM→AgiBot 与人类→AgiBot 视频-only 数据均显著提升 unseen 任务表现Q5 few-shot 本体适配仅 30 分钟 play 数据55 幕适配全新 YAM 机器人保持语言跟随与零样本泛化。图 8Few-shot 本体适配AgiBot 预训练模型用 30 分钟 play 数据适配 YAM泛化到南瓜、泰迪熊等训练外物体Oral 信号验证附录 C范式级创新有完整证据链——替换算子/表示视频骨干替代 VLM 图文骨干unseen 任务 2.4× 于最佳 VLA、14B vs 5B 29pp制造监督信号联合视频-动作 flow matching异构数据 17pp、from-scratch VLA 同类数据上仅 1%解放固定生成组件Flash 解耦噪声调度单步去噪 74% vs 朴素 52%4 步 83%、速度 2.33×。结果对比总结图 11结果对比总结DreamZero 零样本 seen 62.2% vs 27.4%2.3×、unseen 39.5% vs 16.3%2.4×、跨本体视频迁移 44.7% 相对提升、38× 加速实现 150ms 7Hz 闭环控制关键发现零样本泛化 2 倍以上超越最先进 VLAAgiBot seen 任务 62.2% vs 27.4%2.3×、unseen 任务 39.5% vs 16.3%2.4×DROID unseen 进度/成功率 49%/22.5% vs 31%/12.5%18pp。异构数据即可学习from-scratch VLA 在异构非重复数据上几乎失败1%DreamZero 达 62.2%消融显示异构数据较重复数据 17pp。规模效应显著14B 较 5B 任务进度 29pp21%→50%而 VLA 即使扩到 14B 在异构数据上仍为 0%。视频是跨本体通道20 分钟 YAM 视频跨本体迁移 44.7% 相对提升12 分钟人类视频 41.8%视频-only 数据即可用。30 分钟 play 数据 few-shot 适配新本体55 幕数据适配 YAM保持语言跟随与零样本泛化泛化到南瓜、泰迪熊等训练外物体。38× 推理加速实现 7Hz 实时闭环CFG 并行 DiT 缓存 NVFP4 量化 Flash 单步去噪延迟从 5.7s 降至 150ms单步去噪 74% vs 朴素 52%。局限性算力门槛高7Hz 实时控制需 2× GB20038× 加速后对比 VLA 在消费级 GPU 上可达 20Hz边缘部署仍远。短视界视觉记忆仅 6.6 秒本质是 System 1 模型长程任务需 System 2 规划器配合。高精度任务欠拟合亚厘米级操作插钥匙、精细装配表现不足异构数据策略牺牲了稠密示范覆盖。缩放规律未明缺少模型/数据/算力的 WAM 缩放定律最优配置未知。作者展望大规模第一视角人类视频Ego4D、EgoDex 等有望带来比 VLA 更强的迁移更小但泛化强的视频骨干可实现边缘端 System 1 部署。常见问题FAQDreamZero 是什么DreamZero 是 NVIDIA GEAR Lab 提出的 14B 世界行动模型WAM用预训练视频扩散模型 Wan2.1 同时预测未来帧与动作让机器人在异构数据上学到可泛化的物理技能实现 7Hz 实时闭环控制。WAM 与 VLA 有什么区别VLA 学习观测→动作的直接映射动作监督依赖大量重复示范WAM 学习视频动作联合分布动作由预测的视觉未来隐含决定天然继承视频数据中的物理动力学先验因而在异构非重复数据上也能学习。为什么视频数据能跨本体迁移视频是本体无关的稠密世界表示——它描述世界如何演化而非某条机械臂怎么动。因此 YAM 机器人的视频20 分钟甚至人类视频12 分钟都能迁移到 AgiBot提升 unseen 任务表现 42% 以上。DreamZero 训练需要多少数据AgiBot G1 使用约 500 小时异构遥操作数据22 个环境、7.2K 幕跨本体迁移只需 10–20 分钟视频示范适配全新机器人只需 30 分钟 play 数据55 幕无需重复示范。7Hz 实时控制是怎么实现的通过系统级优化套件CFG 双 GPU 并行、DiT 缓存16→4 步、torch.compile CUDA Graph、NVFP4 量化加上 DreamZero-Flash 解耦噪声调度实现单步去噪总加速 38×延迟从 5.7s 降至 150ms。DreamZero 的主要局限是什么需要 2× GB200 级算力边缘部署远、视觉记忆仅 6.6 秒System 1 模型、亚厘米级高精度任务欠拟合且 WAM 的缩放规律尚未明确。参考链接arXiv 论文页World Action Models are Zero-shot Policies (arXiv:2602.15922)DreamZero 项目网站WanOpen and Advanced Large-Scale Video Generative ModelsGR00T N1.6NVIDIAπ0.5: Vision-Language-Action ModelPhysical IntelligenceDreamGen: Unlocking Generalization in Robot Learning through Video World Models (CoRL 2025)Cosmos: World Foundation ModelsNVIDIA给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件

相关新闻

2026/8/6 17:55:34

合理控制IT项目预算的关键策略

引言在IT项目管理中,预算控制是决定项目成败的核心环节之一。很多项目在启动时看似规划完善,交付时却因为预算超支而陷入困境。合理控制IT项目预算的关键,不仅在于前期的精细规划,更在于执行过程中的持续监控与动态调整。本文将围…

2026/8/6 17:55:34

CSS: underline

.mark { text-decoration-line: underline; //下划线text-decoration-style: wavy; //波浪线 text-decoration-color: red; //红色 }text-decoration-line: overrline; //上划线

2026/8/6 19:55:45

别把整份代码规范塞给 Codex:我用这 5 类项目规则减少无关修改

上一篇我把前端代码风格拆成了格式、结构、状态、契约和行为 5 个层次。 问题随之而来: 已经识别出的项目风格,哪些应该写成规则,让 Codex 每次都遵守? 最直接的做法,是把团队现有代码规范、开发手册、目录说明和历史…

2026/8/6 19:55:45

Codex 写的前端代码能运行,为什么还是一眼不像这个项目?

前两篇解决了 Codex 接手陌生前端项目的第一步:先确认项目边界、规则、执行方式和启动链,再沿目录、配置和入口文件建立最小项目地图。 地图建立以后,文件通常已经找对了,但新的问题很快会出现: Codex 写出的代码可以…

2026/8/6 19:55:45

Copilot改按量计费后,我找了个不绑客户端的平替方案

Copilot改按量计费后,我找了个不绑客户端的平替方案写代码写了十几年,AI编程工具换了一茬又一茬。Cursor估值冲到500亿美元,Claude Code年化收入25亿,Copilot付费用户超470万。三家里都用过一阵,去年6月Copilot全面转按…

2026/8/6 19:55:45

专业的论文降AIGC率哪个更靠谱

嘿,朋友!我深耕论文降AIGC率这个垂类都5年啦,经手过10w 爆款内容,今天就跟你好好唠唠专业的论文降AIGC率到底哪家更靠谱。行业深度观察现在写论文的时候,很多人会借助AIGC工具来找找灵感、补补资料。但难题也来了&…

2026/8/6 19:50:44

iOS上畅玩Minecraft Java版:PojavLauncher完整免费指南

iOS上畅玩Minecraft Java版:PojavLauncher完整免费指南 【免费下载链接】PojavLauncher_iOS A Minecraft: Java Edition Launcher for Android and iOS based on Boardwalk. Succeeded by https://github.com/AngelAuraMC/Amethyst-iOS 项目地址: https://gitcode…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/6 0:04:22

电力系统调度中的源荷不确定性建模与优化实践

1. 电力系统调度中的源荷不确定性挑战现代电力系统正面临前所未有的复杂性,其中源荷不确定性(Source-Load Uncertainty)已成为调度决策中最棘手的难题之一。我在参与某省级电网调度系统升级时,曾遇到风电预测误差导致日内调度计划…

2026/8/6 0:04:22

VGG-T3技术解析:3D重建速度的革命性突破

1. 项目概述:VGG-T3如何重新定义3D重建速度在计算机视觉领域,3D场景重建一直是个计算密集型任务。传统方法重建1000帧图像规模的场景往往需要数小时甚至更长时间,而英伟达最新发布的VGG-T3技术将这个时间压缩到了惊人的54秒。这个突破性进展来…

2026/8/6 0:04:22

深度解析旅游网站建设的意义及其对行业发展的深远影响与核心价值体现

在这个数字化浪潮席卷全球的今天,我们似乎已经忘记了,曾经有一段时间,人们想要去一个陌生的地方,只能靠在书桌前翻阅厚厚的旅游杂志,或者向刚从那里回来的朋友询问那些模糊不清的印象。那时候,“远方”是一个需要精打细算才能抵达的奢侈概念。而现在,只需要一部手机,轻…

2026/8/5 19:21:13

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/5 19:21:13

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/5 19:21:13

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…