LaWAM:用于高效动态-觉察机器人策略的潜世界行动模型

发布时间:2026/9/24 13:44:20

LaWAM:用于高效动态-觉察机器人策略的潜世界行动模型 26年6月来自清华、吉林大学、南开、北大、哈工大、中关村学院、正行创新Striding AI公司和无问芯穹Infinigence AI公司的论文“LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies”。视觉-语言-动作模型VLAs利用大规模的视觉-语言预训练来实现语义机器人控制但通常缺乏对机器人动作如何改变场景的明确前瞻性。世界-动作模型WAMs通过将策略建立在预测未来的基础上来解决这一限制但现有方法通常依赖计算开销高且像素级冗余大的视频生成。LaWAM一种潜世界动作模型它通过紧凑的潜视觉子目标而不是重建的未来视频将预测动态信息呈现给机器人策略。LaWAM的核心是潜动作条件的潜世界模型LaWM。通过在预训练视觉基础模型的潜空间中训练潜动作模型并重用其前向解码器来预测场景演化的未来观测特征从而获得LaWM。然后LaWAM基于这些预测的潜视觉子目标来调节动作生成从而实现动态-觉察的机器人控制。LaWAM在LIBERO98.6%成功率、RoboTwin91.22%成功率以及真实世界的操作任务中达到了最先进或具有竞争力的成功率同时保持低延迟推理。LaWAM每次动作预测只需187毫秒其时钟墙延迟相比像素空间的WAMs低了最多24倍。如图 2 给出完整的两阶段预训练流程概述。首先将 LaWM 训练为一个潜动作条件的世界模型然后通过潜动作蒸馏对 LaWAM 进行预训练以实现子目标条件的动作生成。总体而言这一训练流程使用大约 3,000 小时的机器人视频和 1,500 小时的第一人称人类视频。在测试时策略会预测一个潜动作LaWM 会在一次前向传递中将其解码为潜视觉子目标然后动作专家根据当前上下文和预测的子目标生成动作片段。在针对不同基准的后续训练后LaWAM 在模拟基准和真实机器人任务中对强大的 VLA 和 WAM 基线表现出最先进或具有竞争力的成功率这些任务包括 LIBERO [21]、RoboTwin [22] 以及真实世界的抓取与放置、抽屉开启和毛巾折叠任务参数量为 23 亿。除了准确性之外图 1 显示 LaWAM 将非迭代潜在预测与一个紧凑的 2.3 亿参数 LaWM 相结合使用的世界建模参数比 50 亿参数的 WAN 主干 [23] 少约 95%。LaWAM 每次动作片段预测运行时间为 187 毫秒且实现的实际延迟比像素空间的 WAM 低多达 24 倍。第一阶段学习 LaWM 作为潜动作模型的前向解码器。每个训练样本包含一个当前观测 o 和一个在物理时间间隔 τ 后采样的远景观测 o_T。在将它们编码为 (u, u_T) 后逆动力学编码器推断潜动作 z ∼ q_φ (z | u, u_T)。然后解码器使用 (u, z) 来预测远景特征u ̃_T LaWM_ω(u, z)。这个训练设置给 LaWM 一个简单的角色在给定当前潜变量状态和潜变量动作的情况下预测未来的潜变量状态。目标 u_T 直接监督解码器而推断出的潜变量动作 z 则作为第二阶段策略先验的教师信号。在这个预训练阶段加入一个辅助信号。一个轻量级的预测器 g 将当前末端执行器状态 s 和潜变量动作 z 映射到未来状态 s_T鼓励 z 编码实际动作而不仅仅是视觉外观的变化。预训练完成后会丢弃这个辅助头只保留解码器作为 LaWM后验编码器仅用于生成策略训练的教师潜变量动作。第二阶段把预训练的 LaWM 变成了测试时的策略接口。第一阶段的 IDM 编码器在部署时不能使用因为它需要未来的特征 u_T 。因此训练策略先验 p_θ (zˆ | o, l) 来根据当前的观察和指令预测潜动作。预测的潜动作会传入预训练的 LaWM 解码器从而生成 uˆ_T LaWM_ω(u, zˆ)让策略能够对块级视觉未来进行潜预测而不需要生成未来的像素。动作专家通过交替DiTAlternate-DiT设计[5]使用这种预测的未来。一条流从VLM骨干网络传递语义上下文而另一条流则携带由(u, uˆ_T)形成的潜动态上下文。在这两条流之间交替让专家在去噪动作块时将任务意图与预测的场景演变结合起来。图3展示最终的块级执行动作专家生成一个基于预测潜子目标的机器人运动块而执行的动作会朝向相应的子目标区域移动。第二阶段训练结合潜动作蒸馏、子目标监督和动作流匹配。进一步应用知识隔离KI[37]以避免动作专家的梯度覆盖预训练的 LaWM 动力学。对于混合频率的机器人数据LaWAM 保持每个数据集的原生控制频率并使用物理时间编码。潜世界模型架构LaWM 在精炼的 DINOv3 ViT-B/16 编码器 [17] 的特征上运行。它的逆动力学编码器和解码器都是 24 层的 Transformer 模块。编码器采用了 V-JEPA2 风格的时空设计 [46]来自当前和远景观测的视觉补丁被展平成一个单独的 token 序列并共同处理以推断潜动作后验。与 Genie [16] 中使用的加性 token 注入不同解码器通过自适应层归一化对潜动作 z 进行条件处理这在跨实体设置中更稳定加性注入可能会因为潜动作范数的波动而导致视觉 token 的整体偏移并引发损失的急剧上升。辅助状态预测器使用轻量级 MLP 头来处理不同机器人实体间的状态语义不一致在 LaWM 训练后会被弃用。潜世界动作模型架构LaWAM 遵循 Qwen-GR00T 架构。用 Qwen3-VL 的前 16 层 Transformer 作为 VLM 主干并用四个 Alternate-DiT 模块实例化动作专家总共对应 16 层 Transformer。隐藏维度为 1024。策略输入序列包含主视角观测、任务指令、潜动作查询 token、可选辅助视角图像以及动作查询 token。所有非查询 token 都充当上下文。通过这种排序和因果注意力掩码潜在动作查询可以收集驱动 LaWM 所需的信息而动作查询仍然可以关注用于控制的完整语义上下文。动作专家通过 Alternate-DiT [5] 接收 LaWM 子目标它不仅在视觉流和语言流之间交替而是在完整的 VLM 隐状态和由当前潜视觉特征 u 与预测子目标特征 uˆ_T 构建的动态流之间交替。所有机器人动作标签都被转换为末端执行器 (EEF) 表示。在策略训练和评估期间不会提供本体感知状态输入这有助于避免对特定轨迹的状态轨迹过拟合并提高空间泛化能力 [47]。所有实验均使用仅 RGB 观测图像尺寸调整为 256 × 256。混合频率数据的物理时间对齐机器人数据集和下游实体可能在不同的控制频率下运行因此相同的动作 token 索引不一定表示相同的物理时间间隔。LaWAM 通过保持每个数据集或实体分支在其原生控制频率同时用固定物理间隔 τ 定义每个动作块来处理这个问题。这使得即使不同分支的离散动作 token 数量不同远景也对应一致的真实时间长度。混合频率训练实验这个实验旨在分离物理时间编码在混合源预训练中的作用。在那种情况下不同的控制频率会导致相同的离散动作索引对应不同的物理时间。在完整的预训练混合数据中直接量化这个效果是困难的因为数据集规模、体现方式、任务分布、摄像机设置和语言覆盖率都在同时变化。因此构建了一个受控的 LIBERO 分析并从零开始训练 LaWAM这样控制频率就是主要的操控变量。从相同的原生 20 Hz LIBERO 轨迹开始通过时间下采样创建 10 Hz 和 5 Hz 版本然后在组合的 5/10/20 Hz 数据上共同训练 LaWAM。这样可以保持各分支之间的任务分布、体现方式、视觉域和语言指令不变同时只改变离散动作索引与经过的物理时间之间的映射。由于低频分支是从相同的 20 Hz 演示中派生出来的混合频率训练并没有引入额外的专家轨迹在这个受控环境下原生 20 Hz 模型因此作为上限参考而不是较弱的数据基线。目标是测试物理时间编码是否能够通过解决混合频率训练带来的控制频率模糊问题从而恢复接近这个参考的性能。训练详情LaWM训练。对于LaWM训练用连续潜动作并利用16个H100 GPU优化等式4实现10万步采用AdamW学习率3×10⁻4权重衰减10⁻²全局批处理大小为10²⁻¹。将KL正则化权重设为β 10−5。固定的物理时间视角为机器人远程操作视频的1.2秒自我中心的人类视频为0.4秒。在 DINOv3 编码之前会对编码器和解码器的视图应用不同的随机裁剪和色彩增强同时保持每个编码器剪辑内的增强时间一致;这让LaWM不太愿意记忆具身特定的像素布局。LaWAM策略训练与评估。第二阶段策略集成使用带有显式语言指令的机器人轨迹。以自我为中心的人类视频通过LaWM先前学习的动态做出贡献但由于通常缺乏明确机器人预期行为的任务描述因此不被用于策略集成。轻量级查询聚合块在潜在动作蒸馏前将潜在动作查询映射到 zˆ。在所有实验中都设 λ_distill λ_wm 0.1。在基准测试专属的后训练之前在64个H100 GPU上运行20万步的LaWAM策略集成预训练阶段整体批处理规模为1024。在此阶段动作专家的学习率为10⁻⁴而其他模块则使用3×10⁻⁹的学习率。对于每个基准的后训练用带余弦衰减的学习率为10⁻4。除非另有说明所有政策均通过10个去噪步骤进行评估。为了测量推理延迟在A100 GPU上运行1000次重复动作块预测并报告平均墙钟延迟。论文中报道的WAM参数计数排除了视频扩散VAE和文本编码器后者大小可达10B参数。与最新的VLA、潜作用和WAM基线进行比较尽可能使用原始论文中的数据其他时间则取出最强的复现数据。真实世界实验协议用两个物理机器人平台如图所示。抓取与搬运以及抽屉开启任务在配备平行夹爪和外部RGB摄像头的Franka Emika Panda机械臂上进行摄像头用于观察工作空间而折叠毛巾任务则在Quanta X1双臂机器人上进行。为每个Franka任务训练了150次真实演示为折叠毛巾训练了280次演示并在30次真实实验中评估每个任务覆盖已知环境和未知测试环境。为了保证对比的可控性每个任务使用的初始配置只生成一次然后在LaWAM和所有基准方法中保持固定以确保所有方法都在相同的物理条件下进行评估。
延伸阅读

更多相关文章

2026/9/19 23:02:19

Hadoop实战入门:从零搭建伪分布式集群与MapReduce开发指南

1. 项目概述:从“听说过”到“用得上”的Hadoop实战入门如果你在数据领域工作,或者对处理海量信息感兴趣,那么“Hadoop”这个名字你一定不陌生。它经常和“大数据”、“分布式计算”这些听起来高大上的词捆绑出现,让很多初学者望而…

2026/9/24 3:29:29

数据库设计工具横向评测:从PowerDesigner到开源方案选型指南

1. 从“画图”到“工程”:数据库设计工具的本质在数据库领域摸爬滚打十几年,我见过太多团队在数据库设计这个环节上“返璞归真”——用Word画表,用Excel写字段,最后用Visio甚至PPT来画ER图。不是说这些工具不能用,而是…

2026/9/23 3:18:16

从Conda到Mamba:Python包管理工具的性能革命与实战迁移指南

1. 从Conda到Mamba:一次包管理工具的“换芯”体验如果你和我一样,长期在Python数据科学、机器学习或者AI开发领域工作,那么“conda activate”和“conda install”这两条命令,恐怕已经刻进了你的肌肉记忆里。Conda,作为…

2026/9/24 13:41:14

阅读笔记GB/T 22239-2019信息安全技术网络安全等级保护基本要求》

云计算:通过网络访问可扩展的、灵活的物理或虚拟共享资源,并按需自助获取和管理资源的模式。(资源:服务器、操作系统、网络、软件、应用和存储设备等)虚拟机监视器hypervisor:运行在基础服务器和操作系统之…

2026/9/24 13:41:14

企业管理系统沦为 “鸡肋”?管理者的困局与破局思路

不少企业老板都遇到过这样的难题:斥资几十万上线管理系统,员工抵触不愿使用;可如果不上系统,企业管理又跟不上业务发展。钱投入不少,内部抱怨不断,原本想解决的管理痛点依旧存在。本文不讲空泛理论&#xf…

2026/9/24 13:41:14

工控机+AI落地实战:边缘算力如何驱动工业智能

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/23 12:07:00

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/23 12:06:55

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/24 0:00:21

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:21

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:21

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/22 16:34:32

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/22 20:01:30

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/22 13:25:41

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码