发布时间:2026/8/7 5:07:15
LaWAM:用于高效动态-觉察机器人策略的潜世界行动模型 26年6月来自清华、吉林大学、南开、北大、哈工大、中关村学院、正行创新Striding AI公司和无问芯穹Infinigence AI公司的论文“LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies”。视觉-语言-动作模型VLAs利用大规模的视觉-语言预训练来实现语义机器人控制但通常缺乏对机器人动作如何改变场景的明确前瞻性。世界-动作模型WAMs通过将策略建立在预测未来的基础上来解决这一限制但现有方法通常依赖计算开销高且像素级冗余大的视频生成。LaWAM一种潜世界动作模型它通过紧凑的潜视觉子目标而不是重建的未来视频将预测动态信息呈现给机器人策略。LaWAM的核心是潜动作条件的潜世界模型LaWM。通过在预训练视觉基础模型的潜空间中训练潜动作模型并重用其前向解码器来预测场景演化的未来观测特征从而获得LaWM。然后LaWAM基于这些预测的潜视觉子目标来调节动作生成从而实现动态-觉察的机器人控制。LaWAM在LIBERO98.6%成功率、RoboTwin91.22%成功率以及真实世界的操作任务中达到了最先进或具有竞争力的成功率同时保持低延迟推理。LaWAM每次动作预测只需187毫秒其时钟墙延迟相比像素空间的WAMs低了最多24倍。如图 2 给出完整的两阶段预训练流程概述。首先将 LaWM 训练为一个潜动作条件的世界模型然后通过潜动作蒸馏对 LaWAM 进行预训练以实现子目标条件的动作生成。总体而言这一训练流程使用大约 3,000 小时的机器人视频和 1,500 小时的第一人称人类视频。在测试时策略会预测一个潜动作LaWM 会在一次前向传递中将其解码为潜视觉子目标然后动作专家根据当前上下文和预测的子目标生成动作片段。在针对不同基准的后续训练后LaWAM 在模拟基准和真实机器人任务中对强大的 VLA 和 WAM 基线表现出最先进或具有竞争力的成功率这些任务包括 LIBERO [21]、RoboTwin [22] 以及真实世界的抓取与放置、抽屉开启和毛巾折叠任务参数量为 23 亿。除了准确性之外图 1 显示 LaWAM 将非迭代潜在预测与一个紧凑的 2.3 亿参数 LaWM 相结合使用的世界建模参数比 50 亿参数的 WAN 主干 [23] 少约 95%。LaWAM 每次动作片段预测运行时间为 187 毫秒且实现的实际延迟比像素空间的 WAM 低多达 24 倍。第一阶段学习 LaWM 作为潜动作模型的前向解码器。每个训练样本包含一个当前观测 o 和一个在物理时间间隔 τ 后采样的远景观测 o_T。在将它们编码为 (u, u_T) 后逆动力学编码器推断潜动作 z ∼ q_φ (z | u, u_T)。然后解码器使用 (u, z) 来预测远景特征u ̃_T LaWM_ω(u, z)。这个训练设置给 LaWM 一个简单的角色在给定当前潜变量状态和潜变量动作的情况下预测未来的潜变量状态。目标 u_T 直接监督解码器而推断出的潜变量动作 z 则作为第二阶段策略先验的教师信号。在这个预训练阶段加入一个辅助信号。一个轻量级的预测器 g 将当前末端执行器状态 s 和潜变量动作 z 映射到未来状态 s_T鼓励 z 编码实际动作而不仅仅是视觉外观的变化。预训练完成后会丢弃这个辅助头只保留解码器作为 LaWM后验编码器仅用于生成策略训练的教师潜变量动作。第二阶段把预训练的 LaWM 变成了测试时的策略接口。第一阶段的 IDM 编码器在部署时不能使用因为它需要未来的特征 u_T 。因此训练策略先验 p_θ (zˆ | o, l) 来根据当前的观察和指令预测潜动作。预测的潜动作会传入预训练的 LaWM 解码器从而生成 uˆ_T LaWM_ω(u, zˆ)让策略能够对块级视觉未来进行潜预测而不需要生成未来的像素。动作专家通过交替DiTAlternate-DiT设计[5]使用这种预测的未来。一条流从VLM骨干网络传递语义上下文而另一条流则携带由(u, uˆ_T)形成的潜动态上下文。在这两条流之间交替让专家在去噪动作块时将任务意图与预测的场景演变结合起来。图3展示最终的块级执行动作专家生成一个基于预测潜子目标的机器人运动块而执行的动作会朝向相应的子目标区域移动。第二阶段训练结合潜动作蒸馏、子目标监督和动作流匹配。进一步应用知识隔离KI[37]以避免动作专家的梯度覆盖预训练的 LaWM 动力学。对于混合频率的机器人数据LaWAM 保持每个数据集的原生控制频率并使用物理时间编码。潜世界模型架构LaWM 在精炼的 DINOv3 ViT-B/16 编码器 [17] 的特征上运行。它的逆动力学编码器和解码器都是 24 层的 Transformer 模块。编码器采用了 V-JEPA2 风格的时空设计 [46]来自当前和远景观测的视觉补丁被展平成一个单独的 token 序列并共同处理以推断潜动作后验。与 Genie [16] 中使用的加性 token 注入不同解码器通过自适应层归一化对潜动作 z 进行条件处理这在跨实体设置中更稳定加性注入可能会因为潜动作范数的波动而导致视觉 token 的整体偏移并引发损失的急剧上升。辅助状态预测器使用轻量级 MLP 头来处理不同机器人实体间的状态语义不一致在 LaWM 训练后会被弃用。潜世界动作模型架构LaWAM 遵循 Qwen-GR00T 架构。用 Qwen3-VL 的前 16 层 Transformer 作为 VLM 主干并用四个 Alternate-DiT 模块实例化动作专家总共对应 16 层 Transformer。隐藏维度为 1024。策略输入序列包含主视角观测、任务指令、潜动作查询 token、可选辅助视角图像以及动作查询 token。所有非查询 token 都充当上下文。通过这种排序和因果注意力掩码潜在动作查询可以收集驱动 LaWM 所需的信息而动作查询仍然可以关注用于控制的完整语义上下文。动作专家通过 Alternate-DiT [5] 接收 LaWM 子目标它不仅在视觉流和语言流之间交替而是在完整的 VLM 隐状态和由当前潜视觉特征 u 与预测子目标特征 uˆ_T 构建的动态流之间交替。所有机器人动作标签都被转换为末端执行器 (EEF) 表示。在策略训练和评估期间不会提供本体感知状态输入这有助于避免对特定轨迹的状态轨迹过拟合并提高空间泛化能力 [47]。所有实验均使用仅 RGB 观测图像尺寸调整为 256 × 256。混合频率数据的物理时间对齐机器人数据集和下游实体可能在不同的控制频率下运行因此相同的动作 token 索引不一定表示相同的物理时间间隔。LaWAM 通过保持每个数据集或实体分支在其原生控制频率同时用固定物理间隔 τ 定义每个动作块来处理这个问题。这使得即使不同分支的离散动作 token 数量不同远景也对应一致的真实时间长度。混合频率训练实验这个实验旨在分离物理时间编码在混合源预训练中的作用。在那种情况下不同的控制频率会导致相同的离散动作索引对应不同的物理时间。在完整的预训练混合数据中直接量化这个效果是困难的因为数据集规模、体现方式、任务分布、摄像机设置和语言覆盖率都在同时变化。因此构建了一个受控的 LIBERO 分析并从零开始训练 LaWAM这样控制频率就是主要的操控变量。从相同的原生 20 Hz LIBERO 轨迹开始通过时间下采样创建 10 Hz 和 5 Hz 版本然后在组合的 5/10/20 Hz 数据上共同训练 LaWAM。这样可以保持各分支之间的任务分布、体现方式、视觉域和语言指令不变同时只改变离散动作索引与经过的物理时间之间的映射。由于低频分支是从相同的 20 Hz 演示中派生出来的混合频率训练并没有引入额外的专家轨迹在这个受控环境下原生 20 Hz 模型因此作为上限参考而不是较弱的数据基线。目标是测试物理时间编码是否能够通过解决混合频率训练带来的控制频率模糊问题从而恢复接近这个参考的性能。训练详情LaWM训练。对于LaWM训练用连续潜动作并利用16个H100 GPU优化等式4实现10万步采用AdamW学习率3×10⁻4权重衰减10⁻²全局批处理大小为10²⁻¹。将KL正则化权重设为β 10−5。固定的物理时间视角为机器人远程操作视频的1.2秒自我中心的人类视频为0.4秒。在 DINOv3 编码之前会对编码器和解码器的视图应用不同的随机裁剪和色彩增强同时保持每个编码器剪辑内的增强时间一致;这让LaWM不太愿意记忆具身特定的像素布局。LaWAM策略训练与评估。第二阶段策略集成使用带有显式语言指令的机器人轨迹。以自我为中心的人类视频通过LaWM先前学习的动态做出贡献但由于通常缺乏明确机器人预期行为的任务描述因此不被用于策略集成。轻量级查询聚合块在潜在动作蒸馏前将潜在动作查询映射到 zˆ。在所有实验中都设 λ_distill λ_wm 0.1。在基准测试专属的后训练之前在64个H100 GPU上运行20万步的LaWAM策略集成预训练阶段整体批处理规模为1024。在此阶段动作专家的学习率为10⁻⁴而其他模块则使用3×10⁻⁹的学习率。对于每个基准的后训练用带余弦衰减的学习率为10⁻4。除非另有说明所有政策均通过10个去噪步骤进行评估。为了测量推理延迟在A100 GPU上运行1000次重复动作块预测并报告平均墙钟延迟。论文中报道的WAM参数计数排除了视频扩散VAE和文本编码器后者大小可达10B参数。与最新的VLA、潜作用和WAM基线进行比较尽可能使用原始论文中的数据其他时间则取出最强的复现数据。真实世界实验协议用两个物理机器人平台如图所示。抓取与搬运以及抽屉开启任务在配备平行夹爪和外部RGB摄像头的Franka Emika Panda机械臂上进行摄像头用于观察工作空间而折叠毛巾任务则在Quanta X1双臂机器人上进行。为每个Franka任务训练了150次真实演示为折叠毛巾训练了280次演示并在30次真实实验中评估每个任务覆盖已知环境和未知测试环境。为了保证对比的可控性每个任务使用的初始配置只生成一次然后在LaWAM和所有基准方法中保持固定以确保所有方法都在相同的物理条件下进行评估。

相关新闻

2026/8/7 5:07:15

Hadoop实战入门:从零搭建伪分布式集群与MapReduce开发指南

1. 项目概述:从“听说过”到“用得上”的Hadoop实战入门如果你在数据领域工作,或者对处理海量信息感兴趣,那么“Hadoop”这个名字你一定不陌生。它经常和“大数据”、“分布式计算”这些听起来高大上的词捆绑出现,让很多初学者望而…

2026/8/7 5:07:15

数据库设计工具横向评测:从PowerDesigner到开源方案选型指南

1. 从“画图”到“工程”:数据库设计工具的本质在数据库领域摸爬滚打十几年,我见过太多团队在数据库设计这个环节上“返璞归真”——用Word画表,用Excel写字段,最后用Visio甚至PPT来画ER图。不是说这些工具不能用,而是…

2026/8/7 5:02:15

从Conda到Mamba:Python包管理工具的性能革命与实战迁移指南

1. 从Conda到Mamba:一次包管理工具的“换芯”体验如果你和我一样,长期在Python数据科学、机器学习或者AI开发领域工作,那么“conda activate”和“conda install”这两条命令,恐怕已经刻进了你的肌肉记忆里。Conda,作为…

2026/8/7 6:22:19

UniApp跨端开发实战避坑指南:从编译原理到性能优化

1. 项目概述:一个UniApp开发者的“踩坑”实录 如果你正在用UniApp开发跨端应用,无论是小程序、H5还是App,那么你大概率已经或即将遇到我接下来要聊的这些问题。这不是一篇官方文档的复述,而是一个在一线摸爬滚打多年的开发者&…

2026/8/7 6:22:19

UnityWebRequest实战:从基础GET到高级断点续传

1. 项目概述:为什么UnityWebRequest是网络交互的基石 在Unity开发中,无论是加载一个远程的配置文件、下载一张贴图,还是从服务器拉取玩家的存档数据,网络请求都是绕不开的核心功能。很多开发者,尤其是刚接触Unity不久的…

2026/8/7 6:22:19

Claude Code进阶:基于MCP协议与Function Calling实现业务流程自动化

1. 项目概述:从“代码助手”到“业务流程执行者”的进化最近在AI编程工具圈里,Claude Code 的热度持续攀升,但很多讨论还停留在“它写代码快不快”、“比Copilot谁更强”的层面。作为一个深度使用过各类AI编程工具的老码农,我发现…

2026/8/7 6:22:19

CSS元素居中全解析:从传统定位到Flexbox/Grid现代方案

1. 项目概述:为什么“居中”是CSS的永恒话题?刚入门前端那会儿,我被一个看似简单的问题折磨了好几天:怎么把一个盒子在页面里“摆正”?无论是登录框、弹窗,还是一个小小的图标,让它不偏不倚地待…

2026/8/7 6:22:18

大模型函数调用实战:从自然语言到SQL查询的AI助手构建

1. 项目概述:从“聊天”到“做事”的范式转变如果你最近在折腾大模型,尤其是尝试用它们来做点实际的事情,比如查查数据库、发个邮件、或者控制一下智能家居,那你大概率会遇到一个瓶颈:大模型很能聊,但它给出…

2026/8/7 6:17:18

图解曲面积分:从“数格子”到“看方向”的本质区别与计算策略

1. 从“数格子”到“看方向”:两类曲面积分的直观分野在多元微积分的学习路上,曲面积分常常是那个让人“卡壳”的难点。很多朋友能记住第一类曲面积分是“对面积的积分”,第二类是“对坐标的积分”,但一到具体计算,尤其…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/7 0:01:55

CAD图库管理:从文件归档到设计资产管理的效率革命

你肯定遇到过这种情况:打开一个老项目,想找某个特定的图块——比如一个标准的门、一个特定的设备符号,或者一个公司logo。你记得它就在某个DWG文件里,或者曾经从某个同事那里拷来过。于是,你开始在一堆命名混乱的文件夹…

2026/8/7 0:01:55

5分钟掌握Wand-Enhancer:2026年终极WeMod专业版免费解锁指南

5分钟掌握Wand-Enhancer:2026年终极WeMod专业版免费解锁指南 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer Wand-Enhancer是一款功能强…

2026/8/7 0:01:55

“Quality Control(质量控制)”在软件工程中通常指通过一系列活动确保软件产品符合预定的质量标准和用户需求

“Quality Control(质量控制)”在软件工程中通常指通过一系列活动确保软件产品符合预定的质量标准和用户需求。而“软件测试”是质量控制的关键手段之一,属于QC范畴下的具体实践,其目标是发现缺陷、验证功能正确性、评估软件质量属…

2026/8/5 19:21:13

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/5 19:21:13

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/6 20:45:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…