发布时间:2026/8/7 5:07:15
AHA-WAM:观察引导上下文路由的异步范围-自适应的世界-动作建模 26年6月来自上海交大、上海AI实验室、百度AI和港大的论文“AHA-WAM: Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing”。世界动作模型已成为机器人操作的一个有前景的范式它将视觉场景动态和动作联合建模以将物理先验注入策略学习中。然而现有的世界动作模型在相同的时间分辨率下耦合世界预测和动作执行迫使世界分支去建模那些冗余且信息量弱的近期帧变化。将世界预测和动作执行严格绑定在相同的时间节奏上可能会未充分利用视频分支在实体控制中的潜力。提出 AHA-WAM一种基于双扩散TransformerDiT架构的异步范围-自适应世界-动作模型它围绕这种时间非对称性重新组织世界动作建模。AHA-WAM将视频DiT实例化为低频世界规划器维护对过去观察的滚动KV记忆并暴露可重用的分层潜上下文以编码长时段场景演变而高频动作DiT则通过分层联合注意在闭环中执行短动作块以查询该上下文。为了支持异步执行引入范围-自适应偏移训练和观察引导的视频上下文路由OVCR这两者共同使动作专家能够利用长范围世界上下文同时对实时执行状态保持响应无需重新运行视频DiT。AHA-WAM概述如图1所示通用机器人操作策略。通用机器人策略旨在从大规模多样化的演示中学习广泛适用的操作技能[1-4]。RT-1[5]和RT-2[6]通过吸收异构机器人轨迹并将网络规模的视觉语言知识迁移到机器人控制中建立了视觉-语言-动作VLA范式。后续工作[7-15]通过将流匹配和基于扩散的动作头[16,17]与大型预训练骨干网络相结合进一步提高泛化能力建立了扩散TransformerDiT[18]作为表达能力强且可扩展的策略架构。然而这些方法仍然主要以动作为中心物理场景动态仅通过演示隐式地捕获这促使了AHA-WAM扩展的世界动作建模范式的出现。用于机器人控制的世界模型。世界模型[19-22]通过预测性视觉动力学来增强机器人策略超越了单纯的动作模仿。现有的基于视频的机器人世界模型大致可以分为两类。第一类遵循“先想象后行动”的范式例如UniPi[23]、Seer[24]和视频预测策略[25]等方法首先预测未来的视觉状态或预测性视觉表征然后通过逆动力学或基于预测未来的策略来恢复动作这在闭环部署中引入了延迟。第二类方法执行联合世界-动作建模其中未来的视觉动力学和动作在共享的生成架构中建模[26-31]。但所有这些方法都将世界预测和动作执行耦合在相同的时间分辨率下将资源消耗在对控制而言冗余的短时域相邻帧上。AHA-WAM通过将视频DiT作为低频长时域规划器与动作DiT作为高频闭环执行器来解决这个问题。双-系统和异步机器人策略。近期的机器人策略探索双-系统或异步设计旨在将深思熟虑的计算与反应式控制相结合。RoboDual [32] 使用 VLA 通用机器人为高效的扩散专家提供任务理解和粗略的动作指导而 Reactive Diffusion Policy [33] 则将缓慢的潜扩散策略与快速的触觉反馈路径相结合以实现丰富的接触操作。AsyncVLA [34] 异步运行一个大型基础模型以提供延迟的语义指导并通过轻量级边缘适配器对其进行细化从而实现快速执行。虽然这些方法验证双-系统执行的有效性但它们的慢速分支主要为动作策略提供指导、反馈或表征。AHA-WAM 则在联合世界-动作建模中实现慢速-快速分离视频 DiT 和动作 DiT 异步运行但通过逐层联合注意机制保持耦合。AHA-WAM世界动作模型将动作预测与学习到的视觉动态相结合但现有模型通常将视频分支和动作分支组织在相同的短时域执行节奏下。其将世界动作建模构建为一个双时间尺度生成问题。图2展示了整体架构。AHA-WAM将WAM推理重组为一个异步世界动作耦合框架同时保留双DiT架构低频视频规划器生成可重用的长时域规划器上下文而高频动作专家则利用该上下文进行闭环动作去噪。这里“时域自适应”指的是在解耦的时间尺度下对任意规划器-执行器相位偏移的鲁棒性而不是在线时域选择。换句话说AHA-WAM在测试时不会动态选择视频或动作时域相反它训练执行器在可变动作起始偏移下利用长时域规划器上下文从而使异步接口能够应对流式部署引起的相位错位。该设计由三种互补机制支持。观察引导的视频上下文路由OVCR无需重新运行视频DiT即可将缓存的规划器上下文调整到最新观察结果。时域自适应偏移训练使动作专家能够感知异步流式传输引起的规划器-执行器相位偏移而滚动KV存储则扩展了视频规划器的时间感受野使其涵盖过去的观察结果。最后实时推理优化进一步加速了高频动作流从而实现闭环部署。1双DiT规划器-执行器架构模型架构。AHA-WAM 基于双 DiT 架构构建该架构包含一个视频 DiT 世界规划器和一个动作 DiT 执行器。视觉观测由预训练的 VAE 进行编码而来自文本编码器的语言嵌入则为两个分支提供条件。动作分支是一个轻量级的动作专家 DiT其层深度与视频 DiT 相同从而实现两个分支之间的逐层交互。视频 DiT 以视觉潜tokens作为输入并经过训练以预测更长规划周期内的未来视频潜tokens。动作 DiT 接收带噪声的动作tokens和本体感受 tokens并在闭环机器人状态反馈下对动作块进行去噪。高频动作分支的视觉反馈并非简单地拼接密集视觉tokens相反视觉信息通过规划器的视频上下文进行中介并由 OVCR 进行调整。逐层规划器-执行器耦合。两个 DiT 之间的核心接口是逐层规划器的视频上下文。此上下文是一种潜在的世界规划表示由一个视频扩散Transformervideo-DiT前向传播暴露出来并被多个后续的动作扩散Transformeraction-DiT前向传播重用。它不同于滚动KV记忆后者在视频规划器内部存储跨规划器刷新的历史视频状态。在训练过程中视频分支在完全因果的视频掩码下预测未来的视频潜元素从而鼓励视频动态信息树学习前向场景动态同时利用视觉动态监督来塑造规划器上下文。动作分支被屏蔽使其无法关注未来的视频元素因此在推理过程中可以移除未来视频预测路径。由此未来视频预测作为世界建模的训练信号而规划器视频上下文则作为推理时与动作执行器的接口。这个耦合保留视觉动态和动作生成之间的 WAM 式交互同时将昂贵的视频 DiT 计算分摊到多个高频动作更新中。联合世界-动作训练目标。AHA-WAM 的训练目标是结合动作片段和未来视频潜表示实现动作流匹配。在部署时AHA-WAM 取消显式的未来帧解码视频 DiT 仅刷新规划器视频上下文动作 DiT 使用此上下文生成闭环动作块。2 基于观察的视频上下文路由异步执行会为多个动作块复用同一个规划器视频上下文这虽然分摊了视频DiT的计算成本但也带来了一个上下文对齐问题在下一次规划器刷新之前机器人状态和视觉场景可能已经发生变化。基于观察的视频上下文路由OVCR通过使用最新的视觉观察结果将共享的规划器上下文转换为特定于动作块的上下文从而解决了这个问题。OVCR 不是将密集的视觉tokens输入到高频动作 DiT 中而是将它们压缩成一组路由查询这些查询在动作去噪之前选择并编辑相关的规划器上下文。对于时间 t 的每个动作块将对齐的观察上下文拆分为视觉tokens和本体感觉tokens。本体感觉输入紧凑且与瞬时机器人状态直接相关因此轻量级编码器将其映射到一个状态token其直接提供给动作 DiT。视觉反馈通过上下文路由间接注入。给定 Q 个可学习的基础查询 BOVCR 通过对当前视觉tokens进行注意池化来构建观察引导的路由查询。由此产生的查询提供紧凑的、受观察条件约束的槽位用于从规划器视频上下文中检索与块相关的信息。OVCR 将规划器上下文的重用从静态缓存转变为基于观察的检索和自适应。因此视频 DiT 保持在每次更新的关键路径之外而每个动作块仍然会收到与最新视觉证据一致的规划器表示。3. 范围-自适应偏移训练异步流会改变慢速规划器和快速执行器之间的相对时间相位。如果训练始终使用视频规划窗口和动作块之间的固定对齐方式则动作 DiT 可能过拟合于单个规划器-执行器相位并在部署期间的中间阶段重用规划器上下文时变得脆弱。因此引入范围-自适应偏移训练使执行器能够应对异步推理引起的相位偏移。令 h_v 表示视频规划视域h_a 表示动作块视域其中 h_a h_v。如图 3 所示对于从时间 τ 开始的每个训练片段视频规划器对 [τ, τ h_v) 上的未来视频潜表示进行建模。由于规划器-执行器对齐方式随动作块大小周期性变化因此采样 δ ∈ [0, h_a) 可以覆盖在多个执行器更新中重用同一规划器上下文时遇到的所有块级相位。因此范围-自适应偏移训练教会动作 DiT 在可变动作开始偏移下利用长范围规划器上下文而 OVCR 在每个阶段处理观察条件上下文选择。4. 滚动式规划器内存由于视频 DiT 作为低频规划器运行它应该在规划器刷新期间保留历史场景信息而不仅仅依赖于当前观测值。这对于长范围操作至关重要因为已完成的子目标、位移的物体或先前观测的状态可以提供重要的上下文信息。因此在视频规划器内部维护一个固定大小的 FIFO 滚动式 K/V 内存。该内存位于慢速视频规划器内部不会被动作 DiT 直接使用。它会在生成下一个规划器上下文之前扩展规划器的时间感受野而高频执行器仍然只与最新的 OVCR 自适应规划器视频上下文交互。5 流式推理和实时优化异步规划器-执行器架构自然而然地导致了流式streaming推理调度。在部署时视频规划器和动作执行器作为两个非阻塞流执行其中 AHA-WAM 将视频 DiT 从每次更新的关键路径中移除但动作分支仍必须以闭环控制频率运行。因此优化动作块推理路径测量一次动作更新的端到端延迟 L_chunk其中包括图像编码、规划器上下文访问、OVCR 路由和动作去噪。视频 DiT 预填充是异步执行的因此 L_chunk 直接决定了动作更新频率。CUDA 加速。通过尽可能使用 TensorRT 和 CUDA 图捕获来执行动作 DiT、内存和上下文模块以及 VAE 编码器从而将重复的动作阶段计算编译成一个静态部署路径同时从去噪热路径中移除冗余的循环不变计算和重复的缓冲区复制。这些更改不会改变模型架构、权重或采样过程但将 10 步动作推理的延迟从 PyTorch eager execution 中的 415.77 毫秒降低到 41.37 毫秒。ODE 蒸馏。在 CUDA 加速的 10 步路径之上构建 AHA-WAM-Flash将动作采样器从 10 个去噪步骤蒸馏到 2 个步骤同时保持相同的观测、规划器上下文和 OVCR 接口。在蒸馏过程中视频 DiT 被冻结学生模型通过采样中间状态进行训练以直接预测教师模型的最终动作输出采样偏向于噪声较大的状态以支持积极的步骤缩减。 ODE 蒸馏进一步将 Lchunk 从 41.37 毫秒减少到 17.56 毫秒。实验设置模型与训练。AHA-WAM 采用双 DiT 策略实现并具有显式异步的规划器-执行器接口。用预训练的 Wan2.2-5B 视频模型初始化世界规划分支其中包括视频 DiT、文本编码器和视频 VAE。与 Fast-WAM [30] 类似高频动作执行器采用紧凑的 DiT 架构隐藏维度 d_a 1024对应约 10.2 亿个参数。除了 49.9 亿个参数的视频规划器和 10.2 亿个参数的动作 DiT 之外AHA-WAM 还引入了 12.2 亿个参数用于滚动 K/V 记忆和上下文路由模块使得最终实例化的模型总参数量约为 72.3 亿个。对于 AHA-WAM 的时间配置视频分支在一个较长的规划时域 h_v 64 上运行而动作分支则预测时域 h_a 16 的短可执行块。在异步推理期间视频规划器维护一个可重用的逐层 K/V 上下文该上下文通过最多 6 个历史观测帧的 FIFO 滚动内存进行增强。动作执行器通过 OVCR 调整此上下文每个动作块使用 32 个基于观测的路由查询。训练过程中世界建模和动作预测均采用流匹配噪声时间采用 logit 正态采样。动作生成方面在推理阶段使用 10 个去噪步骤并将 CFG 设置为 1.0。所有模型均使用 AdamW 进行训练学习率为 1 × 10⁻⁴权重衰减为 0.01采用余弦调度、混合精度和梯度裁剪。延迟是在单个 NVIDIA RTX 5090D GPU 上报告的。评估范围。我们在 RoboTwin 2.0 仿真 [35] 和真实世界实验中评估 AHA-WAM。仿真基准测试在干净场景和随机场景下进行多任务操作而真实世界实验测试在物理双臂任务上的部署。在两种设置下都将任务成功率作为主要指标并进一步分析闭环推理延迟以量化部署效率。RoboTwin 仿真在 RoboTwin 2.0 [35] 上评估 AHA-WAMRoboTwin 2.0 是一个双臂操作基准测试包含 50 个涵盖各种技能的双臂任务。遵循 [27, 29, 30] 中的多任务训练设置对于每个任务训练集包含 50 个干净场景下的演示和 500 个随机场景下的演示。模型采用多任务方式训练全局批大小为 512。每种方法在干净设置和随机设置下每个任务均进行 100 次试验报告任务平均成功率。将模型与具有竞争力的 VLA 和 WAM 基线模型进行比较包括 π0 [2]、π0.5 [9]、ABot-M0 [36]、Motus [27]、LingBot-VA [29] 和 Fast-WAM [30]。真实世界机器人实验设置。用配备自视RGB摄像头的双手动AgileX Piper平台进行评估策略仅使用头部视角RGB观测值、本体感觉状态和语言指令作为输入。考虑四个任务——折叠毛巾、整理桌面、制作豆浆和存放餐盘——涵盖可变形操作、长时域重排、精细工具使用、接触丰富的控制和空间泛化。对于每个任务平均收集约120个回合。实现。由于Fast-WAM和AHA-WAM默认情况下未在任何机器人数据上进行预训练用选定的RoboCOIN子集[37]对Fast-WAM和AHA-WAM进行预训练该子集包含24,600条轨迹和约165小时的机器人数据以确保部署比较的公平性和稳定性。两个模型均在相同的特定任务演示上进行微调。 Motus 和 Fast-WAM 的部署延迟较大导致动作更新稀疏闭环行为不稳定。采用 RTC 式的非阻塞执行方案 [38] 来部署它们并在预测块之间进行动作插值从而在高推理延迟下实现更平滑的控制。AHA-WAM 则通过其异步规划器-执行器接口进行部署其中执行器利用最新的观测结果和重用的规划器上下文执行高频闭环更新。

相关新闻

2026/8/7 5:07:15

LaWAM:用于高效动态-觉察机器人策略的潜世界行动模型

26年6月来自清华、吉林大学、南开、北大、哈工大、中关村学院、正行创新(Striding AI)公司和无问芯穹(Infinigence AI)公司的论文“LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies”。 视觉-语言…

2026/8/7 5:07:15

Hadoop实战入门:从零搭建伪分布式集群与MapReduce开发指南

1. 项目概述:从“听说过”到“用得上”的Hadoop实战入门如果你在数据领域工作,或者对处理海量信息感兴趣,那么“Hadoop”这个名字你一定不陌生。它经常和“大数据”、“分布式计算”这些听起来高大上的词捆绑出现,让很多初学者望而…

2026/8/7 5:07:15

数据库设计工具横向评测:从PowerDesigner到开源方案选型指南

1. 从“画图”到“工程”:数据库设计工具的本质在数据库领域摸爬滚打十几年,我见过太多团队在数据库设计这个环节上“返璞归真”——用Word画表,用Excel写字段,最后用Visio甚至PPT来画ER图。不是说这些工具不能用,而是…

2026/8/7 6:22:19

UniApp跨端开发实战避坑指南:从编译原理到性能优化

1. 项目概述:一个UniApp开发者的“踩坑”实录 如果你正在用UniApp开发跨端应用,无论是小程序、H5还是App,那么你大概率已经或即将遇到我接下来要聊的这些问题。这不是一篇官方文档的复述,而是一个在一线摸爬滚打多年的开发者&…

2026/8/7 6:22:19

UnityWebRequest实战:从基础GET到高级断点续传

1. 项目概述:为什么UnityWebRequest是网络交互的基石 在Unity开发中,无论是加载一个远程的配置文件、下载一张贴图,还是从服务器拉取玩家的存档数据,网络请求都是绕不开的核心功能。很多开发者,尤其是刚接触Unity不久的…

2026/8/7 6:22:19

Claude Code进阶:基于MCP协议与Function Calling实现业务流程自动化

1. 项目概述:从“代码助手”到“业务流程执行者”的进化最近在AI编程工具圈里,Claude Code 的热度持续攀升,但很多讨论还停留在“它写代码快不快”、“比Copilot谁更强”的层面。作为一个深度使用过各类AI编程工具的老码农,我发现…

2026/8/7 6:22:19

CSS元素居中全解析:从传统定位到Flexbox/Grid现代方案

1. 项目概述:为什么“居中”是CSS的永恒话题?刚入门前端那会儿,我被一个看似简单的问题折磨了好几天:怎么把一个盒子在页面里“摆正”?无论是登录框、弹窗,还是一个小小的图标,让它不偏不倚地待…

2026/8/7 6:22:18

大模型函数调用实战:从自然语言到SQL查询的AI助手构建

1. 项目概述:从“聊天”到“做事”的范式转变如果你最近在折腾大模型,尤其是尝试用它们来做点实际的事情,比如查查数据库、发个邮件、或者控制一下智能家居,那你大概率会遇到一个瓶颈:大模型很能聊,但它给出…

2026/8/7 6:17:18

图解曲面积分:从“数格子”到“看方向”的本质区别与计算策略

1. 从“数格子”到“看方向”:两类曲面积分的直观分野在多元微积分的学习路上,曲面积分常常是那个让人“卡壳”的难点。很多朋友能记住第一类曲面积分是“对面积的积分”,第二类是“对坐标的积分”,但一到具体计算,尤其…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/7 0:01:55

CAD图库管理:从文件归档到设计资产管理的效率革命

你肯定遇到过这种情况:打开一个老项目,想找某个特定的图块——比如一个标准的门、一个特定的设备符号,或者一个公司logo。你记得它就在某个DWG文件里,或者曾经从某个同事那里拷来过。于是,你开始在一堆命名混乱的文件夹…

2026/8/7 0:01:55

5分钟掌握Wand-Enhancer:2026年终极WeMod专业版免费解锁指南

5分钟掌握Wand-Enhancer:2026年终极WeMod专业版免费解锁指南 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer Wand-Enhancer是一款功能强…

2026/8/7 0:01:55

“Quality Control(质量控制)”在软件工程中通常指通过一系列活动确保软件产品符合预定的质量标准和用户需求

“Quality Control(质量控制)”在软件工程中通常指通过一系列活动确保软件产品符合预定的质量标准和用户需求。而“软件测试”是质量控制的关键手段之一,属于QC范畴下的具体实践,其目标是发现缺陷、验证功能正确性、评估软件质量属…

2026/8/5 19:21:13

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/5 19:21:13

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/6 20:45:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…