LaWAM:用于高效动态-觉察机器人策略的潜世界行动模型 26年6月来自清华、吉林大学、南开、北大、哈工大、中关村学院、正行创新Striding AI公司和无问芯穹Infinigence AI公司的论文“LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies”。视觉-语言-动作模型VLAs利用大规模的视觉-语言预训练来实现语义机器人控制但通常缺乏对机器人动作如何改变场景的明确前瞻性。世界-动作模型WAMs通过将策略建立在预测未来的基础上来解决这一限制但现有方法通常依赖计算开销高且像素级冗余大的视频生成。LaWAM一种潜世界动作模型它通过紧凑的潜视觉子目标而不是重建的未来视频将预测动态信息呈现给机器人策略。LaWAM的核心是潜动作条件的潜世界模型LaWM。通过在预训练视觉基础模型的潜空间中训练潜动作模型并重用其前向解码器来预测场景演化的未来观测特征从而获得LaWM。然后LaWAM基于这些预测的潜视觉子目标来调节动作生成从而实现动态-觉察的机器人控制。LaWAM在LIBERO98.6%成功率、RoboTwin91.22%成功率以及真实世界的操作任务中达到了最先进或具有竞争力的成功率同时保持低延迟推理。LaWAM每次动作预测只需187毫秒其时钟墙延迟相比像素空间的WAMs低了最多24倍。如图 2 给出完整的两阶段预训练流程概述。首先将 LaWM 训练为一个潜动作条件的世界模型然后通过潜动作蒸馏对 LaWAM 进行预训练以实现子目标条件的动作生成。总体而言这一训练流程使用大约 3,000 小时的机器人视频和 1,500 小时的第一人称人类视频。在测试时策略会预测一个潜动作LaWM 会在一次前向传递中将其解码为潜视觉子目标然后动作专家根据当前上下文和预测的子目标生成动作片段。在针对不同基准的后续训练后LaWAM 在模拟基准和真实机器人任务中对强大的 VLA 和 WAM 基线表现出最先进或具有竞争力的成功率这些任务包括 LIBERO [21]、RoboTwin [22] 以及真实世界的抓取与放置、抽屉开启和毛巾折叠任务参数量为 23 亿。除了准确性之外图 1 显示 LaWAM 将非迭代潜在预测与一个紧凑的 2.3 亿参数 LaWM 相结合使用的世界建模参数比 50 亿参数的 WAN 主干 [23] 少约 95%。LaWAM 每次动作片段预测运行时间为 187 毫秒且实现的实际延迟比像素空间的 WAM 低多达 24 倍。第一阶段学习 LaWM 作为潜动作模型的前向解码器。每个训练样本包含一个当前观测 o 和一个在物理时间间隔 τ 后采样的远景观测 o_T。在将它们编码为 (u, u_T) 后逆动力学编码器推断潜动作 z ∼ q_φ (z | u, u_T)。然后解码器使用 (u, z) 来预测远景特征u ̃_T LaWM_ω(u, z)。这个训练设置给 LaWM 一个简单的角色在给定当前潜变量状态和潜变量动作的情况下预测未来的潜变量状态。目标 u_T 直接监督解码器而推断出的潜变量动作 z 则作为第二阶段策略先验的教师信号。在这个预训练阶段加入一个辅助信号。一个轻量级的预测器 g 将当前末端执行器状态 s 和潜变量动作 z 映射到未来状态 s_T鼓励 z 编码实际动作而不仅仅是视觉外观的变化。预训练完成后会丢弃这个辅助头只保留解码器作为 LaWM后验编码器仅用于生成策略训练的教师潜变量动作。第二阶段把预训练的 LaWM 变成了测试时的策略接口。第一阶段的 IDM 编码器在部署时不能使用因为它需要未来的特征 u_T 。因此训练策略先验 p_θ (zˆ | o, l) 来根据当前的观察和指令预测潜动作。预测的潜动作会传入预训练的 LaWM 解码器从而生成 uˆ_T LaWM_ω(u, zˆ)让策略能够对块级视觉未来进行潜预测而不需要生成未来的像素。动作专家通过交替DiTAlternate-DiT设计[5]使用这种预测的未来。一条流从VLM骨干网络传递语义上下文而另一条流则携带由(u, uˆ_T)形成的潜动态上下文。在这两条流之间交替让专家在去噪动作块时将任务意图与预测的场景演变结合起来。图3展示最终的块级执行动作专家生成一个基于预测潜子目标的机器人运动块而执行的动作会朝向相应的子目标区域移动。第二阶段训练结合潜动作蒸馏、子目标监督和动作流匹配。进一步应用知识隔离KI[37]以避免动作专家的梯度覆盖预训练的 LaWM 动力学。对于混合频率的机器人数据LaWAM 保持每个数据集的原生控制频率并使用物理时间编码。潜世界模型架构LaWM 在精炼的 DINOv3 ViT-B/16 编码器 [17] 的特征上运行。它的逆动力学编码器和解码器都是 24 层的 Transformer 模块。编码器采用了 V-JEPA2 风格的时空设计 [46]来自当前和远景观测的视觉补丁被展平成一个单独的 token 序列并共同处理以推断潜动作后验。与 Genie [16] 中使用的加性 token 注入不同解码器通过自适应层归一化对潜动作 z 进行条件处理这在跨实体设置中更稳定加性注入可能会因为潜动作范数的波动而导致视觉 token 的整体偏移并引发损失的急剧上升。辅助状态预测器使用轻量级 MLP 头来处理不同机器人实体间的状态语义不一致在 LaWM 训练后会被弃用。潜世界动作模型架构LaWAM 遵循 Qwen-GR00T 架构。用 Qwen3-VL 的前 16 层 Transformer 作为 VLM 主干并用四个 Alternate-DiT 模块实例化动作专家总共对应 16 层 Transformer。隐藏维度为 1024。策略输入序列包含主视角观测、任务指令、潜动作查询 token、可选辅助视角图像以及动作查询 token。所有非查询 token 都充当上下文。通过这种排序和因果注意力掩码潜在动作查询可以收集驱动 LaWM 所需的信息而动作查询仍然可以关注用于控制的完整语义上下文。动作专家通过 Alternate-DiT [5] 接收 LaWM 子目标它不仅在视觉流和语言流之间交替而是在完整的 VLM 隐状态和由当前潜视觉特征 u 与预测子目标特征 uˆ_T 构建的动态流之间交替。所有机器人动作标签都被转换为末端执行器 (EEF) 表示。在策略训练和评估期间不会提供本体感知状态输入这有助于避免对特定轨迹的状态轨迹过拟合并提高空间泛化能力 [47]。所有实验均使用仅 RGB 观测图像尺寸调整为 256 × 256。混合频率数据的物理时间对齐机器人数据集和下游实体可能在不同的控制频率下运行因此相同的动作 token 索引不一定表示相同的物理时间间隔。LaWAM 通过保持每个数据集或实体分支在其原生控制频率同时用固定物理间隔 τ 定义每个动作块来处理这个问题。这使得即使不同分支的离散动作 token 数量不同远景也对应一致的真实时间长度。混合频率训练实验这个实验旨在分离物理时间编码在混合源预训练中的作用。在那种情况下不同的控制频率会导致相同的离散动作索引对应不同的物理时间。在完整的预训练混合数据中直接量化这个效果是困难的因为数据集规模、体现方式、任务分布、摄像机设置和语言覆盖率都在同时变化。因此构建了一个受控的 LIBERO 分析并从零开始训练 LaWAM这样控制频率就是主要的操控变量。从相同的原生 20 Hz LIBERO 轨迹开始通过时间下采样创建 10 Hz 和 5 Hz 版本然后在组合的 5/10/20 Hz 数据上共同训练 LaWAM。这样可以保持各分支之间的任务分布、体现方式、视觉域和语言指令不变同时只改变离散动作索引与经过的物理时间之间的映射。由于低频分支是从相同的 20 Hz 演示中派生出来的混合频率训练并没有引入额外的专家轨迹在这个受控环境下原生 20 Hz 模型因此作为上限参考而不是较弱的数据基线。目标是测试物理时间编码是否能够通过解决混合频率训练带来的控制频率模糊问题从而恢复接近这个参考的性能。训练详情LaWM训练。对于LaWM训练用连续潜动作并利用16个H100 GPU优化等式4实现10万步采用AdamW学习率3×10⁻4权重衰减10⁻²全局批处理大小为10²⁻¹。将KL正则化权重设为β 10−5。固定的物理时间视角为机器人远程操作视频的1.2秒自我中心的人类视频为0.4秒。在 DINOv3 编码之前会对编码器和解码器的视图应用不同的随机裁剪和色彩增强同时保持每个编码器剪辑内的增强时间一致;这让LaWM不太愿意记忆具身特定的像素布局。LaWAM策略训练与评估。第二阶段策略集成使用带有显式语言指令的机器人轨迹。以自我为中心的人类视频通过LaWM先前学习的动态做出贡献但由于通常缺乏明确机器人预期行为的任务描述因此不被用于策略集成。轻量级查询聚合块在潜在动作蒸馏前将潜在动作查询映射到 zˆ。在所有实验中都设 λ_distill λ_wm 0.1。在基准测试专属的后训练之前在64个H100 GPU上运行20万步的LaWAM策略集成预训练阶段整体批处理规模为1024。在此阶段动作专家的学习率为10⁻⁴而其他模块则使用3×10⁻⁹的学习率。对于每个基准的后训练用带余弦衰减的学习率为10⁻4。除非另有说明所有政策均通过10个去噪步骤进行评估。为了测量推理延迟在A100 GPU上运行1000次重复动作块预测并报告平均墙钟延迟。论文中报道的WAM参数计数排除了视频扩散VAE和文本编码器后者大小可达10B参数。与最新的VLA、潜作用和WAM基线进行比较尽可能使用原始论文中的数据其他时间则取出最强的复现数据。真实世界实验协议用两个物理机器人平台如图所示。抓取与搬运以及抽屉开启任务在配备平行夹爪和外部RGB摄像头的Franka Emika Panda机械臂上进行摄像头用于观察工作空间而折叠毛巾任务则在Quanta X1双臂机器人上进行。为每个Franka任务训练了150次真实演示为折叠毛巾训练了280次演示并在30次真实实验中评估每个任务覆盖已知环境和未知测试环境。为了保证对比的可控性每个任务使用的初始配置只生成一次然后在LaWAM和所有基准方法中保持固定以确保所有方法都在相同的物理条件下进行评估。