【星海图】Fast-WAM: Do World Action Models Need Test-time Future Imagination 译读笔记

📅 发布时间:2026/8/22 10:32:46
【星海图】Fast-WAM: Do World Action Models Need Test-time Future Imagination 译读笔记
Fast-WAM: Do World Action Models Need Test-time Future Imagination?摘要世界行动模型World Action Models, WAMs作为一种有前景的替代方案可以取代视觉-语言-行动Vision-Language-Action, VLA模型用于实现具身控制因为它们显式地对视觉观测在动作影响下将如何演变进行了建模。大多数现有的WAMs遵循“先想象后执行”imagine-then-execute的范式这会因迭代式的视频去噪而在测试阶段产生显著的延迟然而要获得强大的动作表现显式的未来想象是否真的是必要的目前仍不清楚。本文探讨了 WAM 在测试阶段是否需要显式的未来想象或者它们的优势是否主要来源于训练期间的视频建模。本文提出了一种 WAM 架构 Fast-WAM它在训练期间保留了视频协同训练video co-training但在测试阶段跳过了未来预测从而将训练期间视频建模的作用与推理期间显式的未来生成解耦。本文进一步实例化了几个 Fast-WAM 变体以便对这两个因素进行对照比较。在这些变体中本文发现 Fast-WAM 依然能与“先想象后执行imagine-then-execute”的变体保持竞争力而移除视频协同训练则会导致大得多的性能下降。从经验上看在没有进行具身预训练的情况下Fast-WAM 在仿真基准测试LIBERO和RoboTwin以及真实世界任务上都取得了与最先进方法相媲美的结果。它可以实时运行延迟仅为190毫秒比现有的 imagine-then-execute WAMs 快 4 倍以上。这些结果表明WAM中视频预测的主要价值可能在于改进训练期间的世界表征而不是在测试阶段生成未来的观测结果。1 引言构建通用具身智能体需要的策略不仅能将视觉观测映射为动作还能推理物理世界在交互作用下将如何演变。这激发了人们对世界动作模型World Action Models, WAMs日益增长的兴趣这些模型在一个统一的框架中结合了未来视觉预测与动作建模。与标准的视觉-语言-动作d Vision-Language-Action, VLA模型相比WAM颇具吸引力因为对未来观测进行建模可能有助于捕捉物理动力学以及与任务相关的时间结构。大多数现有的WAMs遵循“先想象后执行imagine-then-execute”的范式它们首先生成未来的观测结果然后以想象的未来为条件来预测动作。