ImageWAM 论文笔记

📌 论文基本信息

项目 内容
标题 ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?
作者 Yuyang Zhang*, Wenyao Zhang*, Zekun Qi, He Zhang, Haitao Lin, Jingbo Zhang, Yao Mu, Xiaokang Yang, Wenjun Zeng, Xin Jin
单位 上海交通大学、东方理工学院、腾讯 Robotics X、清华大学、中关村学院
日期 2026年6月19日
论文链接 https://arxiv.org/abs/2606.19531
项目主页 https://zhangwenyao1.github.io/ImageWAM/
GitHub https://github.com/yuyangalin/ImageWAM

🎯 核心思想(一句话总结)

WAM 不一定需要视频生成,用图像编辑模型作为骨干更高效、更聚焦于任务相关的视觉变化,且推理成本大幅降低。


1. 研究背景与动机

1.1 现有 WAM 的问题

传统 WAM 依赖 视频生成模型 来预测未来帧,存在三大耦合问题:

问题 说明
推理成本高 需要生成密集的多帧时空 token,计算量大
容量浪费 视频模型需要建模外观细节、背景变化、相机运动等,这些与机器人动作弱相关
误差积累 长时程想象可能产生错误的未来视频,误导动作预测

核心疑问:世界动作模型真的需要视频生成吗?

1.2 图像编辑的优势

图像编辑模型是将源图像根据语言指令进行转换,相比视频生成,它具有三个优势:

  1. 指令-变化对齐:预训练目标直接耦合语言与视觉修改,关注"什么应该变、在哪里变、怎么变"
  2. 更简单的代理任务:只需建模当前状态与目标状态的视觉差异,而非完整时间轨迹
  3. 更紧凑的推理路径:可直接使用内部编辑感知表示,无需解码密集多帧视频

2. 方法:ImageWAM

2.1 问题形式化

  • 输入:当前观测图像 $o_t$+语言指令 $l$
  • 输出:动作块 ${\mathbf{a}}{t:t+H}=(a_t, a{t+1}, \dots, a_{t+H})$
  • 策略学习目标:${\pi}0({\mathbf{a}}{t:t+H}|0_t,l)$

视频 WAM

$$(o_t, l) \rightarrow \hat{o}{t+1:t+H+1} \rightarrow \mathbf{a}{t:t+H}$$

ImageWAM

$$(o_t, l) \rightarrow \hat{o}{\text{edit}} \equiv \hat{o}{t+H+1} \rightarrow \mathbf{a}_{t:t+H}$$

ImageWAM 只预测一个终点帧,而非完整视频轨迹。

2.2 架构设计

关键机制

  • KV Cache 提取:(\mathcal{C}{\text{edit}}^\tau = f{\text{edit}}^\tau(o_t, l)),从编辑骨干的某一去噪时间步提取
  • 动作专家:基于 KV Cache,通过流匹配(Flow Matching)生成动作块
  • 推理时:只需一步编辑前向传播,无需完整去噪轨迹

2.3 训练目标

图像编辑损失
$$\mathcal{L}{\text{img}} = \mathbb{E}\left[| u\phi(z_r, r | o_t, l) - (\epsilon_z - z_{t+K}^*)|_2^2\right]$$

动作流匹配损失
$$\mathcal{L}{\text{act}} = \mathbb{E}\left[| v\theta(\mathbf{a}s, s | o_t, l, \mathcal{C}{\text{edit}}^\tau) - (\epsilon_a - \mathbf{a}_{t:t+H}^*)|_2^2\right]$$

联合优化:$\mathcal{L} = \mathcal{L}{\text{act}} + \mathcal{L}{\text{img}}$

2.4 高效推理

  • 使用固定编辑去噪时间步 $\tau^*$
  • 仅执行一次编辑前向传播获得 KV Cache
  • 动作专家在缓存条件下生成动作块

3. 实验设置

3.1 评测基准

基准 特点 任务数
LIBERO 标准机器人操作基准 4个套件 × 10任务
LIBERO-Plus 增加视觉和布局变化扰动 4个套件
RoboTwin 2.0 双臂机器人操作,大规模仿真 50+ 任务
Real-World 真实双机械臂平台(Dobot XTrainer) 4个任务

3.2 真实世界任务

任务 类型
T1: Stack Three Bowls 长时程操作
T2: Fold Towel 可变形物体操作
T3: Open Drawer & Store Marker 视觉遮挡、精细操作
T4: Hang Cup On Rack 精细操作

3.3 基线方法

  • VLA 基线:π₀、π₀.₅、OpenVLA、GR00T N1、UniVLA、WorldVLA
  • WAM 基线:LingBot-VA、Motus、FastWAM、ABot-M0

4. 主要结果

4.1 RoboTwin 2.0 结果

方法 P.T. Clean Rand. Avg.
π₀ 65.92 58.40 62.16
π₀.₅ 82.74 76.76 79.75
ABot-M0 81.20 80.40 80.80
Motus 88.66 87.02 87.80
LingBot-VA 92.90 91.50 92.20
FastWAM 91.88 91.78 91.83
ImageWAM (Ours) 93.20 93.56 93.38

结论:ImageWAM 在干净和随机场景下均达到最优,且无需额外策略预训练

4.2 LIBERO 结果

方法 P.T. Spatial Object Goal Long Avg.
OpenVLA 84.7 88.4 79.2 53.7 76.5
π₀ 96.8 98.8 95.8 85.2 94.1
π₀.₅ 98.8 98.2 98.0 92.4 96.9
LingBot-VA 98.5 99.6 97.2 98.5 98.5
FastWAM 98.2 100.0 97.0 95.2 97.6
ImageWAM 97.2 99.2 98.8 98.4 98.4

4.3 LIBERO-Plus 结果(更具挑战性)

方法 P.T. Camera Robot Language Light Background Noise Layout Avg.
FastWAM 16.4 44.5 68.9 78.2 53.7 37.7 60.7 51.5
ImageWAM (FLUX.2 4B) 80.8 50.3 91.4 98.1 85.5 93.8 80.5 83.1

结论:ImageWAM 在全部 7 种扰动维度上均大幅优于 FastWAM,尤其在 Camera、Robot、Layout 等难度较高的维度上优势明显。

4.4 真实机器人实验

方法 T1 (叠碗) T2 (叠毛巾) T3 (开抽屉) T4 (挂杯子) Avg.
π₀ 57 58 54 54 55.8
π₀.₅ 83 77 74 55 72.3
FastWAM 88 75 77 76 79.0
ImageWAM 94 84 78 82 84.5

结论:ImageWAM 在所有四项真实任务上均取得最优成绩,尤其在可变形物体操作(叠毛巾)上提升最显著(+9%)。

4.5 效率对比

方法 延迟 (ms) TFLOPs
FastWAM-IDM (视频) 1081 63.65
FastWAM (1 Step) 302 13.21
ImageWAM (Ours) 263 9.72

结论:ImageWAM 将延迟降至视频 WAM 的 1/4,FLOPs 降至 1/6


5. 消融与分析

5.1 不同编辑骨干的影响

骨干 LIBERO-Plus Avg.
OmniGen2 71.8%
Ovis-U1 71.2%
FLUX.2 4B 83.1%
FLUX.2 9B 85.2%

结论:ImageWAM 不依赖特定编辑模型,更强的编辑骨干可直接提升策略鲁棒性。

5.2 与统一理解-生成模型的对比

方法 P.T. LIBERO RoboTwin (Clean) RoboTwin (Hard)
UniVLA 95.5
BagelVLA (w/ K.F.) 75.3 20.9
BagelVLA (w/o K.F.) 56.7 15.9
ImageWAM 98.4 84.4 18.3

关键洞察:统一理解-生成模型存在任务干扰,而 ImageWAM 通过冻结理解模块、仅训练生成模块的解耦设计,在无预训练的情况下取得更优性能。

5.3 注意力可视化

ImageWAM 的注意力集中在任务相关的变化区域(操作对象、目标容器、接触区域),而 FastWAM 的注意力较为分散,包含较多背景无关区域。

5.4 未来视频伪影分析

视频 WAM 在预测未来帧时会产生明显伪影(几何扭曲、空间布局不一致),这些伪影会误导动作专家。ImageWAM 通过不生成实际未来视频帧,避免了这一问题。


6. 核心贡献总结

贡献 说明
新框架 首次将图像编辑模型作为 WAM 骨干,替代视频生成
新视角 将机器人操作公式化为"指令引导的视觉转换"问题
三个优势 指令-变化对齐、更简单的代理任务、紧凑推理路径
高效性能 在多个基准上达到 SOTA,且 FLOPs 仅 1/6、延迟 1/4
无需预训练 无需额外策略预训练(P.T.),仅在任务演示上训练

7. 与综述论文的关联

综述 (WAM Survey) ImageWAM 的定位
WAM 定义:联合预测未来状态与动作 ImageWAM:预测单帧终点状态(简化版)
级联式 WAM:先预测状态,再生成动作 ImageWAM 属于级联式,但用图像编辑替代视频生成
联合式 WAM:联合生成状态与动作 不在该范畴,属于轻量级替代方案
隐式规划(Latent Planning) ImageWAM 使用 KV Cache 作为隐式规划中间表示
推理延迟是核心挑战 ImageWAM 将延迟从 1081ms 降至 263ms

8. 论文的局限与未来工作

  1. 端点帧预测的适用性:对于需要精确理解完整轨迹动态的任务,单帧预测是否足够?
  2. 编辑骨干的可扩展性:随着编辑骨干规模增大,性能增益是否持续?
  3. 动作专家与编辑骨干的耦合:是否有更优的耦合方式?
  4. 真实场景泛化:在更复杂、更开放的真实环境中表现如何?

🔑 关键术语速查

术语 英文 含义
WAM World Action Model 联合预测未来状态与动作的具身模型
VLA Vision-Language-Action 视觉-语言-动作模型,直接映射观测到动作
KV Cache Key-Value Cache Transformer 中的键值缓存,用于高效注意力计算
Flow Matching Flow Matching 一种生成模型训练方法,学习从噪声到数据的连续变换
DiT Diffusion Transformer 基于 Transformer 的扩散模型骨干
MoT Mixture of Transformers 多专家 Transformer 架构
P.T. Policy Pretraining 策略预训练