初学WAM-ImageWAM
ImageWAM 论文笔记
📌 论文基本信息
| 项目 | 内容 |
|---|---|
| 标题 | ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing? |
| 作者 | Yuyang Zhang*, Wenyao Zhang*, Zekun Qi, He Zhang, Haitao Lin, Jingbo Zhang, Yao Mu, Xiaokang Yang, Wenjun Zeng, Xin Jin |
| 单位 | 上海交通大学、东方理工学院、腾讯 Robotics X、清华大学、中关村学院 |
| 日期 | 2026年6月19日 |
| 论文链接 | https://arxiv.org/abs/2606.19531 |
| 项目主页 | https://zhangwenyao1.github.io/ImageWAM/ |
| GitHub | https://github.com/yuyangalin/ImageWAM |
🎯 核心思想(一句话总结)
WAM 不一定需要视频生成,用图像编辑模型作为骨干更高效、更聚焦于任务相关的视觉变化,且推理成本大幅降低。
1. 研究背景与动机
1.1 现有 WAM 的问题
传统 WAM 依赖 视频生成模型 来预测未来帧,存在三大耦合问题:
| 问题 | 说明 |
|---|---|
| 推理成本高 | 需要生成密集的多帧时空 token,计算量大 |
| 容量浪费 | 视频模型需要建模外观细节、背景变化、相机运动等,这些与机器人动作弱相关 |
| 误差积累 | 长时程想象可能产生错误的未来视频,误导动作预测 |
核心疑问:世界动作模型真的需要视频生成吗?
1.2 图像编辑的优势
图像编辑模型是将源图像根据语言指令进行转换,相比视频生成,它具有三个优势:
- 指令-变化对齐:预训练目标直接耦合语言与视觉修改,关注"什么应该变、在哪里变、怎么变"
- 更简单的代理任务:只需建模当前状态与目标状态的视觉差异,而非完整时间轨迹
- 更紧凑的推理路径:可直接使用内部编辑感知表示,无需解码密集多帧视频
2. 方法:ImageWAM
2.1 问题形式化
- 输入:当前观测图像 $o_t$+语言指令 $l$
- 输出:动作块 ${\mathbf{a}}{t:t+H}=(a_t, a{t+1}, \dots, a_{t+H})$
- 策略学习目标:${\pi}0({\mathbf{a}}{t:t+H}|0_t,l)$
视频 WAM:
$$(o_t, l) \rightarrow \hat{o}{t+1:t+H+1} \rightarrow \mathbf{a}{t:t+H}$$
ImageWAM:
$$(o_t, l) \rightarrow \hat{o}{\text{edit}} \equiv \hat{o}{t+H+1} \rightarrow \mathbf{a}_{t:t+H}$$
ImageWAM 只预测一个终点帧,而非完整视频轨迹。
2.2 架构设计
关键机制:
- KV Cache 提取:(\mathcal{C}{\text{edit}}^\tau = f{\text{edit}}^\tau(o_t, l)),从编辑骨干的某一去噪时间步提取
- 动作专家:基于 KV Cache,通过流匹配(Flow Matching)生成动作块
- 推理时:只需一步编辑前向传播,无需完整去噪轨迹
2.3 训练目标
图像编辑损失:
$$\mathcal{L}{\text{img}} = \mathbb{E}\left[| u\phi(z_r, r | o_t, l) - (\epsilon_z - z_{t+K}^*)|_2^2\right]$$
动作流匹配损失:
$$\mathcal{L}{\text{act}} = \mathbb{E}\left[| v\theta(\mathbf{a}s, s | o_t, l, \mathcal{C}{\text{edit}}^\tau) - (\epsilon_a - \mathbf{a}_{t:t+H}^*)|_2^2\right]$$
联合优化:$\mathcal{L} = \mathcal{L}{\text{act}} + \mathcal{L}{\text{img}}$
2.4 高效推理
- 使用固定编辑去噪时间步 $\tau^*$
- 仅执行一次编辑前向传播获得 KV Cache
- 动作专家在缓存条件下生成动作块
3. 实验设置
3.1 评测基准
| 基准 | 特点 | 任务数 |
|---|---|---|
| LIBERO | 标准机器人操作基准 | 4个套件 × 10任务 |
| LIBERO-Plus | 增加视觉和布局变化扰动 | 4个套件 |
| RoboTwin 2.0 | 双臂机器人操作,大规模仿真 | 50+ 任务 |
| Real-World | 真实双机械臂平台(Dobot XTrainer) | 4个任务 |
3.2 真实世界任务
| 任务 | 类型 |
|---|---|
| T1: Stack Three Bowls | 长时程操作 |
| T2: Fold Towel | 可变形物体操作 |
| T3: Open Drawer & Store Marker | 视觉遮挡、精细操作 |
| T4: Hang Cup On Rack | 精细操作 |
3.3 基线方法
- VLA 基线:π₀、π₀.₅、OpenVLA、GR00T N1、UniVLA、WorldVLA
- WAM 基线:LingBot-VA、Motus、FastWAM、ABot-M0
4. 主要结果
4.1 RoboTwin 2.0 结果
| 方法 | P.T. | Clean | Rand. | Avg. |
|---|---|---|---|---|
| π₀ | ✓ | 65.92 | 58.40 | 62.16 |
| π₀.₅ | ✓ | 82.74 | 76.76 | 79.75 |
| ABot-M0 | ✗ | 81.20 | 80.40 | 80.80 |
| Motus | ✓ | 88.66 | 87.02 | 87.80 |
| LingBot-VA | ✓ | 92.90 | 91.50 | 92.20 |
| FastWAM | ✗ | 91.88 | 91.78 | 91.83 |
| ImageWAM (Ours) | ✗ | 93.20 | 93.56 | 93.38 |
结论:ImageWAM 在干净和随机场景下均达到最优,且无需额外策略预训练。
4.2 LIBERO 结果
| 方法 | P.T. | Spatial | Object | Goal | Long | Avg. |
|---|---|---|---|---|---|---|
| OpenVLA | ✓ | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 |
| π₀ | ✓ | 96.8 | 98.8 | 95.8 | 85.2 | 94.1 |
| π₀.₅ | ✓ | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 |
| LingBot-VA | ✓ | 98.5 | 99.6 | 97.2 | 98.5 | 98.5 |
| FastWAM | ✗ | 98.2 | 100.0 | 97.0 | 95.2 | 97.6 |
| ImageWAM | ✗ | 97.2 | 99.2 | 98.8 | 98.4 | 98.4 |
4.3 LIBERO-Plus 结果(更具挑战性)
| 方法 | P.T. | Camera | Robot | Language | Light | Background | Noise | Layout | Avg. |
|---|---|---|---|---|---|---|---|---|---|
| FastWAM | ✗ | 16.4 | 44.5 | 68.9 | 78.2 | 53.7 | 37.7 | 60.7 | 51.5 |
| ImageWAM (FLUX.2 4B) | ✗ | 80.8 | 50.3 | 91.4 | 98.1 | 85.5 | 93.8 | 80.5 | 83.1 |
结论:ImageWAM 在全部 7 种扰动维度上均大幅优于 FastWAM,尤其在 Camera、Robot、Layout 等难度较高的维度上优势明显。
4.4 真实机器人实验
| 方法 | T1 (叠碗) | T2 (叠毛巾) | T3 (开抽屉) | T4 (挂杯子) | Avg. |
|---|---|---|---|---|---|
| π₀ | 57 | 58 | 54 | 54 | 55.8 |
| π₀.₅ | 83 | 77 | 74 | 55 | 72.3 |
| FastWAM | 88 | 75 | 77 | 76 | 79.0 |
| ImageWAM | 94 | 84 | 78 | 82 | 84.5 |
结论:ImageWAM 在所有四项真实任务上均取得最优成绩,尤其在可变形物体操作(叠毛巾)上提升最显著(+9%)。
4.5 效率对比
| 方法 | 延迟 (ms) | TFLOPs |
|---|---|---|
| FastWAM-IDM (视频) | 1081 | 63.65 |
| FastWAM (1 Step) | 302 | 13.21 |
| ImageWAM (Ours) | 263 | 9.72 |
结论:ImageWAM 将延迟降至视频 WAM 的 1/4,FLOPs 降至 1/6。
5. 消融与分析
5.1 不同编辑骨干的影响
| 骨干 | LIBERO-Plus Avg. |
|---|---|
| OmniGen2 | 71.8% |
| Ovis-U1 | 71.2% |
| FLUX.2 4B | 83.1% |
| FLUX.2 9B | 85.2% |
结论:ImageWAM 不依赖特定编辑模型,更强的编辑骨干可直接提升策略鲁棒性。
5.2 与统一理解-生成模型的对比
| 方法 | P.T. | LIBERO | RoboTwin (Clean) | RoboTwin (Hard) |
|---|---|---|---|---|
| UniVLA | ✓ | 95.5 | — | — |
| BagelVLA (w/ K.F.) | ✓ | — | 75.3 | 20.9 |
| BagelVLA (w/o K.F.) | ✓ | — | 56.7 | 15.9 |
| ImageWAM | ✗ | 98.4 | 84.4 | 18.3 |
关键洞察:统一理解-生成模型存在任务干扰,而 ImageWAM 通过冻结理解模块、仅训练生成模块的解耦设计,在无预训练的情况下取得更优性能。
5.3 注意力可视化
ImageWAM 的注意力集中在任务相关的变化区域(操作对象、目标容器、接触区域),而 FastWAM 的注意力较为分散,包含较多背景无关区域。
5.4 未来视频伪影分析
视频 WAM 在预测未来帧时会产生明显伪影(几何扭曲、空间布局不一致),这些伪影会误导动作专家。ImageWAM 通过不生成实际未来视频帧,避免了这一问题。
6. 核心贡献总结
| 贡献 | 说明 |
|---|---|
| 新框架 | 首次将图像编辑模型作为 WAM 骨干,替代视频生成 |
| 新视角 | 将机器人操作公式化为"指令引导的视觉转换"问题 |
| 三个优势 | 指令-变化对齐、更简单的代理任务、紧凑推理路径 |
| 高效性能 | 在多个基准上达到 SOTA,且 FLOPs 仅 1/6、延迟 1/4 |
| 无需预训练 | 无需额外策略预训练(P.T.),仅在任务演示上训练 |
7. 与综述论文的关联
| 综述 (WAM Survey) | ImageWAM 的定位 |
|---|---|
| WAM 定义:联合预测未来状态与动作 | ImageWAM:预测单帧终点状态(简化版) |
| 级联式 WAM:先预测状态,再生成动作 | ImageWAM 属于级联式,但用图像编辑替代视频生成 |
| 联合式 WAM:联合生成状态与动作 | 不在该范畴,属于轻量级替代方案 |
| 隐式规划(Latent Planning) | ImageWAM 使用 KV Cache 作为隐式规划中间表示 |
| 推理延迟是核心挑战 | ImageWAM 将延迟从 1081ms 降至 263ms |
8. 论文的局限与未来工作
- 端点帧预测的适用性:对于需要精确理解完整轨迹动态的任务,单帧预测是否足够?
- 编辑骨干的可扩展性:随着编辑骨干规模增大,性能增益是否持续?
- 动作专家与编辑骨干的耦合:是否有更优的耦合方式?
- 真实场景泛化:在更复杂、更开放的真实环境中表现如何?
🔑 关键术语速查
| 术语 | 英文 | 含义 |
|---|---|---|
| WAM | World Action Model | 联合预测未来状态与动作的具身模型 |
| VLA | Vision-Language-Action | 视觉-语言-动作模型,直接映射观测到动作 |
| KV Cache | Key-Value Cache | Transformer 中的键值缓存,用于高效注意力计算 |
| Flow Matching | Flow Matching | 一种生成模型训练方法,学习从噪声到数据的连续变换 |
| DiT | Diffusion Transformer | 基于 Transformer 的扩散模型骨干 |
| MoT | Mixture of Transformers | 多专家 Transformer 架构 |
| P.T. | Policy Pretraining | 策略预训练 |
