9月22日,凭借FLUX图像模型声名鹊起的Black Forest Labs跨界推出了开源7B世界动作模型FLUX 3 Action。根据其官方博客内容,该模型在英伟达RoboLab-120排行榜上超越了此前最强的开源模型Cosmos 3 Nano,而其参数量还不到后者的一半。一家专注于图像生成的企业开始涉足机器人控制领域,这反映出视频模型中积累的「物理直觉」正被越来越多的团队用作机器人大脑的基础。
这条技术路线被称为世界动作模型(World-Action Model,WAM)。自今年2月英伟达在DreamZero论文中首次提出这一概念以来,相关研究论文迅速增加。然而,热闹背后存在一个尴尬的问题:这些系统几乎都同时替换了视频骨干、训练数据、视频与动作的交互方式以及推理流程,因此很难确定究竟是哪个设计带来了性能提升。
本周,斯坦福大学李飞飞、吴佳俊、Ehsan Adeli等人的团队发布了一篇论文,提出了开放的世界动作建模框架OpenWAM,旨在系统性地回答这个问题。

OpenWAM框架概览:三阶段训练、共享MoT架构、四种可配置交互方式,以及可冻结复用的局部动力学模型。

传统的视觉-语言-动作模型(VLA)就像一个靠条件反射驾驶的司机,看到画面、听到指令就直接输出动作。
而WAM则增加了一步「脑内预演」:同时预测接下来几秒的画面会如何变化,以及为了实现这一变化该如何行动。 视频天然记录了物体如何下落、碰撞和被推动,因此,用海量视频预训练过的模型自带物理先验知识。
问题在于,「预测画面」和「生成动作」可以有多种耦合方式:先想象再动作、先动作再想象后果、两者同时生成,或者各自独立计算。不同团队选择不同,所用的底座和数据也不一样,放在一起比较,就像几位厨师同时更换了食材、灶具和下锅顺序,很难判断菜肴好吃究竟归功于哪一步。
第二个问题更为隐蔽。机器人训练数据大多是成功示范,只告诉模型「正确的路怎么走」,几乎不包含「手多伸出去两厘米会怎样」。这好比只看过教练完美绕桩录像的学员,记住了路线,却不懂方向盘打多少车会偏多少。
OpenWAM对前者的回答是共享底座加可切换的交互方式,对后者的回答是大规模「反事实」数据。
OpenWAM以阿里开源的视频模型Wan2.2-5B为起点,首先在大约334万条机器人与人类交互视频上继续预训练,名义时长约1.46万小时,全程不使用动作标签,在32块B200上训练了14天。
关键改动是「因果化」:每个视频块只能看到当前及之前的内容,不能提前看到未来。原来的模型像拿着整本剧本反复修改台词,现在则要像直播一样按时间顺序逐步推进,这正符合机器人逐步行动的需求。
随后,团队采用Mixture-of-Transformers(MoT)架构,将5B的视频专家和2B的动作专家组合在一起。两者各自保留归一化、投影和前馈层,仅在一层联合注意力中交换信息。

共享MoT架构,视频专家与动作专家在打包后的token上执行联合注意力。
在这个骨架上,团队定义了四种「交互程序」:
这就像同一支乐队演奏同一首曲子,变化的只是谁先开始演奏、彼此能否听见。这四种方式共享底座、tokenization和flow matching目标,唯一的变量是生成顺序和跨模态注意力,因此比较具有「控制变量」的意义。

四种交互程序(A–D)与两种局部动力学程序(E–F)的注意力掩码。
论文中更具新意的部分,是将逆向动力学模型(IDM)和正向动力学模型(FDM)拆分成可独立训练的组件。
IDM像一个翻译器:输入当前画面、机器人本体状态和一段想象出来的未来视频,输出具体动作;FDM则相反,根据动作预测画面会变成什么样。
关键在于「局部」:两者都不接收任务指令和更早的历史信息,只关心「这一小段画面变化对应什么动作」。因此,它们不绑定具体任务,可以与任何兼容的视频预测器拼接,视频模型决定「该发生什么」,IDM负责「怎么做到」。
但只学过成功示范的翻译器见识有限。为此,团队构建了LIBERO-Long-CF数据集:恢复示范中的仿真器状态,执行被改动过的动作,例如停止、反向、加噪声、改变夹爪开合时机等,共得到32000个片段、约410万条控制记录,是原始示范的29.7倍,其中72.3%的片段改变了物体的摆放状态。很多分支根本无法完成任务,但这正是重点。回到驾校的比喻,这相当于教练让学员故意多打半圈方向盘,学员记住的不再只是路线,还有车本身的特性。
在LIBERO四个子集上,四种交互程序的成功率都很高,VTA平均达到98.6%,略高于论文引用的LingBot-VA(98.5%)和π0.5(96.9%)等已报告结果。不过,LIBERO已接近饱和,更值得关注的细节是:在LIBERO-Long上,未来部分互不可见的Decoupled(97.0%)与双向交互的Joint(96.6%)表现不相上下。

四个LIBERO子集上的闭环成功率(%),基线为已报告结果。
在真机测试中,团队使用两台Franka FR3机械臂测试了烤面包、还原2×2魔方最后一层和按颜色分拣杯子,VTA和Joint的平均成功率分别为92.1%和91.9%。

左图为三项真机双臂任务,右图为用于组件迁移的四个LIBERO-90任务。
消融实验显示了底座的重要性:其他条件不变,使用原版Wan2.2初始化时,VTA在LIBERO-Long上只有68.4%,换成机器人视频预训练的因果底座后,成功率升至97.8%,提升了29.4个百分点。作者强调,这是数据与因果化改造共同作用的结果。

视频骨干初始化方式对LIBERO-Long成功率的影响。
最关键的是组件迁移实验。团队将在LIBERO-Long上训练的IDM冻结,搭配针对四个LIBERO-90新任务调整过的视频预测器。
结果显示,使用示范加反事实数据训练的局部IDM,平均成功率达到84.0%,而接收完整上下文的IDM只有47.0%,仅用示范训练的局部IDM更是只有21.5%。
「只看局部」和「见过足够多样的后果」两者缺一不可,结合起来才能得到一个可迁移的动作翻译器。需要注意的是,目标任务上的视频预测器是用含动作标签的示范微调过的,这并非零样本迁移,作者对此有明确说明。

冻结IDM迁移到四个LIBERO-90任务的成功率。
FDM的结论一致。从同一状态出发执行16种不同动作,让模型判断预测画面对应哪个真实结果,随机猜测约为6%,仅用示范训练的FDM为21.1%,加入反事实数据后升至71.3%,模型终于能分清「这样推」和「那样推」的区别。

局部FDM在反事实转移上的预测表现。
作者也坦承了局限性:组件复用主要在仿真中验证,真机上「故意做错」的成本高得多;FDM也只覆盖短时程预测。但OpenWAM的价值不在于又多刷了零点几个百分点。在WAM论文以周为单位涌现的当下,一个固定底座、只改一个变量的公共试验台,能帮助领域从「谁的分更高」转向「为什么更高」。而可复用的动作翻译器则暗示,未来的机器人大脑或许不必是整体训练的黑箱,负责想象与负责落地的模块可以各自迭代、按需拼装。那些没能完成任务的轨迹,恰恰是让模型理解物理世界的养料。
目前,团队已开源训练、评测与组合代码,以及预训练视频模型权重。
本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:关注AI的机器之心,36氪经授权发布。