ARTICLE SIGNAL

李飞飞团队OpenWAM解析:世界动作模型引爆AI机器人革命

李飞飞团队最新发布OpenWAM世界动作模型,通过共享底座与可配置交互方式解决机器人控制难题。本文深入解读该框架的因果化改造与反事实数据,探讨人工智能前沿,为您提供最新AI资讯,AI新闻,AGI,大模型等核心动态。

type
status
date
slug
summary
tags
category
icon
password
网址
随着人工智能技术的飞速发展,AI的触角正在从纯数字世界的文本和图像生成,迅速延伸至物理世界的机器人控制。近期,以FLUX图像模型闻名的Black Forest Labs跨界发布了开源7B世界动作模型FLUX 3 Action,在机器人控制榜单上大放异彩。这标志着视频模型中积累的“物理直觉”正成为下一代机器人大脑的核心底座。作为专业的AI门户,我们每天都在关注这类能够推动AGI进程的突破性进展。
在这个背景下,斯坦福大学李飞飞、吴佳俊、Ehsan Adeli等人的团队本周发布了一项重磅研究,提出了开放的世界动作建模框架——OpenWAM。这项研究不仅为机器人操作提供了新的解法,更为当前混乱的世界动作模型(WAM)研究提供了一个标准化的“统一考卷”。今天,我们将在这篇AI日报中,为您深入解读OpenWAM的核心机制及其对未来机器人技术的深远影响。获取更多前沿AI资讯与AI新闻,请持续关注AIGC资讯站。

为什么我们需要一张“统一考卷”?

传统的视觉-语言-动作模型(VLA)在处理任务时,往往像是一个单纯依靠条件反射开车的司机:看到画面、听到指令,就直接输出动作。这种方式虽然直接,但缺乏对物理世界动态变化的预判能力。
相比之下,世界动作模型(WAM)引入了“脑内预演”的机制。它不仅能生成动作,还能同时预测接下来几秒钟的画面变化。由于这些模型通常使用海量视频进行预训练,它们天生自带关于物体下落、碰撞和推动的“物理先验”。这就像大模型(LLM)通过海量文本掌握了语言规律一样,WAM通过视频掌握了物理规律。
然而,当前的WAM研究面临两个尴尬的痛点: 1. 变量太多,难以归因:不同的研究团队在“预测画面”和“生成动作”的耦合方式上各不相同(先想再动、先动再想、同时进行等),并且使用了不同的视频骨干和训练数据。这导致当一个模型表现出色时,我们根本无法判断是哪个环节带来了提升。 2. 缺乏“反事实”数据:目前的机器人训练数据大多是成功的示范,只告诉模型“正确的路怎么走”。这就像一个只背过标准答案的chatGPT,一旦遇到从未见过的错误情况,就会不知所措。
OpenWAM正是为了解决这两个痛点而生。它提供了一个共享底座和可切换的交互方式,并引入了大规模的“反事实”数据。

OpenWAM的核心架构:同一副骨架,四种交互

OpenWAM从开源的视频模型Wan2.2-5B出发,在约334万条、总时长约1.46万小时的机器人与人类交互视频上进行了继续预训练。值得注意的是,这个过程全程没有使用任何动作标签。
团队对底座进行了一个关键的“因果化”改造:让模型只能看到当前及之前的内容,不能“偷看”未来。这使得模型从“拿着完整剧本改台词”转变为“像直播一样按时间顺序往下演”,完美契合了机器人逐步行动的实际需求。
在架构上,OpenWAM采用了Mixture-of-Transformers(MoT)设计,将5B的视频专家和2B的动作专家拼接在一起。两者各自保留独立层,仅在联合注意力层交换信息。在这个统一的骨架上,团队设计了四种控制变量的“交互程序”:
  • VTA:先想象未来画面,再生成动作。
  • ATV:先生成动作,再想象后果。
  • Joint:两者同时生成并互相参考。
  • Decoupled:两者在未来部分互不可见。
这种设计就像是为测试不同的提示词(Prompt)策略提供了一个标准化的沙盒环境,让研究人员终于能够清晰地对比不同交互顺序的优劣。

拆解“动作翻译器”:反事实数据的威力

OpenWAM最引人注目的创新之一,是将逆向动力学模型(IDM)和正向动力学模型(FDM)拆解为可独立训练的组件。
IDM就像是一个“动作翻译器”,输入当前画面和想象的未来视频,输出具体动作;而FDM则相反,根据动作预测未来的画面。这两个组件只关注局部的画面变化与动作对应关系,不绑定具体任务,因此可以与任何兼容的视频预测器灵活拼接。
为了让这个“翻译器”见多识广,团队构建了LIBERO-Long-CF数据集,包含了高达410万条控制记录。这里的核心魔法是“反事实数据”——在仿真器中故意执行被改动过的动作(如停止、反向、加噪声等)。
这就像是openai在训练模型时引入对抗性测试一样。通过让模型经历大量的“失败”和“意外”,模型不仅记住了成功的路线,更理解了物理世界的“脾气”。这种“故意做错”的训练方式,是让模型真正理解因果关系的关键。

实验结果与组件迁移:底座与数据的双重胜利

实验数据充分证明了OpenWAM设计的优越性。在LIBERO的四个子集上,四种交互程序的成功率都极高,其中VTA平均达到了98.6%。在真实的Franka FR3机械臂测试中(如烤面包、还原魔方、分拣杯子),VTA和Joint的平均成功率也分别稳定在92%左右。
更令人振奋的是消融实验和组件迁移实验的结果: * 底座的分量:在使用原版初始化时,VTA在复杂任务上的成功率仅为68.4%;而换成经过机器人视频预训练的因果底座后,成功率飙升至97.8%。 * 翻译器的搬家能力:将训练好的局部IDM冻结,搭配新的视频预测器迁移到全新任务中。结果显示,结合了示范与反事实数据训练的局部IDM,平均成功率高达84.0%;而只用示范训练的模型,成功率暴跌至21.5%。
这证明了“只看局部”和“见过足够多样的后果”缺一不可。两者结合,才能打造出一个真正具备泛化能力、能够随时“搬家”的动作翻译器。

结语:迈向模块化的机器人大脑

尽管OpenWAM目前在真机上获取大规模反事实数据的成本依然很高,且FDM仅覆盖短时程预测,但它的核心价值远不止于在榜单上刷出更高的分数。
在世界动作模型如雨后春笋般涌现的今天,OpenWAM提供了一个极其宝贵的公共试验台。它将推动整个领域从单纯的比拼“谁的分数更高”,转向深入探讨“为什么更高”。可复用的动作翻译器组件也向我们暗示了未来机器人大脑的发展形态:它不再是一个庞大的、需要整体训练的黑箱,而是可以像claude的插件一样,负责想象与负责落地的模块各自迭代、按需拼装。
对于关注AI变现和技术落地的从业者来说,OpenWAM展示了通过高质量数据(尤其是反事实数据)和模块化设计来降低机器人训练成本的巨大潜力。物理世界的AI革命才刚刚开始,那些没能完成任务的轨迹,恰恰是让模型真正理解物理世界的宝贵养料。获取更多关于大模型前沿应用与AI资讯,欢迎访问AIGC官方平台,与我们一起见证AI时代的每一次飞跃。
Loading...

没有找到文章