世界模型因果升级:CD-LAM如何用极少微调颠覆具身智能控制
type
status
date
slug
summary
tags
category
icon
password
网址
在人工智能迈向通用人工智能(AGI)的征途中,如何让AI理解并与物理世界进行安全、精准的交互,成为了当前大模型(LLM)和具身智能领域最核心的挑战之一。人类的大脑拥有强大的“世界模型”预测能力——在手松开之前,我们就能预判杯子会掉落;在推抽屉之前,我们已能想象它合上的画面。
为了让机器人也拥有这种“脑补”未来的能力,研究人员引入了具身世界模型(Embodied World Model)。然而,传统的隐动作模型(LAM)在利用海量无标注视频进行预训练时,常常陷入“画面流畅但无视控制指令”的尴尬境地。近日,一项由学术界与工业界联合开展的最新研究提出了 CD-LAM(Causally Debiased Latent Action Model,因果去偏隐动作模型),仅需几千步微调,即可显著增强动作控制。
获取更多前沿AI资讯与人工智能深度解析,欢迎访问AI门户 AIGC.bar。
视觉混杂:传统隐动作模型的“致命捷径”
为了利用互联网上数以万计的无标注视频,研究人员通常使用隐动作模型(LAM)从画面变化中提取“隐动作”作为伪标签,让世界模型在海量视频上进行预训练,学会“物理世界大概怎么动”。随后,再通过少量带有真实动作标注的视频进行后训练,以适应真实的机器人控制。
然而,这种主流路线存在一个严重的因果逻辑漏洞。传统的LAM大多以视频重建为训练目标,无法区分画面的变化究竟是由机器人的动作引起的,还是由镜头晃动、光照变化或背景漂移造成的。
为了降低重建误差,模型会选择走“捷径”:将场景上下文、背景连续性等与动作无关的信息也编码进“隐动作”中。这导致世界模型在预训练阶段继承了这种错误的因果关系——它学会了依靠场景线索去“猜测”下一帧画面,而不是真正执行控制指令。在干预测试中,当研究人员固定初始画面并输入“静止”指令时,传统基线模型生成的机械臂依然在运动;而当替换目标动作时,生成轨迹也无法跟随新动作发生改变。这种“因变果不变”的现象,直接证实了视觉混杂因素对模型控制能力的干扰。
动作误差与画面质量的脱节:引入全新评测指标 FDCE
在视频生成领域,PSNR(峰值信噪比)等通用指标常被用来衡量生成画面与真实画面在像素层面的相似度。但研究表明,PSNR的高低与动作控制的准确性之间关联极弱。换句话说,画面看起来很逼真,并不代表机器人的动作做对了。
为了解决这一评估痛点,研究团队借鉴了视频生成中基于点跟踪的运动评测方法,提出了面向具身操作的全新评估指标——FDCE(Foreground Action Deviation Distance,前景动作偏差距离)。
该指标的核心逻辑在于:
1. 将机械臂及被操作物体等前景区域从背景中分离出来。
2. 跟踪这些前景关键点的运动轨迹。
3. 计算生成轨迹与参考轨迹之间的偏差距离。
通过FDCE,开发者能够更直观、准确地评估世界模型在动作控制上的真实表现,避免被高PSNR的“花哨画面”所误导。
CD-LAM的核心突破:三阶段因果去偏架构
为了清除隐动作表征中夹带的场景与背景信息,CD-LAM在不改动世界模型主体架构、隐动作维度和输入接口的前提下,在模型上游设计了三阶段的训练流程:
第一阶段:去偏LAM训练。CD-LAM通过引入三个全新的训练目标来净化隐动作空间:
* 具身中心重建:利用SAM3等分割模型标出前景与背景,在重建损失函数中赋予前景区域更大的权重,迫使模型将注意力集中在机械臂和操作对象上。
* 动作中心对比学习:通过从视频的文本标注中提取动词并归类为动作原语(如抓取、倾倒、打开等),利用SigLip Loss拉近同类动作的表征,推远异类动作表征,使潜动作空间的聚类基于“动作”而非“场景”。
* 隐空间校准:对输入两张相同帧时产生的“零动作”隐向量进行约束,将静止状态压向原点,确保模型在无动作输入时保持静止。
第二阶段:训练世界模型。使用经过第一阶段去偏净化后的隐动作为条件,预训练世界模型,使其真正学习到“动作如何改变未来画面”。
第三阶段:接入真实机器人动作。利用带有真实控制指令的机器人数据进行后训练,通过轻量的适配层将控制指令无缝接入已去偏的隐动作空间。
性能飞跃:动作误差骤降与10倍微调加速
实验结果表明,CD-LAM在动作控制精度和微调效率上均取得了突破性的提升。
在尚未接入真实机器人控制指令的预训练阶段,CD-LAM在不同参数规模下(2B和14B),动作误差分别下降了42%和26%,同时PSNR画面质量指标也得到了显著提升。在接入真实机器人动作进行后训练后,相较于基线模型,CD-LAM的动作误差降低了30%以上,在静止指令测试中残余运动幅度最高减少了76.7%。
更令人兴奋的是其微调效率的飞跃。在机器人动作适配测试中,CD-LAM仅需3,000步左右的微调更新,就达到了基线模型DreamDojo训练50,000步的性能水平,实现了 10倍以上的训练加速。当微调进行到6,000步时,主要指标已全面反超基线模型。
此外,CD-LAM的去偏过程对大规模视频数据的依赖极低。实验显示,仅使用1小时视频数据进行去偏训练,就能获得使用1,000小时数据时约80%的性能收益。这表明,一个干净、无偏的隐动作空间能够极大减轻后续的迁移负担,避免模型在后训练阶段重复纠正预训练时遗留的视觉混杂问题。
结语:具身智能因果升级的未来展望
CD-LAM的成功为具身世界模型的发展提供了一条全新的路径。通过因果去偏,我们不仅能够让机器人“脑补”出更符合物理规律的未来画面,更能确保其真正听懂并精准执行人类的控制指令。这种低成本、高效率的微调技术,将极大地加速大模型在工业制造、家庭服务等真实物理场景中的落地应用。
在这个AI技术日新月异的时代,紧跟前沿趋势至关重要。想要获取更多关于大模型、AGI、提示词(Prompt)优化以及AI变现的最新AI新闻与深度教程,敬请持续关注 AIGC.bar —— 您的专业AI资讯门户。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)