银河通用发布具身智能TTT框架 WAM-TTT:机器人实现“看视频即部署”
type
status
date
slug
summary
tags
category
icon
password
网址
在大模型领域,以 OpenAI o1 为代表的推理期计算(Test-Time Compute)正引领新的技术范式。如今,这股“现学现用”的风潮正式刮到了具身智能(Embodied AI)领域。近日,国内具身智能领军企业银河通用正式发布了全球首个面向具身智能大模型的测试时后训练框架 WAM-TTT(World-Action Model Test-Time Training)。该框架成功将大语言模型中的 TTT 范式迁移至物理世界的机器人控制中,使机器人仅凭观看人类操作视频,即可在部署阶段快速适应新场景,实现了具身大模型技术的一大重要突破。
核心机制与技术突破:如何实现“看视频即部署”
当前具身智能普遍面临着“训练场内精通,部署现场失灵”的泛化性衰退难题。为了适应新环境,传统方法往往需要重新采集海量数据并微调模型,成本极其高昂。WAM-TTT 框架的出现正是为了系统性地攻克这一痛点。
WAM-TTT 的核心底座是一个预训练的世界动作模型(WAM)。在实际运行中,该框架冻结了主模型的参数,引入了一个轻量级的“快速权重记忆”(fast-weight memory)模块。整个训练流程被巧妙地划分为两个阶段:
- **离线元训练(Meta-Training)**:相当于机器人的“出厂设置”。通过成对的人类和机器人演示数据,模型学会了如何将人类的视觉线索与机器人的物理行为进行对齐。
- **线上测试时训练(Test-Time)**:这是实际部署的关键阶段。用户只需提供一段未标注的普通人类 RGB 视频,机器人便能将其转化为对任务的理解并写入临时记忆模块,随后结合已有的基础能力完成动作。
通过这一创新机制,WAM-TTT 实现了四大显著突破:一是大幅降低了对昂贵遥操作轨迹数据的依赖;二是完全免去了人工动作标注的需求,直接采用自监督学习;三是无需改变底层模型参数,避免了全量微调的高昂算力成本;四是成功避免了“灾难性遗忘”,在跨环境测试中性能保持率高达 75.6%,远超传统上下文学习(ICL)方案。
商业影响与应用前景:打破规模化落地瓶颈
WAM-TTT 的发布为具身智能的商业化落地提供了全新的解题思路。过去,为了让机器人适应新的工厂或家庭环境,企业需要组建庞大的数据采集团队,耗费极高的人力与时间成本。例如,一些头部的拟人机器人项目每天都需要操作员进行长达数小时的遥操作演示。
现在,借助于 WAM-TTT 框架,后训练的数据采集成本被大幅压缩到了“手机拍摄级”。实验数据显示,由少量机器人轨迹混合普通人类视频组成的训练集,其任务成功率已经与纯机器人遥操作数据训练的效果基本持平。这种无需重新预训练、不依赖复杂标注的轻量化部署方式,使得机器人能够低成本、高效率地进入不同场景,真正满足了具身智能规模化、常态化落地的核心诉求。
技术挑战与潜在限制
尽管 WAM-TTT 展现出了惊人的应用潜力,但在具身智能领域实现完美的 TTT 依然面临诸多挑战。
首先,与文本生成中离散且容错率高的 token 不同,物理世界中机器人的动作空间是高维连续的。一个抓取角度和力度的微小偏差,在现实世界中都不可逆转,甚至可能导致操作对象损坏。这要求模型在推理时必须具备极高的精确度和容错修正能力。
其次,物理交互的实时性要求极高。机器人的动作必须跟上现实世界的时间尺度,如果视觉信息的解析和临时记忆的更新存在延迟,机器人可能会错过最佳的操作窗口。此外,当前框架依然高度依赖输入的视频质量,在光照极其恶劣或视角严重遮挡的极端复杂场景下,其鲁棒性与实际表现仍需进一步的工程验证。
结语:迈向具身智能的 ChatGPT 时刻
银河通用推出的 WAM-TTT 框架,成功补齐了其具身多模态大模型从预训练到部署后持续学习的技术闭环。它不仅是对具身大模型算法的一次重要革新,更是向整个行业证明了:机器人同样可以在真实世界中积累经验,在部署后持续自我进化。
随着测试时训练(Test-Time Training)技术在具身智能领域的不断成熟,部署成本将迎来指数级下降。当机器人真正具备了在应用中进化的能力,距离具身智能迎来规模化爆发的“ChatGPT 时刻”,无疑又近了坚实的一步。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)