ARTICLE SIGNAL
清华徐梦迪解读具身智能Scaling Law与AI未来趋势
深入解读清华叉院徐梦迪关于具身智能、Scaling Law的最新访谈。探讨机器人上下文学习突破与真正的泛化能力,关注我们的AI门户,获取最新AI资讯、大模型进展及AI变现洞察。
type
status
date
slug
summary
tags
category
icon
password
网址
🚥本周「十字路口」的嘉宾是清华叉院助理教授徐梦迪。从清华车辆工程出发,途经 Johns Hopkins、CMU,再到 Stanford 吴佳俊、李飞飞组做博士后,2024 年初她选择回国,加入清华交叉信息研究院。她的核心命题是机器人的 In-Context Learning (ICL):让机器人到一个新环境,通过一两次交互当场学会新任务,而且越学越快。
本期节目还有一个及时的注脚:就在我们录完节目后的第二周,Generalist 发布 GEN-1.5 ——只给机器人看一段 3-12 秒的动作示范作为 "physical prompt",不做微调、不更新参数,它就能当场尝试完成新任务(10 项任务平均成功率约 59%)。ICL 随即成为全球具身智能领域最受关注的话题之一,而这正是梦迪持续押注的方向。
除了 ICL,我们还聊到:
•预训练的天花板
•真正的泛化
•Scaling Law 的信号与陷阱
•跑通稳定的数据闭环
•叠衣服 demo 的误导
•行业的泡沫与进步
•年轻 PI 的真实生活与研究选择
穿越所有的技术话题之后,这还是一期关于人生选择、环境与长期主义的对话,希望可以是给所有站在中美之间、学术与产业之间、跟随热点与坚持长线之间的年轻人的一份参考。
微信收听播客:
小宇宙收听播客:
🎬 视频播客已同步上线于 @Koji杨远骋 的视频号、小红书、哔哩哔哩、Youtube 等平台
快问快答
👦🏻 Koji
我们先从传统快问快答开始,帮助大家了解你。梦迪你的年龄?
👩🏻 徐梦迪
我今年 30.5 岁。
👦🏻 Koji
30.5?这么精确!MBTI 和星座?
👩🏻 徐梦迪
我的 MBTI 是 INTJ,星座是摩羯。
👦🏻 Koji
一句话介绍你当前花时间最多的研究方向是什么?
👩🏻 徐梦迪
让机器人能够从现实场景当中,不断地持续提升自己。
👦🏻 Koji
这个做了多久?我记得很早之前你就在做泛化。
👩🏻 徐梦迪
在 CMU 之后,我其实就一直在沿着泛化的方向做。
当时觉得机器人不能只依赖预先学到的知识。人类之所以有这么强的泛化性,有两个层面:一是人有很多先验知识;二是人学新知识学得非常快。真正的泛化,是希望让机器人具备类似人类这种快速学习的能力。
👦🏻 Koji
当时是什么契机让你进入这个研究方向的?
👩🏻 徐梦迪
到 CMU 之后,我开始做当时叫 Robot Learning 的方向,把机器学习的方法用到机器人上,当时还不叫具身智能这个 fancy 的名字。
我在 CMU 时非常喜欢一个工作叫 MAML,是 Stanford 教授、Physical Intelligence 联合创始人 Chelsea Finn 非常有名的一项成果。MAML 厉害的地方在于,它能让机器人学到没见过的任务。我当时觉得这才是机器人未来的方向。
👦🏻 Koji
当时是怎么关注到这个工作的?
👩🏻 徐梦迪
当时这个工作非常有名,实验室有同学对 ML 前沿方向都很感兴趣,大家平时经常交流、分享文章。我们看的论文非常杂,就注意到了这个方向。
衡水, 清华, JHU, CMU, 斯坦福
👦🏻 Koji
清华本科你读的是车辆工程系,从车辆工程到具身智能,中间感觉隔着一个“变形金刚”,你是怎么转型的?
👩🏻 徐梦迪
本科我学的是汽车,专业叫车辆工程。现在回想,当时去汽车系是一个非常正确的选择,汽车系学得非常全面:机械设计、汽车电子,跟电子系交叉很强,还有很多算法课程。从机械设计到算法,本科时都有所涉猎。
真正转向 Robotics 的契机在大二。当时我跟着机械系的阎绍泽老师做科研,做 Bio Robotics,研究蜜蜂翅膀的超弹性恢复。蜜蜂在采蜜过程中,翅膀会频繁与周围环境碰撞,但翅膀不会受损,因为它在结构上具有超弹性的性质。
以此为契机,大三暑研我去了 CMU Howie Choset 教授的组,他们组非常有名的方向就是 Bio Robotics。我在那里设计了一个爬管子的蛇形机器人,从那会儿开始,工作重心从机械设计逐渐转向了机器人算法。
👦🏻 Koji
这应该不是车辆工程系学生的常规路径吧?
👩🏻 徐梦迪
汽车系学生有个特点:自己想做的事情,就会非常努力去找跟兴趣 match 的地方。
当时有一些学长在阎绍泽老师组里,包括现在在哈佛做 AP 的杨珩学长,还有我高中一起学竞赛的同学也在,阴差阳错,我非常幸运地进了阎老师的组。
👦🏻 Koji
说到高中竞赛,你在中学甚至小学阶段是怎样的经历?一路都是学霸吗?
👩🏻 徐梦迪
我特别不敢称自己是学霸。后来求学、出国,见过太多厉害的人,大家都有非常独特的想法。学不学霸,无非是有人把精力放在学业上,有人放在了更感兴趣的事情上。
我小学过得挺轻松的,没上过补习班,课余时间要么参加学校活动,要么跟朋友玩。
👦🏻 Koji
我记得你的高中是衡水中学?
👩🏻 徐梦迪
对,衡中。小学时家里给的环境比较宽松,过得很快乐。当时有个爱好是拼四驱车,赶上动漫《四驱兄弟》大火,买零件自己拼,拼车很费钱,我们还琢磨着怎么赚钱。
👦🏻 Koji
玩四驱车还能赚钱?
👩🏻 徐梦迪
大院里好几个小朋友都喜欢,大家就想办法搞钱买车。
👦🏻 Koji
怎么赚呢?
👩🏻 徐梦迪
放学路上捡废品卖掉,其实还蛮赚钱。
👦🏻 Koji
听起来很像城市寻宝游戏,但是什么样的废品能卖到买四驱车的钱呢?
👩🏻 徐梦迪
一些废弃的钢铁零件,会有人回收。现在想想,小时候找零件还挺有毅力的。
👦🏻 Koji
感觉很小就埋下了车辆工程的种子?
👩🏻 徐梦迪
确实是我后来选车辆工程的原因之一。我一直觉得机械结构特别酷,能把很多细小的零件组装在一起,凝结了几代工匠的知识积累,变成一台精密的仪器。
👦🏻 Koji
在衡水中学的体验是什么样的?
👩🏻 徐梦迪
我自己的体验挺好的。高中的时候我是竞赛生,主业是搞竞赛,跟高考班的管理要求不太一样。竞赛更需要激发自主的 motivation,所以课程节奏跟普通班不同。
👦🏻 Koji
你是怎么成为竞赛生的呢?
👩🏻 徐梦迪
高一第一学期结束时会有意向调研,老师会来问对哪科感兴趣。当时我在数学和物理之间挑,觉得物理是一个非常 ground 到现实世界的学科,就选了物理。
👦🏻 Koji
听说衡中早上 5 点多、6 点就要起床,作息精细到几分钟。我听说甚至一个礼拜只有一次洗澡机会?
👩🏻 徐梦迪
不管是高考班还是竞赛班,作息要求都很一致:早操、上午操,时间表极其严格,高一到高三错峰去食堂。管理上确实非常严苛。
👦🏻 Koji
外面对衡水模式讨论很多,大家很好奇衡水毕业生的未来发展?你的观察是什么?
👩🏻 徐梦迪
以竞赛班来说,大家的特点是每个人都有极其强烈的个人想法。竞赛需要巨大的时间 commitment,因为别人放寒暑假,我们也在搞集训。我们班同学,一部分出国成了优秀的 Researcher,一部分在国内发展得也很好。
👦🏻 Koji
当时选择竞赛路线,是不是也像是选择了一条不归路?
👩🏻 徐梦迪
会有这种感觉。你不可能像其他高考学生那样面面俱到地学所有科目。一路经历竞赛考试、保送、自招,直到确定没有保送机会了,才会 merge 进普通高考班,但那时已经到高三下学期了。
👦🏻 Koji
有点像创业,需要破釜沉舟。
👩🏻 徐梦迪
对,但当时觉得非常有意思、有干劲。身边的朋友目标高度一致,小到解出一道题,大到冲省一、拿金牌,motivation 极强,完全不觉得苦。
👦🏻 Koji
同学之间竞争强吗?
👩🏻 徐梦迪
竞争肯定存在,但教练引导得很好。在班级里大家更像是并肩作战的同伴。所有人从零开始抱团解决问题,这种战友式的情谊比竞争坚固得多。
不能只靠预训练
👦🏻 Koji
在 CMU 读机械工程时,你的拿了系里的最佳 PhD 论文奖。这个奖一年发出多少个?
👩🏻 徐梦迪
我们那一届是两个人。
👦🏻 Koji
那篇论文的核心内容是什么?
👩🏻 徐梦迪
题目叫《Building Adaptable Generalist Robots》。核心是希望让机器人具备适应动态变化环境的能力。
预训练当然有用,我也非常相信 scaling,但预训练不是全部。我们不能指望机器人光靠预训练就变成一个 100% 成功的全能个体,它进入真实环境必须适应具体的变化。
现实是开放世界,任务在不断变化:家里今天有 20 个物体,一周后可能有 30 个,品类完全不同;不同人在不同场景下的 preference 也在变。对应到机器人的能力上,必须能够适应变化,并在变化中自我迭代。
👦🏻 Koji
当时主要的解题路径是什么?
👩🏻 徐梦迪
主要是两条路:
第一条是 In-Context Learning,上下文学习;第二条是 Test-Time Training,在部署时调整一小部分模型参数。目标都是让机器人摆脱单纯对 Pre-training 的依赖,通过 context 和 interaction 在现实场景中持续学习。
In-Context Learning 这条线,源于我 2021 年做的工作 Prompt Decision Transformer。当时的 motivation 是看到了 GPT-3 的上下文学习能力。我觉得太酷了——传统的 ML 是遇到新任务就做 Fine-tuning,而 GPT-3 是给一个 prompt 或输出格式,模型根据 prompt 直接调整输出。这种 adaptation 方式高效直接,不需要在部署端重新训练。当时我就想,机器人能不能也具备这种能力?
Prompt Decision Transformer 从相对基础的 setting 切入:给模型一段机器人的 demonstration,让它快速 adapt 到不同的 locomotion 和 manipulation 任务。
第二项工作是它的续作,Hyper-Decision Transformer,走的是 Test-Time Training 的路子。在部署阶段调整参数是一把双刃剑:调了参数能解决当前任务,但调多了又会遗忘预训练知识。我们折中做了一个 Hypernetwork,将元知识注入其中,再由它生成一个只占整体 Transformer 0.5% 参数量的小 Adapter。部署时只需要更新这 0.5% 的参数。
👦🏻 Koji
实测效果怎么样?
👩🏻 徐梦迪
在小样本预训练的前提下,Hypernetwork 更容易见效。
但随着现在数据量和预训练规模的大幅积累,我认为未来的核心方向依然是 In-Context Learning。通过 prompting 的方式解决,不用频繁改参数;或者等收集到足够多的 multi-task 数据后,再做批量的参数更新。
👦🏻 Koji
你现在推进的工作,相比当时有哪些延伸?
👩🏻 徐梦迪
做完 Prompt Decision Transformer 之后,业内利用 In-Context Learning 做快速 adaptation 的工作多了很多。
DeepMind 有个工作叫 Algorithm Distillation,视角非常惊艳:模型到底应该等价于一种什么样的智能?
现在大家用 VLA,是将模型参数等价于任务知识的载体,把专家 demonstration 通过模仿学习 distill 到参数里;而 Algorithm Distillation 认为,模型参数应该等价于一个算法,等价于一个 RL algorithm。它把 suboptimal 的轨迹放入 context window,让模型根据过去的失误动作和历史不断修正未来的 action。Transformer 结构由此具备了自我提升能力,参数本身就是一个强化学习算法。
👦🏻 Koji
这项工作在真机上验证过吗?
👩🏻 徐梦迪
在模拟器里跑通了,但任务更偏 navigation 和 locomotion,比如走迷宫。用在 manipulation 上依然很难。
类似的工作还有 Skild 团队的 LocoFormer,用 Transformer 基于 In-Context Learning 做腿足机器人的 adaptation,也是偏 locomotion。还有英伟达最近的 RoboTTT,让机器人观察人类长程 manipulation 视频,通过 TTT layer 改变 behavior,复现出类似演示里的动作。
👦🏻 Koji
大家的解法听起来还挺发散的,有收敛的迹象吗?
👩🏻 徐梦迪
业内对 adaptation 的重视度明显高起来了。
大家逐渐意识到,仅靠海量数据和海量参数预训练,或者单纯依靠基于专家演示的模仿学习,无法彻底解决机器人应用。在此基础上的 adaptation 成了破局点,这个共识正在形成。
👦🏻 Koji
我觉得这听起来好像是顺理成章、理所当然的事,为什么到现在才变成核心共识呢?
👩🏻 徐梦迪
业内一直有争论。人类之所以泛化能力强,原因有二:一是漫长演化带来的深厚先验与小脑控制力;二是人类新学一项技能的速度极快。
此前的主流做法是通过 scale 数据和模型,先把机器人的 prior 做厚,强化 multi-task 和 instruction following 能力,这并不意味着 adaptation 不重要。
但在真实场景中,机器人如果只有自适应能力而没有足够扎实的基模底座,试错代价会非常可怕,比如把家里的杯子全打碎,先做强 prior 再做 adaptation,路径是合理的。
👦🏻 Koji
博士后你去了斯坦福,加入吴佳俊和李飞飞的实验室,当时主攻哪些方向呢?
👩🏻 徐梦迪
我参与了三个自己非常满意、也很有意思的工作。当时有非常强大的伙伴,主要把博士阶段偏理论的想法往落地推进。
第一个是 BEHAVIOR Challenge。这是飞飞组里倾注了大量心血的 simulation benchmark,试图回答一个根本问题:机器人到底应该解决什么样的现实任务?里面有极其丰富的家庭和学校场景资产。我在其中负责生成数据集,提出了一种叫 MoMaGen 的方法,生成双臂移动操作的数据,比我过去的工作更贴近实际落地。
第二个是围绕让机器人更具备 steerability,属于我的主线研究。让机器人能够遵循人类更多样化的指令,适应不同人的偏好。
第三个是做了一个叫 Creative Tool Use 的 benchmark,探索机器人能否拥有人类那种创造性使用物理工具的能力。
👦🏻 Koji
这个 benchmark 怎么做评测呢?从名字看,它既要 creative,又要能 benchmark。
👩🏻 徐梦迪
我们从采集人类真实数据起步。人在使用工具时,从来不是看工具的名字,而是看功能,也就是机器人学里常说的 affordance。
比如想切蛋糕,手边没有刀,用叉子或者筷子一样能切开;想清理桌面,没有扫帚,拿书本甚至用手臂一划也能搞定。人类懂得创造性地利用环境里的物体,我们希望机器人也具备这种行为。
我们采了大量人类创造性使用工具的数据,从三个维度评测:一是多模态大模型挑选工具和规划轨迹的能力;二是针对非刚体、柔性物体的 3D 和 4D 场景重建能力;三是能否将人类灵巧使用工具的技能迁移到机器人上。
李飞飞的训练
👦🏻 Koji
李飞飞是什么样的风格,组里是什么氛围?
👩🏻 徐梦迪
当时我有两个 advisor,飞飞和佳俊。非常幸运能有两个 advisor,他们的风格挺不一样的,给我的收获也很不同。
飞飞非常 vision-driven。她总会抛出一些让你跳出单个项目去思考的问题,比如:未来 10 年,这个领域最本质的问题是什么?你在其中要扮演什么角色?
👦🏻 Koji
这两个问题是她原话问过的吗?
👩🏻 徐梦迪
不算是原话,但每次深入探讨,最终都会指向这个层面的思考。
我们当初定 benchmark 指标时,试图定很多细粒度的过程指标,比如进度百分比、各阶段耗时。飞飞直接点破:这些指标里哪个是真正重要的?只有最终的 Success Rate。过程指标是用来开发 debug 的,而不是最终的愿景。她当时引用了爱因斯坦的一句话:凡事应力求简单,但不能过于简单。
成为 PI 之后,核心职责是让大家始终盯住最本质的目标。佳俊则非常 hands-on,从 project 选型到具体 design 都会深度推演,在我迷茫时 push 我去打磨自己的 research brand。他们俩作为 co-advisor 是非常好的组合。
👦🏻 Koji
你如何理解建立 research brand 这件事?
👩🏻 徐梦迪
它必须发源于你真正的兴趣。如果一个问题能让你心甘情愿投入 5 到 10 年去深挖,它自然就会变成你的 research brand。
👦🏻 Koji
这跟创业很像,必须从你内心深处真正相信的事情出发?
👩🏻 徐梦迪
是的,从相信的地方出发。
👦🏻 Koji
这让我想到保罗·格雷厄姆那篇《如何成就伟大事业》的文章,每个知识体系远看都像一个完美光滑的球体,走近才发现到处是坑洼与黑洞,那些缺陷正是创业或研究的起点。
回清华
👦🏻 Koji
后来是什么促使你决定回国?当时留在斯坦福似乎是顺理成章的路?
👩🏻 徐梦迪
我是 2023 年回清华交叉信息研究院面试的,当时聊了院系里的很多老师,也包括姚先生。
👦🏻 Koji
当时怎么决定要来面试?
👩🏻 徐梦迪
2023 年我进入博士五年级,在考虑之后的发展方向。对我来说主要是工业界和学术界两个选择。
当时我在 Google 实习了非常长一段时间,体验非常好,mentor 给了我很多帮助,包括构建我自己的 research taste。在工业界确实有资源做更大规模的事情,学术界确实有一些资源上的限制,当时思考了很多到底去工业界还是学术界。
去叉院面试的契机,是有幸认识了吴翼老师,他帮我做了 bridge,拿到了面试机会。面试时跟院系老师聊、跟姚先生聊,体验都蛮好的。
叉院有几个强项:一是人很强,学生非常强。很多在美国做 Robotics 和 AI 方向的人都会认识一些姚班的人,姚班毕业生里有非常多各个领域的顶尖 researcher。
第二,我的研究方向是做机器人,机器人本身是一个系统,单纯只做大脑或者只做硬件,我心里都会觉得欠缺。我需要找一个最合适的地方,把机器人做成一个真正能落地的系统。综合考虑下来,叉院的机会是我的最优选择。
👦🏻 Koji
在工业界和学术界之间,后来是怎么做决定的?很多人现在也面临同样的十字路口。
👩🏻 徐梦迪
做决定之前,包括来叉院面试前,我找了非常多的朋友和师长寻求建议。后来发现,真正促使自己做决定的,还是心里具体想要什么。
工业界有很多算力支持,可以把小想法更容易地 scale up,但同时会有自由度的缺失。自由度对我来说非常重要,我希望时间能够最大化地分配到我认为重要的问题上,学术界是相对更好的选择。
落脚点还是自己心里真的觉得什么东西重要。
👦🏻 Koji
之前聊天你说有位老师问了一个让你印象深刻、好感倍增的问题?
👩🏻 徐梦迪
后来我也一直在思考这个问题。
他问:你为什么觉得你 5 年之后一定能成为自己领域的顶尖 researcher?
我当时的回答并不太好,只是非常自信地说“我觉得我一定可以”。但后来逐渐想,如果我...
Loading...