ARTICLE SIGNAL

Yann LeCun万字拆解世界模型:为何预测像素是伪命题

Yann LeCun,世界模型,JEPA,预测像素,ECCV 2026,AGI,大模型局限,具身智能,人工智能,抽象表征,System 2推断,深度学习架构

type
status
date
slug
summary
tags
category
icon
password
网址
在经历了由大语言模型(LLM)狂飙突进引领的技术浪潮后,全球人工智能行业正在迎来新的拐点。曾经被整个行业奉为圭臬的“缩放定律(Scaling Law)”正逐步遭遇边际收益递减的瓶颈:更大的模型规模、更多的数据标记(Token)吞吐,虽在代码编写与标准化测试中屡创佳绩,却始终无法让 AI 迈过理解真实物理世界的门槛。
在 ECCV 2026 的主题演讲中,图灵奖得主、深度学习先驱 Yann LeCun 带来了一场颠覆业界共识的万字 Keynote——《World Models: Enabling the next AI revolution》。LeCun 明确指出:“预测像素”从物理和数学本质上就是一个伪命题,仅靠语言和离散 Token 训练,AI 绝不可能跨入通用人工智能(AGI)的殿堂。
伴随着这篇演讲,关于“世界模型(World Models)”的路径大争论全面爆发。作为关注前沿科技的从业者与研究者,获取一手、客观且深入的AI资讯与行业动态至关重要。本文将系统拆解 LeCun 的核心论点,深度透视世界模型的四条主流技术路线,并探讨这一技术转向将如何重塑整个人工智能产业的未来格局。

四方角力:2026年“世界模型”牌桌上的路线之争

进入 2026 年,“世界模型”已经接棒 Scaling Law,成为前沿科研与资本市场中最受瞩目的核心词汇。然而,不同的顶尖团队对“让机器理解世界”这件事,给出了截然不同、甚至彼此对立的解答。目前行业内主要存在四条截然不同的路线:
  1. 涌现派(视频生成路线):以 OpenAI 的 Sora、Google 的 Genie 等为代表。这一流派笃信端到端视频生成,认为只要将扩散模型或自回归模型推向极致、下一帧像素还原得足够逼真,关于重力、惯性与遮挡等物理规律就会自然而然地从高密度像素中“涌现”出来。
  1. 几何派(三维一致性路线):由李飞飞联合创办的 World Labs 主导。该路线主张从底层表征锁死三维几何一致性,跳过纯平面的像素幻觉,直接生成物理结构稳定、可供自由探索与交互的三维世界。
  1. 仿真派(显式物理引擎路线):以英伟达的 Cosmos 与 Omniverse 为代表。其核心逻辑是将高度精确的工业级仿真与显式物理引擎作为机器人的“虚拟练兵场”,通过海量合成环境弥补现实世界试错成本高昂的问题。
  1. 抽象表征派(JEPA 联合嵌入路线):由 Yann LeCun 亲自扛旗的孤峭道路。该路线完全放弃在像素空间中生成未来画面,而是主张在高度压缩、丢弃不可预测噪声的抽象隐空间中预测未来状态。
四条路线的根本分歧,本质上直指智能的核心命题:机器要真正“懂”物理世界,究竟应当去精确“复刻”它,还是去抽象“推理”它?
前三条路线无论以何种形式展开,本质上都在试图让机器看见并重构完整的感官输入;而 LeCun 押注的 JEPA(联合嵌入预测架构),则选择了逆流而上——在进入预测前,先由编码器主动剥离那些无法被预测的混乱细节。

为什么说“预测像素”从底层逻辑上就是伪命题?

在过去很长一段时间里,基于生成式 AI 的视频预测模型被许多研究者冠以“世界模型”之名。但在 LeCun 看来,这不仅概念混淆,而且方向完全南辕北辙:在像素层面预测世界,在数学与物理上是不可能实现的。
这一论断的深层依据在于物理世界的本质复杂性与高熵特征:
  • 视界之外的信息缺失:设想你将摄像头对准一个房间的角落开始录制。下一帧画面中是否会突然出现一只猫、光影是否会因窗外云层飘过而改变,这些决定下一帧像素的关键信息,在“当前帧”中根本不存在。要求模型预测下一帧的微观像素分布,等同于强迫模型凭空猜测一个无解的边界外事件。
  • 连续空间的概率分布难题:在 ChatGPT、Claude 等大模型所擅长的文本领域,Token 是离散的,且词表规模有限(通常在数万到数十万量级),模型能够有效地通过 Softmax 表征所有可能 Token 上的概率分布。然而,高分辨率图像与连续视频是无限维且高度连续的空间,数学上根本无法定义一个有效的后验概率分布。
  • 平均化导致的“模糊陷阱”:强行让生成模型在像素空间预测不确定的未来,系统为了降低均方误差(MSE)损失,必然会输出所有可能未来的统计平均值——这正是早期视频预测论文中画面必然模糊的根源。即便引入隐变量或扩散机制强行消除模糊,模型生成的也只是华丽却虚妄的幻觉,并未真正习得现实的物理规律。
在真实世界中,一辆自动驾驶汽车无需预测路旁树叶随风摇曳的具体纹理,也无需精确计算水洼涟漪的每一个反光点。强迫网络去解这些不可预测的高频噪声,不仅极大地浪费算力,更会从根本上破坏模型学习宏观物理规律与因果关联的能力。
JEPA 的核心思想正在于此:通过编码器将感知输入映射到高维抽象隐空间,主动丢弃不可预测的微观细节,仅在表征空间中预测下一步的状态。这种架构让系统得以摆脱“生成像素”的沉重枷锁,将算力完全聚焦于可预测、可规划的物理本质。

莫拉维克悖论再现:文本训练跨不过的物理常识鸿沟

在当下的AI新闻与产业舆论中,常有一种乐观论调认为:只要算力足够、Prompt 足够精细,基于自回归的大语言模型就能逐步演化出通用推理能力。但 LeCun 明确警示:当下的 AI 依然存在巨大的底层缺陷。
这再次将整个行业推向了经典的莫拉维克悖论(Moravec's Paradox):计算机可以在抽象的微积分计算、法律考试甚至国际象棋中击败人类,却在动物幼崽都能轻松掌握的物理感知与肢体协调面前束手无策。
LeCun 从信息论的角度给出了一组极具说服力的数据对比:
  • 互联网全量文本的极限:训练一个顶级 LLM,如果吞吐互联网上近乎全部公开文本,数据量大约为 20 万亿到 30 万亿个 Token。按每 Token 占用 2 到 3 个字节计算,其总信息量约为 $10^{14}$ 字节。一个普通人如果全天候阅读,需要花费大约 40 万年才能读完这些文字。
  • 人类儿童的感官带宽:一个 4 岁的人类幼童,其双眼视网膜经神经节细胞初步压缩后,每秒向大脑传递约 200 万字节的感知信号。在生命的头 4 年里,累计清醒时间大约为 6 万小时。两者相乘,$2 \times 10^6 \text{ 字节/秒} \times 3600 \text{ 秒/小时} \times 60000 \text{ 小时} \approx 4.3 \times 10^{14}$ 字节。
这意味着:一个 4 岁的孩子仅仅通过日常观察周围环境、触摸物体所吸收的多模态物理信息量,就已经超越了整个人类互联网所有文本的信息总量。
语言只是人类对现实世界高度压缩、后天抽象出的一层稀疏标签。真实的物理世界远比离散的 Token 更加混乱、高维且连续。一只家猫能够利用墙壁的反弹力跳跃至数米高的柜顶,一个未成年的少年仅需约 20 小时的实际驾驶训练就能熟练掌控车辆。而基于海量驾驶记录与专家模仿学习训练的端到端自动驾驶网络,至今仍难以安全落地真正的 L5 级自主驾驶。这充分证明,脱离真实物理环境的“离散知识堆砌”,根本不等同于真正的智能。

告别被动反应:构建具备 System 2 规划能力的世界模型

为什么当前的聊天机器人在写代码与解数学题时表现惊艳,一旦用于复杂现实决策便频频碰壁?LeCun 指出,根源在于推断机制的本质差异。
现有的自回归大模型本质上是 System 1(反应式系统):数据向前单向穿过深层神经网络,以贪婪或采样的方式逐个吐出下一个 Token。在输出当前 Token 的瞬时微秒内,网络内部没有任何真正的回溯与规划机制。
尽管目前行业通过思维链(Chain of Thought)、强化学习搜索策略等工程手段模拟反思,但这仅在“输出结果能够被快速程序化验证”的封闭领域(如编译器纠错、数学定理证明)有效。一旦进入非确定性极高、物理因果不可逆的现实世界,验证成本变得不可压缩,这种靠暴力试错的机制就会彻底失效。
为了实现真正的 System 2(深思熟虑式规划),LeCun 倡导的基于能量的推断模式展现出更强大的架构优势:
  • 能量函数评估:答案不再由网络直接端到端生成,而是将候选动作与预期结果作为输入喂给模型,由网络计算一个标量“能量(Energy)”。能量越低,代表该决策在当前约束与物理规律下越合理。
  • 基于世界模型的后果预测:在正式执行动作前,智能体调用内置的世界模型,在内部虚拟空间中推演:“如果我采取动作 $A$,世界将演变至状态 $S'$”。
  • 动态目标优化与硬编码安全护栏:系统通过梯度下降或优化搜索,在隐空间内寻找能够最小化代价函数的动作序列。更关键的是,开发者可以通过在能量目标中嵌入严格的数学约束(Guardrails),将安全性直接固化在系统的优化目标之中。这从根本上避免了大语言模型因提示词注入等漏洞引发的越狱与失控风险。
在此基础上,LeCun 提出了通向终极机器自主的关键支柱——层级化规划(Hierarchical Planning)。人类面对复杂任务时绝非在毫秒级的肌肉抽动层面做规划。当你计划“明天从纽约飞往巴黎”时,你的最高层世界模型仅规划“前往机场”、“登机”与“出关”等抽象里程碑,再由下层模型根据实时情境细化为“打车”、“按电梯”、“迈步”。构建具备分层抽象能力的世界模型,是破解通用机器人与具身智能落地瓶颈的必经之路。

激进反思与行业启示:AI 该往何处去?

在演讲的尾声,LeCun 面对台下数千名顶尖计算机视觉研究人员,掷地有声地给出了三条颠覆主流舆论的建议:
  1. 停止死磕纯生成式模型
  1. 停止将精力局限在 LLM 身上
  1. 全面转向联合嵌入架构(JEPA)、抽象表征与世界模型
对于整个行业而言,这无疑是一记响亮的警钟。在过去两年里,海量资源沉淀在以提示词工程、RAG(检索增强生成)以及单纯追逐更大参数的 LLM 框架上。然而,正如 LeCun 所创办的 AMI Labs 所展现的战略方向,下一代人工智能的核心突破点正在向具身智能、空间表征与物理因果推演快速转移。
对于技术团队和开发者来说,紧跟这一范式转移具有极高的战略价值:
  • 拥抱多模态与时空动力学:摆脱单纯的“文本中心主义”,深入探索结合空间几何、视频表征与物理交互的复合系统;
  • 从生成迈向决策控制:不再执着于像素级的生图、生视频玩具,将核心算法深度整合至基于能量的模型(EBM)与模型预测控制(MPC)中,攻克工业自动化、具身操作等高价值场景;
  • 持续洞察最前沿的AI门户生态:无论是寻找最新的技术突破、大模型横向对比、开发者工具,还是探索前沿科研向产业落地的商业路径,建立全方位的技术雷达都是决胜未来的基础。

结论

Yann LeCun 在 ECCV 2026 上的这篇万字布道,绝非对现有深度学习成就的虚无主义否定,而是一次去伪存真的深层路线校准。
生成式大模型为人类创造了前所未有的语言生产力工具,但它并非通往物理世界自主智能的万能钥匙。“预测像素”的虚幻繁荣,终将被更深层、更具结构性的表征预测所超越。未来的智能体不会是一个闭门造车的语言大师,而是一个能够在抽象维度理解现实规律、洞察行动后果、从容应对未知环境的敏捷探索者。
人工智能的下半场才刚刚拉开序幕。摆脱对单一路径的盲从,在更混乱、更高维的真实世界中寻找智能的物理基石,将是所有 AI 探索者共同的远方。
Loading...

没有找到文章