Sand.ai获超亿美元融资,曹越详解视频如何通往世界模型与AGI

type
status
date
slug
summary
tags
category
icon
password
网址
在人工智能(AI)狂飙突进的当下,视频生成与“世界模型”已然成为全球科技巨头与顶尖创业团队的兵家必争之地。2026年,国内AI视频生成领域的明星初创企业 Sand.ai 宣布完成两轮累计超亿美元的巨额融资,投资方汇集了包括 Look Capital、九坤创投、经纬创投、源码资本、今日资本、百度风投等在内的数十家一线硬科技投资机构。
作为上一代AI创业潮“光年之外”的核心成员,Sand.ai 创始人曹越在经历行业洗牌后,迅速带领团队在视频生成模型赛道上开辟出了一条非共识的道路。从最初坚定选择自回归(Autoregressive)路线,到率先攻克音画同出难题,再到全面转向混合专家模型(MoE)架构,Sand.ai 的每一步都在押注非共识。
那么,在“世界模型”被概念泛化和滥用的今天,为什么视频是通往通用人工智能(AGI)最关键的拼图?AI大模型初创公司又该如何在模型研发与产品变现之间找到平衡?想要了解更多前沿大模型动态与AI变现指南,欢迎访问领先的AI门户与AI资讯平台 AIGC.bar

从自回归到MoE:Sand.ai的“非共识”技术美学

在 Sand.ai 创立之初的2024年初,整个AI视频生成行业几乎被 Diffusion(扩散模型)路线所统治,Sora 的横空出世更是让这一共识达到了顶峰。然而,曹越和他的团队从第一天起就坚定地站在了自回归路线这一边。
在物理世界中,万事万物在时序上都存在着极强的因果关系。物理规律本质上是一个随着时间变化的函数。因此,“预测下一帧”(Predict Next Frame)或“预测下一秒”才是对视频数据最本质的训练范式。Sand.ai 旗下的 Magi-1 模型在 Google DeepMind 提出的物理真实性测试榜单 Physics-IQ 中长期保持第一,甚至超越了 Nvidia 发布的旗舰级世界模型 Cosmos3-Super,这充分验证了自回归架构在模拟物理规律上的优越性。
随着模型效果的提升,团队在推出 Magi-1 后意识到,纯粹的画面生成无法完整压缩物理世界的状态。声音与画面在现实中是天然对齐且互为因果的。实现“音画同出”不仅是功能的升级,更是对世界状态更高维度的表达。为此,Sand.ai 推出了音画同出模型 Gaga-1,成为行业内最早攻克这一难题的团队之一。
然而,视频模型的发展始终受制于“成本、速度、效果”的物理不可能三角。在 Dense(稠密)架构下继续扩大参数规模(Scale Up),其推理和训练成本会呈指数级上升。为了打破这一瓶颈,Sand.ai 在2025年底果断选择转向 MoE(混合专家模型)架构。
视频 MoE 的训练难度远超语言模型(LLM)。视频的 Token 序列极长,冗余度高,这对通信开销、负载均衡以及训练稳定性提出了严苛挑战。通过在模型架构上的多项自主创新,Sand.ai 成功跑通了超大规模视频 MoE 模型的稳定训练方案。据悉,其即将在2026年第三季度发布的新一代视频生成模型,将采用 MoE 架构,在兼顾高效推理的同时,提供开源领域最大的参数规模,并将无保留地开源给全球开发者。

为什么视频是通往世界模型的“唯一最优解”?

如今,“世界模型”已经成为AI日报和各类科技媒体上的高频词汇,但也面临着概念被完全滥用的窘境。在曹越看来,当前的世界模型仍处于“前 GPT-1 时代”——数据维度缺失、技术路线未收敛、定义尚不明确。
真正的世界模型,其核心在于从当前观测直接推演下一刻的真实观测,而不是从人类先验定义的隐藏状态去推演。历史经验(如 The Bitter Lesson)一再证明,任何试图用人类先验去拆解和定义物理世界复杂度的行为,最终都会被规模化(Scale)的原始数据预测所击败。
在所有可获取的数据类型中,视频数据是走向世界模型最重要的数据源。原因在于:
  1. 信息密度最高:视频是4D物理世界(3D空间+时间轴)经由摄像头投影后的结构化切片。它同时编码了时间、空间、视觉和听觉,是规模最大、维度最丰富的观测数据。
  1. 多模态隐式编码:视频中不仅包含画面和声音,更隐式编码了触觉、温度、材料属性以及人类的意图与情感。这些多模态信息都随着时序的变化被高度压缩在视频像素中。
视频生成模型的演进,本质上是一个AI模型逐步建立对物理世界认知的过程。从静态图像生成(认识静止的世界),到早期视频生成(画面动起来),再到音画同出(引入听觉维度)、3D空间一致性(理解空间结构),最后到因果关系与实时交互。在这个过程中,模型没有背诵物理公式,而是通过海量视频数据的预测训练,自主涌现出了对物理世界的规律理解。

模型与产品双轮驱动:VidMuse的商业化变现探索

在AI行业,关于“模型公司要不要做应用”的争论从未停止。Sand.ai 给出的答案是明确的:必须模型与产品双轮驱动。
在视频AI领域,模型与产品的物理距离极近,能够直接吃到算力红利与用户数据反馈的红利。只做 API 售卖的纯模型公司,很容易在行业演进中被生态整合;而纯产品公司如果在底层缺乏 SOTA 模型的训练能力,也会丧失长期的护城河。
Sand.ai 采用了以模型为核心的多产品矩阵打法。其在2026年初上线的音乐与音画 Agent 产品 VidMuse,仅用三个月时间就实现了千万美元的年经常性收入(ARR)。这不仅证明了 AI 视频在泛内容创作赛道上的强大变现能力,更为底层模型的优化提供了闭环通路。通过端到端收集用户的真实生成偏好,这些宝贵的反馈数据能够直接反哺模型的后训练(Post-training)阶段,形成自我进化的正向循环。

视频模型市场的终局与中美竞速

展望未来,AI视频模型的竞争格局与语言模型有所不同。由于视频生成涉及更加多元的创意表达、叙事逻辑和多镜头协同,其垄断程度不会像 LLM 那样极端。未来的视频大模型市场不会出现一家独大的局面,更可能呈现“牌桌逻辑”——最终留下三到五家头部企业共同瓜分这个万亿级的内容生产与交互市场。
对于 OpenAI 关停 Sora 业务的业界传闻,这更像是一次理性的战略收缩。在面临上市预期和算力约束的双重压力下,将算力从变现路径较长的 Sora 转移至能直接产生现金流的 Coding 模型(如 Codex)和推理模型,是商业逻辑上的合理抉择。
而在这一轮视频模型的国际竞争中,中国团队凭借极早的布局时间、活跃的短视频产业生态以及在自回归和 MoE 架构上的快速迭代,已经稳稳站住了全球 Tier 1 的第一梯队。
从 Magi-1 到 Gaga-1,再到即将问世的 MoE 开源大模型,Sand.ai 的成长轨迹表明,唯有回归第一性原理,不盲从市场共识,才能在 AGI 的长跑中笑到最后。
获取更多关于 OpenAI、ChatGPT、Claude 的最新技术评测、Prompt 提示词技巧及人工智能行业深度报告,请持续关注 AIGC.bar
Loading...

没有找到文章