摩尔线程的「三座 AI 工厂」:国产 GPU 从万卡训练到世界模型的实战答卷

type
status
date
slug
summary
tags
category
icon
password
网址

引言:从"有多少卡"到"生产多少 Token"

在 2026 世界人工智能大会期间,国产 GPU 厂商摩尔线程抛出了一个颇能代表当下行业情绪的观点:AI 基础设施的评价标准,正在从 GPU 数量和峰值算力,转向"每天能稳定生产多少高质量 Token"。InfoQ 在 7 月 20 日的深度报道中梳理了摩尔线程提出的"三座 AI 工厂"框架——模型训练工厂、词元生产工厂和智能体生产工厂,以及其夸娥(KUAE)智算集群、MTT S5000 全功能 GPU 与 MUSA 软件栈的最新进展。其中最引人注目的案例,是北京大学的 5D 世界模型 EvoPhys-World 原生全程在国产 GPU 上完成训练,并拿下斯坦福 WorldScore 榜单"世界生成"赛道第一名。

事实梳理:三座工厂分别解决什么问题

摩尔线程创始人张建中的判断是,智能体应用爆发让 Token 消耗量出现千倍级增长,而企业级的高品质 Token 需要支撑万亿参数模型、百万级上下文、极低首字延迟和 99.99% 的稳定性,传统算力指标已无法衡量这种生产能力。「三座工厂」框架正是对此的回应。
第一座是模型训练工厂。摩尔线程以夸娥智算集群加 MUSA 软件栈覆盖训练全流程:底层通过 Torch-MUSA 兼容 PyTorch 算子生态,适配 Triton 和 TileLang,上层支持 Megatron-LM、DeepSpeed、FSDP 等主流分布式框架,并开源了 MT-VeRL、MT-Slime 两套强化学习训练套件。针对 MoE 模型,MTT S5000 可结合 DeepEP 通信技术原生支持 Per-Block FP8 计算。网络侧,MTT C256 超节点用一层 Scale-up 网络实现单柜 128 卡全互联,并柜可扩展至 256 卡,卡间延迟压到亚微秒级。官方公布的数据显示,夸娥集群扩大训练规模时线性扩展效率最高达 95%,支持断点续训,有效训练时长占比超过 90%,并已与某国家级实验室合作在国产万卡集群上从零训练了 MoE-236B 基础模型。
第二座是词元生产工厂,核心是推理成本。其推理栈原生适配 SGLang 和 vLLM,对 DeepSeek、MiniMax、GLM、Kimi、Qwen 等国内主流模型实现"发布即适配"。更值得注意的是 PD 分离异构推理方案:把计算密集的 Prefill 阶段部署在 MTT S5000 上,把对显存带宽更敏感的 Decode 阶段留在企业已有的国际主流 GPU 上。官方实测称,3 台 MTT S5000 加 2 台国际主流 GPU 可以达到 9 台国际主流 GPU 的等效性能,为存量算力的国产化混合部署提供了路径。
第三座是智能体生产工厂。数字智能体方面,摩尔线程自研的"小麦"掌握 60 余项技能、可控制 38 款应用;物理智能体方面,全栈仿真平台 MT Lambda 集成 MuJoCo、Newton 等开源物理引擎并提供 MUSA 加速版,结合 3DGS、生成式渲染和硬件光线追踪构建数字孪生环境,支持从单卡扩展到上千卡集群做 Sim-to-Real 训练。

世界模型与生态:国产 GPU 的实战证据

北大 EvoPhys 团队在摩尔线程"灯塔计划"支持下完成的 EvoPhys-World,原生训练全程基于 MTT S5000 和 MUSA 软件栈,最终在斯坦福 WorldScore 公开评测的"世界生成"赛道排名第一。此外,摩尔线程还用 MTT S5000 千卡级集群训练了 Wan 类视频生成模型,与北京智源研究院合作完成 RoboBrain 2.5 具身大脑模型训练,极佳视界也在基于该平台训练具身世界模型。产业侧,京东云透露其 JoyAI 系列大模型相当一部分训练依托摩尔线程国产化算力;趋境科技称已具备日均万亿级高品质 Token 供应能力,并通过国产与国际 GPU 的 PD 分离混合部署实现成本与性能互补。针对 CUDA 生态迁移难题,摩尔线程提供 Musify、AutoMusify 自动迁移工具,并推出 MusaCoder 代码大模型和 MUSACODE 编程智能体,用 AI 来降低算子转换和适配成本。

影响与用法:企业能怎么用

对正在规划智算投入的企业而言,这一轮信息的价值主要在三点。其一,评估框架可以从"采购多少卡"切换为"单位成本生产多少可用 Token",把延迟、吞吐和稳定性纳入同一个账本。其二,预算有限或已有大量存量 GPU 的企业,不必整体替换设备,可以评估 PD 分离这类异构推理方案,用国产卡承接 Prefill 等计算密集环节。其三,有世界模型、具身智能、视频生成等新型负载的团队,国产全功能 GPU 兼具 AI 计算与图形渲染能力的特性,在 3DGS、数字孪生等场景可能是差异化选项。

风险与限制

需要冷静看待的是,上述性能数据——包括 95% 线性扩展效率、"3+2 等效 9 台"的推理结论、与国际主流 GPU"接近"的表现——均来自厂商披露或合作方口径,缺乏第三方独立基准复核,实际效果会因模型结构、并行策略和负载类型而显著波动。其次,"发布即适配"的承诺在模型结构快速迭代的背景下需要长期兑现,生态迁移工具能覆盖多少冷门算子仍是未知数。再次,万卡级训练案例目前公开的只有个别合作,国产 GPU 在超大规模训练上的稳定性样本仍然有限。最后,异构调度引入了额外的系统复杂度,运维能力和软件栈成熟度本身也是成本。

结语

摩尔线程的"三座工厂"本质上是把国产 GPU 的叙事从参数竞赛拉回到生产闭环:训练、推理、智能体部署分别对应模型能力上限、商业化成本和落地形态。EvoPhys-World 在国产算力上原生训练并登顶 WorldScore 单项赛道,是这条路线迄今最有说服力的公开证据之一。接下来值得观察的,是更多独立第三方工作负载能否复现这些指标,以及 PD 异构、仿真训练等方案能否从示范案例走向标准化产品。
Loading...

没有找到文章