ARTICLE SIGNAL

8卡AMD硬刚16卡B200!Kimi K3大模型推理成本直降秘籍

本文深入解析AMD MI355X运行Kimi K3大模型的评测,分析显存容量对LLM推理效率的影响,展示ROCm生态的最新突破,并探讨人工智能芯片市场的未来格局。获取更多前沿AI资讯与大模型动态,请访问AI门户。

type
status
date
slug
summary
tags
category
icon
password
网址
随着人工智能技术的爆发式发展,万亿参数级别的超大语言模型(LLM)已经成为推动AGI(通用人工智能)进程的核心力量。然而,极高的参数量也给底层的算力基础设施带来了前所未有的挑战。最近,关于月之暗面 Kimi K3 模型的部署评测引发了行业广泛关注。
在传统的认知中,NVIDIA 的 Hopper 和 Blackwell 架构芯片是运行此类顶级大模型的唯一选择。但根据 Wafer AI 的最新实测,原本需要 16 张 NVIDIA B200 显卡、横跨两台服务器才能勉强运行的 Kimi K3,如今在一台配备 8 张 AMD MI355X 的服务器上就能成功部署,且性价比表现惊人。这一突破不仅展示了 AMD 在硬件规格上的前瞻性,也预示着大模型推理市场正在迎来多元化竞争的新格局。想要了解更多最新的 AI资讯AI日报,欢迎访问我们的 AI门户 AIGC.bar

显存成为新瓶颈:为什么8张AMD能装下Kimi K3?

在 LLM 推理任务中,算力固然重要,但随着模型尺寸的急剧膨胀,显存容量与带宽正在成为决定生死的新瓶颈。
Kimi K3 作为一个拥有 2.8 万亿参数的巨无霸模型,仅其静态的模型权重就需要占用超过 1.5 TB 的显存。如果再算上支持百万 Token 上下文所必需的 KV Cache(键值缓存),对显存总量的要求更是呈指数级上升。
在 NVIDIA 阵营中,一台标准的 8 卡 B200 服务器,每张显卡配备 192 GB 的 HBM 显存,整机总显存约为 1.5 TB。这意味着,单台 B200 服务器甚至连 Kimi K3 的静态模型权重都无法完全装下,更遑论预留出足够的空间来存放 KV Cache。因此,技术团队不得不采用跨节点(双服务器)的方案,动用 16 张 B200 显卡进行分布式部署。
然而,跨节点运行会带来严重的性能损耗。每生成一个 Token,数据都需要在两台服务器之间进行网络同步,即使使用高速的 RoCE v2 网络,通信延迟依然会成为拖慢解码速度的元凶。
相比之下,AMD MI355X 每张卡配备了高达 288 GB 的 HBM 显存,8 卡整机总显存达到了 2.3 TB。这多出来的显存空间,恰好能够将整个 Kimi K3 模型及其运行所需的 KV Cache 完整地保留在单台服务器内部。正是由于消除了跨节点的通信瓶颈,8 张 MI355X 最终跑出了令人瞩目的性能成绩。

性能与性价比的双重逆袭

在实际测试中,当输入 1024 个 Token 并输出 400 个 Token 时,8 卡 MI355X 方案展现出了极强的吞吐能力:
  • 总吞吐量:MI355X 达到了 952 Token/s,而 16 卡 B200 双节点部署的总吞吐量为 498 Token/s。
  • 单节点对比:若按单节点平均计算,MI355X 的吞吐量约为 B200 方案的 3.8 倍。
  • 单用户生成速度:MI355X 达到了 118 Token/s,同样高于 B200 的 90 Token/s。
虽然 NVIDIA 最新一代的 B300 依然保持着绝对性能的领先(8 卡 B300 总吞吐量可达 1568 Token/s),但价格因素彻底扭转了性价比的对比。
根据行业估算的使用成本(MI355X 约为 2.5 美元/卡/小时,B200 约为 4.25 美元/卡/小时,B300 约为 6 美元/卡/小时),在每美元所能提供的峰值吞吐量上,MI355X 达到了约 48 Token/s,而 B300 约为 33 Token/s,B200 则仅为 7 Token/s。对于需要大规模部署大模型服务的数据中心和 AI 企业来说,这种单位成本效率的提升,直接关系到商业化落地的可行性与利润空间。

ROCm生态的蜕变:从“不能用”到“直接用”

长期以来,软件生态(CUDA 护城河)一直是 AMD 挑战 NVIDIA 的最大软肋。许多开发者在使用 AMD 显卡时,常常会遇到算子不支持、需要重写底层内核等繁琐问题。但在此次 Kimi K3 的部署过程中,AMD 软件栈 ROCm 的表现令人刮目相看。
Wafer AI 指出,Kimi K3 几乎可以直接在 MI355X 上跑通,后续的优化工作主要集中在解决少量的兼容性问题上。
例如,在推测解码环节,由于 ROCm 分支中缺失了一个名为 top_k_renorm_prob 的函数,导致系统在首次请求时报错。技术人员并没有去手写复杂的 GPU 内核,而是直接使用了一个普通的 PyTorch 函数就补齐了这部分逻辑。修复后,推测解码成功帮助单路性能提升了约 2.2 倍,峰值总吞吐量提升了 18%。
另一个关键优化在于解决首字延迟(TTFT)问题。在处理 17.2 万 Token 的长文本预填充任务时,MI355X 最初因为注意力头数(12个)与 AMD 高速内核(AITER MLA)要求的倍数(4、8、16等)不匹配,退回到了较慢的通用 Triton 实现,导致首次响应时间长达 51 秒。
技术团队采用了一种非常巧妙且朴素的优化方法:通过“补零”操作,将 12 个注意力头虚拟填充至 16 个,成功调用了高速内核,计算完成后再剔除无用数据。这一改动将冷启动预填充速度提升了 2 到 3 倍,显著改善了用户的使用体验。

算力市场新变局:大模型推理的未来

这次实践证明,NVIDIA 坚不可摧的 CUDA 护城河已经出现了明显的缺口。在万亿参数大模型时代,硬件的显存容量设计正在直接左右系统层面的部署逻辑。
虽然 NVIDIA 在绝对生态和单核性能上依然领先,但 AMD 凭借“大显存 + 快速迭代的 ROCm 软件生态 + 高性价比”的组合拳,已经具备了在特定大模型推理场景下与 NVIDIA 正面分庭抗礼的实力。随着开源大模型的持续繁荣,这种硬件层面的多元化竞争,必将加速整个 人工智能 行业的普惠与应用落地。
更多关于大模型、chatGPTclaude 以及全球前沿 AI新闻 的深度解读,请持续关注 AI门户 AIGC.bar,为您带来最新、最专业的行业洞察。
Loading...

没有找到文章