ARTICLE SIGNAL

算力纪元:我国首个全国产10万卡AI超集群“曙光8000”正式投用

国家超算互联网郑州核心节点正式启用我国首个全国产10万卡人工智能超集群“曙光8000”。其每秒峰值算力相当于全人类持续计算200年,标志着国产算力基础设施迈入十万卡级新阶段,将为大模型训练与前沿科学研究提供强大支撑。

type
status
date
slug
summary
tags
category
icon
password
网址
随着生成式AI和大模型技术的爆发式增长,底层的算力基础设施正成为决定技术演进速度的核心命脉。在 aigc.bar 持续关注的全球算力军备竞赛中,中国算力产业迎来了一座全新的里程碑。日前,我国首个全国产10万卡人工智能超集群正式投入运行,这不仅标志着国产算力基础设施建设正式迈入“十万卡级”的超大规模部署新阶段,也为未来的通用人工智能(AGI)发展筑牢了底座。

事实梳理:十万卡级“算力巨兽”的诞生

此次正式投用的算力集群名为“曙光 8000(登峰)”,由中科曙光主导建设,并已成功接入国家超算互联网的郑州核心节点。从硬件规模与绝对性能来看,这套系统的参数堪称“算力巨兽”:
首先,该集群实现了惊人的算力峰值。据国家高性能计算机工程技术研究中心专家透露,该集群每秒钟的峰值计算能力,相当于全人类不眠不休持续计算200年的工作量。这一海量算力依托于十万张全国产AI加速卡构建而成,彻底摆脱了对单一外部供应链的依赖。
其次,在物理部署与散热技术上,“曙光 8000”采用了极为先进的浸没式相变液冷技术。在如此庞大的算力密度下,传统风冷已无法满足散热需求。该技术不仅支撑了单机柜达到兆瓦(MW)级的高功率密度部署,还结合了国产冷媒与全年自然冷却方案,极大地提升了整个超大规模集群的PUE(电能利用效率)表现。

融合算力的深远影响与应用场景

与传统的纯AI算力中心不同,“曙光 8000”最大的技术革新在于其“超智融合”的技术路线。在 aigc.bar 看来,这种融合算力将重塑算力的使用方式。
该集群能够提供从 FP64(双精度浮点,常用于高精度科学计算)到 INT8(8位整数,常用于低精度AI推理)的全精度算力支持。这意味着它不仅能像传统的GPU集群那样高效执行千亿级甚至万亿级参数的大语言模型(LLM)训练和日常AI推理任务,还能完美兼容气象模拟、工业仿真、流体力学等严苛的科学计算。
目前,该集群已经在支持新材料研发、创新药分子发现、人工智能大模型训练等26个前沿领域的300多种复杂计算任务。这种科学计算与智能计算的无缝融合,为“AI for Science”(人工智能驱动科学研究)提供了最理想的试验场。

潜在风险与大规模部署的限制

尽管十万卡超集群的投用令人振奋,但在实际的运维与商业化落地过程中,仍有一些不可忽视的风险与限制挑战:
  1. 网络互联与算力损耗:在十万卡级别的大规模集群中,节点间的通信延迟是致命的瓶颈。如何用国产网络交换架构实现无阻塞的高速互联,确保算力线性扩展而不是在内耗中衰减,是长期的技术考验。
  1. 软件生态与CUDA兼容性:硬件的突破只是第一步,开发者生态才是护城河。目前全球AI开发深度依赖特定的软件栈环境,国产十万卡集群需要提供足够易用、高效的底层编译器与算子库,以降低开发者的迁移成本。
  1. 极限能耗挑战:即便采用了业界顶级的相变液冷技术,十万张加速卡的绝对能耗依然是一个天文数字。在“双碳”目标背景下,如何保障该节点长期的绿色能源供应,将是考验地方电力基础设施的一大难题。

结语

“曙光 8000”的正式投用,是我国在顶级AI算力领域交出的一份重量级答卷。它不仅证明了全国产硬件在“十万卡”这一极限规模下具备实战部署能力,也为国内的AIGC初创企业、科研院所提供了安全、稳定、充沛的算力水源。算力即国力,在迈向AGI的征途上,这个十万卡超集群的轰鸣,只是新时代大幕拉开的前奏。
Loading...

没有找到文章