揭秘世界最大AI集群:马斯克 xAI Colossus 算力中心(10万H100 GPU)

发布者:知足者常乐 2026-8-9 10:10

图 | xAI Colossus 数据中心

对于那些听说过埃隆·马斯克的xAI在孟菲斯建造超级AI算力中心的人来说,这个价值数十亿美元的AI集群配备了100,000块NVIDIA H100 GPU,其引人注目之处不仅在于其规模,更在于其建造速度。团队仅用122天就建成了这个巨型集群。

Supermicro液冷机架

Colossus的基本构建模块是Supermicro液冷机架。每个机架包含8台4U服务器,每台服务器配备8块NVIDIA H100 GPU,因此每个机架共计64块GPU。这8台GPU服务器,加上一台Supermicro冷却液分配单元及相关硬件,共同构成一个GPU计算机架。

图 | xAI Colossus数据中心Supermicro液冷节点低角度视图

这些机架以8组为一组排列,共计512块GPU,并配备网络设备,在这个庞大系统中形成更小的子集群。

图 | xAI Colossus数据中心Supermicro 4U通用GPU液冷服务器

xAI在此使用的是Supermicro 4U通用GPU系统。这些是当前市场上最先进的AI服务器,原因有几点:一是其液冷程度,二是其可维护性。

图 | xAI Colossus数据中心Supermicro 4U通用GPU液冷服务器特写

该系统的一个特点是,其托盘化设计使得无需将系统从机架中移出即可进行维护。1U机架歧管负责为每台系统导入冷却液和导出升温后的液体。快速断开接头使得移开液冷管路变得迅速,一旦这些管路移开,托盘即可拉出进行维护。

图 | Supermicro 4U通用GPU系统(用于液冷NVIDIA HGX H100和HGX 200)SC23展品 3

幸运的是,这台服务器原型机的图片,可以展示这些系统内部的构造。除了采用Supermicro定制液冷模块的8 GPU NVIDIA HGX托盘外,CPU托盘展示了为何这是业界无可比拟的下一代设计。

图 | Supermicro 4U通用GPU系统(用于液冷NVIDIA HGX H100和HGX 200)SC23展品 6

上图中SC23原型机里的两个x86 CPU液冷模块相当常见。独特之处在于右侧。Supermicro的主板集成了当今几乎所有HGX AI服务器中使用的四个Broadcom PCIe交换机,而非将其置于单独的子卡上。然后,Supermicro采用定制的液冷模块来冷却这四个PCIe交换机。业界其他AI服务器是先设计风冷方案,然后再添加液冷。而Supermicro的设计则是从零开始就面向液冷,并且全部由一家供应商提供。

图 | Supermicro SYS 821GE TNHR NVIDIA H100和NVSwitch液冷模块 8

这类似于汽车,有些是先设计为燃油车,然后将电动动力系统适配到该底盘上,而有些则是从零开始设计的电动车。Supermicro系统属于后者,而其他HGX H100系统属于前者。我们已经亲手测试过自发布以来的大部分公开展示的HGX H100/H200平台,以及一些超大规模设计。毫无疑问,这款Supermicro系统与其他系统(包括我们之前评测过的Supermicro其他一些可风冷或液冷的设计)之间存在着巨大差距。

在机架背面,看到用于连接GPU和CPU单元的400GbE网络光纤,以及用于管理网络的铜缆。这些网卡也位于它们自己的托盘上,便于在不拆卸机箱的情况下进行更换,但它们位于机箱后部。每台服务器有四个电源,同样支持热插拔,并由三相PDU供电。

图 | xAI Colossus数据中心Supermicro 4U通用GPU液冷服务器背面 1

在机架底部,是CDU,即冷却液分配单元。这些CDU就像巨大的热交换器。每个机架内都有一个流体回路,为所有GPU服务器供液。我们称之为“流体”而非“水”,是因为通常这些回路中需要充注针对液冷模块、管道、歧管等材料特性调制的专用液体。

图 | xAI Colossus数据中心机架底部的Supermicro CDU

每个CDU都有冗余泵和冗余电源,这样即使其中一个发生故障,也可以在不停机整个机架的情况下进行现场更换。由于我以前更换过这类CDU的泵,我曾想在Colossus现场也演示一下。但转念一想,这可能不是最明智的主意,因为我们去年已经有我更换泵的录像了。

图 | Patrick拆卸Supermicro CDU泵

xAI的机架涉及大量工作,但在拍摄2023年的片段时,我们获得了Supermicro CDU更清晰的镜头。在这里,您可以看到连接设施供水/回水和机架歧管的输入和输出接口。您还可以看到每个CDU的热插拔冗余电源。

图 | Supermicro CDU 2023 背面 1

这是在Colossus机架中的CDU,被各种管道和线缆遮挡。

图 | xAI Colossus数据中心Supermicro CDU背面

在Colossus机架的两侧,我们能看到三相PDU以及机架歧管。每个为4U通用GPU系统供液的前置1U歧管,又由连接CDU的机架歧管供液。所有这些组件都用红色和蓝色的接头进行了标记。幸运的是,这是一个熟悉的颜色编码方案:红色代表回路中的温热部分,蓝色代表较冷部分。

图 | xAI Colossus数据中心Supermicro机架歧管软管

您很可能从这些照片中注意到,这里仍然有风扇。在许多液冷服务器中,风扇用于冷却DIMM、电源、低功耗基板管理控制器、网卡等组件。在Colossus,每个机架需要与数据中心大厅实现热中和,以避免安装庞大的空气处理器。服务器中的风扇从机架前部吸入较冷的空气,并将空气从服务器后部排出。然后,空气通过后门热交换器被抽出。

图 | xAI数据中心参观:后门热交换器

虽然后门热交换器听起来可能很高端,但它们非常类似于汽车中的散热器。它们从机架吸入排出的空气,使其通过一个带翅片的热交换器/散热器。该热交换器中有液体流过,就像服务器一样,热量随后可以交换到设施水回路中。空气通过设备背面的风扇被吸入。与大多数汽车散热器不同,这些设备有一个非常巧妙的功能。在正常运行时,它们会发出蓝光。它们也可以显示其他颜色,例如红色表示出现问题需要维护。当我在建设现场参观时,虽然我没有去开启其中几个机架,但看着这些热交换器在机架上电时依次呈现出不同的颜色,还是非常新奇的。

图 | xAI数据中心参观:后门热交换器

这些后门热交换器在数据大厅中还起到了另一个重要的设计作用。它们不仅能移除Supermicro液冷GPU服务器产生的杂散热量,还能移除来自存储、CPU计算集群以及网络组件的热量。

基于Supermicro的xAI存储系统

存储系统非常有趣。在AI集群中,通常能看到大型存储阵列。在这里,我们看到来自不同供应商的存储软件在运行,但我们看到的几乎所有存储服务器也都是Supermicro的。这并不令人意外。Supermicro是许多存储设备厂商的代工厂。

图 | xAI Colossus数据中心Supermicro 1U NVMe存储节点

一个非常巧妙的细节是,一些存储服务器看起来与CPU计算服务器非常相似。

图 | xAI Colossus数据中心Supermicro 1U NVMe存储节点 2

无论哪种情况,都会在照片和视频中看到大量的2.5英寸NVMe存储槽位。在Substack上曾报道过,大型AI集群正逐渐从基于磁盘的存储转向闪存,因为闪存可以显著节省电力,同时提供更高的性能和密度。闪存每PB的成本可能更高,但在此规模的集群中,基于总体拥有成本,闪存往往胜出。

图 | 基于Supermicro的xAI CPU计算集群

在这些集群中,通常也会有一定数量的传统CPU计算节点。处理和数据处理任务在CPU上运行得仍然非常好,而不是GPU。您可能也希望让GPU专注于运行AI训练或推理工作负载,而不是处理其他任务。

图 | xAI Colossus数据中心CPU计算机架

在这里,我们看到一机架的1U服务器。每台服务器都旨在平衡计算密度和产生的热量。一个很好的例子是,我们可以在正面看到用于NVMe存储槽位的橙色卡扣,但大约三分之一的机箱前面板专门用于将冷空气吸入系统。

图 | xAI Colossus数据中心CPU计算机架 2

这些1U计算服务器可以通过风扇进行冷却,然后后门热交换器可以移除热量并将其交换到设施水回路中。由于采用后门热交换器的数据中心设计,xAI可以同时处理液冷设备和风冷设备。

xAI Colossus的网络系统

网络系统是其中一个引人入胜的部分。如果您的计算机使用以太网线缆,那么其基础技术与这里的网络相同。只不过,这里是400GbE,即每个光连接的速度是常见的1GbE网络的400倍。每个系统还有九条这样的链路,这意味着每台GPU计算服务器拥有约3.6 Tbps的带宽。

图 | xAI Colossus数据中心网卡

GPU的RDMA网络占据了大部分带宽。每个GPU都有自己的网卡。这里,xAI使用的是NVIDIA BlueField-3超级网卡和Spectrum-X网络。NVIDIA在其网络堆栈中拥有一些“独门秘籍”,有助于确保数据在集群中绕过瓶颈,正确地到达目的地。

图 | xAI Colossus数据中心交换机光纤 1

这非常重要。许多超级计算机网络使用InfiniBand或其他技术,但这里使用的是以太网。以太网意味着它具有可扩展性。以太网是互联网的骨干。因此,这是一项具有巨大扩展性的技术。这些庞大的AI集群正在扩展到一些更奇特的技术从未触及的规模。这是xAI团队一个非常大胆的举动。

除了GPU RDMA网络,CPU也获得一个400GbE连接,该连接使用完全不同的交换网络。xAI为其GPU运行一个网络,为集群的其余部分运行另一个网络,这是高性能计算集群中非常常见的设计。

图 | xAI Colossus数据中心单模和多模光纤

为了让您对400GbE的速度有所感受,它的连接能力超过了2021年初顶级Intel Xeon服务器处理器所有PCIe通道加起来的处理能力。而这里每台服务器要使用九次这种级别的网络连接。

图 | xAI Colossus数据中心交换机堆叠

所有这些网络意味着我们拥有海量的光纤布线。每条光纤都被切割并端接到正确的长度,并做好标记。

图 | xAI Colossus数据中心光纤布线

结构化布线总是看起来非常棒。

图 | xAI Colossus数据中心架空线缆

除了高速集群网络,还有用于各种管理接口和环境设备的中低速网络,这些都是此类集群的组成部分。

对液冷网络交换机的需求

这个设施,有一点非常明显,那就是迫切需要液冷网络交换机。最近评测了一款64端口800GbE交换机,与许多AI集群中使用的属于同一51.2T级别。业界需要解决的一个问题是,不仅要冷却交换芯片,还要冷却光模块,在现代交换机中,光模块的功耗可能远超交换芯片。也许像这样的大型安装会推动业界转向共封装光学,以便交换机的冷却能跟随计算单元走向液冷。之前见过液冷共封装光学交换机的演示,希望这次安装的实例能帮助这些技术从原型走向量产。

Colossus设施

拥有液冷机架的AI服务器,电力和设施用水对安装至关重要。下面是大型水管的照片。有冷却水和温水两个回路。冷却水被引入设施,在每个机架的CDU中循环。热量在CDU处从GPU和后门热交换器回路传递到设施水回路。升温后的水随后被输送到设施外的冷却器。当然,这些冷却器不是制冰的那种。相反,其目标只是将水温降低到足够冷却,以便再次循环回设施中使用。

图 | xAI Colossus数据中心设施水管

在设施外部,装有特斯拉Megapack储能系统的集装箱。这是建设这个巨型集群的团队学到的一个非常精妙的经验。AI服务器并非7x24小时以100%的额定功耗运行。相反,它们的功耗有很多峰值和谷值。由于现场有如此多的GPU,功耗会随着工作负载分配给GPU、然后结果汇总、新任务被分发而波动。团队发现,毫秒级的电涌和跌落压力很大,因此在中间部署特斯拉Megapack来缓冲这些电力尖峰,有助于提高整个安装的可靠性。

当然,这个设施才刚刚起步。虽然在我们参观时,由四个25,000 GPU数据大厅组成的初始集群已上线运行,拥有约100,000块GPU,但集群的扩展工作正在快速推进。

这似乎只是一个真正令人惊叹的项目的开端。

结语

这个项目之所以能够建成,靠的是一大批专家怀揣着以前所未有的速度建造巨型AI集群的愿景,齐心协力共同建设。

ServeTheHome,本文仅供行业交流学习之用。

大家都在看