马斯克押注超大规模AI算力 xAI计划部署逾120万颗英伟达GPU

📅 2026-09-25

摘要:

埃隆·马斯克旗下人工智能公司xAI正在进一步扩大数据中心规模,并计划在未来几年部署超过120万颗英伟达AI GPU。随着Colossus数据中心持续扩建,xAI希望通过大规模算力基础设施训练和运行下一代Grok模型,与OpenAI等竞争对手展开更加激烈的AI基础设施竞争。

xAI目前最大的AI基础设施项目是位于美国田纳西州孟菲斯的Colossus数据中心。该项目从2024年开始建设,第一阶段Colossus 1已经投入运行。马斯克此前曾将Colossus称为xAI的“算力超级工厂”,其核心目标就是以尽可能快的速度集中部署大量GPU。

Colossus最初主要采用英伟达H100 GPU。第一阶段此前公布的规模约为20万颗H100,而随着后续扩建,数据中心已经开始加入更加先进的Blackwell系列GPU。最新信息显示,Colossus 1除了原有的H100之外,还部署了约3万颗英伟达GB200,因此目前整个Colossus 1的GPU数量已经达到约23万颗。

xAI的第二阶段Colossus 2规模则更加庞大。该项目同样位于孟菲斯,并计划部署超过50万颗英伟达GPU。按照目前的规划,Colossus 2将成为全球规模最大的AI数据中心项目之一,其计算能力将远远超过传统超级计算机。

如果把Colossus 1和Colossus 2以及后续建设项目全部计算在内,xAI未来计划使用的英伟达GPU数量将达到约120万颗甚至更多。这一数字并不是指这些GPU已经全部安装完毕,而是对应xAI未来数据中心扩张计划的整体规模。

xAI如此激进地扩充GPU数量,与AI模型训练对算力的需求快速增长直接相关。大型语言模型的参数规模、训练数据以及强化学习过程都需要越来越多的计算资源,而模型训练和推理所需要的计算能力正在从传统数据中心规模向超级计算集群规模发展。

在这种情况下,拥有大量GPU已经成为AI公司扩大模型能力的重要基础。马斯克此前多次强调,xAI需要尽可能快速地扩大计算能力,并通过建设自己的超级计算集群减少对第三方云计算平台的依赖。

Colossus的建设速度也是xAI基础设施战略的一大特点。第一阶段数据中心是在一座废弃的工业设施基础上改造而来,而xAI通过大量预制设备、并行施工以及快速部署GPU的方式,在很短时间内将其扩展为拥有数十万颗GPU的大型AI训练设施。

xAI还在不断扩大Colossus的数据中心建筑和电力供应能力。由于现代AI GPU的功耗极高,数据中心规模扩大并不只是简单增加服务器数量,还必须同时建设大量电力、冷却、网络和存储基础设施。

此前xAI已经面临电力供应问题。Colossus 1的功耗达到数百兆瓦级别,而随着GPU数量进一步增加,其能源需求也将大幅上升。为了支持后续扩建,xAI一直在寻找新的电力来源,并建设相应的发电和配电基础设施。

随着英伟达Blackwell以及后续Rubin系列GPU逐步进入市场,xAI的数据中心也将继续进行硬件升级。与H100相比,新一代GPU能够提供更高的AI计算性能,但单颗GPU的功耗同样不断提高,因此未来大型AI数据中心必须同时解决计算密度和能源供应问题。

马斯克此前还表示,xAI计划在2027年前后大幅提升数据中心的整体电力容量,并将计算能力扩大到此前规模的数倍。相关规划显示,xAI未来数据中心总电力规模可能达到数吉瓦甚至10吉瓦级别。

如此庞大的基础设施意味着xAI正在尝试建立类似大型云计算公司的AI“超级工厂”。GPU服务器、网络设备、存储系统、电力设施和液冷系统将被组合成一个巨大的计算集群,用于训练和运行Grok等AI模型。

这一战略也使xAI与OpenAI之间的竞争越来越直接。OpenAI近年来同样在大规模建设AI数据中心,并与英伟达建立了大规模基础设施合作关系。英伟达已经宣布计划向OpenAI提供至少10GW的AI系统,对应数百万颗GPU,并计划随着基础设施部署逐步向OpenAI投资最高1000亿美元。

OpenAI的这一计划意味着AI行业正在进入以“吉瓦级数据中心”为基本竞争单位的新阶段。过去AI公司的竞争更多集中在模型算法、人才和数据,而现在计算基础设施本身已经成为决定模型训练速度和规模的重要因素。

xAI选择自行建设大规模Colossus数据中心,则可以让公司更加直接地控制GPU部署、网络结构、数据中心软件以及训练基础设施。对于需要不断进行大规模模型训练的公司而言,这种方式可以减少对外部云平台的依赖,同时允许工程团队针对自己的模型进行硬件和软件优化。

不过,120万颗GPU的规模仍然是一个未来目标,而不是xAI当前已经部署完成的数量。数据中心建设速度、GPU供应、电力供应、冷却设施、网络设备以及资金投入都会影响最终部署速度。因此,最终实际运行的GPU数量以及完成时间仍可能发生变化。

无论最终数字能否达到目前规划的规模,xAI正在建设的Colossus已经显示出AI基础设施竞争正在进入一个新的阶段。随着OpenAI、Google、Meta、微软以及其他AI公司纷纷建设吉瓦级数据中心,未来AI模型之间的竞争很大程度上也将演变成数据中心规模、电力供应和先进GPU获取能力之间的竞争。

关联标签

相似文章

评论

0/500
验证码(点击图片刷新)
暂无评论