AI怪盗图9月27日消息,马斯克旗下AI公司xAI正推进位于孟菲斯的Colossus数据中心项目。该项目于2024年开工建设,一期工程Colossus 1已投入运营,主要采用英伟达Hopper GPU;二期工程Colossus 2同样落地孟菲斯,并将主要采用英伟达Blackwell GB300 GPU。
马斯克表示,Colossus 2计划在2026年底前上线66万块英伟达Blackwell GPU,整体部署规模超过50万块AI GPU。这一规模远超当前任何已知的数据中心项目,反映出xAI在算力竞赛中的激进策略。实际上,全球范围内能够稳定获取如此大量高端GPU的企业屈指可数,英伟达自身的产能分配也成为关键制约因素。
由于GPU是人工智能建设中最稀缺的资源之一,Colossus 2被视为全球最大数据中心之一。xAI借鉴特斯拉的做法,将Colossus称为其计算领域的“超级工厂”。从行业视角看,这种“超级工厂”模式不仅考验硬件采购能力,更对电力供应、散热效率和数据中心基础设施建设提出极高要求——孟菲斯当地电力网络能否支撑数十万块GPU的持续运行,仍是外界关注的焦点。
在Colossus 1方面,该数据中心最初依赖20万块英伟达H100 GPU。马斯克后来透露,其GPU总数已达到23万块,因为Colossus 1还使用了3万块英伟达GB200 AI GPU。值得注意的是,H100与GB200属于不同代际产品,混合部署虽能提升算力利用率,但也意味着运维复杂度的增加。
对于Colossus 2,马斯克称其当前运行着11万块GB200 GPU和44万块GB300 GPU。他还给出了分阶段上线计划:本周末将再上线22万块GB300,11月底再增加22万块,最后一批22万块预计在2026年12月底前上线。这种分批部署策略有利于降低一次性投资风险和供应链压力,但也对工程团队的协调能力提出了挑战。
GB300是GB200的升级版,二者均采用Grace CPU,但GB300使用的是更新的Blackwell Ultra GPU。据业界分析,Blackwell Ultra在张量核心数和内存带宽上均有显著提升,尤其适合大模型训练场景。然而,新一代GPU的功耗同步攀升,单块GB300的峰值功耗可能超过1000瓦,这意味着Colossus 2整体电力需求或达数百万千瓦级别。
马斯克的最新表态,是其围绕xAI算力扩张的一系列评论之一。他声称,xAI应能达到Anthropic的模型和OpenAI的GPT-6模型水平,并认为这些目标有望在未来两到三个月内实现。他同时强调,“快速实现大规模在线计算极其困难”。从技术路径看,xAI起步较晚但算力投入极为集中,这种“以量补时”的策略是否有效,取决于其模型架构优化和训练效率能否同步跟进。
马斯克还表示,xAI的人工智能研发项目仅有3年历史,而Anthropic和OpenAI分别已有6年和10年历史。如果xAI的“二阶导数”保持强劲势头,xAI将在约6个月内占据领先地位。所谓“二阶导数”指算力增长速度的加速度——但仅靠算力堆叠难以保证模型性能的全面超越,算法创新、数据质量和人才储备同样是决定性因素。综合来看,Colossus 2的建成将加剧AI算力军备竞赛,但最终成果仍需在实际应用中验证。
