拥有GPU只是开始,如何组织和利用GPU,决定AI基础设施价值。

作者丨魏溶

编辑丨包永刚

近日,英伟达发布Spectrum-6以太网交换机,为下一代Vera Rubin平台以及十亿瓦级AI工厂提供连接GPU集群的数据中心网络支持。一次网络设备更新,释放出一个重要信号:随着AI集群规模扩大,AI基础设施竞争正在从算力供给,转向如何让庞大算力集群高效协同。

过去几年,行业争夺的核心是GPU。谁拥有更多先进GPU,谁就拥有更强的AI计算能力。但当训练和推理任务进入万卡甚至更大规模集群,新的问题开始出现:如何连接、管理并调度这些分散的计算资源,决定了昂贵算力能否真正转化为有效产能。

随着大模型训练规模扩大,以及推理需求增长,AI基础设施正在从单机、单服务器扩展为更大规模的计算系统。在这一过程中,算力规模不再是唯一指标。如何降低通信损耗、提高GPU利用率、优化资源调度,成为AI Infra下一阶段需要解决的问题。

01

从“堆算力”到“算效率”

这背后首先是AI计算方式的变化。单张GPU可以独立完成计算,但当一个任务需要由成千上万张GPU共同完成时,GPU之间就需要不断交换数据。集群规模越大,需要参与协同的节点越多,通信、等待和资源分配带来的损耗也随之增加。

换句话说,买下一万张GPU,并不意味着能够获得一万张GPU等比例叠加的计算能力。部分GPU等待数据、任务分配不均、资源碎片化,都可能让昂贵的算力处于闲置状态。此时,决定一个AI集群能力的,已经不只是“有多少卡”,还包括这些卡究竟能不能被有效组织起来。

一位AI Infra调度层的从业人士向雷峰网表示,堆算力并非长久之计,企业短期内买十台GPU的预算或许可以承受,但如果算力不够,就要再买二十台,对企业的采购会带来较大挑战。

他向雷峰网表示,真正的解法应该是系统工程优化,让GPU的利用率从20%-30%提升到70%以上。

这也是AI Infra开始出现新价值环节的原因。此前GPU供给紧张,产业链最直接的竞争围绕芯片展开;而当越来越多GPU进入数据中心,网络互联、资源调度、虚拟化等过去更偏后台的能力,开始直接影响算力的实际产出。

Spectrum-6所代表的正是其中一个方向。随着AI工厂走向更大规模,英伟达不仅要提升单颗GPU的性能,也需要解决GPU之间如何高速交换数据的问题。按照英伟达的产品规划,Spectrum-6将与Vera Rubin平台共同服务于下一代大规模AI工厂,其关注点已经从单个计算单元延伸到整个集群如何协同。

这种变化并不意味着GPU的重要性下降。相反,正因为GPU越来越昂贵、部署规模越来越大,每一点通信和调度损耗都会被进一步放大。过去,一块GPU没有被充分使用,影响的可能只是单台服务器;当集群扩大至数千、数万张GPU后,局部的等待与空转也会被系统规模放大。

因此,AI Infra的效率账开始变得越来越具体:GPU计算得再快,如果数据无法及时送到下一张GPU,昂贵的芯片仍然需要等待;如果任务无法被合理分配,新增算力也未必能转化为等比例的有效产出。

单卡性能仍然重要,但网络、互联、调度以及软件之间能否形成高效协同,也开始决定一座AI工厂最终能够释放多少有效算力

02

竞争单位变成了“系统”

这种变化已经开始在具体的产品和基础设施形态上显现。

过去,数据中心扩容最直观的方式是增加服务器和GPU数量;如今,随着集群规模不断扩大,厂商开始把竞争的重点进一步推向系统性设计。

Spectrum-6并不是一个孤立的信号。6月,Arista发布面向AI基础设施的新一代1.6T网络平台7060XE7,直接将产品定位于从数千颗扩展至数十万颗XPU的AI集群,并称网络正从独立层转向高度集成AI系统的“关键背板”。

7月,DriveNets则把这种“组系统”的范围进一步扩大。其宣布将两个相距52英里的H200 GPU集群连接为一个逻辑上的GPU超级集群,以突破单个数据中心受到的电力和空间限制。随后,DriveNets又与AMD发布基于MI350 GPU的AI基础设施参考架构,将GPU、网络和自动化编排放进同一套系统设计中。

这些动作虽然来自不同厂商,却指向同一个变化:AI Infra正在从采购单个计算部件,转向考虑整套计算系统如何协同

超节点也是这种变化下的一种体现。简单来说,传统集群更像把大量独立服务器连接起来,而超节点希望通过更高速、更紧密的互联,把更多GPU、CPU和内存组织成一个更大的计算单元,让原本分散的硬件尽可能像一台机器一样工作。

英伟达GB200、GB300 NVL72以及后续Vera Rubin平台都体现了这种思路,AMD、华为等厂商也在强化系统级产品布局。超节点因此并不是某一家公司的独有概念,其背后更重要的变化是:AI基础设施的竞争单位,正在从单颗芯片向更完整的计算系统延伸。

比“超节点”这个概念本身更重要的是,AI基础设施的竞争单位正在向系统内容延伸。如果说,网络负责把算力链接起来,超节点让计算资源更紧密地协同,而调度和虚拟化进一步决定了这些资源如何被分配和使用。

有从业者分享,不管在金融、互联网还是云厂商等多个领域的使用者都面临着算力如何高效利用的问题。

GPU依然是算力的核心,但围绕GPU如何被连接、组织和使用的能力,正在成为新的竞争变量。

它们并不是同一种技术,却在回答同一个问题:当AI基础设施拥有越来越多昂贵的计算资源后,如何把这些资源真正组织成持续输出的有效算力。

03

谁能从“效率”里赚钱

当AI基础设施从芯片竞争走向系统竞争,这种变化已经开始反映在产业链的收入中。

网络是最先受益的环节之一。Broadcom最新披露的第二季度财报显示,其AI半导体收入达到108亿美元,同比增长143%,公司将增长归因于定制AI加速器和AI网络需求。在当季财报电话会上,Broadcom进一步披露,网络业务已经贡献了接近四成的AI收入。

另一家网络厂商Arista也在最新季度延续增长。其第二季度收入约30.4亿美元,同比增长38%,公司同时给出了高于市场预期的下一季度指引,AI基础设施扩张仍是网络需求的重要推动力。

这些数字至少说明,AI算力投入带来的价值并没有停留在GPU本身。随着集群规模扩大,负责连接这些GPU的网络基础设施,也正在形成越来越明确的商业价值。

但系统效率的竞争并不会止于硬件。当越来越多不同型号、不同来源的GPU进入数据中心,另一个问题随之出现:这些已经连接起来的算力,究竟应该如何分配给不同任务,又如何减少闲置和资源碎片?

这种价值已经开始转化为实际付费。一位算力调度领域从业者提到,某头部用户此前已经在内部使用开源调度方案,但随着部署规模扩大,最终仍选择向原团队购买商业版本,以解决稳定性、性能优化和大规模资源管理等问题。

在小规模部署中,开源工具或许已经能够解决“能不能用”的问题;但当GPU集群规模扩大、算力成本持续上升后,企业开始愿意为“能不能稳定、高效地用”付费。调度层的价值,也由此从工具能力逐渐转化为可以被单独采购的基础设施服务

网络解决的是算力如何连接,超节点试图让更多芯片像一个计算单元一样协同,而调度和虚拟化解决的则是算力最终如何被使用。

它们处在不同技术层,却共同说明一个变化:AI基础设施的价值正在从“拥有多少计算资源”,进一步扩展到“如何让这些计算资源持续、高效地产生产出”。

Spectrum-6的意义并不是AI Infra进入新阶段的唯一证据,却提供了一个清晰的切口:当下一代AI工厂迈向更大的规模,竞争的标准已经很难再由一张GPU决定。

从买更多GPU,到把更多GPU组织成一个高效系统,AI基础设施开始进入一场更复杂、也更考验系统能力的竞争。