英伟达GPU的销售上限最终取决于电网的电力容量。随着数据中心折旧周期延长,老旧的Hopper或Blackwell系统在数年内不会被淘汰,而更多的GPU意味着更高的电力需求。虽然英伟达无法迫使电网运营商加速扩容,但它正致力于帮助客户构建更智能、高效的数据中心,以榨取每一分效率。

在本周举行的AI基础设施峰会上,英伟达首次展示了其DSX平台。该系统旨在最大化可用计算功率,同时最小化数据中心对当地电网的影响。英伟达高性能计算及AI超大规模基础设施解决方案高级总监Dion Harris表示,团队正在思考如何在每吉瓦电力驱动下实现更高性能。

DSX MaxLPS:消除闲置电力

传统数据中心的运行负荷很少达到峰值。一个100兆瓦的数据中心通常仅将80%的电力用于关键计算,剩余20%作为缓冲以应对硬件低效、转换损耗或需求激增。这部分未利用容量既无法被数据中心使用,也无法被公用事业公司回收。DSX MaxLPS旨在解决这一浪费问题。

MaxLPS是旧概念的演进:若计算设备能与配电柜、电池、冷却液分配单元(CDU)和冷水机组等物理基础设施相互通信,操作员即可实现显著节能。例如,空气处理单元可根据机柜实时功耗调节运行状态,而非持续满负荷运转。

挑战在于让来自不同供应商的系统使用统一语言对话。英伟达通过DSX Exchange API解决了这一通信层难题,该接口可从Vertiv、施耐德电气等“DSX Ready”合作伙伴及楼宇管理系统中捕获信息。随着AI系统部署扩大,更高效的数据中心能产生更多Token并转化为收入,这促使行业更容易达成共识。

在峰会演示中,英伟达与Lambda展示了该技术的效果。在相同功率预算下,Lambda成功将节点数量从16个增加至19个,使集群整体吞吐量和每瓦性能均提升了24%。英伟达称,得益于对整个数据中心更高的可见性和控制权,客户无需再像以往那样过度预留容量。

DSX Flex:削峰填谷换取电网容量

除了提升内部效率,英伟达还展示了DSX Flex平台如何降低大型AI部署对电网的冲击。通过与Emerald AI和硅谷电力合作,英伟达演示了在电网需求激增时释放数据中心电力,同时不中断关键工作负载的能力。

需求响应技术已存在多年,谷歌等公司曾通过暂停非关键AI工作负载来避免电网过载。英伟达的DSX Flex将此功能普及至所有部署其硬件的用户。更重要的是,这项技术可能成为说服公用事业公司批准额外电网容量的筹码。

Harris指出,当电网提供商知晓用户有能力在特定窗口期内削减负荷时,他们在分配容量时会减少保守预留。收回容量并不意味着关闭关键工作负载:通过与英伟达软件栈的深度集成,非关键负载可被暂停或迁移至拥有过剩容量的邻近数据中心,即“追逐阳光”策略。

另一座“围墙花园”

尽管DSX在使用验证硬件的AI工厂中表现优异,但其对第三方加速器的支持较为复杂。对于d-Matrix等NVLink Fusion生态合作伙伴,英伟达计划扩展DSX支持,但这需要额外的软件集成,且并非所有芯片都能提供同等细粒度的控制级别。至于AMD Instinct GPU等竞争平台,数据中心建设者可能需要寻找替代的管理系统。

综上,英伟达DSX不仅在挖掘有限电网容量的潜力,更构建了另一座“围墙花园”,确保持续锁定客户对其设备的采购需求。