英伟达Vera Rubin加速部署,AI算力进入能效竞争
AI基础设施竞争正在进入一个新阶段。过去几年,科技巨头争夺的是GPU数量和数据中心规模,而现在,如何用更少的电力支撑更大规模的模型训练和推理,正在成为新的战场。
7月21日,英伟达宣布,面向“千兆级AI工厂”的下一代平台Vera Rubin正在全球扩大部署。包括CoreWeave、谷歌云、微软Azure以及甲骨文云在内的云计算服务商,已经开始采用Vera Rubin NVL72系统。
这意味着AI算力基础设施正在从单纯堆叠芯片,转向整套系统效率优化。
英伟达给出的数据颇具冲击力。根据CoreWeave测试结果,Vera Rubin NVL72相比上一代Grace Blackwell NVL72,在每兆瓦电力消耗下,可以实现10倍Token吞吐提升。简单来说,在同样的能源条件下,新平台能够处理更多AI任务,这对于当前被电力成本限制的数据中心行业来说,吸引力非常明显。
AI模型越来越大,带来的问题也越来越现实。
过去,大模型竞争主要围绕参数规模展开。但随着GPT级别模型、企业级智能代理以及实时AI推理服务快速增长,算力需求已经从实验室训练阶段延伸到商业化运行阶段。大量企业需要的不只是训练一个模型,而是每天持续运行数百万次甚至更多推理请求。
这让数据中心开始面临类似工业生产的问题:单位能源产出的效率,决定长期竞争力。
Vera Rubin平台并不是简单升级一款GPU,而是一套完整计算架构。该系统整合了Vera CPU、Rubin GPU、NVLink 6高速互联技术、ConnectX-9 SuperNIC网络组件、BlueField-4 DPU以及Spectrum-6交换系统,试图从计算、通信、数据传输多个环节减少损耗。
这也是英伟达近年来不断强化系统级方案的原因。
过去,英伟达主要依靠GPU芯片占据AI基础设施核心位置。但随着AI数据中心规模扩大,单颗芯片性能提升已经无法完全解决问题。服务器之间的数据交换、网络延迟、电力管理和散热效率,都会影响最终AI服务成本。
因此,英伟达正在从“卖GPU”转向“打造AI工厂操作体系”。
这种变化也符合云厂商的需求。微软Azure、谷歌云和甲骨文云等企业,需要向客户提供稳定的大规模AI计算能力。如果基础设施成本持续上升,AI服务价格和利润空间都会受到影响。更高效的平台,可以帮助云厂商降低运营压力,同时提高单位机房面积的产出。
目前,英伟达表示,Vera Rubin已经覆盖全球350多个AI工厂节点,涉及30个国家。其目标并不只是提升算力,而是降低AI基础设施建设成本,提高能源利用效率。
不过,AI算力升级背后仍然存在新的挑战。先进芯片需要先进封装、存储、网络设备以及稳定电力供应,整个产业链都需要同步扩张。尤其是在美国等市场,数据中心电力供应已经成为限制AI发展的关键因素之一。
从GPU到整套AI工厂,英伟达正在重新定义人工智能基础设施的竞争方式。未来几年,AI公司的差距可能不只是模型能力的差距,也会体现在谁能更高效地管理算力、电力和数据流动。
Vera Rubin的推出,本质上是AI产业从“抢算力”走向“算效率”的一个信号。芯片性能依然重要,但如何让每一瓦电产生更多智能,正在成为下一轮竞争的核心。