英伟达(NVDA)7月21日宣布,面向“千兆级AI工厂”的Vera Rubin平台正在全球扩大部署,CoreWeave(CRWV)、谷歌云、微软(MSFT)Azure和甲骨文(ORCL)云等已开始采用Vera Rubin NVL72系统。英伟达(NVDA)称,CoreWeave(CRWV)测试显示,Vera Rubin NVL72相比Grace Blackwell NVL72,每兆瓦可实现10倍Token吞吐提升。该平台整合Vera CPU、Rubin GPU、NVLink6、ConnectX-9SuperNIC、BlueField-4DPU及Spectrum-6交换系统,旨在提升AI训练和推理效率。英伟达(NVDA)表示,Vera Rubin已覆盖全球350多个工厂节点、30个国家,目标是降低AI基础设施成本并提高能源(850101)利用效率。
DeepInfra的基准测试结果显示,NVIDIA Vera CPU的速度是其他CPU的两倍多,并且能够支持更多并发的AI代理。云平台DeepInfra是NVIDIA开放AI生态系统的早期体验参与者,独立设计并运行了基于其生产型AI代理基础设施的基准测试。DeepInfra每周处理近五万亿个代币,其中约30%由代理系统驱动。其云平台专为高通(QCOM)量AI推理而建。基准测试显示,在相同服务质量下,支持最多1.6倍的并发AI代理,协同速度高达2.2倍,同时提升基础设施利用率和成本效益。这些结果表明,NVIDIA Vera CPU 能够实现生产代理人工智能(885728)所需的成本效益、低延迟和吞吐量。
随着AI代理承担更复杂的推理、规划、工具使用和数据流动,CPU性能在围绕每次模型调用的协调工作中变得越来越重要。作为英伟达(NVDA)对AI工厂极端联合设计策略的一部分,Vera CPU专为代理性工作负载设计。DeepInfra的基准测试强调了NVIDIA Vera CPU如何帮助云服务提供商提升基础设施利用率、提高成本效率,并在相同服务质量下支持更多并发的AI代理。
英伟达(NVDA)称,随着AI智能体(886099)承担更多推理、规划和工具调用任务,CPU在模型调用过程中的调度效率将成为AI基础设施性能的重要因素。(界面)
