三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

吞吐量狂飙10倍!英伟达Vera Rubin开始批量“进厂”,谷歌微软甲骨文都用上了

时间:2026-08-08人气: 作者: 佚名

芯东西于8月7日进行报道, 在7月21日的时候, 英伟达公布了Vera Rubin AI基础设施平台的最新进展情况, 并且这家公司的Vera Rubin NVL72正展开全面加速量产行动, 当下已经有机架被部署在合作伙伴的数据中心, 这些合作伙伴有谷歌云、微软智能云以及甲骨文云基础设施等。

在同一时间的另外情况之中, 那些提供AI云服务的商家, 已经于芬兰的AI工厂, 收到了首套名为Vera Rubin NVL72的系统。并且他们做出了计划, 打算去进一步扩大在全球范围内部署的规模。这个平台在配套部署方面呢, 有着-6 102.4T以太网交换机, 其用途是用来达成Vera Rubin NVL72整机柜, 与外围的大规模AI算力集群之间的高速互联组网的。

经过三代, 针对机架级所为的协同设计, 完成了迭代, Vera Rubin NVL72系统达成了, 于托盘之内, 不存在电缆, 不存在风扇, 不存在液冷软管的, 极为简约的设计, 把计算托盘的组装时间, 从以往的数小时, 大幅度缩短到, 仅仅需要1分钟。

这一系统运用45℃高温液冷进水设计方法, 能够节省传统冷水机组, 仅凭借干式冷却器就可以达成整机散热目的。对于新建的AI算力工厂来讲, 采用这种高温干式冷却与闭环液冷相结合起来的方案, 每兆瓦算力每年能够节约数百万加仑的用水量(1美制加仑大约为3.785升)。

微软、特斯拉等企业, 正在部署 -6 交换机, 目的是加快自家 AI 算力工厂的建设, 另外, 英伟达向第三方 XPU 开放了基础设施平台, 这使得合作伙伴能够基于扩展技术和生态系统, 开发自己的计算方案。

维拉·鲁宾平台从芯片开始着手, 一路到电网都开展了全栈协同设计, 其目的是尽力提供最高程度的每瓦性能, 以及最低的代币成本。英伟达表明, 这个平台覆盖了全球三十个国家, 还有超过三百五十个工厂节点, 已然构建起当前规模最为庞大的机架级人工智能基础设施供应链体系。

一、Vera CPU, 其单线程性能实现了提升, 提升幅度为1.6倍, 并且, 其内存延迟有所降低, 降低比例为40%。

Vera Rubin平台有着七款芯片, 其中包括Vera CPU, 包括Rubin GPU, 含有6这一元素, 还有‑9, 还有‑4 DPU, 还有‑6, 并且包含首次纳入该平台体系的Groq 3 LP, Vera Rubin平台围绕这些展开关于五种机架系统的协同设计, 这五种机架系统是Vera Rubin NVL72, 是Vera CPU机架, 是Groq 3 LPX, 是-6 SPX, 是Vera -4 STX。

吞吐量狂飙10倍!英伟达Vera Rubin开始批量“进厂”,谷歌微软甲骨文都用上了(图1)

当中, Vera CPU属于该平台的关键构成部分, 此CPU是针对AI Agent工作之负载来进行设计的, 运用定制核心, 相较于竞品芯粒()方案而言, 单线程性能能够提升两倍, 核间带宽提升三倍, 内存延迟降低百分之四十。

吞吐量狂飙10倍!英伟达Vera Rubin开始批量“进厂”,谷歌微软甲骨文都用上了(图2)

与此同时, 美国的AI推理云厂商, 借助其生产级AI智能体基础设施, 针对Vera CPU执行了基准测试, 其算力平台每周处理约莫5万亿Token, 当中大概30%源自AI Agent系统。

测试结果表明, 在维持相同服务质量的情形下, Vera CPU所支持的并发AI智能体数量, 相较于其他CPU, 其提升幅度高达1.6倍, 且编排速度快出2.2倍, 与此同时, 还能够提升基础设施的利用率以及成本效益。

今年7月21日, 在商业化落地这块儿, 微软与法国AI公司宣布扩大合作, 要大规模配上英伟达新一代Vera Rubin GPU, 配置数量达数千块, 以此扩充算力池。然后搭建一个用于支撑模型训练的、能进行推理的、可大规模商用部署的共享算力底座, 与此同时承接微软不断增长的云AI业务需求。

在网络的那一侧, Vera Rubin平台引进了第六代纵向扩展的技术, 在复杂的工作负载的情形之下, 这项技术和通用以太网相比较, 吞吐量提高超过两倍。延迟下降大约三分之一, 数据包处理速度提高10倍。

面对跨数据中心情景, -XGS以太网方案于跨站点时, 吞吐量实现了提升, 提升幅度达1.9倍, 并且进一步使得多站点通信能力得到了提升。

有关横向扩展, -X以太网平台集成好多组件, 其中有102.4T容量的-6交换机, 再有1.6T的那个-9 , 还有自适应路由、拥塞控制 和遥测技术等, 这些组件呢使得它的RDMA带宽比通用以太网高出1.6倍这多, 进而能提供更高规模数量的AI集群互联能力。

搭载英伟达共封装光学, 也就是 CPO 技术的该交换机实现了集群横向扩容, 并且它还是全球首款达成规模化量产的 CPO 架构交换机, 同老式的插拔式光模块交换机作比较, 其电源能效有了 5 倍的提升, 而且平均无故障工作时长提高了 10 倍。

、、甲骨文云基础设施均是该CPO交换机技术的早期客户。

二、Vera Rubin NVL72, 其每兆瓦吞吐量实现了提升, 提升幅度达到了10倍, 并且, 推理成本能够降低, 降低至原来的1/10。

是首批达成Vera Rubin NVL72布置以及验证的人工智能云服务提供商。

在硬件这一层面, 将英伟达102.4 Tb/s ‑6交换芯片用作核心组网器件, 整机柜交换机运用液冷散热的方案达成高密度硬件堆叠, 最终单台交换机整机柜总的带宽达到1.64 Pb/s, 和前代风冷架构的交换机机柜相比, 整体网络吞吐容量实现了翻倍。

吞吐量狂飙10倍!英伟达Vera Rubin开始批量“进厂”,谷歌微软甲骨文都用上了(图3)

在网络架构这一层面, 采用的是那种无阻塞性、具备多平面、有着多轨道的叶脊(Spine and Leaf)组网这一方案, 此架构它能够做到消除集群内部通信方面所存在的瓶颈, 以此来保障在基于Vera Rubin NVL72搭建起来的超大规模GPU算力系统当中, 所有GPU节点相互之间能够达成无阻塞的高速互连通信。

首次放出该公司Vera Rubin NVL72上机实测的性能报告, 实测显示, 在部署-R1时, 对比上代Grace NVL72, Vera Rubin NVL72每秒AI Token吞吐量在每消耗1兆瓦电力提升了相应数值乘以整十数。 \。

-R1运用混合专家即MoE架构, 于大规模开展部署之际, GPU相互间的All-to-All通信变成对效率造成影响的关键要素。Vera Rubin NVL72借由260 TB/s的6互连架构, 提高GPU相互之间的数据交换效率, 致使整个机架能够当作统一计算单元来运行。

在其他情况之外, Vera Rubin NVL72被运用到谷歌云所推出的新一代A5X裸金属实例当中。伦敦有一家AI初创公司参与其中, 成为了首批采用该实例的用户成员之一。这家公司正在开展一项基于强化学习的“”系统的研制开发工作。

不同于那些依赖静态数据集来进行训练的大语言模型, 有一种系统, 它会通过与环境持续不断地交互从而生成经验, 并且还会进行策略更新。而像这样的工作负载, 是需要具备高算力、低延迟以及高带宽互连的。

谷歌云A5X实例是基于Vera Rubin NVL72机架级系统构建而成的, 跟上一代系统相比较而言, 此实例每Token推理成本下降为原来的十分之一, 与此同时, 每兆瓦Token吞吐量提高了10倍。

吞吐量狂飙10倍!英伟达Vera Rubin开始批量“进厂”,谷歌微软甲骨文都用上了(图4)

英伟达 -9 被 A5X 搭载, 谷歌新一代 Virgo 高速网络架构与之搭配, 在单数据中心内部, 数万颗 Rubin 系列 GPU 可进行扩容部署, 当做多地域组网时, 整体集群规模可逼近百万颗 GPU 级别。

结语:简化高密度算力交付,减少算力周期成本

同过去的AI算力方案相比, Vera Rubin平台借助全栈协同, 重新构建了AI算力集群的部署体系, 重新构建了其运行体系, 还重新构建了能耗体系。它有着极为简单的模块化机架设计, 这种设计压缩了算力设备的部署成本, 也压缩了其运维成本, 在一定程度上解决了传统状态下高密度算力集群装配繁杂琐碎、故障率偏高的痛点问题。

与此同时, 依靠新一代高速互联网络, 凭借规模化CPO交换技术, 借助节能液冷方案, 该平台达成了算力吞吐量优化, 达成了能效的多重优化, 达成了成本上的多重优化, 精确适配大模型MoE架构的落地需求, 精密适配AI Agent的实现需求, 精准适配强化学习的落地要求, 也为当下规模化的AI应用给予了更具成熟度的底层支撑, 也为当前商业化的AI应用提供了更为成熟的底层支持。