三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

黄仁勋,给中国超节点带货

时间:2026-07-31人气: 作者: 佚名

2024年3月, 英伟达那位创始人黄仁勋, 于GTC上率先把「超节点」这个概念提了出来, 他在台上清楚地展示了英伟达的NVL72系列能怎样将36个Grace CPU和6组12个GPU也就是72个GPU, 装到一个液冷机柜当中, 并且呈现给大家看。

与传统的那种, “8卡属于一个服务器, 而一个服务器即为一个节点”的情况不一样, 所谓的“超节点”指的是, 借助高速互联技术, 把许多GPU、CPU, 将以往“多台服务器”的协作, 整合成为单个物理节点, 这也就是黄仁勋所讲的“一台超级计算机”了。

但是在那个时候, 穿着皮衣老黄振臂高呼所提及的「超节点」, 并没有很快就变成一个风口, 甚至NVL72系列, 还曾经因为「散热问题」, 出现了推迟交付的情况, 进而被不少媒体疑问是不是又在画饼。

可是随后, 那些巨头们, 凭借着「千卡、万卡乃至百万卡AI集群」这样的实际举措, 去回应了针对黄仁勋「超节点」的那种追捧。

后来有媒体进行报道, 马斯克为由其自己家建立的xAI寻找黄仁勋, 向其加价, 以获得插队下单的机会, 所要下单的是, 数量为1600台的GB200 NVL72服务器机柜, 甚至, 他还与甲骨文董事长拉里·埃里森一同攒局, 邀请黄仁勋去吃饭。

在时隔两年之后, 那对饭桌礼仪颇为精通的黄仁勋这才慢悠悠地进行辟谣说道啥呢: “的确是一起吃上那么一顿饭了, 而且整个气氛也算是蛮不错相当良好的, 然而呢他们打从始至终从来就没有去求购过GPU, 仅仅只要按照正常的规程去下单就完全可以成功搞定的。”。

黄仁勋言论所表达的内容的确是正确的, 鉴于当下诸多巨头所谋求的并非单纯的GPU, 而是装配有芯片的人工智能机柜。

到了今年7月份的时候, 英伟达那位身负硬件工程高级副总裁职务的Bell, 将一组数据对外做出了透露, 这组数据是经由跟十家制造伙伴展开合作之后得出的, 最终能够达成的结果是, 每天能够产出的Vera Rubin机柜数量, 最高可以达到1000个。

处于大洋彼岸之外的中国, 在与皮衣老黄提出所谓「超节点」正好相隔一年的这个时间点上, 华为快速地推出了属于自家的超节点 384, 涉及到由 14 个机柜连接起来的众多设备, 这些设备包含 384 张卡, 其中卡的数量是 NVL72类型卡数量的 5 倍还要多, 并且在占地面积方面, 达到了 NVL72类型相对占地面积的 16 倍了。

关键这种以量取胜的方式,还能弯道超车。

就据进行拆解来看, 仅仅单个的384集群, 当中BF16这方面的性能, 整体上是的的确确为NVL72的1.7倍, 而其总内存容量, 也是实实在在NVL72的3.6倍, 至于总内存带宽, 更是后者也就是NVL72的2.1倍。

黄仁勋,给中国超节点带货(图1)

图源:

华为所点起的这把“超节点火”, 在此之后的一年多时间当中, 让整部国产算力生态将其奉为圣杯, 仅仅在刚刚过去的WAIC之上, 便曾有20多家企业发售了超节点相关方案。

作为一门被逼出来的创新, 超节点确实存在。一方面呢, 摩尔定律趋向于极限, 这就把单颗芯片的性能上限给锁住了;另一方面, 大模型参数竞争始终没停, 还不断地把算力需求往上推高, 所以它成了兵家必须争夺的关键之地。

但超节点却是一块极具吸引力的蛋糕。如同从从事卖芯片转而卖机柜的黄仁勋再三表明的那样, 英伟达并非单纯售卖芯片, 它是致力于打造超级计算机、创办AI工厂的, 从芯片、互联、软件、存储以及工程部署等方面来看, 围绕「超节点」的上下游各个环节均存在获利空间。

1、被逼出来的创新

说超节点是一门被逼出来的创新,这点并不为过。

当杨植麟和月之暗面凭借有着近3万亿参数的Kimi K3将硅谷模型生态予以冲击颠覆之际, 极少人留意到, 与之对应的另一边,处于微信公众号平台上, 阿里云隐秘地宣称采纳了K3, 表明阿里云灵骏真武M890超节点在初始之日就使得Kimi K3适用了。

黄仁勋,给中国超节点带货(图2)

图源:阿里云

依据阿里云所讲的内容, Kimi K3被安置在了由64张平头哥真武M890构建而成的超节点之上。

为什么这么需要超节点?

Kimi后来在一份47页的技术报告里, 真切回应了一个重点, 那就是, 过去从学术界一直到业界, 始终在探讨大模型有没有达到饱和状态, 经过一番周折, Kimi凭借实际行动告知你, 不但没有消失, 并且在你进行部署之前、部署之后都是需要投入算力的。

Kimi为同行们归纳出大模的两条路, 第一条路是, 在部署之前投入算力, 于预训练阶段, 构建更大的参数规模、获取更多的数据量, 如此一来模型就更智能。

第二条路是, 部署之后持续投入算力, 于后训练阶段以及推理阶段, 进行推理优化、强化学习、Agent长程执行, 如此一来对算力需求便持续增长, 而更大量的算力投入, 模型的深度思考能力方才越强。

就是说, 虽说每家都在使出各种技术独到的方法、彼此表示敬意, 以此来提高模型效率, 可是前提是大家都认同, 模型参数规模的那种“军备竞赛”并未停下, 甚至是以每年10倍的速率在增长, 进入到十万亿级程度。

在这样的形势状况之下, 算力集群的整体规模便开始逐步朝着千卡级的方向迈进, 进而又朝着万卡级的水平发展了, 接着还向着十万卡的层级推进, 甚至于达到了马斯克以及黄仁勋正在竞争角逐的百万卡级别。

算力的需求规模不同,建集群的方式也不同。

传统算力集群的节点常常是一台带八张卡的服务器, 厂商们运用横向扩展即Scale Out的办法, 借助传统以太网去连接诸多AI服务器, 增添节点数量, 进而构建出包含千卡、万卡的集群。

但这种方式,模型厂商们很快发现性价比不高,因为有三堵墙:

第一堵墙是,通信。

大模型MoE架构得以普及, 在模型训练里, 存在专家并行(EP)以及张量并行(TP)等分布式并行策略, 其通信量颇为巨大, 对于带宽有着较大需求, 传统以太网根本就难以承受这一状况。

第二堵墙是,功耗。

随便你用豆包弄出一个PPT, 运用CodeX去跑一项自动化任务, 处在距离你数千公里远的地方, AI集群承受着非常大的压力。

英伟达芯片越强的情况下, 绝对功耗竟然在上升, 单颗GPU功耗由A100的400W、H100的700W, 到了某个时代, 单颗B200的功耗已然突破了1000W大关, GB200更是直接突破到2700W, 这种情况下传统风冷根本无法满足散热需求, 过去标准化的机柜也完全扛不住。

第三堵墙,是复杂度。

万级处理器带来故障常态化,放大了传统集群运维复杂度。

2024年, Meta在训练Llama 3时, 有了最为直接的体感, 在54天的预训练期间, 用于训练模型的16384个英伟达H100显卡集群, 总共出现了419次意外故障, 并且平均每三小时就会出现一次。

三堵墙下,被逼出来的超节点放大了另一个策略的先进性:

纵向扩展(Scale Up)。

一般来讲, 能够把往昔分散于数十台服务器之中的成百上千颗芯片, 于一个具备低延迟以及高带宽特性的域里, 整合构建成为逻辑上统一的一颗“超级大芯片”, 进而达成协同高速计算效果的超节点, 其开展此项工作的所在之处亦被称作HBD, 也就是高带宽域。

作者声明:该图片由AI生成

黄仁勋,给中国超节点带货(图3)

超节点的单节点, 已不是以往那种意义上的一台服务器, 它是计算单元, 由多台服务器以及网络设备共同构成。

好处也显而易见。

一方面, 借助机柜内部高速互联, 当往机柜里放入更多的GPU, 达成更高效的互联时, GPU间的参数交换以及数据同步会愈发顺利, 这对减小小模型的训同期是有帮助的。

另一方面,理论上部署和运维难度也降低了。

超节点是一个高集成度、经预先调优的超级计算机, 在供电方面采用效率更高的技术和系统, 在散热方面也采用效率更高的技术和系统。对于上述在两方面之举通过这样全方面综合起来观察考量看, 会呈现出使组网难度降低以及使运维难度降低的结果。

无论是从集群搭建的角度去看, 超节点都是一个因被迫而产生的性价比方面的选择, 对于国产厂商来讲, 超节点同样是一个因被迫而出现的务实性的选择。

原因很简单:大力出奇迹、用量取胜。

倘若单颗芯片性能之间存在着距离差, 那么不妨采用更多芯片, 以及更快互联的办法, 借助更高的系统效率去弥补单卡方面的差距, 这种凭借系统获取胜利的策略亦是中国科技以往所拥有的优势之处。

有券商总结的好:超节点就是中国AI的「韬定律」。

2、诱人的蛋糕

黄仁勋首先开创了超节点的理念, 硅谷的大型科技公司中, 人工智能集成群体呈现繁盛态势, 然而, 在实际开展的推进进程里, 设想虽美好, 实际却是残酷的。

黄仁勋,给中国超节点带货(图4)

图源:天风国际证券分析师郭明錤

一方面, 虽然早早地就拿出了AI工厂的路线图, 鸿海等服务器厂商们也纷纷将产能拉满, 然而具体到英伟达下一代的AI机柜, 其量产交付时间却会因各种各样的问题而被卡住。

消息称, 有爆料指出, 原本计划在2023年下半年推出的Kyber机架架构, 鉴于制造工艺方面出现了问题, 所以将会推迟到2028年。

在另一边, 马斯克的xAI开始出租算力, 扎克伯格的Meta也开始出租算力, 这使得市场出现质疑, 质疑此类算力租赁商的成长性, 甚至还回到了那个「算力是否建设过度」的老问题、。

黄仁勋,给中国超节点带货(图5)

xAI 数据中心计算大厅

与之相反, 于中国而言, 各种各样的超节点方案好似如雨后春笋一般纷纷涌现, 各家都在比拼规模, 比拼参数, 比拼方案, 甚至存在厂商把今年称作是「中国超节点元年」。

黄仁勋,给中国超节点带货(图6)

元年是不是元年并非具备重要意义, 市场已然听闻了数量众多的有关元年的故事, 更为关键的要点在于缘何中国的厂商针对超节点呈现出如此激进的态势?

有三股看得见的手,在加速拉满国产超节点的进度条。

第一只手,就是国产芯片厂商。

为国产芯片们能有条跳出和英伟达「比单卡性能」状况的思路, 超节点给出的办法是, 通过Scale Up这样做来堆卡数, 并且是以系统来换性能, 就是这种方式。

摩尔线程副总裁马鉴, 于接受媒体采访之际提及, 借助系统方面的提升, 来对标国际上先进且处于领先地位的超大规模集群, 进而训练出同样具备先进性的模型。

但如果从拼单卡转变到拼系统, 还有一个益处, 那便是超节点实际上就为国产芯片打造出了最为直接的练兵场所, 国产芯片厂商能够进一步地将上下游产业链生态予以绑定, 从能够使用逐步迈向好用。

第二只手,则是国产大模型厂商。

这之中,不同模型厂商也各有意图。

诸如、月之暗面这般的模型厂商, 极为大力地推崇国产超节点, 从本质上来说, 依旧是为了去争夺更多的算力, 进而用以提升模型的智能。

并且, 诸如阿里、百度这般, 同时具备芯片、云、模型以及应用这些方面的全栈供应商, 超节点更是有着极高经济效益。

一方面, 芯片属于为模型进行特制打造, 而模型反过来又助力芯片进行更新迭代;另一方面, 就算是存在建设过度的情况, 超节点自身也能够以云服务的形态, 依据词元来进行调用, 阿里云也已然开始实施这种做法了。

第三只手,则是国产服务器厂商。

摩尔线程众多角色所呈现的毛利率为60%, 浪潮信息那些角色构成体,其毛利率却低于5%, 传统服务器生产厂家赚取的是犹如组装车间般的辛劳之财。

超节点给予了国产服务器厂商们翻身的契机, 英伟达NVL72系列已就此给他们上了一课, 这是其中一点。

因为,超节点更贵了,组装厂也跟着能赚。

英伟达, 上一代的GB200 NVL72, 其售价大概是300万美元, 今年开始量产的新一代Vera Rubin NVL72, 单柜物料成本又进一步往上升, 一直攀升到了780万美元。

黄仁勋,给中国超节点带货(图7)

交付单元发生了变化, 原先只是单台, 现在变成了整柜, 服务器厂商所做的事情, 并非仅仅是组装, 而是还涵盖了整机柜集成, 还包括Scale-up组网, 还涉及供电与结构件, 还包含上架联调, 是一种完整系统级交付。

工程复杂度增长了, 利润空间同样会更为可观, 依据大摩所做的研究报告, 在Rubin那个时期, ODM的附加值会提高35%至40%。

鸿海等企业, 居然也开始效仿存储厂商, 大肆谈论商业模式的转变, 即由以往的「买断制」转变为「寄售制」, 曾经身居高位的甲方, 甘愿降低姿态垫付资金, 代工厂无需再进行大额垫资备货。

于是乎, 在超节点此一事项之上, 浪潮信息、新华三等国产服务器厂家呈现出格外积极之态, 不但同芯片厂家开展联合创新之举, 还推出更为丰富多样的产品以及服务。

就算超节点是这般极具吸引力的一块蛋糕, 然而于它大规模落地而言, 仍存在着一段相当长的路程要去走。

3、革命尚未成功

一个月之前, 黄仁勋出现在中国台北电脑展这儿, 在吃完鸿海董事长刘扬伟所准备的红豆饼之后, 他顺着势头对刘扬伟发出喊话 , 这话是这样讲的:

“食用红豆饼的数量但凡越多, 那么所产出的Vera Rubin的数量也就会越多。”然而仅仅过去了一个月的时间, 便遭到了媒体的反驳, 被证明是交付延迟了。

种种迹象都在显示, 超节点的技术, 其商业化落地的难度, 恐怕简直比巨头们所设想的要大得多得多。

第一道关,就是灵魂之问:到底怎么连。

虽然当下全球范围之内, Scale Up协议整个生态正逐步朝着开放而去, 然而随之出现的却是割裂情况以及碎片化了。

之所以如此, 是由于协议生态一般而言皆是由巨头予以推动, 并且开放联盟的竞争关系同样是处于动态变化之中的。

英伟达在2014年推出,早期相对封闭,厂商难以创新。

可是在去年5月的时候, 英伟达于互联技术大家族之中增添了一项内容, 这项内容是允许第三方厂商去定制CPU或者加速器, 虽说每个节点依旧必须涵盖最少一颗英伟达芯片, 然而这种「半封闭、半开放」的策略, 表明英伟达跨出了开放的一步。

黄仁勋,给中国超节点带货(图8)

由AMD主导的那个协议叫, 它成立于2024年, 早期参与的还有AWS丶谷歌丶英特尔丶博通丶Meta丶微软等, 不过在2025年时, 博通也正式推出了自家的协议SUE, 其目的是要把自身在以太网方面的优势引进到Scale Up领域。

于国内范畴内, 华为于2019年之际发布了灵衢(), 是直接进行对标之举。海光同样在去年12月之时, 与国产的AI芯片、操作系统、存储以及网络模块等各类厂商合作联手, 发布了海光系统总线互联协议(HSL)1.0规范。

黄仁勋,给中国超节点带货(图9)

除此以外, 中国移动发布了各自的Scale Up开放协议, , 阿里云发布了各自的Scale Up开放协议, 字节跳动等也发布了各自的Scale Up开放协议。

但是, 就如同上文所讲述指出的那样, 协议数目众多, 不存在任何一个巨头是不想掌控自身协议的, 如此一来便造成出现这样的结果, 那就是在行业起先阶段用于Scale Up的协议生态是相对地不严密。

除了去解决那存在于 GPU 之间内部的互联协议之外, 怎么就连那所使用的物理介质竟然也有着技术路线的分化呢:

用电,还是用光?

电互连所对应的铜缆有着价格便宜、功耗较低的特点, 然而其传输距离受到限制。光缆可做到远距离进行传输, 对于方便组建多个机柜的网络颇为有益, 不过其硬件所需要的造价更高, 并且中间起着“翻译官”作用的光模块还会产生额外的功耗。

英伟达所构思之计策乃是径直迈向硅光共封装之途径, 协同台积电等诸多伙伴, 全力投注于CPO(即光电共封装)技术。

中国信通院把光互链路途中的进展途径归纳成以下三次步骤, 首先是NPO转入用来商业的阶段, 后来CPO在其中占据主要地位, 最后OIO也就是大家说的光输入输出变成最终的样子, 与此同时, 中国的超节点领域已经跃跃欲试, 开始着手把光互连技术应用起来了。

除了怎么连外,第二道关,还有供电和冷却。

AI的尽头是算力,算力的尽头是电力。

面对如何喂饱那所谓的「吞电兽」, 以及怎样给超节点降温这种情况, 这明确表示了必然得拥有更具先进性的供电系统以及冷却系统, 在未来, 技术的发展方向会着重关注于具备更高电压的供电架构, 还有风液混合、全液冷系统。

尚有更为关键的一道关卡, 实则就在眼前, 回溯至上游的国产芯片方面, 于客户的大额订单以及高预期情形下, 晶圆厂的产能究竟能不能持续得以兑现呢?

扭转头去瞧, 革命的进程还没有达成成功的状态。超级节点能够呈现出火热状况的缘由, 是那种被逼迫出来的创新情形, 是更为切实可行的一种选择, 与之雷同相似的故事在科技发展的历史长河当中也并非是少见的情形, 然而距离达成真正意义上的大规模范围的落实与推进, 去推翻英伟达所拥有的地位局面, 仍然是存在着相当长的一段路途的。

参考资料:

1、魔形智能:一文洞悉超节点:解密AI时代的算力基石

2、鲜枣课堂:最近很火的“超节点”,到底是干啥的?

3、东方证券:超节点:国产算力进攻的“矛”

4、国联证券:国产算力“三支箭”:芯片、FAB、超节点

5、国金证券:国产机柜“时间”到来

标签: 超节点   AI算力   英伟达   华为   国产芯片