超节点:华为无路可退时的一场胜利
备选标题:
NPO+灵衢:华为如何将超节点变成算力之海?
超节点:算力之海与一场胜利
将所有算力联接起来:华为式“算力突围”
算力成海:华为与超节点的故事
算力成海:华为在无路可退时造出了路
导语:将所有算力联接起来,把所有可能性发挥到极致
AI爆发式增长下,我们正在共同见证一场前所未有的算力虹吸。
2020年,我们认为千亿参数规模是大模型的标志。仅仅几年过去,顶尖模型已经迈向10万亿规模,接下来很可能向100万亿演进。智能体已经可以处理复杂的长线程、跨应用任务;具身智能与智能驾驶汽车正在将AI带向物理世界。
这些肉眼可见的突破都建立在同一个条件之上:充沛的AI算力。AI技术的飞速发展,不断考验着AI基础设施的规模、性能与可靠性。要知道,AI技术并不会稳定地线性成长,而是经常以几何级的爆发,极限考验AI算力的供给关系。
我们要如何应对这种情况?面对这个问题,今天计算产业内外会高度一致地想到一个名字——“超节点”。
2025年,华为让超节点广为人知。接下来,华为要做的是证明超节点+集群是一条可持续、可成长的算力通道。在9月17日开幕的华为全联接大会上,超节点的进化之路被证实为真。
大会期间,华为副董事长、轮值董事长汪涛发表题为“智启新未来,打造智能世界的硅基黑土地”的主题演讲,发布全球首个采用NPO技术的超节点——昇腾960超节点。大会期间,脑极体对汪涛进行了专访,围绕华为的AI战略,以及对打造中国坚实算力底座的发展目标进行了深入探讨。
如果说,2025年华为用超节点给计算产业打开了一个可能与契机,那么在今天,华为就用灵衢+NPO的技术突破,让超节点走向了能力更强、产品更加成熟的进化之路。
这是超节点的故事,也是华为面向算力围堵无路可退时,转身掘海造船的故事。
如果算力是水渠,那么下游会被上游予取予求;只有算力成海,公平与充沛才会是智能世界的底色。
越来越多人开始相信,超节点就是那片算力之海。
在智能体全面崛起的Agentic AI时代,用户对AI算力的需求与定位正在发生全面重构。一方面模型能力的进化让单芯片算力捉襟见肘。大规模MoE、复杂上下文序列、长文记忆等显著的新一代模型特征,都需要大规模并行计算来保证模型训练、推理效果。另一方面,在巨大的算力成本之下,业界开始追求更高的计算效率,而单芯片算力的推理开销巨大,也不符合AI商业化发展的客观需求。在此基础上,依靠算力规模堆叠的传统集群化AI算力也面临着收益递减的困局。随着算力单位的提升,集群中被浪费的算力就越庞大,在算力规模达到一定程度后成本将难以承受。
另一方面,中国AI还面临着特殊的算力难题,即高端AI算力难以从外部获取。而本土半导体能力还在持续突破中。比拼单芯片算力,意味着中国将从算力底座上丧失对先进AI技术的主动掌握权。不仅是华为在算力问题上无路可退,整个中国AI在这局比赛中都无路可退。
因此,无论是技术与产业趋势的客观要求,还是特殊环境使然下的主观需要,将多芯片组成更加紧密、经济、方便获取的算力形式,都是中国AI面对算力困局的必然选择。如果AI算力还是一条小溪,那么它注定无法滋养雄心勃勃的AI良田。
只有把小溪变成江河,江河汇成大海,才能找到中国AI算力需求的真正出路。既然单卡方案既不行,就要拼整体能力;要以多路径的技术创新,战胜单一路径的技术劣势。
无路可退时,就必须谋求一场胜利。
在华为看来,算力围困是完全有可能被打破的。这种打破不是单一技术的突围,而是利用30年积累的技术优势,在各个方面合纵连横,实现架构创新,满足中国AI的算力需求。超节点,就是这种努力最终得到的成果之一。
自华为在2025年推出超节点以来,业界井喷般涌现出了众多“超节点”,但这些产品的技术内核大相径庭,标准十分混乱,并且普遍将超节点与集群进行概念上的混淆。为了正本清源,规范行业标准,在2026世界人工智能大会(WAIC)期间,鹏城实验室(PCL)和全球计算联盟(GCC)共同牵头发布了《超节点定义与实践白皮书》。其中明确定义:超节点是一种在物理上由多个计算节点通过高效的互联协议紧密连接组成,具备跨物理节点的统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。超节点有三大核心技术特征,包括:“内存语义”和“统一内存编址”、超低时延、超大带宽。
从产业价值上看,超节点也与传统基于IP互联的集群方案具有极大的不同。前者的模型浮点可用率较比后者有极大的提升,能够适配更加复杂的模型训推场景,适配大模型“紧耦合、同步并行”的计算特征,综合成本开支极大降低,呈现出超节点规模越大,综合收益越明显的显著特征。因此,业界普遍认为超节点已经成为建设超大规模AI基础设施的必然选择。
在清晰的标准定义下,我们可以发现昇腾超节点是目前国内唯一可以规模商用的超节点。截至目前,昇腾910C超节点已商用超过1000套,应用于互联网、运营商、金融、教育、医疗、交通、制造等行业,并且是国内唯一训练出SOTA模型的超节点。
在今年WAIC期间,昇腾950超节点首次真机亮相,并于华为全联接大会2026期间宣布进入规模商用阶段。
与此同时,华为还在此次大会上发布了业界首个基于NPO的超节点。基于“灵衢+Hi-ONE”,华为打造的昇腾960超节点可扩展至4096卡,能够有效匹配十万亿规模大模型的训练和推理需求。
不仅能够实现唯一规模商用的超节点,还能够持续实现超节点升级。华为究竟是如何做到这一切的?
答案在于,超节点这条AI算力之路,背后并不是单一能力或器件水平决定的,而是一场多学科知识、多领域技术以及系统化工程能力的综合考验。NPO、灵衢网络,这些支持昇腾960超节点进化的关键技术,背后蕴藏了华为在各个数字化领域的漫长积累与关键时刻的融会贯通。
汪涛在采访中提到,华为的超节点集群解决方案具有领先优势,在通信技术、IP、光等领域,尤其是光模块、算力、系统,华为在这一领域有长期大规模的研发投资,每个领域我们都有最好的专家,把这些能力全聚成系统工程能力……华为的研发投资力都是“范弗利特弹药量,打破一个城墙口”。
华为在被迫无奈下紧急解出了这道题,在机缘巧合下让算力成海。
昇腾960超节点的进化,一条关键线索来自光。近段时间,光模块得到了让人意想不到的关注。究其原因,是因为越来越多人意识到AI算力不仅是半导体与服务器的问题,而是更深层次的工艺与技术考验。
在大模型训练中,AI算力单元需要频繁进行All-Reduce、All-to-All等集体通信操作,数据传输量随算力规模的增加呈现出超线性增长。其间,大量时间会消耗在数据通信上,而不是真正的运算当中。而光模块的带宽、延迟与可靠性直接决定了规模化AI算力的加速比与训练效率,是算力基础设施中至关重要的一环。
面向10万亿模型训练集群,传统的可插拔光模块数量大,可靠性低,由于部署器件太多,也不适合结构高度紧密的超节点方案。于是,华为依靠多年积累的先进光技术,率先在超节点系统内推出了全球首个NPO光引擎Hi-ONE。这是业界首个量产的NPO产品,也是目前具有最大传输能力的NPO产品,总容量达到7.2T。同时,它还是首个实现内置光源的NPO产品。
通过使用NPO方案,昇腾960超节点实现了性能提升,在4096卡超节点规模下,功耗降低超550千瓦,系统无故障运行时间提升一倍,系统可用度达到99.8%。综合来看,NPO是目前最为适配超节点的光模块技术路径。
汪涛认为,随着单一超节点集群变得越来越大,从传统的可插拔模块走向NPO是必经之路,现在一个NPO所谓的7.2T,是把36个200G的Lane集成一个模块。一个小的Hi-ONE模块代替9个800G光模块。
能够率先实现NPO技术落地,背后的原因是华为拥有全球最先进的光通信技术与最丰富的光产业经验。在漫长时间中,华为一直扮演着“追光者”的角色。这种探索与积累不仅在固网通信事业中得到了证明,更在这一关键历史节点中融入算力之海,成为其中不可熄灭的“光之灯塔”。
有理由相信,华为开始部署光通信与光模块技术的时候,并不能预料到需要它们来解决AI算力问题的那一天。但这一天就是出现了。
只有做好所有准备,才能应对一切风浪。
在规模化的AI算力中,一直存在着算力与网络的“剪刀差”问题。即算力规模越大,浪费在通信中的算力就越多,进而演变成困扰大规模AI算力的恶性循环。比如在大语言模型的训练中,网络问题导致的训练失败率可能达到20%,一次网络中断可能造成数小时乃至数天的计算结果被浪费。提升规模化算力MFU,已经成了世界级难题。
华为之所以能够搭建出国内唯一商用的超节点,核心原因之一是华为找到依靠联接能力,突破规模化AI算力“剪刀差”的方法。其中的关键成果,就是灵衢UnifiedBus。灵衢是华为自研的超节点互联协议与架构体系,也是昇腾、鲲鹏超节点的核心技术底座之一。它并非传统意义上的数据中心网络,而是一套打通芯片、整机、机柜三层的统一互联总线。或许可以这么说,灵衢与Hi-ONE共同构成了昇腾960超节点的神经元。
2025年3月,搭载灵衢的超节点正式商用交付。随后,在9月的华为全联接大会2025上,正式发布了灵衢2.0,并对外开放全部技术规范,成为国内首个开放的超节点互联标准。
在这届全联接大会中,灵衢迎来了与NPO技术的深度融合,为全球超节点探索翻开了新的一页。同时,华为还发布了分层分级的灵衢互联设备,覆盖柜内、跨柜与集群三级互联,支持从单柜到百万卡集群的弹性扩展。依托灵衢,多个超节点可以构建出更大规模的超节点集群,其由昇腾960超节点、鲲鹏950超节点、OceanStor M900记忆存储及星河UBG交换机组成,可以实现多样算力协同与分级资源池化,从而实现从数万卡到数十万卡,甚至百万卡的算力规模搭建。
灵衢的成功商用与走向开放,证明了华为将网络通信能力与计算能力进行融合创新的可行性。以联接能力起家的华为,又一次证明了这一基础能力的重要性。在华为看来,超节点不是服务器、机柜的累加,而是一个复杂的软硬件体系。而互联能力是硬件释放性能,软件发挥效应,最终实现体系化可用的前提条件。从韬定律到超节点,互联始终是打开智能世界大门的钥匙。
汪涛提出,华为希望通过打造新一代通信网络,将所有的算力连接起来。
当算力的小溪被联接成海,固有的规则与限制自然也就化为无形。
依靠超节点+集群打造新一代算力基础设施,不仅需要强大的技术、工程和能力,更需要生态的支持与场景的牵引。生态是同舟共济的人,场景是使用其价值的人。超节点不仅是算力单元的紧密联接,更是人与人之间更加紧密的联接。
在生态方面,华为持续深耕CANN这个昇腾生态根基。2025年12月30日,CANN如期完成了开源代码上线。当前,月活开发者突破5200名,开源代码行日均新增3万,支持40个原生模型预训练,已经成为中国最具活力的AI开源社区,支持主流大模型原生训练。
昇腾与PyTorch、vLLM、SGLang、Triton、Tilelang等90多家开源社区达成了深度合作,昇腾成为可在PyTorch官网直接选择安装的算力平台,同时华为也成为首个达成此目标的中国硬件厂商。汪涛提到,昇腾生态已经跨过了拐点。
在应用场景方面,华为希望AI入端全面加速,在手机端通过麒麟+昇腾实现端侧算力自给、自治。在汽车方面,预计到2030年,华为乾崑自动驾驶云端训练算力将突破100 EFLOPS,车端算力将突破3000 TFLOPS,车端模型参数规模将突破20B。同时,华为还将面向海量轻智能终端打造端侧轻量化AI核,打造万物智能的算力底座。
灵衢+NPO实现超节点技术升级,昇腾跨过拐点,各个智能化场景持续牵引。这些合力因素推动了华为对算力底座的有效建设。
当年那看似无解的算力绝壁,如今似乎已经成为可以通航的良港。
昇腾960超节点的背后,是一种前所未见的技术突围。它集合了通信、光、计算、AI等诸多技术,并且是各个体系的创新协同交织在一起,最终完成了一首交响乐般的突围。这不是硬碰硬的技术死磕,而是大家分头出击,各自行动并在某个节点会师的战略性远征。
恐怕全世界没有任何一家公司,能够像华为这样聚合如此多元化的综合能力。但同时也没有哪家公司,曾经面对如此严苛绝望的技术封锁。时至如今,昇腾依旧有很多问题,比如供应量不足,全球份额较低等。但不得不说,依靠超节点+集群,华为已经完成了一场无路可退时的胜利:即使半导体制程依旧没有提升,华为也找到了算力升级的可替代路径,找到了多样性的创新方案。
山中无路,就去海里找路,甚至这片海也可以亲手开掘出来。
汪涛在接受媒体采访时说,黎明前的黑暗一定要冲过去,要把产品做好,让用户觉得选择华为是值得的,正确的。
最终,时间会证明哪条路才是胜利之路。









