华为发布昇腾960超节点:4096卡、NPO光互联,瞄准十万亿参数模型

首页 / AI资讯 / 泛AI领域

0:00
0:00
1x
定时

9月17日,华为全联接大会2026在上海开幕,会上发布了新一代AI算力基础设施昇腾960超节点。这被官方定义为业界首个采用NPO即近封装光学技术的超节点,最多可搭载的算力卡数量从上一代的1024卡升级到4096卡,用于匹配十万亿参数规模模型的训练与推理需求。华为副董事长兼轮值董事长汪涛表示,960芯片已提前就绪,实现性能翻番。

从1024卡到4096卡:超节点解决的是什么问题

当大模型参数从千亿走向万亿乃至十万亿,传统8卡服务器已经无法满足训练和推理的通信需求。节点之间交换数据的开销会迅速吃掉算力收益,规模越大效率越低。超节点的思路是把尽可能多的加速卡放进一个统一的内存编址域内,让它们像一台计算机一样协同工作,从而把跨节点的通信开销降下来。

昇腾960超节点具备跨物理节点统一内存编址能力。官方给出的仿真数据显示,4个超节点组成的10万卡集群,模型浮点算力利用率相比传统8卡服务器集群提升2.75倍。这个倍数的意义在于,它衡量的是有效算力而不是名义算力:同样数量的卡,能不能被真正喂饱,取决于互联架构而不是芯片本身的峰值指标。华为此前还发布了Peerium架构,并提出UnifiedBus用于实现百万级处理器的资源统一共享,目标是把强扩展能力推到更大规模。

统一内存编址带来的直接好处是编程模型简化。开发者不需要显式为跨节点数据搬运编写通信代码,框架层可以把整个超节点当作一块内存来调度,这降低了把训练任务扩展到万卡规模的工程门槛。

NPO近封装光学:把光互联拉到封装旁边

这次发布最具技术含量的是NPO即近封装光学技术。在超大规模集群里,节点间互联正在从电信号向光信号迁移,原因很直接:电互联的带宽密度和功耗随距离迅速恶化,而光互联在这两项上都有数量级优势。近封装光学进一步缩短了光引擎与计算芯片之间的距离,减少信号在电与光之间转换的次数,从而降低延迟和功耗。

行业对光互联的投入正在加速。同一时间段,长飞光纤宣布其反谐振空芯光纤衰减突破至0.032dB/km,刷新全球最低传输损耗纪录,并已在国内完成超13个商用及试点项目;高盛把全球光模块市场预测大幅上调,预计2030年高速数通光模块出货超1.6亿只、光器件收入接近700亿美元、CPO与NPO端口接近3500万个。这些数字共同说明,算力竞争的瓶颈正在从单卡性能转向互联能力,谁能把成千上万张卡高效地缝合成一个整体,谁就掌握了规模化的钥匙。

NPO的产业意义不止于性能。近封装光学把光引擎与计算芯片的距离压缩到封装尺度,对封装工艺、散热设计与良率控制都提出了新要求,这也意味着算力竞争正在把产业链上游的先进封装能力一并卷进来。

国产算力从能跑到能训:软件栈同步补齐

硬件之外,这次大会还披露了配套的软件与平台进展。灵衢昇腾950智算集群服务全球上线,搭载五级快速恢复机制,可保障40天云上训练稳定运行、10分钟内完成故障恢复,Token吞吐性能较上一代提升20%,将于9月30日国内商用、11月30日海外商用。华为云还发布CMS记忆存储解决方案,构建PB级记忆空间,存储容量较同类提升一倍,支持TB级高速读取。

这些动作回应的是同一个问题:训练一个十万亿参数模型,考验的不只是峰值算力,还有长时间运行的稳定性、故障恢复速度和数据供给能力。40天连续训练、10分钟故障恢复这类指标,恰恰是过去国产算力方案最容易被质疑的地方。与此呼应的是9月中旬中电信发布并开源的星辰Xing4.0-29B-A4B,该模型全程基于昇腾910C芯片与国产框架训练,训练吞吐较开箱状态提升约96%。从只能跑推理到能完成训练,这是国产算力生态最关键的转折点,而昇腾960超节点要解决的是这个转折之后的下一个规模问题。

软件栈的成熟度往往比硬件指标更难追赶。一个训练框架要支持万卡规模稳定运行,需要在大规模并行、容错恢复、数据流水线等多个方向积累工程经验。40天连续训练与10分钟故障恢复这两个指标,衡量的正是这部分隐性能力。

算力的下一道题:电力与成本

规模的尽头是电力。华为云CEO周跃峰在会上表示,重点是降低端到端成本,同时坦言芯片供应紧张,部分需求无法满足。华为援引的数据显示,2026年全球数据中心用电量将达到565太瓦时,同比增长26%;国内方面,Token日均消耗量已从2024年初的日均千亿增至日均约500万亿。算力正在成为用电增长最快的新增负荷。

这也解释了为什么9月的算力议题里,电力与算力的协同被反复提及。中国算力大会期间发布的《算电协同高质量发展倡议》,从规划、建设、运行、创新、标准与安全六个方向推进算力与电力协同,配套项目库首批纳入54个行业实践样本。当单栋机房的IT供电容量被推到168兆瓦这个量级,选址、绿电直连、调峰能力就不再是配套问题,而是决定算力能否落地的硬约束。国产算力的下一轮竞争,比的可能不是谁的集群更大,而是谁能在给定的电力与成本约束下,把有效算力利用率和单位Token成本做到更优。

单位Token成本因此成为比峰值算力更实用的评价指标。它同时包含芯片利用率、互联效率、电力价格与散热开销,是算力方案能否长期跑下去的综合性判断。对采购方而言,这个数字比任何单点性能指标都更接近真实账单。

素材来源:界面新闻、网易科技、华为全联接大会2026、上海证券报 发布时间:2026-09-20