平头哥发布AI芯片真武V900,216GB显存单芯算力达上代三倍

首页 / AI资讯 / 泛AI领域

0:00
0:00
1x
定时

9月22日,2026杭州云栖大会上,阿里巴巴集团CEO吴泳铭把AI模型、AI芯片、AI云定义为机器智能时代的三大基石,并给出一个比喻:如果说词元是AI时代的电,芯片就是发电机。同一天,平头哥发布了新一代训推一体AI芯片真武V900,并首次公开服务器CPU的产品路线图。按照官方说法,这款芯片是目前中国算力性能最强的AI芯片。

216GB显存与三倍算力

真武V900基于自研并行计算架构设计,单芯片性能为上一代真武M890的3倍。最受关注的参数是216GB的大容量显存,官方解释这是为了解决记忆常驻问题:当模型规模达到万亿参数级别,参数需要被切分到多张卡上,卡间通信会成为瓶颈,而更大的单卡显存可以减少切分与数据搬运的开销。片间互联带宽达到1200GB/s,为多卡协同提供了足够的数据通路。

精度支持是另一项关键能力。该芯片原生支持FP8与FP4低精度计算,覆盖从高精度训练到低精度与超低精度推理的全场景。平头哥半导体副总裁高慧给出的解释很直观:精度每降一档,一度电换来的词元数量基本可以翻一倍。在推理成本成为竞争焦点的当下,低精度支持直接决定单位算力的产出效率,而不只是纸面峰值性能。

按照规划,真武V900将于2027年第一季度量产售卖,并在阿里云数据中心规模化部署。从发布到量产之间留出半年以上的窗口,反映的是芯片从流片到规模部署所需的验证周期。对采购方而言,这意味着短期内可用的仍是上一代产品,新一代的实际性能需要在真实负载下验证。

从单芯片到超节点

这款芯片的部署形态是超节点,而不是单卡。真武V900通过平头哥自研的ICN Switch互联芯片连接,具备原生内存语义与内存统一编址能力,可实现千卡全带宽高速互联。这意味着上千颗芯片能够像一颗超级芯片一样协同工作,跨节点的数据访问发生在统一的内存大空间里,不会出现带宽不匹配导致算力闲置的情况。

配套的新一代磐久超节点服务器集成了真武V900、ICN Switch、磐脉智能网卡与镇岳SSD主控芯片,实现算、存、网的全栈系统级协同。结合阿里云新一代智算中心网络架构,单一集群可扩展至50万卡规模。这个量级指向的是十万亿参数级别模型的训练与推理需求,也说明竞争已经从单芯片性能转向整机柜与集群级交付能力。

上一代产品提供了验证基础。基于M890的超节点已大规模应用,并跑通了Qwen3.8、Kimi K3等超过2万亿参数规模的模型。据平头哥披露,真武系列芯片已服务超过650家企业客户,覆盖智驾、金融、大模型、具身智能、能源与制造等行业;另有公开资料显示,截至规划公布时该系列累计出货56万片。这些数字说明国产AI芯片已经从试点进入批量交付阶段。

为什么开始重视CPU

这次发布会一个容易被忽略但更重要的动作,是平头哥首次公布了服务器CPU的路线图。规划显示,2027年将推出倚天720与倚天730两代产品,前者实现单核性能、核密度与能效的全面提升,后者首次基于平头哥全自研CPU微架构设计,单核性能最高提升至倚天710的1.4倍;后续还将推出搭载第二代自研核的倚天750,支持自研ICN片间互联总线协议,使CPU与真武AI芯片直接互联。

把CPU重新放到台前,原因是负载结构的变化。智能体的任务规划、状态管理、工具调用、代码沙箱与多智能体编排高度依赖通用处理器,海量数据的预处理、编排与吞吐同样离不开它。在对话式AI阶段,加速卡是主角,CPU打辅助;当智能体应用大规模铺开,工具调用与调度成为常态,CPU的单核性能、内存带宽以及与加速卡的耦合程度,会直接影响系统的整体效率。

这条逻辑与行业趋势一致。多家芯片公司在近期都把通用处理器重新纳入AI基础设施的叙事,原因相同:推理与智能体任务的占比上升,需求从少数超大训练集群分散到大量持续运行的在线服务上,而这类负载对通用计算与内存带宽的依赖远高于单次训练。

软件与生态的配套

芯片性能之外,真正决定可用性的是软件栈。国产AI芯片过去的主要短板不在峰值算力,而在框架适配、算子覆盖与开发者工具链。平头哥此次披露的信息中,软件侧的配套与硬件参数并列:超节点方案包含网络芯片、智能网卡与存储主控,说明交付的是完整系统而非单颗芯片;模型侧跑通2万亿参数级别的大模型,则是对软件栈成熟度的直接检验。

从行业整体看,这一轮国产算力的推进方式与几年前不同。早期的做法是单点突破,先做出一颗可用的加速卡,再逐步补齐软件;现在的做法更接近系统级协同,把芯片、互联、存储与云服务打包提供,用真实业务负载倒逼软件优化。这种路径的代价是投入更大、周期更长,好处是交付给客户的是一套可以立即上线的能力,而不是需要自行集成的部件。

检验软件栈成熟度有个直接办法:第三方开发者能否低成本迁移主流训练与推理框架。适配成本越低,工具链越接近开箱可用;反之,客户会因迁移代价推迟采购。

国产算力的位置与挑战

把这次发布放进更大的时间轴,可以看到一个明确的产业节奏。按一年一代的迭代规划,真武系列在2026年9月发布V900,2028年第三季度计划推出J900;倚天CPU也在2027年进入两代并行的更新周期。阿里云方面提出,到2032年全球数据中心规模将超过20吉瓦。硬件迭代与基础设施扩张被放在同一份规划里,说明算力被当作长期投入而非短期项目。

挑战同样具体。制程与单卡峰值性能上的差距短期内难以消除,可行的竞争方式是把系统级协同与单位词元成本做优;软件生态需要时间积累,开发者是否愿意迁移到新的工具链,取决于适配成本与迁移收益的比较;大规模集群的部署还受到电力、散热与场地的约束,这些外部条件往往比芯片本身更能决定项目能否按期落地。

对国内用户来说,这次发布提供的实际信息是:新一代芯片的量产窗口在2027年第一季度,现有M890超节点仍在持续交付并已支撑超大模型训练,CPU路线图给出了与加速卡协同的时间表。选择国产算力方案时,值得关注的指标正在从单卡峰值算力,转向单位词元成本、集群可用度与软件迁移成本这三项。这也意味着评价国产芯片的窗口期,恰好与推理和智能体负载成为主流的阶段重叠。

素材来源:羊城晚报、环球网、潮新闻、百度百科 发布时间:2026-09-24