谷歌在自研AI芯片上又迈出了一大步。8月初消息显示,谷歌将推出两款第八代TPU,分别是专注大规模训练的TPU8t和专注低延迟推理与服务的TPU8i。谷歌方面表示,预训练、后训练和实时推理服务的需求已经彻底分化,两款芯片将各司其职,共同支撑Gemini模型的训练与推理,也将在今年年底向Google Cloud客户开放。
这一代TPU的规格提升相当显著。TPU8i相比前代Ironwood,性能提升最高80%,能支撑近两倍用户量;TPU8t单超级集群(9600芯片)算力近3倍提升,达到121 ExaFLOPs,可以把训练时间从月压缩到周,性能每瓦特提升约2倍。在芯片设计上,谷歌首次引入第二家设计伙伴,TPU8i由联发科设计,打破博通在此前数代TPU上的独家垄断,供应链格局迎来大洗牌。
TPU8t的定位是训练专用芯片,代号Sunfish,由博通主导设计。其单超级集群由9600颗芯片组成,算力达到121 ExaFLOPs,相比前代近3倍的提升,直接把大规模训练的时间成本压缩了一个量级。谷歌官方表示,借助TPU8t,原本需要数月的模型训练可以压缩到数周完成,这对于Gemini这样参数规模持续膨胀的旗舰模型至关重要。
TPU8i则瞄准推理与实时服务场景,代号Zebrafish,由联发科设计。相比前代Ironwood,TPU8i性能提升最高80%,能支撑近两倍的用户量,特别适合高并发的API推理服务。在模型即将商品化的时代,推理成本直接决定模型的商业化空间,TPU8i的效率提升意味着更低的单位推理成本,也意味着谷歌云在AI推理市场上更有竞争力的报价。
除了算力规格,存储配置同样大幅升级。两款芯片均采用HBM3E规格,TPU8t每芯片约216GB,TPU8i每芯片约288GB,单个TPU8t超级集群需要约2PB共享HBM。主CPU搭配谷歌自研的Axion(基于Arm架构),网络采用自研Virgo光学电路交换,冷却升级为第四代液冷。从硅片到数据中心的全栈自研,正在成为谷歌算力战略的鲜明标签。
TPU8供应链最引人注目的变化,是联发科的首次入局。此前数代TPU均由博通独家设计,博通负责高复杂度的SerDes互连、先进封装和大规模训练所需的高性能实现。而TPU8i首次由联发科设计,据报道可节省20%至30%的成本,同时分散风险、借鉴移动端高效低功耗经验。谷歌打破博通独家垄断的意图十分明确:多源化供应链,降低对单一伙伴的依赖。
在制造端,两款芯片的主要代工厂均为台积电,初期基于N3工艺家族,后续计划转向2nm,先进封装采用CoWoS技术,HBM堆叠成为关键瓶颈。高带宽内存方面,主要供应商包括SK海力士、三星,并扩展到美光。光模块、电源管理、组装等环节涉及多家EMS厂商。整体策略清晰:多源化、全栈自研、锁定大客户订单,Anthropic等客户已承诺多GW级别的算力需求。
供应链重组的背后是算力军备竞赛的加剧。全球AI算力需求持续暴涨,亚马逊、微软、Meta等巨头都在加速自研芯片布局,谷歌TPU的迭代速度与供应链灵活性,直接关系到其云业务在AI时代的竞争力。联发科的加入不仅带来了成本优势,也为谷歌提供了与博通谈判的筹码,让TPU的供应体系更加稳健。当芯片设计、制造、内存、网络全部实现多源化,谷歌算力基础设施的抗风险能力将显著增强。
121 ExaFLOPs是什么概念?作为对比,全球最顶尖的商用超算集群通常只有数百PetaFLOPs级别的算力,而谷歌一个TPU8t超级集群的算力相当于其上百倍。这样的算力密度,让大规模模型训练从不可能变为可能,也让谷歌在训练GPT级别乃至更大规模模型时拥有充足的算力储备。更关键的是,性能每瓦特约2倍的提升,直接改善了电力成本与单位经济性。
在系统设计上,TPU8t超级集群展现出极高的工程复杂度。9600颗芯片通过自研Virgo光学电路交换网络互联,共享约2PB的HBM内存,配合第四代液冷散热,构成了一个高度集成的算力单元。光学电路交换相比传统电互连具有更低的延迟与功耗,是支撑大规模集群扩展的关键技术。谷歌在系统级工程上的积累,正在转化为实实在在的算力成本优势。
从算力经济学看,TPU8系列的意义在于降低AI模型的全生命周期成本。训练阶段,TPU8t把训练时间从月压缩到周,意味着更快的模型迭代节奏与更低的资金占用;推理阶段,TPU8i的高效率让模型服务的边际成本持续下降,支撑更大规模的用户访问。当算力成本成为AI竞争的核心变量,谷歌凭借TPU8在硬件层面的优势,正在为Gemini模型在价格与能力上的双重领先提供底座支撑。
TPU8系列揭示的谷歌战略,是全栈自研的算力闭环。从TPU芯片设计(博通、联发科+谷歌架构)、Axion CPU、Virgo网络、第四代液冷,到全球数据中心布局,谷歌正在把算力价值链的每一个环节掌握在自己手中。这种全栈能力让谷歌可以根据模型需求定制硬件,避免受制于外部芯片厂商的路线图,也让谷歌云在AI算力市场上拥有差异化的竞争优势。
对谷歌云客户而言,TPU8意味着更具性价比的AI算力选择。相比采购英伟达GPU,TPU在特定工作负载下具有成本优势,尤其适合Gemini生态的模型训练与推理。年底向Google Cloud客户开放后,企业用户将可以直接使用TPU8t进行大规模模型训练,或用TPU8i部署高并发推理服务,算力成本有望进一步下降。这也在客观上对英伟达在云AI算力市场的份额构成压力。
从全球算力格局看,TPU8的发布将加剧AI基础设施的竞争烈度。一方面,谷歌、亚马逊、微软三大云厂商的自研芯片持续迭代,云AI算力市场正在从英伟达一家独大走向多极竞争;另一方面,国产算力芯片加速追赶,寒武纪、海光等厂商在推理场景快速渗透。当算力供给日益多元,AI模型厂商的议价能力增强,整个AI产业的成本结构有望持续优化。谷歌TPU8的落地,既是谷歌自身算力战略的关键一环,也是全球AI算力版图重塑的重要信号。