面对人工智能技术开启的“智能体”新时代,谷歌对其硬件战略进行了根本性重组。过去采用单一通用芯片处理训练与推理任务的模式已被抛弃,取而代之的是自主研发并推出的两款定制芯片:专用于大规模训练的 TPU 8t 和专用于高并发推理的 TPU 8i。该公司于 23 日在美国拉斯维加斯举办的 Cloud Next 2026 会议上正式发布了这两款创新芯片。谷歌方面诊断称,当前 AI 市场正迅速从模型开发的创建阶段分化至实际服务投入的运营阶段,并强调新芯片系列正是为了适应这一需求结构的变化而设计。
如果说上一代 Ironwood TPU 是为推理时代准备的单一旗舰平台,那么这一代最大的特点便是将架构本身一分为二。随着 AI 智能体技术的迅速普及,能够训练更庞大模型的基础设施需求,以及在云端快速高效执行这些模型的推理基础设施需求,同时呈爆炸式增长。谷歌为此采取了明确区分训练与推理的战略,旨在为每个阶段的特性提供优化的性能和效率。
TPU 8t 是一款专注于大规模预训练和嵌入工作负载的芯片,采用了 3D 环面网络拓扑结构,极大提升了大型集群的扩展性。单 Pod 可连接芯片数量达到 9600 个,超越了旧模型的 9216 个。其核心在于 SparseCore 技术和对 4 位浮点运算的支持。SparseCore 作为专用加速器,处理大型语言模型检索过程中频繁出现的不规则内存访问,并结合低比特运算降低了内存带宽压力。由此,在保持较小内存使用量同时维持精度的前提下,吞吐量提升了两倍。这一进展也与减少参数位数的量化技术趋势相契合,从而同时降低了电力消耗和空间占用。
TPU 8i 则是专为模型训练完成后投入实际服务的推理阶段而设计,在大型模型的后处理及多用户并发的高并发推理方面具有优势。根据谷歌介绍,该芯片配备了比旧型号多 3 倍的静态 RAM,能够容纳 LLM 推理所需的大键值缓存,从而大幅提升文本生成速度。此外,还应用了名为 Collectives Acceleration Engine 的推理系统,加速了自回归解码和链式推理过程中所需的同步与缩减运算。通过引入名为 Boardfly ICI 的定制网络拓扑,实现了最多 1152 个芯片的互联,并通过缩短数据包移动距离和跳转次数,将整体通信跳转数减少了高达 50%。
谷歌此次的胜负手在于能否撼动以英伟达为中心的市场格局。TPU 8t 和 8i 的瓦特性能均较上一代提升了两倍,确保了电力效率,这已成为决定大型 AI 数据中心盈利能力的核心变量。这不仅超越了单纯的新芯片发布,更标志着谷歌正式将 AI 基础设施战略划分为“训练”与“推理”两大板块。在 AI 服务竞争焦点从模型性能转向运营成本、响应速度和并发吞吐量的趋势下,此举旨在增强其在云业务中的分量。市场关注实际客户的采用速度以及与英伟达生态系统的软件兼容性将是决定成败的关键变量,但随着 AI 智能体的扩散导致训练与推理需求同步增长,谷歌的分化策略极有可能成为未来 AI 基础设施竞争的重要转折点。