面對人工智能技術開啟的全新代理(Agent)時代,谷歌徹底重構其硬體策略。過去採用單一通用晶片同時處理學習過程與推論業務的模式已告終結,取而代之的是自主開發並推出的兩款客製化半導體:專用於大規模學習的 TPU 8t,以及專用於高併發推論的 TPU 8i。該公司於 23 日在美國拉斯維加斯舉辦的 Cloud Next 2026 會議上正式發表這兩款創新晶片。谷歌方面指出,當前 AI 市場正迅速從開發模型階段分化為實際投入服務的營運階段,因此強調此次推出的新晶片陣容正是針對此需求結構變化而量身打造。
若上一代 Ironwood TPU 是為應對推論時代而設計的單一旗艦平台,那麼本世代最顯著的特徵便是架構本身的分化。隨著 AI 代理技術的急速普及,能夠訓練更龐大模型的基礎設施需求,與能在雲端環境中快速高效執行的大型模型推論基礎設施需求,同時呈現爆炸式增長。谷歌為此採取明確區分學習與推論的策略,展現出力求在各階段特性上獲得最佳化效能與效率的決心。
TPU 8t 是專注於大規模預訓練與以嵌入(Embedding)為主的負載之晶片,透過應用 3D 托勒密(Torus)網路拓撲結構,極大化了大型叢集的擴展能力。單個 Pod 可連接的晶片數量達 9600 顆,超越先前模型的 9216 顆,其核心在於 SparseCore 技術與對 4 位浮點運算的支持。SparseCore 作為專用加速器,負責處理大型語言模型搜尋過程中頻繁發生的不規則記憶體存取,並結合低位元運算以降低記憶體頻寬負擔。藉此,在維持相同準確度的情況下,處理能力提升兩倍,且與減少參數位元數的量化技術趨勢相呼應,可同時降低電力消耗與空間負擔。
TPU 8i 則是為將已完成學習的模型投入實際服務服務的推論階段而設計,在大型模型的後處理與多個使用者同時請求的高併發推論方面表現優異。根據谷歌說法,該晶片搭載的靜態記憶體容量是先前模型的三倍,可容納大型語言模型推論所需的巨大 Key 值快取,從而大幅提升文字生成速度。此外,該晶片採用名為 Collectives Acceleration Engine 的推論系統,加速自迴歸解碼與連串推論過程中所需的同步與縮減運算。導入名為 Boardfly ICI 的客製化網路拓撲結構,允許最多 1152 顆晶片相互連接,並透過減少資料封包移動距離與跳數,將整體通訊跳數最多減少 50%。
谷歌此次的勝負關鍵在於能否撼動以英特爾(Nvidia)為核心的市場。TPU 8t 與 8i 相對於前一代,每瓦性能提升兩倍,確保了電力效率,這正是決定大型 AI 數據中心獲利能力的核心變數。這不僅是單純的半導體新產品發布,更標誌著谷歌正式將 AI 基礎設施策略分為學習與推論兩軌,顯示出在 AI 服務競爭焦點從模型性能轉向營運成本、回應速度與同時處理量的趨勢中,致力強化雲端事業份量的戰略意圖。市場關注的焦點在於實際客戶導入速度與與英特爾生態系統的軟體相容性將決定成敗,但鑑於 AI 代理的擴散同時帶動學習與推論需求,谷歌的分化策略極有可能成為未來 AI 基礎設施競爭的重要轉捩點。