Google hat seine Hardware-Strategie grundlegend neu ausgerichtet, um sich auf die neue Ära der Agenten vorzubeugen, die einen neuen Horizont für KI-Technologien darstellen. Anstatt wie in der Vergangenheit auf einen universellen Chip zu setzen, der sowohl Lernprozesse als auch Inferenzaufgaben handhabt, hat das Unternehmen zwei maßgeschneiderte Halbleiter eigenständig entwickelt und vorgestellt: den für das große Lernen vorgesehenen TPU 8t und den für die Hochzeitstabilität-Inferenz vorgesehenen TPU 8i. Das Unternehmen stellte diese beiden innovativen Chips am 23. auf der Cloud Next 2026-Konferenz in Las Vegas offiziell vor. Google betonte, dass der KI-Markt sich derzeit schnell von der Entwicklungsphase des Modellbaus auf die Betriebsphase der tatsächlichen Dienstleistung verschiebt, und dass die neue Chip-Reihe speziell auf diese Veränderung der Nachfragestruktur abgestimmt ist.
Während die vorherige Generation, der Ironwood TPU, eine einzelne Flaggschiff-Plattform zur Vorbereitung auf die Inferenzepoche war, ist das Hauptmerkmal dieser Generation ihre strukturelle Dualisierung. Aufgrund der raschen Verbreitung von KI-Agenten-Technologien ist die Nachfrage sowohl nach Infrastruktur, mit der noch größere Modelle trainiert werden können, als auch nach Inferenzinfrastruktur, die diese im Cloud-Umfeld schnell und effizient ausführen kann, explosionsartig gestiegen. Google hat dies durch eine Strategie berücksichtigt, die Lernen und Inferenz klar voneinander unterscheidet, um Leistung und Effizienz, die auf die Eigenschaften jeder Phase optimiert sind, zu gewährleisten.
Der TPU 8t ist ein Chip, der sich auf große Vorab-Lernen und Einbettungszentrierte Workloads konzentriert. Durch die Anwendung einer 3D-Torus-Netzwerktopologie wurde die Skalierbarkeit von großen Clustern maximiert. Die Anzahl der an einem einzelnen Pod anschließbaren Chips beträgt 9.600, was die 9.216 des vorherigen Modells übersteigt. Das Kernstück ist die SparseCore-Technologie und die Unterstützung für 4-Bit-Float-Operationen. SparseCore fungiert als spezieller Beschleuniger für unregelmäßige Speicherzugriffe, die häufig bei großen Sprachmodell-Suchprozessen auftreten, und reduziert die Speicherbandbreitenlast durch die Kombination mit niedrigbitigen Operationen. Dadurch wurde die Durchsatzrate verdoppelt, während die Genauigkeit mit weniger Speicher behoben wurde, was auch mit dem Trend zur Quantisierung übereinstimmt, bei dem die Anzahl der Bits pro Parameter reduziert wird, wodurch gleichzeitig der Stromverbrauch und der Platzbedarf verringert werden können.
Der TPU 8i wurde für die Inferenzphase konzipiert, in der trainierte Modelle in tatsächliche Dienste eingeführt werden, und zeichnet sich durch Vorteile bei der Nachbearbeitung großer Modelle und hochzeitstabilen Inferenzen aus, die von vielen Benutzern gleichzeitig angefordert werden. Laut Google ist dieser Chip mit dreimal so viel statischem RAM ausgestattet wie das vorherige Modell, was es ermöglicht, große Schlüsselwert-Caches für LLM-Inferenz zu speichern und die Textgenerationsgeschwindigkeit erheblich zu steigern. Zudem wurde ein Inferenzsystem namens Collectives Acceleration Engine angewendet, um Synchronisations- und Reduktionsoperationen, die für autoregressive Dekodierung und Ketteninferenz erforderlich sind, zu beschleunigen. Durch die Einführung der maßgeschneiderten Netzwerktopologie Boardfly ICI können bis zu 1.152 Chips miteinander verbunden werden, wodurch der gesamte Kommunikations-Hop-Zähler um bis zu 50% reduziert wurde.
Die Aufmerksamkeit liegt darauf, ob Googles aktuelle Zugabe den von NVIDIA dominierten Markt erschüttern kann. Sowohl der TPU 8t als auch der 8i bieten eine um das Zweifache verbesserte Leistung pro Watt im Vergleich zur vorherigen Generation und sichern somit die Energieeffizienz, was ein entscheidender Faktor für die Rentabilität großer KI-Rechenzentren ist. Dies ist mehr als nur die Vorstellung eines neuen Halbleiterprodukts; es ist ein Signal dafür, dass Google seine KI-Infrastruktur-Strategie nun offiziell in Lernen und Inferenz aufteilt. In einer Umgebung, in der der Wettbewerb um KI-Dienste vom Modellvermögen auf Betriebskosten, Antwortgeschwindigkeit und gleichzeitige Durchsatzmenge verlagert wird, ist dies eine Strategie, um das Gewicht des Cloud-Geschäfts zu stärken. Der Markt sieht die Geschwindigkeit der tatsächlichen Kundenimplementierung und die Software-Kompatibilität mit dem NVIDIA-Ökosystem als entscheidende Variablen für Erfolg oder Misserfolg, doch angesichts der gleichzeitigen Zunahme der Nachfrage nach Lern- und Inferenzbedarf durch die Ausbreitung von KI-Agenten ist Googles Dualisierungsstrategie wahrscheinlich ein wichtiger Wendepunkt im zukünftigen Wettbewerb um KI-Infrastruktur.