À frente da nova era dos agentes, horizonte tecnológico da inteligência artificial, a Google reestruturou fundamentalmente sua estratégia de hardware. Abandonando a abordagem anterior de processar tanto o processo de aprendizado quanto as tarefas de inferência com um único chip de propósito geral, a empresa desenvolveu e apresentou independentemente dois semicondutores personalizados: o TPU 8t, dedicado ao aprendizado em larga escala, e o TPU 8i, especializado em inferência de alta concorrência. A companhia anunciou oficialmente esses dois chips inovadores na conferência Cloud Next 2026, realizada em Las Vegas, nos Estados Unidos, no dia 23. A equipe da Google diagnosticou que o mercado de IA está se dividindo rapidamente da fase de desenvolvimento de criação de modelos para a fase operacional de implementação real em serviços, e enfatizou que a nova linha de chips foi projetada exatamente para atender a essa mudança na estrutura de demanda.
Enquanto a geração anterior, o TPU Ironwood, foi uma plataforma de bandeira única preparada para a era da inferência, a característica mais marcante desta geração é a própria dualidade da estrutura. Isso se deve ao aumento explosivo simultâneo da demanda por infraestrutura capaz de treinar modelos ainda maiores e por infraestrutura de inferência capaz de executá-los rapidamente e eficientemente em ambientes de nuvem, impulsionado pela rápida disseminação da tecnologia de agentes de IA. Refletindo isso, a Google adotou uma estratégia de claramente separar os chips para aprendizado e para inferência, demonstrando a determinação de obter desempenho e eficiência otimizados para as características específicas de cada etapa.
O TPU 8t é um chip focado em cargas de trabalho centradas em pré-treino em larga escala e em embedding, aplicando topologia de rede toroidal 3D para maximizar a escalabilidade de grandes clusters. O número de chips conectáveis por padrão ultrapassa o dos modelos anteriores, atingindo 9600 (contra 9216), e o seu cerne é a tecnologia SparseCore e o suporte a operações de ponto flutuante de 4 bits. O SparseCore atua como um acelerador dedicado para lidar com acessos à memória irregulares que ocorrem com frequência durante o processo de busca em grandes modelos de linguagem, e ao combinar operações de baixa bit, reduziu a carga na largura de banda de memória. Isso permitiu dobrar a taxa de processamento enquanto mantém a precisão com menos memória, alinhando-se também com a tendência de técnicas de quantização que reduzem o número de bits por parâmetro, permitindo ao mesmo tempo reduzir o consumo de energia e a ocupação de espaço.
O TPU 8i foi projetado especificamente para a etapa de inferência, onde modelos concluídos são inseridos em serviços reais, destacando-se no pós-processamento de grandes modelos e na inferência de alta concorrência solicitada por múltiplos usuários simultaneamente. De acordo com a Google, este chip carrega três vezes mais RAM estática do que o modelo anterior, permitindo armazenar grandes caches de valores de chave necessários para inferência de LLM, o que aumentou dramaticamente a velocidade de geração de texto. Além disso, aplicou o sistema de inferência Collectives Acceleration Engine para acelerar operações de sincronização e redução necessárias nos processos de decodificação autogerativa e de raciocínio encadeado. Ao adotar a topologia de rede personalizada Boardfly ICI, permitiu a interconexão de até 1152 chips, reduzindo a distância de movimento dos pacotes de dados e o número de saltos, economizando até 50% no número total de saltos de comunicação.
O sucesso desta jogada da Google chama a atenção para se ela pode abalar o mercado centrado na NVIDIA. Ambos os TPU 8t e 8i dobraram o desempenho por watt em comparação com a geração anterior, garantindo eficiência energética, o que é uma variável central que determina a rentabilidade de grandes data centers de IA. Mais do que um simples lançamento de novos produtos de semicondutores, isso é um sinal de que a Google está separando formalmente a estratégia de infraestrutura de IA em aprendizado e inferência. Trata-se de uma estratégia para aumentar o peso do negócio de nuvem em um contexto onde a competição de serviços de IA está se deslocando do desempenho do modelo para custos operacionais, velocidade de resposta e throughput simultâneo. O mercado vê a velocidade de adoção por clientes reais e a compatibilidade de software com o ecossistema da NVIDIA como variáveis decisivas para o sucesso ou fracasso, mas, dado que a expansão dos agentes de IA está aumentando simultaneamente a demanda por aprendizado e inferência, a estratégia de dualidade da Google tem grandes chances de se tornar um ponto de virada importante na futura competição de infraestrutura de IA.