Google Cloud rivalise plus directement avec Nvidia dans les infrastructures d’IA.
Lors de Cloud Next 2026, Google a présenté TPU 8t pour l’entraînement et TPU 8i pour l’inférence, séparant ses dernières puces d’IA entre la construction de grands modèles et leur mise à disposition en production.
Pourquoi Google sépare l’entraînement et l’inférence
Selon la présentation des TPU de huitième génération de Google Cloud, TPU 8t est conçu pour l’entraînement et TPU 8i pour l’inférence, tous deux fonctionnant sur les processeurs de Google basés sur Arm, Axion. Google affirme que cette séparation reflète le fossé grandissant entre le matériel nécessaire pour entraîner de grands modèles et celui nécessaire pour faire fonctionner efficacement des services d’IA une fois ces modèles déployés.
L’entraînement de grands modèles dépend de l’échelle, d’une puissance de calcul élevée et de communications rapides au sein de vastes clusters. L’inférence accorde davantage d’importance à la latence, à l’utilisation de la mémoire, à l’efficacité énergétique et au coût du traitement des requêtes dans la durée.
Dans son analyse technique approfondie de TPU 8t et TPU 8i, Google affirme que TPU 8i offre jusqu’à 80 % de performances supplémentaires par dollar dépensé et deux fois plus de performances par watt en inférence que la génération précédente. Ces chiffres viennent de Google et non de tests indépendants : il vaut donc mieux les considérer comme des arguments commerciaux tant que les clients n’auront pas pu les mesurer dans des déploiements réels.
Google intègre également ces puces dans un système plus vaste. Son AI Hypercomputer regroupe le calcul, le réseau, le stockage et les logiciels au sein d’une même pile gérée, ce qui permet à Google Cloud de mieux séduire les entreprises qui consacrent de plus en plus de dépenses à l’exploitation d’outils d’IA au fil du temps, plutôt qu’à leur seul entraînement.
Cette évolution vers du matériel personnalisé se manifeste également ailleurs sur le marché, notamment avec la dernière expansion des puces personnalisées d’Anthropic avec Google et Broadcom et la récente offensive d’Intel sur le terrain des GPU de Nvidia.
Ce que la séparation des TPU de Google signifie pour Nvidia
Google continue dans le même temps de collaborer avec Nvidia. Dans sa mise à jour 2026 de l’infrastructure présentée au GTC, Google a déclaré prévoir de proposer les systèmes Nvidia Vera Rubin NVL72 au deuxième semestre 2026.
La stratégie cloud de Google couvre désormais les deux options : ses propres TPU pour les clients prêts à construire autour de la pile de Google, et les systèmes Nvidia pour ceux qui souhaitent disposer d’outils GPU éprouvés et de workflows fondés sur CUDA.
Pour les clients, le choix dépendra probablement de la charge de travail et du coût de son exploitation. Les entreprises qui entraînent des modèles de pointe accorderont peut-être surtout de l’importance à l’échelle des clusters et à leur taux d’utilisation. Celles qui proposent des fonctionnalités d’IA à un grand nombre d’utilisateurs seront peut-être davantage attentives au temps de réponse, à la consommation électrique et au coût par requête.
Nvidia défend ses propres arguments autour de ces mêmes contraintes dans sa dernière présentation de l’infrastructure d’IA, tandis que Google soutient que des puces distinctes peuvent mieux correspondre à la manière dont les systèmes d’IA sont conçus et déployés.
La question de savoir si cet argument se traduira par une adoption plus large dépendra de ce que les clients constateront après le lancement. Une fois ces systèmes utilisés, le prix, les performances et les difficultés liées aux logiciels compteront davantage que les diapositives consacrées à l’architecture.
Pour l’instant, Google présente TPU 8t et TPU 8i comme une alternative plus spécialisée à l’approche fondée sur une seule puce, ainsi que comme un défi plus direct lancé à Nvidia dans les infrastructures cloud d’IA.
À lire également : L’investissement de Nvidia dans CoreWeave montre à quelle vitesse les dépenses consacrées aux infrastructures d’IA augmentent.

