Cette semaine, lors du sommet mondial de l’Open Compute Project (OCP), Nvidia a présenté ses projets pour ce qu’elle appelle des « usines d’intelligence artificielle (IA) à très grande échelle ».
Ces centres de données de nouvelle génération sont conçus pour traiter d’immenses charges de travail d’IA. Nvidia a annoncé plusieurs innovations à la communauté OCP, en mettant l’accent sur les normes ouvertes, la réduction de la consommation électrique et des architectures évolutives.
Cette annonce intervient seulement une semaine après que le PDG Jensen Huang a déclaré que la demande en IA « explose ».
Vera Rubin NVL144 pour les usines d’IA
Lors d’une réunion d’information avec la presse consacrée à l’OCP, Nvidia a dévoilé les caractéristiques de son rack à architecture ouverte et de son tiroir de calcul Vera Rubin NVL144 MGX, conçus pour accélérer l’assemblage, augmenter la capacité électrique et améliorer l’efficacité du refroidissement dans les centres de données d’IA à grande échelle.
Le système adopte une conception entièrement refroidie par liquide et remplace le câblage traditionnel par un fond de panier à circuit imprimé. Chaque tiroir comprend des baies d’extension modulaires compatibles avec la mise en réseau ConnectX-9 800 Gbit/s de Nvidia et les processeurs graphiques Rubin CPX.
Plus de 50 partenaires de systèmes et de composants MGX développent des produits fondés sur l’architecture Vera Rubin. Nvidia a indiqué qu’elle contribuerait les nouvelles conceptions de rack et de tiroir de calcul à titre de normes ouvertes auprès de l’OCP, en s’appuyant sur le cadre MGX qui comprend déjà les systèmes GB200 NVL72 et GB300 NVL72.
Acheminer directement l’électricité du réseau au rack
Nvidia et ses partenaires passent à une nouvelle architecture en courant continu de 800 volts (V CC), qui remplace les systèmes historiques en courant alternatif de 415 volts (V CA) utilisés dans les centres de données actuels. Les systèmes en 415 V CA nécessitent plusieurs conversions CA-CC entre le réseau et le rack, ce qui gaspille de l’énergie et limite l’évolutivité d’un centre de données.
Cette évolution déplace la conversion électrique en amont et achemine directement du 800 V CC jusqu’au rack. Les centres de données bénéficieront d’un meilleur rendement, d’une utilisation réduite des matériaux et d’une densité accrue de processeurs graphiques par site. Cette conception, déjà utilisée dans les véhicules électriques et les systèmes d’énergie solaire, prend en charge les usines d’IA à très grande échelle. L’architecture constitue également la base de Kyber, la plateforme de serveurs en rack de nouvelle génération de Nvidia, appelée à succéder à Oberon.
Plusieurs entreprises l’adoptent déjà. Par exemple, le centre de données Kaohsiung-1 de Foxconn, d’une puissance de 40 mégawatts et situé à Taïwan, est construit autour du 800 V CC pour prendre en charge Kyber. CoreWeave, Lambda, Nebius, Oracle, et Together AI suivent une approche similaire.
Cette transition exige une coordination étroite à tous les niveaux de la pile. Nvidia travaille avec plus de 20 partenaires du secteur afin de créer un plan directeur commun pour cette transition. Cette solution est particulièrement adaptée à l’augmentation des besoins de calcul liés à l’inférence, à la génération vidéo et au codage logiciel avancé.
Spectrum-X et alignement de Spectrum-XGS sur l’OCP
Nvidia a annoncé que Spectrum-XGS Ethernet, le dernier ajout à sa plateforme Spectrum-X Ethernet, prend désormais en charge les normes OCP et SONiC.
Fondé par Meta, l’OCP est un consortium industriel qui facilite le partage de conceptions de produits pour centres de données et de bonnes pratiques. SONiC est un système d’exploitation réseau basé sur Linux qui fonctionne sur des commutateurs de plusieurs fournisseurs. La mise à jour annoncée par Nvidia permettra aux organisations de construire de grands centres de données d’IA hautes performances à l’aide de matériel et de logiciels open source.
Annoncé plus tôt cette année, Spectrum-XGS permet une « mise à l’échelle transversale » : plusieurs centres de données répartis dans différentes villes, régions ou même différents continents peuvent être connectés et fonctionner comme une seule infrastructure de calcul. La solution utilise des algorithmes qui adaptent le réseau à la distance entre les centres de données, ce qui contribue à réduire la latence des charges de travail d’IA distribuées. Meta et Oracle Cloud Infrastructure (OCI) comptent parmi les premiers à adopter cette technologie dans des environnements fondés sur l’OCP. HPE prendra également en charge Spectrum-XGS.
NVLink Fusion s’étend à Intel et Samsung Foundry
L’écosystème NVLink Fusion de Nvidia s’étend, offrant à ses partenaires un moyen d’intégrer directement leurs processeurs et leurs circuits personnalisés à l’infrastructure de Nvidia. Ces partenaires comprennent Intel et Samsung Foundry.
Intel fabriquera des processeurs x86 qui se connecteront aux plateformes Nvidia au moyen de NVLink Fusion. Samsung Foundry fournira des services allant de la conception à la fabrication pour des processeurs personnalisés et des processeurs spécialisés (XPU) destinés aux charges de travail d’IA. Fujitsu intègre également ses processeurs de la série Monaka à des processeurs graphiques Nvidia au moyen de la même interface. Nvidia a indiqué que ces partenariats simplifient la conception des systèmes et raccourcissent les cycles de développement, tout en accélérant la mise sur le marché.
Une approche unifiée et ouverte pour construire des usines d’IA
MGX est le plan directeur de l’entreprise pour une conception modulaire et reproductible. La même idée s’étend aux réseaux, où Spectrum-XGS introduit une compatibilité open source qui permet aux opérateurs de centres de données d’intégrer les produits Nvidia dans des environnements fondés sur l’OCP sans devoir revoir leurs infrastructures.
Bien que Nvidia ait développé ces technologies, elle a toujours disposé d’un solide écosystème pour accompagner ses produits. Par exemple, le partenariat NVLink Fusion avec Intel vise à simplifier la façon dont les processeurs et les processeurs graphiques se partagent les charges de travail. Parallèlement, la transition vers la nouvelle architecture en 800 V CC nécessite une collaboration étroite avec les fournisseurs, les distributeurs et les fabricants.
Les récents gains de performances de Nvidia avec la plateforme Blackwell reflètent également sa stratégie. Selon les nouveaux résultats de tests communiqués par Nvidia, Blackwell est 15× plus rapide que la génération Hopper précédente, grâce à une co-conception plus poussée du matériel et des logiciels. Nvidia a annoncé que d’autres mises à jour logicielles seraient déployées au cours des six prochains mois, afin d’étendre encore les capacités en matière de performances.
En définitive, les annonces récentes ont abouti à une architecture type capable de passer à l’échelle, des composants aux sites entiers. Les annonces propres à l’OCP font entrer la technologie dans le domaine de l’open source, permettant à un plus grand nombre d’organisations d’en tirer parti.
Nvidia a clairement indiqué que chaque nouvelle fonctionnalité et chaque partenariat servent un objectif plus large : faciliter la construction, l’extension et la maintenance des centres de données d’IA au fil du temps — ce qui est bénéfique pour tout le monde.
En octobre, Nvidia a également annoncé la sortie de DGX Spark, présenté comme « le plus petit supercalculateur d’IA au monde.”

