AMD et Cerebras répartissent une même requête d’inférence IA entre deux architectures de processeurs. Annoncé le 23 juillet, le service prévu utilisera les systèmes AMD Helios pour traiter les prompts et le Wafer-Scale Engine de Cerebras pour générer les tokens de sortie, avec une disponibilité attendue via Cerebras Cloud au second semestre 2026.
Cette conception cible les assistants de programmation, les copilotes en temps réel, les agents autonomes et d’autres applications où les délais de réponse peuvent s’accumuler lors d’appels répétés aux modèles. AMD et Cerebras n’ont pas communiqué leurs tarifs, les modèles pris en charge ni les résultats de production de bout en bout ; l’architecture reste donc non éprouvée en dehors des modélisations des entreprises.
Fonctionnement du processus en deux étapes
L’inférence des grands modèles de langage comporte deux grandes étapes. Lors du prefill, le système traite le prompt et crée le cache clé-valeur, ou KV, utilisé pour produire une réponse. Lors du décodage, le modèle lit cet état stocké et génère la sortie token par token.
AMD Helios prendra en charge le prefill et les fenêtres de contexte étendues, tandis que le Wafer-Scale Engine de Cerebras exécutera l’étape de décodage très gourmande en bande passante mémoire. Les entreprises décrivent cette conception comme un flux de travail intégré unique dans leur annonce de partenariat, bien que le service ne soit pas encore disponible pour tous.
Le prefill bénéficie de capacités de calcul parallèles. Le décodage accède de manière répétée aux données du modèle pendant la génération des tokens, ce qui rend particulièrement importantes la bande passante mémoire et la latence. Cerebras intègre de la SRAM à son processeur à l’échelle de la plaquette afin de rapprocher davantage de données des cœurs de calcul.
Cerebras suit une approche similaire avec un service d’inférence désagrégé avec AWS, qui utilise Trainium pour le prefill, des systèmes CS-3 pour le décodage et l’Elastic Fabric Adapter d’Amazon pour transférer le cache KV entre les deux, et des reportages indépendants notent que les benchmarks publics de bout en bout restent indisponibles.
Les affirmations de performance doivent encore être testées indépendamment
AMD et Cerebras estiment que la configuration combinée pourrait fournir jusqu’à cinq fois plus de tokens par seconde et par watt qu’une configuration Cerebras seule. Cette estimation provient d’une modélisation interne utilisant le modèle Kimi K2.6 à 1 000 milliards de paramètres, et non d’une comparaison indépendante avec du matériel Nvidia ou d’un déploiement AMD autonome.
Les entreprises n’ont pas non plus publié leurs tarifs, leurs données de coût total de possession ni leurs engagements de niveau de service. Les entreprises ne doivent pas considérer la projection d’efficacité multipliée par cinq comme une référence d’achat. Elles devront mesurer la latence, le coût par requête terminée et la surcharge liée au transfert de l’état du modèle avec leurs propres longueurs de prompts et profils de trafic.
Helios est une architecture de référence refroidie par liquide, fondée sur la norme Open Rack Wide de l’Open Compute Project. Elle combine 72 GPU Instinct MI455X avec des processeurs EPYC et des systèmes réseau Pensando, soutenant la stratégie d’AMD en matière d’infrastructures IA à l’échelle du rack. Les partenaires OEM et ODM, plutôt qu’AMD elle-même, commercialiseront des systèmes fondés sur cette architecture.
L’accord avec Cerebras intervient après l’engagement d’Anthropic de déployer jusqu’à 2 gigawatts de capacité AMD Instinct dans le cadre d’un accord d’infrastructure pluriannuel. Le premier gigawatt devrait être opérationnel au premier semestre 2027.
L’accord s’inscrit dans un marché en pleine croissance pour les clouds d’inférence IA spécialisés. Une date de lancement ferme, une liste des modèles pris en charge, les tarifs et des mesures indépendantes de la latence, du débit et de la consommation énergétique constitueront les prochains éléments de preuve. Ces résultats montreront si la répartition de l’inférence entre les matériels AMD et Cerebras réduit les coûts et la latence en production — ou si elle ne fait que déplacer la complexité vers le réseau et la couche d’orchestration.
En savoir plus : un projet de cloud TPU de 5 milliards de dollars US permettrait aux entreprises d’accéder à une autre voie vers le calcul IA spécialisé, en dehors des offres standards des clouds publics.


