Un concurrent occidental entre dans la course aux modèles ouverts.
Soutenue par Nvidia, Reflection AI s’attaque aux modèles chinois à poids ouverts en misant sur la réduction de la puissance de calcul nécessaire au codage en entreprise et aux agents d’IA.
Reflection AI, un laboratoire installé à Brooklyn et fondé en 2024 par Misha Laskin et Ioannis Antonoglou, deux anciens chercheurs de Google DeepMind, a annoncé Beam le 5 octobre. Ce système de 501 milliards de paramètres est le premier modèle à poids ouverts, conçu spécifiquement pour automatiser le codage, gérer le raisonnement en plusieurs étapes et alimenter des agents logiciels autonomes.
En concurrence avec les modèles chinois à poids ouverts
Beam entre dans un écosystème largement dominé par les développeurs chinois. Andreessen Horowitz, partenaire de la société, Martin Casado estime que 80 % des développeurs dans le monde utilisent des outils d’IA open source conçus à partir de modèles chinois. La plateforme cloud Vercel a rapporté que les architectures à poids ouverts ont traité 56 % des tokens acheminés par son AI Gateway en août 2026, contre seulement 7 % en décembre 2025, les systèmes de DeepSeek, Moonshot AI, Alibaba et Zhipu AI (Z.ai) étant à l’origine de cette envolée.
Cette domination a suscité des alertes de sécurité nationale à Washington. Le secrétaire au Trésor américain Scott Bessent a averti le Congrès le mois dernier qu’il ne fallait pas laisser un petit groupe de laboratoires fermés dominer le marché intérieur tandis que des modèles ouverts étrangers équipent les infrastructures des entreprises.
Reflection présente Beam comme une alternative souveraine pour les entreprises qui exigent une maîtrise totale de leurs données. « La seule façon de posséder l’intelligence, par définition, c’est qu’elle soit ouverte », a déclaré Laskin sur le podcast Sources.
Une architecture creuse et une montée en charge de l’entraînement
Beam fonctionne comme un modèle de mixture-of-experts parcimonieux. Bien qu’il contienne au total 501 milliards de paramètres, il achemine les tâches vers des réseaux internes spécialisés qui n’activent que 23 milliards de paramètres par token. À titre de comparaison, le GLM-5.2 de Z.ai en active 40 milliards sur 744 milliards.
La phase de préentraînement a ingéré 23 800 milliards de tokens sur 6 144 GPU Nvidia GB300 NVL72 en moins de quatre semaines. Reflection a ensuite mené une campagne intensive d’apprentissage par renforcement à l’aide de 10 500 GPU Nvidia GB300, générant plus de 100 millions de trajectoires dans 1,3 milliard de bacs à sable d’évaluation.
Pour financer son développement, Reflection a levé 4,7 milliards de dollars, atteignant une valorisation de 25 milliards de dollars, avec notamment un investissement de 800 millions de dollars de Nvidia. Au cours de l’été, la start-up a conclu avec SpaceX et Nebius des accords de calcul d’une valeur supérieure à 7 milliards de dollars afin d’accéder à des grappes Nvidia GB300 jusqu’en 2029.
Le modèle fait actuellement l’objet de tests de red teaming et doit être rendu public sous licence Apache 2.0 plus tard ce mois-ci.
Ce qu’a constaté eWeek : une puissance de calcul réduite ne garantit pas des coûts de déploiement plus faibles
Plutôt que d’établir une domination nette sur les benchmarks standards, les chiffres d’évaluation publiés par Reflection révèlent un compromis stratégique : sacrifier le plafond des capacités maximales pour obtenir une efficacité spectaculaire lors de l’inférence.
Sur les benchmarks d’agents avancés, Beam est en retrait par rapport aux principaux modèles chinois. Sur DeepSWE v1.1, Beam a obtenu 44,4, très loin derrière Qwen3.8-Max d’Alibaba (51,0), Kimi K3 de Moonshot (68,0) et DeepSeek V4.1 Flash (74,2). De même, sur Terminal-Bench 2.1, Beam a obtenu 80,1, contre 86,6 pour Qwen3.8-Max, 88,3 pour Kimi K3 et 90,6 pour DeepSeek.
L’avantage architectural de Beam réside toutefois dans sa consommation de calcul. Reflection affirme que Beam atteint une parité de raisonnement avec GLM-5.2 tout en consommant trois à quatre fois moins de ressources de calcul lors de l’inférence. La start-up reconnaît toutefois que ces métriques constituent une approximation des FLOPs de génération, sans prendre en compte le préremplissage des prompts ni les surcoûts opérationnels liés au service.
Pour les équipes d’entreprise, Beam pourrait constituer un modèle supplémentaire à évaluer pour les charges de travail de codage et d’agents. Les acheteurs devraient comparer le coût par tâche menée à bien, la latence, la fiabilité et les exigences d’hébergement avant de supposer que l’efficacité du calcul réduira leur facture. Des poids ouverts et un développement américain ne suffisent pas, à eux seuls, à garantir la sécurité ou l’accessibilité financière.
En savoir plus : pour un exemple concret de l’équilibre entre contrôle des données et coûts de déploiement, découvrez comment Latham & Watkins utilise une infrastructure Nvidia privée parallèlement à des services d’IA cloud.


