La dernière version de modèle ouvert de Nvidia cherche moins à rivaliser avec les benchmarks de pointe — qu’à corriger ce qui casse lorsque l’IA sort du stade de la démonstration.
Lundi, l’entreprise a annoncé Nemotron 3, une nouvelle famille de grands modèles de langage ouverts conçus spécifiquement pour les systèmes d’IA agentique : des applications où plusieurs agents d’IA collaborent, raisonnent sur de longues séquences et se répartissent le travail entre des modèles spécialisés.
La version comprend trois tailles de modèles (Nano, Super et Ultra), ainsi que des jeux de données ouverts, des environnements d’apprentissage par renforcement, et des outils destinés à aider les développeurs à créer des agents d’IA fiables, adaptés à la production et déployables à grande échelle.
L’efficacité est la promesse phare. Mais l’enjeu plus profond est architectural : Nvidia parie sur le fait que l’avenir de l’IA ne repose pas sur un modèle massif unique, mais sur des systèmes de modèles, et que des fondations ouvertes et inspectables sont essentielles pour que les entreprises confient à ces systèmes de véritables tâches.
- Pourquoi Nemotron 3 existe
- La gamme Nemotron 3
- Une avancée majeure en matière d’efficacité des tokens
- L’ouverture sans compromis
- L’apprentissage par renforcement à grande échelle
- Conçu pour des systèmes de modèles
- IA souveraine et localisation
- L’infrastructure compte
- Disponibilité et prise en charge par l’écosystème
- Ce que Nemotron 3 annonce
Pourquoi Nemotron 3 existe
À mesure que les organisations passent des chatbots à des agents d’IA autonomes ou semi-autonomes, plusieurs problèmes apparaissent rapidement. Les systèmes multi-agents font considérablement augmenter la consommation de tokens. Ils nécessitent de longues fenêtres de contexte, une autoréflexion répétée et une coordination entre plusieurs outils et modèles. La latence s’accumule. Les coûts d’inférence s’envolent. Le contexte dérive.
Dans le même temps, les entreprises veulent davantage de transparence — et non moins. Les modèles qui automatisent des processus critiques pour l’activité doivent être auditables, adaptables et alignés sur les connaissances propres à chaque domaine ainsi que sur les exigences réglementaires.
Nemotron 3 est la réponse de Nvidia à ces contraintes. Plutôt que de rivaliser directement avec les modèles propriétaires de pointe, l’entreprise présente Nemotron comme une couche de raisonnement ouverte et très efficace, capable de fonctionner à leurs côtés. En pratique, cela signifie orienter les tâches courantes ou spécialisées vers les modèles Nemotron, tout en réservant les modèles propriétaires coûteux aux situations où leurs atouts uniques sont les plus importants.
La gamme Nemotron 3
La famille Nemotron 3 comprend trois modèles optimisés pour différents rôles au sein d’un système agentique :
- Nemotron 3 Nano : un modèle de 30 milliards de paramètres, dont seulement 3 milliards sont actifs, conçu pour des tâches ciblées très efficaces.
- Nemotron 3 Super : environ 100 milliards de paramètres, dont 10 milliards actifs, optimisé pour la collaboration entre agents et le raisonnement à faible latence.
- Nemotron 3 Ultra : environ 500 milliards de paramètres, dont 50 milliards actifs, destiné à servir de moteur de raisonnement à grande échelle pour les processus complexes de planification et de recherche.
Seul Nano est disponible aujourd’hui (à télécharger ici). Super et Ultra sont attendus au premier semestre 2026.
Ce qui réunit les trois modèles est une architecture hybride de mélange d’experts latent (MoE), qui permet au modèle d’activer uniquement les paramètres nécessaires à une tâche donnée. Cette conception améliore considérablement le débit et réduit les coûts d’inférence — un facteur de plus en plus critique à mesure que les agents « réfléchissent plus longtemps » et génèrent davantage de tokens de raisonnement.
Une avancée majeure en matière d’efficacité des tokens
Selon Nvidia, Nemotron 3 Nano offre un débit de tokens jusqu’à 4 fois supérieur à celui de Nemotron 2 Nano, tout en réduisant jusqu’à 60 % la génération de tokens de raisonnement. Il prend également en charge une fenêtre de contexte d’un million de tokens, ce qui permet aux agents de raisonner sur des bases de code entières, de longs documents ou de vastes journaux système sans perdre en cohérence.
Des benchmarks indépendants d’Artificial Analysis viennent étayer ces affirmations.
Dans une comparaison entre intelligence et vitesse de production, Nemotron 3 Nano se situe fermement dans le quadrant le plus séduisant — combinant de grandes capacités de raisonnement à un débit de tokens exceptionnel. Parmi les modèles ouverts de taille comparable, il offre le plus grand nombre de tokens produits par seconde, devançant nettement les modèles de Meta, Mistral, DeepSeek et d’autres concurrents.
Un classement distinct de la vitesse de production montre que Nemotron 3 Nano génère environ 377 tokens par seconde, devant le gpt-oss-20B (high) d’OpenAI et très loin devant la plupart des autres modèles ouverts. Pour les systèmes multi-agents susceptibles d’exécuter des dizaines — voire des centaines — d’agents simultanément, cet écart se traduit rapidement par de véritables économies d’infrastructure.
L’ouverture sans compromis
L’efficacité seule ne suffit pas. Historiquement, les développeurs qui choisissaient des modèles ouverts étaient contraints de faire des compromis — sacrifier l’intelligence au profit de la vitesse, ou accepter des chaînes d’entraînement opaques qui rendaient les déploiements en entreprise risqués.
L’Openness Index et l’Intelligence Index d’Artificial Analysis montrent pourquoi Nemotron 3 Nano se distingue. Le modèle figure parmi les plus ouverts tout en se classant dans le haut du tableau en matière d’intelligence, une combinaison qui reste rare alors même que l’IA open source gagne en maturité.
Cette ouverture va au-delà des poids du modèle. Nvidia publie :
- Trois mille milliards de tokens de nouvelles données de pré-entraînement, de post-entraînement et d’apprentissage par renforcement
- Un jeu de données de sécurité agentique à grande échelle, fondé sur des données de télémétrie du monde réel
- NeMo Gym et NeMo RL, des bibliothèques et environnements ouverts d’apprentissage par renforcement
- NeMo Evaluator, pour valider les performances et la sécurité des modèles
L’ensemble est disponible sur GitHub et Hugging Face. L’objectif n’est pas seulement la transparence, mais aussi la reproductibilité — afin que les équipes puissent avoir la certitude de comprendre sur quoi le modèle a été entraîné et comment l’adapter en toute sécurité.
L’apprentissage par renforcement à grande échelle
L’un des changements les moins visibles, mais les plus lourds de conséquences, de Nemotron 3 concerne la manière dont il a été entraîné.
Les générations précédentes s’appuyaient largement sur un réglage fin supervisé, avec un recours limité à l’apprentissage par renforcement. Nemotron 3 change cet équilibre. Nvidia a appliqué un apprentissage par renforcement simultané dans plusieurs environnements, à grande échelle, en entraînant les modèles sur un ensemble diversifié d’environnements afin d’améliorer le suivi des instructions, l’efficacité du raisonnement et la prise de décision sur de longues séquences.
Le résultat, selon les évaluations internes et de tierces parties, est une nette amélioration des performances de raisonnement par rapport aux précédents modèles Nemotron — sans augmentation proportionnelle du coût d’inférence. C’est important pour les agents qui doivent réfléchir, réviser leurs plans et se coordonner avec d’autres agents sous des contraintes de temps réel.
Conçu pour des systèmes de modèles
Un thème central de l’annonce de Nemotron 3 est qu’aucun modèle unique ne suffit.
Dans les déploiements réels, les entreprises combinent de plus en plus des modèles propriétaires de pointe avec des modèles ouverts rapides et spécialisés. Nemotron est conçu pour s’intégrer directement à ces systèmes. Les développeurs peuvent orienter dynamiquement les tâches — utiliser Nemotron pour la synthèse, la recherche documentaire, le débogage de code ou le raisonnement propre à un domaine, et ne transmettre que les problèmes les plus difficiles aux modèles plus coûteux.
Cette approche apparaît déjà en production. Des entreprises comme Perplexity utilisent des routeurs d’agents pour diriger chaque charge de travail vers le modèle le plus approprié. D’autres, comme ServiceNow, CrowdStrike et Siemens, intègrent des modèles Nemotron pour alimenter des processus d’IA propres à certains domaines, dans les opérations informatiques, la cybersécurité et les systèmes industriels.
IA souveraine et localisation
Nemotron 3 s’inscrit également dans l’ambition plus large de Nvidia en matière d’IA souveraine — l’idée que les pays et les organisations doivent pouvoir créer des systèmes d’IA adaptés à leurs propres langues, données et valeurs.
En publiant des jeux de données et des outils d’entraînement ouverts, Nvidia permet aux gouvernements et aux entreprises d’affiner les modèles Nemotron sur des données locales, de traduire les jeux de données de raisonnement dans des langues sous-représentées et de déployer des systèmes conformes aux exigences réglementaires régionales.
Cette approche a déjà été utilisée pour soutenir des modèles dans des langues nationales et des initiatives d’IA localisées, notamment en Europe et en Asie, où la souveraineté des données suscite une préoccupation croissante.
L’infrastructure compte
Les gains d’efficacité de Nemotron 3 sont étroitement liés à la feuille de route matérielle de Nvidia.
Nemotron 3 Super et Ultra sont entraînés avec NVFP4, un format d’entraînement sur 4 bits optimisé pour l’architecture Blackwell de NVIDIA. Cela réduit considérablement les besoins en mémoire et accélère l’entraînement, sans les pénalités de précision traditionnellement associées aux formats de précision inférieure.
Pour l’inférence, Nemotron 3 Nano peut fonctionner sur un matériel relativement modeste, notamment des GPU comme le L40S, ce qui le rend accessible aux entreprises qui veulent de solides performances de raisonnement sans investir dans une infrastructure massive. En parallèle, il s’adapte efficacement aux centres de données accélérés par NVIDIA pour les organisations qui exécutent de vastes flottes d’agents.
Disponibilité et prise en charge par l’écosystème
Nemotron 3 Nano est disponible dès aujourd’hui via :
- Hugging Face
- Des fournisseurs d’inférence comme Baseten, Deepinfra, Fireworks, FriendliAI, OpenRouter et Together AI
- Des plateformes d’entreprise, notamment Couchbase, DataRobot, H2O.ai, JFrog, Lambda et UiPath
- AWS via Amazon Bedrock (sans serveur), avec une prise en charge élargie des services cloud prochainement
Il est également proposé sous forme de microservice Nvidia NIM, permettant un déploiement sécurisé et portable sur l’infrastructure Nvidia.
L’écosystème Nemotron au sens large est pris en charge par des frameworks d’inférence populaires comme llama.cpp, vLLM et SGLang, tandis que des intégrations de l’apprentissage par renforcement sont en cours avec des partenaires tels que Prime Intellect et Unsloth.
Ce que Nemotron 3 annonce
Nemotron 3 n’est pas une tentative de Nvidia de construire des modèles plus performants que ceux de pointe d’OpenAI ou d’autres acteurs. Il reflète plutôt une conviction stratégique : la prochaine phase de l’IA sera architecturale, et pas seulement paramétrique.
À mesure que les agents gagnent en autonomie et que les charges de travail se complexifient, l’efficacité, la transparence et la composabilité comptent autant que l’intelligence brute. Nemotron 3 montre ce qui se produit lorsque ces contraintes sont considérées comme des objectifs de conception de premier ordre.
Les benchmarks indépendants semblent indiquer que Nvidia tient cette promesse — en particulier dans le bas du spectre des tailles de modèles, où l’efficacité des tokens peut faire ou défaire des déploiements réels.
Si Nemotron 3 Super et Ultra étendent ces gains au raisonnement à grande échelle en 2026, Nvidia pourrait avoir positionné les modèles ouverts non pas comme un compromis — mais comme la colonne vertébrale de la pile d’IA agentique.
Note de la rédaction : ce contenu a d’abord été publié dans la newsletter de notre publication sœur, The Neuron. Pour lire davantage de contenus de The Neuron, inscrivez-vous ici à sa newsletter.

