En quête de vitesse : Mercury 2 est 13 fois plus rapide que Claude Haiku

The Neuron featured image on Mercury 2.

Image: The Neuron

Écrit par
Grant Harvey
Grant Harvey
Feb 25, 2026
3 minute read
eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Tous les modèles d’IA que vous avez utilisés jusqu’ici écrivent de la même manière : un mot à la fois, de gauche à droite, comme une machine à écrire. S’ils prennent une mauvaise direction dès le début, tant pis. Ils continuent de taper.

Eh bien, Inception Labs vient de lancer Mercury 2, une IA qui fonctionne de manière complètement différente :

  • Au lieu de prédire un mot après l’autre, elle commence par esquisser grossièrement la réponse dans son ensemble.
  • Puis elle affine tout en même temps, comme un éditeur qui révise un brouillon complet en parallèle.
  • Le terme technique est « LLM de diffusion » (dLLM), une technologie qui reprend la même approche fondamentale que les générateurs d’images comme Midjourney, mais appliquée au texte et au raisonnement.

Croyez-nous, la vitesse est bien réelle. Les tests indépendants menés par Artificial Analysis ont mesuré Mercury 2 à 1 196 jetons par seconde, soit plus de 3 fois la vitesse du modèle suivant le plus rapide dans sa catégorie de prix. C’est considérable si vous avez besoin de vitesse. À titre de comparaison, Claude 4.5 Haiku atteint environ 89 jetons/s et GPT-5 Mini environ 73. RIP.

Voici ce qui compte aussi

  • 0,25 dollar US par million de jetons d’entrée, 0,75 dollar US par million de jetons de sortie (une sortie moins chère que celle de GPT-5 Mini).
  • N° 18 sur 134 modèles dans l’indice d’intelligence d’Artificial Analysis, avec des points forts en programmation agentique et en suivi des instructions.
  • Il prend en charge l’utilisation d’outils, un contexte de 128 k, les sorties structurées et s’intègre à toute stack compatible avec OpenAI sans aucune réécriture.

Pour être clair : Mercury 2 ne cherche pas à détrôner les géants de pointe comme GPT-5.2 ou Claude Opus. Il est conçu pour la vitesse en production, pas pour se vanter de ses performances dans les classements.

Alors, pourquoi une vitesse 10 fois supérieure est-elle si importante ? Parce que l’IA ne se résume plus aux chatbots. Il y a les boucles agentiques, dans lesquelles une tâche enchaîne des dizaines d’appels à l’IA.

  • Andrej Karpathy (ancien chercheur chez OpenAI, responsable de l’IA chez Tesla et, notamment, investisseur d’Inception) l’a parfaitement illustré ce week-end en décrivant la nouvelle couche « Claw » de l’IA.
  • Des plateformes d’agents locales comme OpenClaw et NanoClaw qui orchestrent la planification, les appels aux outils et les workflows persistants sur votre propre machine.
  • Il les a qualifiées de « lutin domestique numérique personnel ». Nous préférons parler d’« une entité numérique non humaine (ne vous méprenez pas) qui travaille pour vous 24 h/24, 7 j/7 », mais l’idée est la même !

Dans les boucles agentiques, la latence s’accumule à chaque étape. Un modèle 10 fois plus rapide ne fait pas que gagner du temps ; il change ce que vous pouvez construire. Des assistants vocaux qui semblent naturels. Des agents de programmation qui suivent le rythme de votre pensée. Des automatisations en arrière-plan qui se terminent vraiment avant que vous n’oubliiez les avoir lancées.

Advertisement

La grande question

Si la diffusion permet à de petits modèles d’être aussi rapides sans sacrifier le raisonnement, les grands laboratoires vont-ils développer les leurs ? Nous savons déjà que Google en a un… Attendez-vous à d’autres expériences prochainement. Passer à un LLM de diffusion augmente considérablement le nombre de jetons que vous pouvez servir par GPU. Les incitations sont nombreuses. Pourquoi s’en priver ?

Découvrez le calcul des coûts de Corey pour utiliser Mercury 2 dans votre configuration OpenClaw, plongez dans notre article de fond sur la combinaison de la diffusion et d’un modèle fondé sur l’énergie, ou essayez Mercury 2 vous-même.

Note de la rédaction : cet article a d’abord été publié dans la newsletter de notre publication sœur, The Neuron. Pour découvrir d’autres articles de The Neuron, inscrivez-vous ici à sa newsletter.

Grant Harvey

Grant Harvey is the Lead Writer of The Neuron, where he continues to lead the publication's daily coverage of AI news, tools, and trends.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.