La nouvelle start-up de l’ancienne directrice technique d’OpenAI, Mira Murati, vient de publier son premier article de recherche, consacré à la correction d’un problème qui agace les ingénieurs en IA depuis le lancement de ChatGPT.
L’article de la start-up de Murati, Thinking Machines Lab (ou simplement Thinky, pour les initiés) s’intitule « Vaincre le non-déterminisme dans l’inférence des LLM » et s’attaque au problème de la « reproductibilité » des modèles de langage comme ChatGPT.
Quelques définitions avant de commencer :
- Non-déterminisme : obtenir des réponses différentes lorsqu’on pose deux fois la même question à ChatGPT avec des paramètres identiques.
- LLM : grand modèle de langage comme ChatGPT, Claude ou Gemini.
- Inférence : lorsqu’on pose une question à un modèle de langage et qu’il génère une réponse.
Le problème
Même lorsque vous réglez les modèles d’IA sur leur paramètre le plus prévisible (température = 0), vous obtenez toujours des réponses différentes à la même question. Les ingénieurs s’arrachaient les cheveux en pensant qu’il s’agissait simplement de « l’un de ces trucs informatiques » impossibles à corriger. Il s’avère qu’ils avaient tort.
La solution
La découverte est due à Horace He, un virtuose de PyTorch (le code utilisé pour l’IA) qui a récemment quitté Meta pour rejoindre l’équipe de Murati. C’est lui qui est à l’origine de torch.compile, cette fonctionnalité qui accélère de 2 à 4 fois l’exécution des modèles d’IA avec une seule ligne de code.
Horace et son équipe ont découvert que le véritable coupable n’était pas le suspect habituel — les bizarreries des calculs en virgule flottante, généralement accusées par les ingénieurs —, mais quelque chose appelé « invariance par lot ». Imaginez la situation suivante :
- Imaginez que vous commandiez le même café chez Starbucks, mais qu’il ait un goût différent selon le nombre d’autres clients dans la file. C’est essentiellement ce qui se passe avec les modèles d’IA.
- Lorsqu’un serveur d’IA est très sollicité, il traite les requêtes par lots.
- Votre requête est regroupée avec d’autres, car c’est plus efficace, et cela modifie d’une manière ou d’une autre votre réponse précise… alors que cela ne devrait pas être le cas.
- Si l’on suit cette logique, plus le serveur est sollicité, plus vos résultats varient.
Cela arrive aussi dans la vraie vie. Êtes-vous déjà allé dans votre Starbucks local pendant l’heure de pointe du café ? À moins d’avoir un barista d’un niveau divin, votre commande risque de ne pas avoir le même goût !
Pourquoi c’est important
C’est important en raison des problèmes suivants :
- Les entreprises d’IA qui effectuent des recherches ne peuvent pas reproduire leurs propres expériences de manière fiable.
- Les entreprises qui utilisent l’IA pour prendre des décisions critiques obtiennent des résultats incohérents.
- L’entraînement de nouveaux modèles d’IA devient beaucoup plus coûteux lorsqu’on ne peut pas faire confiance à ses résultats.
Thinky a publié sa solution sous la forme de code open source, conformément à la promesse de Murati selon laquelle « la science est meilleure lorsqu’elle est partagée ». L’équipe appelle son approche les « noyaux invariants par lot », ce qui revient à apprendre aux serveurs d’IA à vous servir le même café, quelle que soit la longueur de la file.
Pourquoi les géants de l’IA devraient s’inquiéter
Ce n’est que l’entrée en matière d’une équipe qui a récemment levé 2 milliards de dollars US sans même avoir de produit (même si elle en développe un, baptisé en interne « RL for businesses », qui personnalise les modèles en fonction des indicateurs métier propres à une entreprise — ce qui semble très prometteur).
Si la résolution de problèmes vieux de plusieurs décennies et jugés « impossibles à corriger » constitue leur première offensive, les géants de l’IA devraient probablement s’inquiéter (même si le code est ouvert, alors miam miam miam, comme le disent les laboratoires d’IA affamés, affamés).
Note de la rédaction : Ce contenu a d’abord été publié dans notre publication sœur, The Neuron. Pour découvrir d’autres articles de The Neuron, inscrivez-vous ici à sa newsletter.

