Mistral ouvre son nouveau modèle d’IA phare aux tests des entreprises avant d’avoir achevé sa sortie complète.
L’entreprise a ouvert le 6 octobre la préversion publique de l’API de Large 4 pour des tâches couvrant plusieurs étapes et applications. Elle indique que les poids téléchargeables et d’autres détails techniques suivront d’ici la fin octobre.
Les équipes d’entreprise doivent désormais déterminer si ces capacités se traduisent par un meilleur travail au sein de leurs propres systèmes. Les performances, le contrôle et le coût détermineront jusqu’où le nouveau modèle dépassera le stade des tests.
Les tests en entreprise dépassent les simples prompts de chatbot
Mistral Large 4, que l’entreprise a surnommé Le Chonk, est testé sur des tâches qui nécessitent plusieurs étapes plutôt qu’un seul prompt et une seule réponse. Résultats de l’entreprise couvrent le travail dans les applications métier, le développement logiciel et la sécurité.
- Logiciels d’entreprise. Large 4 a obtenu 59,9 % à AutomationBench, qui couvre 657 workflows utilisant des applications comme Gmail et Salesforce. Le test mesure la capacité d’un système d’IA à exécuter une suite de tâches dans différents logiciels professionnels.
- Codage. Les résultats ont atteint 49,8 % sur le Coding Agent Index et 61,7 % sur DeepSWE v1.1. Ces deux évaluations testent la capacité d’un système d’IA à mener à bien des tâches de développement logiciel comportant plusieurs étapes.
- Cybersécurité. Large 4 a obtenu 82 % lors d’une évaluation portant sur la reproduction d’une vulnérabilité logicielle réelle, suivie de sa correction. L’entreprise a également fait état d’un taux de résistance de 93,3 % lors d’un test visant à inciter un système d’IA à suivre des instructions malveillantes.
Le travail professionnel fait également partie de cette sortie. L’outil peut modifier des feuilles de calcul et des documents, et travailler avec du contenu visuel. Son résultat AA-Briefcase a atteint 1 393 Elo lors d’une évaluation de missions prolongées de connaissance.
Les seuls scores de sécurité ne permettent pas d’établir si une correction générée par l’IA se comportera de manière sûre en production. Des recherches sur les corrections de vulnérabilités générées par l’IAont montré que la fermeture d’une faille ne garantissait pas que le correctif préserve le comportement normal du logiciel. Les entreprises qui testent Large 4 pour des tâches de sécurité devraient vérifier les corrections générées par rapport au comportement attendu de l’application avant d’autoriser des modifications automatisées en production.
Les poids téléchargeables prévus permettraient l’auto-hébergement
Large 4 a été entraîné à partir de zéro sur 3 800 GPU Nvidia Grace Blackwell répartis dans des centres de données en Europe. Le trafic de l’API en préversion passe par une infrastructure exploitée par l’entreprise d’IA, qui prévoit également un déploiement régional régi par le droit européen. L’infrastructure régionale s’inscrit dans sa stratégie d’IA
Les poids téléchargeables permettront aux organisations de sécurité d’exécuter le modèle dans un cloud privé ou sur leurs propres sites, conformément à leurs politiques internes. Les entreprises qui traitent du code sensible ou des documents propriétaires pourraient conserver davantage de contrôle sur le lieu d’exécution des tâches d’IA. L’exploitation d’un modèle en interne implique également des coûts de matériel, de personnel et de maintenance qu’une API hébergée laisse à la charge du fournisseur.
Certaines informations nécessaires à la planification d’un déploiement interne, comme les détails de l’architecture et les informations sur le post-entraînement, sont encore attendues. Les équipes qui suivent le marché de l’IA à poids ouvertspeuvent tester la version hébergée dès maintenant, mais le dimensionnement de leur propre infrastructure dépendra des détails techniques restants.
Ce qu’a constaté eWeek : Large 4 élargit le contexte tout en augmentant les tarifs de l’API
eWeek a comparé Large 3 et Large 4. Large 4 offre une capacité de contexte environ 3,9 fois supérieure, tandis que les tarifs habituels des entrées et des sorties augmentent respectivement d’environ 172 % et 179 %. Le tableau utilise les 49 milliards de paramètres actifs annoncés au lancement ; la fiche de modèle de Mistral en indique 52 milliards, ce qui implique une hausse d’environ 27 %, et non 20 %, par rapport à Large 3.
| Mesure | Large 3 | Large 4 | Différence |
| Nombre total de paramètres | 675 milliards | 1,05 billion | Environ 56 % de plus |
| Paramètres actifs par token | 41 milliards | 49 milliards | Environ 20 % de plus |
| Contexte maximal | 256 000 tokens | 1 million de tokens | Environ 3,9 fois plus |
| Tarif habituel des entrées par million de tokens | $0.50 | $1.36 | Environ 172 % de plus |
| Tarif habituel des sorties par million de tokens | $1.50 | $4.18 | Environ 179 % de plus |
Un modèle à mixture d’experts n’utilise qu’une partie de son ensemble total de paramètres pour chaque token traité. Les paramètres actifs indiquent quelle part du réseau participe à chaque étape. Large 4 augmente donc considérablement sa taille totale sans hausse équivalente du nombre de paramètres actifs, même si les seuls nombres de paramètres ne permettent pas d’établir la vitesse, l’utilisation mémoire ou le coût de service.
La capacité de contexte passe de 256 000 tokens à 1 million. Une équipe pourrait envoyer un contrat plus long ou un dépôt de code plus volumineux en une seule requête avant d’atteindre la limite. Des prompts plus volumineux peuvent également signifier davantage de tokens d’entrée facturables ; l’accès à une fenêtre de contexte plus large peut donc accroître les dépenses lorsque les équipes l’utilisent intensivement.
Une remise de lancement de deux semaines réduit temporairement le tarif de Large 4 à 0,68 $ par million de tokens d’entrée et à 2,09 $ par million de tokens de sortie. Les équipes qui envisagent un passage à un modèle d’entreprisedevraient exécuter la même tâche représentative avec les deux versions, puis comparer le taux de réussite et le coût final de l’API en fonction de l’utilisation des tokens et de la latence.
Même pendant la remise de lancement, le tarif des entrées de Large 4 est supérieur de 36 % et celui des sorties d’environ 39 % à ceux de Large 3. Les équipes d’entreprise devraient comparer le coût par tâche menée à bien : un nombre réduit de nouvelles tentatives ou d’appels pourrait compenser les tarifs plus élevés, mais cela doit être démontré sur des charges de travail représentatives de l’entreprise.
Plus d’actualités IA : Wikimedia indique qu’un trafic intense provenant d’agents OpenAI présumés a mis son infrastructure à rude épreuve, même si l’entreprise n’a pas établi que ces agents étaient à l’origine de la panne.


