L’IA de codage locale de Microsoft n’a aucuns frais d’inférence, mais recommande plus de 120 Go de RAM

Écrit par
eWEEK Staff
eWEEK Staff
Oct 8, 2026
4 minute read
Microsoft Surface Laptop Ultra, a high-memory workstation supporting Microsoft local coding AI and MAI-Code-1.1-Flash inference

Microsoft’s local coding AI eliminates per-call inference fees, but its 120GB-plus RAM recommendation makes hardware costs a key consideration for enterprises. Image: Microsoft

eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

L’IA de codage de Microsoft peut fonctionner en local sans frais d’inférence à chaque appel, mais obtenir les meilleures performances pourrait nécessiter une coûteuse mise à niveau matérielle.

Le 7 octobre, Microsoft a annoncé que les développeurs pouvaient télécharger et exécuter MAI-Code-1.1-Flash sur leurs propres ordinateurs sans payer de frais d’inférence en local. L’entreprise recommande plus de 120 Go de RAM pour des performances optimales, soit davantage que la capacité mémoire de nombreux postes de travail de développeurs.

Pour les entreprises, cette version ouvre le choix entre des dépenses récurrentes liées au cloud et des coûts matériels initiaux. L’intégration prévue par Microsoft à GitHub Copilot soulève également des questions concernant l’emplacement des charges de travail et la protection du code propriétaire.

L’IA de codage locale exige un matériel doté d’une grande quantité de mémoire

Selon l’analyse technique de Microsoft, MAI-Code-1.1-Flash utilise une architecture à mélange d’experts comptant 137 milliards de paramètres au total, dont 6,8 milliards sont actifs pour chaque jeton. Sa version quantifiée occupe 53 Go, soit environ 80 % de moins que le modèle cloud en pleine précision.

Les tests effectués sur un Surface Laptop Ultra ont enregistré une utilisation maximale de 75,5 Go de mémoire avec la fenêtre de contexte maximale de 256 000 jetons. Microsoft recommande plus de 120 Go de RAM pour des performances optimales.

Ces chiffres correspondent à des mesures différentes. La taille du modèle n’est pas équivalente à la consommation mémoire en fonctionnement, et les processus du système d’exploitation ainsi que les outils de développement nécessitent une capacité supplémentaire. Microsoft n’a pas établi 120 Go comme minimum obligatoire.

Dans les benchmarks publiés par Microsoft le 5 octobre, le modèle quantifié a obtenu 70,8 % à SWE-bench Verified, contre 72,6 % pour la version en pleine précision. À Terminal-Bench 2.1, il a obtenu 66,29 %, contre 62,9 % pour le modèle plus volumineux.

Les résultats communiqués par l’entreprise suggèrent que la quantification a préservé une grande partie des performances du modèle sur ces benchmarks, même si des tests indépendants sont nécessaires pour évaluer sa fiabilité dans les différentes charges de travail des entreprises.

Advertisement

L’absence de frais d’inférence reporte les coûts sur le matériel

L’inférence en local élimine les frais par appel, mais pas les dépenses d’infrastructure. Les organisations doivent toujours prendre en compte le matériel, l’électricité, la maintenance et, éventuellement, des abonnements distincts ou l’utilisation du cloud. Les services concurrents, notamment l’agent de codage Muse Code de Meta, proposent une tarification à l’usage qui offre aux entreprises un autre modèle de coûts à évaluer.

Le Surface Laptop Ultra de Microsoft, utilisé pour ses tests, intègre un matériel NVIDIA RTX Spark et prend en charge jusqu’à 128 Go de mémoire unifiée. L’ordinateur portable est proposé à partir de 2 599 $, bien que ce prix n’inclue pas la configuration dotée de la mémoire maximale.

Une intégration expérimentale à l’application GitHub Copilot, à l’interface CLI et à Visual Studio Code est prévue d’ici fin octobre 2026. Les développeurs pourront sélectionner l’inférence en local ou utiliser un routage automatique entre les modèles exécutés sur l’appareil et ceux du cloud.

Le routage vers le cloud soulève des enjeux de gouvernance pour le code propriétaire, tandis que l’exécution en local introduit d’autres risques. Lors d’une démonstration, un dépôt GitHub malveillant a incité un assistant de codage à exécuter des commandes qui ont ouvert un shell inversé.

Microsoft met en place des contrôles de bac à sable pour les commandes exécutées par les agents, mais les organisations doivent toujours gérer l’accès aux fichiers, les identifiants et les autorisations réseau. Les défenses des entreprises contre les agents d’IA malveillants comprennent notamment l’accès selon le principe du moindre privilège, les restrictions d’exécution et la surveillance de l’activité.

Ce qu’eWeek a constaté

Les spécifications de Microsoft mettent en évidence l’investissement en infrastructure nécessaire à l’inférence locale sans frais. Les organisations qui disposent déjà de stations de travail dotées d’une grande quantité de mémoire pourront éviter d’acheter du matériel supplémentaire, mais les autres devront engager des coûts initiaux importants.

Les économies réelles dépendent de la fréquence des charges de travail, de l’utilisation du matériel et des exigences de gouvernance. Les entreprises doivent comparer ces facteurs à l’utilisation du cloud avant de considérer l’absence de frais d’inférence comme une option moins coûteuse.

Advertisement

Vous voulez en savoir plus sur les conseils, astuces et techniques de formulation de requêtes pour l’IA ? Laissez-nous vous apprendreComment parler à l’IA gratuitement ! Suivez notre cours de six minutes à The Neuron Academy, notre plateforme d’apprentissage pratique conçue pour aider les professionnels à utiliser l’IA avec davantage d’assurance au travail.

Apprenez quelques méthodes simples pour rédiger de meilleures requêtes et obtenir des résultats plus utiles de l’IA, ou découvrez gratuitement pendant sept jours notre autre cours sur l’IA. Les lecteurs d’eWeek bénéficient d’un accès gratuit de 7 jours. Découvrez toutes les leçons ici →

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.