Microsofts lokale KI zum Programmieren verursacht keine Inferenzgebühren, empfiehlt aber mehr als 120 GB RAM

Verfasst von
eWEEK Staff
eWEEK Staff
Oct 8, 2026
3 minute read
Microsoft Surface Laptop Ultra, a high-memory workstation supporting Microsoft local coding AI and MAI-Code-1.1-Flash inference

Microsoft’s local coding AI eliminates per-call inference fees, but its 120GB-plus RAM recommendation makes hardware costs a key consideration for enterprises. Image: Microsoft

eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Microsofts KI zum Programmieren kann lokal ohne Inferenzgebühren pro Aufruf ausgeführt werden, doch für die beste Leistung könnte ein kostspieliges Hardware-Upgrade erforderlich sein.

Am 7. Oktober gab Microsoft bekannt, dass Entwickler MAI-Code-1.1-Flash herunterladen und auf ihren eigenen Computern ausführen können, ohne lokale Inferenzgebühren zu zahlen. Für eine optimale Leistung empfiehlt das Unternehmen mehr als 120 GB RAM – mehr, als viele Entwickler-Workstations bieten.

Für Unternehmen bedeutet die Veröffentlichung eine Wahl zwischen wiederkehrenden Cloud-Ausgaben und den Anschaffungskosten für Hardware. Microsofts geplante Integration in GitHub Copilot wirft außerdem Fragen zur Platzierung von Workloads und zum Schutz proprietären Codes auf.

Lokale KI zum Programmieren stellt hohe Anforderungen an den Arbeitsspeicher

Laut der technischen Analyse von Microsoft nutzt MAI-Code-1.1-Flash eine Mixture-of-Experts-Architektur mit insgesamt 137 Milliarden Parametern, von denen pro Token 6,8 Milliarden aktiv sind. Die quantisierte Version belegt 53 GB und damit etwa 80 % weniger als das Cloud-Modell mit voller Präzision.

Bei einem Test auf einem Surface Laptop Ultra wurden im maximalen Kontextfenster von 256.000 Tokens 75,5 GB Spitzenverbrauch des Arbeitsspeichers gemessen. Microsoft empfiehlt mehr als 120 GB RAM für eine optimale Leistung.

Die Zahlen beziehen sich auf unterschiedliche Messwerte. Die Modellgröße entspricht nicht dem Speicherverbrauch zur Laufzeit, und Prozesse des Betriebssystems sowie Entwicklungstools benötigen zusätzliche Kapazität. Microsoft hat 120 GB nicht als verbindliches Minimum festgelegt.

In Microsofts Benchmarks vom 5. Oktober erzielte das quantisierte Modell bei SWE-bench Verified 70,8 %, verglichen mit 72,6 % für die Version mit voller Präzision. Bei Terminal-Bench 2.1 erreichte es 66,29 %, gegenüber 62,9 % für das größere Modell.

Die vom Unternehmen gemeldeten Ergebnisse deuten darauf hin, dass die Quantisierung einen Großteil der Modellleistung in diesen Benchmarks erhalten hat. Um die Zuverlässigkeit bei verschiedenen Unternehmens-Workloads zu beurteilen, sind jedoch unabhängige Tests erforderlich.

Advertisement

Keine Inferenzgebühren verlagern die Kosten auf die Hardware

Lokale Inferenz beseitigt Gebühren pro Aufruf, nicht aber die Infrastrukturkosten. Unternehmen müssen weiterhin Hardware, Strom, Wartung und möglicherweise separate Abonnements oder Cloud-Nutzung berücksichtigen. Konkurrenzangebote wie Muses Code-Programmieragent von Meta bieten nutzungsabhängige Preise und damit ein weiteres Kostenmodell, das Unternehmen bewerten können.

Microsofts Surface Laptop Ultra, der bei den Tests zum Einsatz kam, verfügt über NVIDIA-RTX-Spark-Hardware und unterstützt bis zu 128 GB Unified Memory. Der Laptop ist ab 2.599 US-Dollar erhältlich, wobei dieser Preis nicht die Konfiguration mit maximalem Arbeitsspeicher umfasst.

Eine experimentelle Integration in die GitHub-Copilot-App, die CLI und Visual Studio Code ist bis Ende Oktober 2026 geplant. Entwickler werden zwischen lokaler Inferenz und einer automatischen Weiterleitung zwischen Modellen auf dem Gerät und in der Cloud wählen können.

Die Weiterleitung in die Cloud schafft Governance-Fragen im Umgang mit proprietärem Code, während die lokale Ausführung eigene Risiken mit sich bringt. In einer Demonstration veranlasste ein bösartiges GitHub-Repository einen Programmierassistenten dazu, Befehle auszuführen, die eine Reverse Shell öffneten.

Microsoft führt Sandbox-Kontrollen für von Agenten ausgeführte Befehle ein, doch Unternehmen müssen weiterhin den Dateizugriff, Zugangsdaten und Netzwerkberechtigungen verwalten. Zu den umfassenderen Schutzmaßnahmen für Unternehmen gegen bösartige KI-Agenten gehören Zugriffe nach dem Prinzip der geringsten Privilegien, Ausführungsbeschränkungen und Aktivitätsüberwachung.

Was eWeek herausgefunden hat

Microsofts Spezifikationen verdeutlichen, welche Infrastrukturinvestitionen hinter der gebührenfreien lokalen Inferenz stehen. Unternehmen mit vorhandenen Workstations mit großem Arbeitsspeicher können möglicherweise auf neue Hardwareanschaffungen verzichten, während andere mit erheblichen Vorabkosten konfrontiert sind.

Die tatsächlichen Einsparungen hängen von der Häufigkeit der Workloads, der Hardwareauslastung und den Governance-Anforderungen ab. Unternehmen müssen diese Faktoren mit der Cloud-Nutzung vergleichen, bevor sie keine Inferenzgebühren vorschnell als kostengünstigere Option betrachten.

Advertisement

Möchten Sie mehr über KI-Tipps, Tricks und Prompting-Techniken erfahren? Wir zeigen IhnenWie man mit KI spricht kostenlos! Testen Sie unseren sechsminütigen Kurs bei The Neuron Academy, unserer praxisorientierten Lernplattform, die Fachleuten helfen soll, KI bei der Arbeit sicherer einzusetzen.

Lernen Sie einige einfache Methoden kennen, um bessere Prompts zu verfassen und nützlichere Ergebnisse von KI zu erhalten, oder stöbern Sie sieben Tage lang kostenlos in unserem anderen KI-Kurs. eWeek-Leser erhalten sieben Tage kostenlosen Zugang. Hier finden Sie alle Lektionen →

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.