Mistral öffnet sein neuestes KI-Flaggschiffmodell für Unternehmenstests, bevor die vollständige Veröffentlichung abgeschlossen ist.
Das Unternehmen hat am 6. Oktober die öffentliche API-Vorschau von Large 4 für Aufgaben mit mehreren Schritten und Anwendungen eröffnet. Das Unternehmen erklärt, dass herunterladbare Gewichte und weitere technische Details bis Ende Oktober folgen werden.
Unternehmensteams müssen nun beurteilen, ob sich diese Fähigkeiten in ihren eigenen Systemen in bessere Arbeit übersetzen lassen. Leistung, Kontrolle und Kosten werden bestimmen, wie weit das neue Modell über die Testphase hinauskommt.
Arbeitsplatztests gehen über Chatbot-Eingaben hinaus
Mistral Large 4, den das Unternehmen Le Chonk getauft hat, wird an Aufgaben getestet, die mehrere Schritte statt nur einer Eingabe und einer Antwort erfordern. Ergebnisse des Unternehmens decken Arbeitsabläufe in Geschäftsanwendungen, der Softwareentwicklung und der Sicherheit ab.
- Geschäftssoftware. Large 4 erzielte bei AutomationBench, das 657 Workflows mit Anwendungen wie Gmail und Salesforce umfasst, 59,9 %. Der Test misst, ob ein KI-System eine Abfolge von Aufgaben in Arbeitsplatzsoftware ausführen kann.
- Coding. Bei den Ergebnissen wurden 49,8 % im Coding Agent Index und 61,7 % bei DeepSWE v1.1 erreicht. Beide Evaluierungen testen, wie gut ein KI-System Softwareentwicklungsaufgaben mit mehreren Schritten bearbeitet.
- Cybersicherheit. Large 4 erzielte bei einer Evaluierung, bei der eine reale Softwareschwachstelle reproduziert und anschließend behoben wurde, 82 %. Das Unternehmen meldete außerdem eine Resistenz von 93,3 % bei einem Test, der versucht, ein KI-System dazu zu bringen, bösartigen Anweisungen zu folgen.
Auch professionelle Arbeit gehört zum Funktionsumfang. Das Tool kann Tabellen und Dokumente bearbeiten und mit visuellen Inhalten arbeiten. Beim AA-Briefcase-Test für umfangreiche Wissensarbeitsaufgaben erreichte es 1.393 Elo.
Sicherheitswerte allein belegen nicht, ob eine von einer KI erzeugte Fehlerbehebung sich in der Produktion sicher verhält. Untersuchungen zu von KI erzeugten Fehlerbehebungen haben ergeben, dass das Schließen eines Exploits nicht garantiert, dass der Patch das normale Softwareverhalten bewahrt. Unternehmen, die Large 4 für Sicherheitsaufgaben testen, sollten erzeugte Fehlerbehebungen gegen das erwartete Verhalten der Anwendung prüfen, bevor sie automatisierte Änderungen in der Produktion zulassen.
Geplante herunterladbare Gewichte würden Self-Hosting ermöglichen
Large 4 wurde von Grund auf auf 3.800 Nvidia Grace Blackwell GPUs in Rechenzentren in ganz Europa trainiert. Der Datenverkehr der Vorschau-API läuft auf einer von dem KI-Unternehmen betriebenen Infrastruktur, das außerdem einen regionalen, dem europäischen Recht unterliegenden Einsatz plant. Regionale Infrastruktur ist Teil seiner KI-Strategie.
Herunterladbare Gewichte ermöglichen es Sicherheitsorganisationen, das Modell unter internen Richtlinien in einer privaten Cloud oder in den eigenen Räumlichkeiten zu betreiben. Unternehmen, die mit sensiblem Code oder proprietären Dokumenten arbeiten, könnten so besser kontrollieren, wo KI-Arbeit ausgeführt wird. Der interne Betrieb eines Modells bringt jedoch auch Kosten für Hardware, Personal und Wartung mit sich, die bei einer gehosteten API beim Anbieter liegen.
Einige Informationen, die für die Planung eines internen Einsatzes benötigt werden, etwa Details zur Architektur und Informationen zum Training nach der Vortrainingsphase, stehen noch aus. Teams, die den Markt für KI mit offenen Gewichtenbeobachten, können die gehostete Version jetzt testen, doch die Dimensionierung der eigenen Infrastruktur hängt von den verbleibenden technischen Details ab.
Was eWeek herausgefunden hat: Large 4 erweitert den Kontext und erhöht zugleich die API-Preise
eWeek hat Large 3 und Large 4 verglichen. Large 4 bietet etwa die 3,9-fache Kontextkapazität, während die regulären Preise für Eingaben und Ausgaben um etwa 172 % beziehungsweise 179 % steigen. Die Tabelle verwendet die in der Ankündigung zum Start genannten 49 Milliarden aktiven Parameter; in Mistrals Model Card werden 52 Milliarden angegeben, was gegenüber Large 3 auf einen Anstieg von etwa 27 % statt 20 % hindeutet.
| Messgröße | Large 3 | Large 4 | Differenz |
| Parameter insgesamt | 675 Milliarden | 1,05 Billionen | Etwa 56 % höher |
| Aktive Parameter pro Token | 41 Milliarden | 49 Milliarden | Etwa 20 % höher |
| Maximaler Kontext | 256.000 Token | 1 Million Token | Etwa 3,9-fach |
| Regulärer Eingabepreis pro 1 Million Token | $0.50 | $1.36 | Etwa 172 % höher |
| Regulärer Ausgabepreis pro 1 Million Token | $1.50 | $4.18 | Etwa 179 % höher |
Ein Mixture-of-Experts-Modell verwendet für jedes verarbeitete Token nur einen Teil seines gesamten Parameterbestands. Aktive Parameter geben an, wie viel von diesem Netzwerk bei jedem Schritt beteiligt ist. Large 4 wächst daher bei der Gesamtgröße deutlich, ohne dass die aktiven Parameter im gleichen Maß zunehmen, wobei sich aus der Anzahl der Parameter allein weder Geschwindigkeit noch Speicherbedarf oder Bereitstellungskosten ableiten lassen.
Die Kontextkapazität steigt von 256.000 Token auf 1 Million. Ein Team könnte eine längere Vertragsdatei oder ein größeres Code-Repository in einer Anfrage übermitteln, bevor das Limit erreicht ist. Größere Eingaben können jedoch auch mehr abrechenbare Eingabetoken bedeuten, sodass der Zugriff auf ein größeres Kontextfenster die Ausgaben erhöhen kann, wenn Teams es intensiv nutzen.
Ein zweiwöchiger Einführungsrabatt senkt die Preise für Large 4 vorübergehend auf 0,68 US-Dollar pro Million Eingabetoken und 2,09 US-Dollar pro Million Ausgabetoken. Teams, die ein Upgrade auf ein Unternehmensmodell erwägen, sollten dieselbe repräsentative Aufgabe durch beide Versionen laufen lassen und anschließend Abschlussquote und endgültige API-Kosten zusammen mit Tokenverbrauch und Latenz vergleichen.
Selbst während des Einführungsrabatts liegt der Eingabepreis von Large 4 um 36 % und der Ausgabepreis um etwa 39 % über dem von Large 3. Unternehmensteams sollten die Kosten pro erfolgreich abgeschlossener Aufgabe vergleichen: Weniger Wiederholungen oder Aufrufe könnten die höheren Tarife ausgleichen, doch das muss anhand repräsentativer Unternehmens-Workloads nachgewiesen werden.
Weitere KI-Nachrichten: Wikimedia erklärt, dass starker Datenverkehr durch mutmaßliche OpenAI-Agenten seine Infrastruktur belastet hat, konnte jedoch nicht feststellen, dass die Agenten den Ausfall verursacht haben.


