Mistral AIs Voxtral Transcribe 2 durchbricht die Schallmauer

Languages

Image: Adobe Stock

Verfasst von
eWEEK Staff
eWEEK Staff
Feb 5, 2026
3 minute read
eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Schallgeschwindigkeit? Klingt gut.

Das französische Unternehmen Mistral AI hat Voxtral Transcribe 2 vorgestellt, eine neue Familie von Spracherkennungsmodellen, die „mit Schallgeschwindigkeit“ transkribiert.

Voxtral Transcribe 2 umfasst zwei Speech-to-Text-Modelle mit hoher Transkriptionsqualität, Sprechererkennung und extrem geringer Latenz. Zur Familie gehören Voxtral Mini Transcribe V2 für die Stapelverarbeitung von Transkriptionen und Voxtral Realtime für Live-Anwendungen.

Laut Mistral, verwendet Voxtral Realtime „eine neuartige Streaming-Architektur, die Audiodaten transkribiert, sobald sie eintreffen“, statt Offline-Modelle anzupassen. Dadurch lässt sich die Latenz „bis auf unter 200 ms konfigurieren“ – ein Schwellenwert, der für Sprachassistenten, Live-Untertitel und konversationelle KI.

Produktstrategie

Das Unternehmen gab außerdem bekannt, dass Voxtral Realtime als Open Weights unter der Apache-2.0-Lizenz veröffentlicht wird. Dadurch können Unternehmen das Modell auf ihrer eigenen Infrastruktur bereitstellen, einschließlich Edge-Geräten. Das hat erhebliche Auswirkungen auf datenschutzsensible Branchen wie das Gesundheitswesen, das Finanzwesen und Behörden, in denen die Übermittlung von Audiodaten an Drittanbieter-Clouds häufig eingeschränkt ist.

Diese Betonung von Open Source und Integration ist kein Zufall. Da sich Unternehmen zunehmend Sorgen über die Abhängigkeit von einzelnen Anbietern und die Datensouveränität machen, positioniert sich Mistral als Alternative zu geschlossenen, in den USA ansässigen KI-Plattformen.

Beim Preis spricht das Unternehmen Klartext. Abgerechnet wird nutzungsbasiert, beginnend bei rund 5.000 € pro Monat (5.896 US-Dollar). Das signalisiert, dass Mistral mittelgroße bis große Unternehmen und nicht einzelne Entwickler ins Visier nimmt, seine Dienste aber dennoch als kostengünstig positioniert.

Leistung

Mistral zufolge erreicht Voxtral Mini Transcribe V2 „eine Wortfehlerrate von ungefähr 4 % bei FLEURS“ zu einem Preis von „0,003 US-Dollar/Min.“, was das Unternehmen als „das beste Preis-Leistungs-Verhältnis aller Transkriptions-APIs“ bezeichnet.

Das Unternehmen gibt an, dass das Modell die Angebote GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal und Deepgram Nova bei der Genauigkeit übertrifft und Audiodaten „etwa 3-mal schneller als ElevenLabs’ Scribe v2“ bei „einem Fünftel der Kosten“ verarbeitet.

Sollten sich diese Angaben unabhängig bestätigen, könnten sie einen Markt umkrempeln, in dem die Preise für Speech-to-Text bislang relativ hoch geblieben sind – insbesondere bei mehrsprachigen Transkriptionen und der Sprechererkennung. Niedrigere Kosten machen es wirtschaftlich sinnvoll, große Mengen an Besprechungen, Anrufen und Medienarchiven zu transkribieren, deren Verarbeitung zuvor zu teuer war.

Advertisement

Ideen für Unternehmen

Über die reine Transkription hinaus bietet Voxtral Mini Transcribe V2 Funktionen, die klar auf den Einsatz in Unternehmen abzielen. Dazu gehören die Sprechererkennung mit präzisen Zeitstempeln, eine Kontextgewichtung für domänenspezifischen Wortschatz, Zeitstempel auf Wortebene sowie eine höhere Robustheit in lauten Umgebungen wie „Produktionshallen“ und „stark frequentierten Callcentern“.

Das Modell unterstützt Aufnahmen von bis zu drei Stunden in einer einzigen Anfrage und funktioniert in 13 Sprachen, darunter Englisch, Chinesisch, Hindi, Arabisch sowie mehrere europäische und asiatische Sprachen. Mistral weist darauf hin, dass die „Leistung in anderen Sprachen als Englisch die der Wettbewerber deutlich übertrifft“ – und adressiert damit eine seit Langem bestehende Schwäche von Sprach-KI, die von englischzentrierten Trainingsdaten dominiert wird.

Mistral versteht Voxtral als grundlegende Ebene für mehrere Branchen. Medien- und Rundfunkunternehmen können mehrsprachige Untertitel live erzeugen, während regulierte Branchen für Compliance und Prüfpfade auf Sprechererkennung und Zeitstempel zurückgreifen können. Beide Voxtral-Modelle unterstützen DSGVO- und HIPAA-konforme Bereitstellungen über On-Premises- oder Private-Cloud-Umgebungen.

Wohin sich Sprach-KI entwickelt

Die Einführung von Voxtral zeigt, wie sich Sprach-KI von einer Neuheit zu einer Infrastruktur entwickelt. Die Kombination aus offenen Gewichten, aggressiver Preisgestaltung und Echtzeitleistung deutet darauf hin, dass sich der Wettbewerb weg von der Frage verschiebt, wer das größte Modell hat, hin zu der Frage, wer praktische, einsetzbare Systeme liefern kann.

Der Erfolg von Voxtral Transcribe 2 dürfte weniger von technischen Benchmarks abhängen als davon, ob das Modell die versprochenen Kosteneinsparungen und Effizienzgewinne tatsächlich liefert.

Im Dezember hatte Mistral mit der Einführung der Mistral-3-Modellfamilie.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.