Microsoft AI a lancé MAI-Transcribe-2 jeudi, lançant un défi direct à ses concurrents en combinant une vitesse de transcription de niveau dernier cri avec un tarif très agressif de 10 centimes par heure d’audio.
Ce modèle illustre l’offensive rapide de Microsoft pour proposer directement des modèles spécialisés dans la reconnaissance vocale via Microsoft Foundry et MAI Playground, sans passer par des laboratoires externes.
Le tarif temporaire de 0,10 dollar par heure est environ 72 % inférieur au prix de 0,36 dollar par heure affiché pour MAI-Transcribe-1 et 1.5. Ce tarif réduit pourrait considérablement diminuer les coûts des entreprises qui traitent à grande échelle des enregistrements de centres d’appels, des réunions et des fichiers audio liés à la conformité.
Microsoft inclut également plusieurs fonctionnalités destinées aux entreprises avec le modèle :
- Diarisation et horodatage des locuteurs : fournit des segments identifiés par locuteur accompagnés d’horodatages au niveau des mots pour accélérer la recherche et la navigation.
- Mise en forme configurable : propose un style « verbatim » qui conserve les mots de remplissage pour les audits et un style « clean » qui produit des comptes rendus de réunion lisibles.
- Prise en charge étendue de l’audio : la détection automatique intégrée de la langue et le changement de code prennent en charge les alternances multilingues naturelles, comme le hinglish et le spanglish, dans 60 langues.
- Adaptation au domaine :la pondération des mots-clés permet aux équipes d’orienter le modèle sur les acronymes, le jargon et les noms propres propres à leur secteur.
Performances dans les benchmarks et tests indépendants
Microsoft affirme que MAI-Transcribe-2 arrive en tête du benchmark multilingue public FLEURS dans 60 langues, avec un taux d’erreur moyen par mot (WER) de 5,2 %.
Artificial Analysis classe actuellement le modèle au deuxième rang général pour la précision, derrière la préversion en flux continu Fun-Realtime-ASR d’Alibaba. Lors de ses tests sans flux continu, MAI-Transcribe-2 a enregistré un WER de 2,0 % et un facteur de vitesse médian de 410,7× le temps réel. Microsoft affirme que le modèle était environ 10 fois plus rapide que OpenAI’s GPT-Transcribe, 7,5 fois plus rapide que Scribe v2 d’ElevenLabs et 4,6 fois plus rapide que Google’s Gemini 3.5 Transcribe lors des tests indépendants.
Microsoft étoffe son portefeuille d’IA développé en interne
Contrairement à un modèle multimodal généraliste, MAI-Transcribe-2 est conçu spécifiquement pour la reconnaissance vocale. Cette spécialisation pourrait aider Microsoft à accélérer le traitement par lots tout en réduisant les coûts des charges de travail fortement axées sur la transcription.
Cette sortie étoffe également le portefeuille de modèles d’IA développés en interne par Microsoft, même si l’entreprise n’a pas indiqué si MAI-Transcribe-2 remplacerait les technologies de transcription existantes dans Teams, Nuance ou ses autres produits.
Ce qu’a constaté eWeek : comparaison avec Microsoft
Un examen plus attentif des données des benchmarks montre que, si MAI-Transcribe-2 obtient des scores composites d’élite, ses performances varient selon les langues.
Modèle | WER d’Artificial Analysis | Facteur de vitesse médian | Prix estimé par heure |
Microsoft MAI-Transcribe-2 | 2.0% | 410,7× | Tarif temporaire de 0,10 dollar |
ElevenLabs Scribe v2 | 2.2% | 54,7× | Environ 0,22 dollar |
Google Gemini 3.5 Transcribe | 2.6% | 89,9× | Environ 0,30 dollar |
OpenAI GPT-Transcribe | 3.3% | 40,0× | Environ 0,27 dollar |
Microsoft MAI-Transcribe-1.5 | 2.4% | 190,3× | $0.36 |
Artificial Analysis normalise les tarifs en fonction du coût du traitement de 1 000 minutes d’audio. Ses chiffres de vitesse correspondent à des résultats médians glissants et peuvent évoluer à mesure que de nouveaux tests sont réalisés.
MAI-Transcribe-2 surclasse ses concurrents en chinois (WER de 4,5 %) et en français (WER de 2,8 %). Toutefois, Google's Gemini 3.1 Pro le devance dans des langues comme l’arménien (6,1 % contre 12,6 %) et le danois (5,3 % contre 5,4 %), tandis que Scribe v2 prend l’avantage en afrikaans (10,6 % contre 13,1 %).
Compromis de mise en production et risques pour les entreprises
Les équipes d’ingénierie doivent noter que Microsoft Learn classe MAI-Transcribe comme une préversion publique sans accord formel de niveau de service et ne le recommande pas pour les charges de travail en production. Le service accepte actuellement les fichiers WAV, MP3 et FLAC jusqu’à 300 Mo ou d’une durée maximale de deux heures.
L’offre à 0,10 dollar par heure doit également expirer à la fin de 2026, et Microsoft n’a pas indiqué combien coûtera le modèle par la suite. Pour les équipes d’entreprise, son prix, sa vitesse et sa prise en charge multilingue justifient des tests sur des enregistrements représentatifs, mais le statut de préversion et le tarif temporaire plaident en faveur d’une évaluation limitée plutôt que d’une migration immédiate des charges de travail critiques.
En savoir plus : Voxtral Transcribe 2 de Mistral propose une autre approche de la reconnaissance vocale pour les entreprises, en combinant la transcription par lots avec un modèle en temps réel à poids ouverts.

