Qwen3.5-Omni, le modèle d’IA multimodale le plus avancé d’Alibaba à ce jour

Infographic for Qwen3.5-Omni-Plus and Realtime AI models featuring two teddy bear mascots illustrating features like Native Multimodal, Voice Control, and WebSearch Tool.

Image: Qwen

Apr 1, 2026
4 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Alibaba a dévoilé Qwen3.5-Omni, le dernier modèle de sa famille Qwen.

Sorti cette semaine, le modèle peut traiter simultanément du texte, des images, de l’audio et de la vidéo, puis répondre dans ces mêmes formats. Qwen3.5-Omni est ce que le secteur appelle un grand modèle de langage « entièrement omnimodal ». En clair, il n’a pas besoin de quatre systèmes d’IA différents pour gérer un appel vidéo, un document, un message vocal et une photo : il s’en charge simultanément, en une seule fois.

Il existe en trois tailles : Plus, Flash et Light, afin de répondre à différents besoins et budgets informatiques. La version phare Plus prend en charge une gigantesque fenêtre de contexte de 256 000 tokens, suffisante pour traiter plus de dix heures d’audio ou plus de 400 secondes de vidéo 720p à raison d’une image par seconde. 

Le modèle a été pré-entraîné de zéro sur plus de 100 millions d’heures de données audiovisuelles, dans le cadre d’un entraînement multimodal natif, plutôt que sur un modèle de texte auquel on aurait ajouté l’audio après coup.

Les benchmarks : Alibaba s’en prend à Gemini

Alibaba avance des affirmations ambitieuses, et les chiffres semblent au moins les étayer.

Selon Alibaba, la version Plus aurait établi de nouveaux records à l’état de l’art sur 215 benchmarks audio et audiovisuels. Cela couvre aussi bien la compréhension audio générale et la reconnaissance vocale que des tâches de traduction couvrant 156 paires de langues. 

Sur le benchmark de compréhension audio MMAU, Qwen3.5-Omni-Plus a obtenu 82,2, contre Google’s Gemini 3.1 Pro à 81,1. L’écart se creuse en compréhension musicale : Qwen a obtenu 72,4 contre 59,6 pour Gemini sur le benchmark RUL-MuchoMusic.

En dialogue vocal, le modèle a obtenu 93,1 sur VoiceBench, contre 88,9 pour Gemini.

La génération vocale constitue un autre temps fort. Lors du test particulièrement difficile « seed-hard », qui évalue le naturel avec lequel un modèle lit à voix haute sous pression, Qwen3.5-Omni-Plus a atteint un taux d’erreur par mot de seulement 6,24, contre 8,19 pour GPT-Audio, 8,62 pour Minimax et 27,70 pour ElevenLabs. Pour le clonage vocal dans 20 langues, il a atteint un taux d’erreur par mot de 1,87 et un score de similarité cosinus de 0,79, deux chiffres en tête de cette comparaison.

Advertisement

Cela dit, la victoire n’est pas totale. Gemini 3.1 Pro conserve certains avantages sur des benchmarks audiovisuels précis, notamment WorldSense, VideoMME avec audio et les tâches d’utilisation d’outils.

Le bond linguistique

L’une des améliorations les plus frappantes par rapport à son prédécesseur, Qwen3-Omni, concerne le multilinguisme. 

Le modèle précédent prenait en charge onze langues et huit dialectes chinois pour la reconnaissance vocale. Qwen3.5-Omni couvre désormais 74 langues et 39 dialectes chinois, soit un total de 113 langues et dialectes. La synthèse vocale prend en charge 36 langues, avec 50 voix disponibles, notamment des options définies par l’utilisateur, dialectales et multilingues.

Une nouvelle capacité que personne n’a programmée : le « vibe coding audio-visuel »

Le principal argument de la nouvelle version de Qwen3.5-Omni n’est pas seulement sa rapidité : c’est aussi une capacité inattendue pour laquelle les développeurs ne l’avaient même pas spécifiquement entraîné. L’équipe Qwen d’Alibaba a observé une nouvelle « capacité émergente » : le modèle écrit du code fonctionnel en se contentant de regarder une vidéo et d’écouter des instructions vocales. Ils ont baptisé cette fonction « Audio-Visual Vibe Coding ».

Lors de tests en conditions réelles, le modèle a pu prendre un croquis sommaire dessiné à la main et présenté devant une caméra, puis le transformer en page web React fonctionnelle. À mesure que l’utilisateur lui parlait, en lui demandant des boutons plus grands ou une mise en page différente, le modèle d’IA a mis à jour le code en temps réel. 

Selon Qwen, cela permet : « d’effectuer directement des tâches de programmation à partir d’instructions audiovisuelles, ce que nous appelons Audio-Visual Vibe Coding ; toutes les fonctionnalités mentionnées ci-dessus sont disponibles via l’API hors ligne. »

Dans les coulisses : les penseurs et les bavards

Pour traiter simultanément le texte, les images, l’audio et la vidéo, Alibaba utilise une architecture unique « Thinker-Talker ». Le Thinker est le cerveau qui traite ce qui est vu et entendu, tandis que le Talker gère la manière dont l’IA vous répond à l’oral.

L’un des principaux défis techniques de l’IA vocale est le « bégaiement », ou les erreurs lors de la lecture de nombres et de textes complexes. Alibaba affirme avoir résolu ce problème grâce à une nouvelle technologie appelée ARIA (Adaptive Rate Interleave Alignment). Cette technologie synchronise les unités de texte et de parole afin que l’IA ne trébuche pas sur ses mots lors d’une conversation en direct.

Advertisement

Le modèle prend également en charge l’interruption sémantique. Ainsi, si vous toussez ou dites « euh », l’IA est suffisamment intelligente pour continuer à parler ; mais si vous commencez réellement une nouvelle phrase pour la corriger, le modèle s’arrête et vous écoute.

Pour en savoir plus sur le bouleversement provoqué par l’IA d’Alibaba, consultez notre article sur le départ inattendu du responsable technique de Qwen.

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.