Google lance Gemini 3.1 Flash-Lite, son modèle d’IA le plus rapide et le moins cher à ce jour

Gemini 3.1 Flash-Lite branding featuring a multi-colored spark icon and a stylized G composed of blue dots on a black background.

Source: Google

Written By
Liz Ticong
Liz Ticong
Mar 4, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Google pousse encore plus loin la vitesse et la capacité de déploiement de l’IA avec un nouveau modèle léger conçu pour les charges de travail massives. L’entreprise a lancé Gemini 3.1 Flash-Lite, qu’elle présente comme son modèle le plus rapide et le plus économique pour les tâches d’IA à fort volume.

Selon Google, ce modèle s’adresse aux développeurs qui exécutent des opérations d’IA à haute fréquence et des services en temps réel nécessitant des réponses rapides sur de gros volumes de requêtes.

Conçu pour passer à l’échelle, tarifé pour la production

Gemini 3.1 Flash-Lite intègre la famille Gemini 3 en tant que modèle rationalisé, adapté aux environnements à haut débit où la vitesse et l’efficacité sont essentielles. Il a été conçu pour prendre en charge des déploiements à grande échelle sans les surcoûts généralement associés aux modèles plus volumineux.

Le lancement commence en version preview, accessible aux développeurs via Google AI Studio par l’intermédiaire de l’API Gemini, et aux équipes d’entreprise via Vertex AI, ce qui permet aux organisations de commencer à tester le modèle sur des charges de travail réelles, tandis que Google étend la série Gemini 3.

Vitesse et économies réunies dans une même offre

Google a également détaillé les améliorations tarifaires et de performances qui sous-tendent la conception de Flash-Lite. Le modèle est facturé 0,25 dollar US par million de jetons d’entrée et 1,50 dollar US par million de jetons de sortie, une structure destinée à maintenir les coûts à un niveau raisonnable pour les applications qui traitent des requêtes à grande échelle.

Côté performances, l’entreprise annonce un délai d’obtention du premier jeton 2,5 fois plus rapide et une vitesse de sortie supérieure de 45 % à celle de Gemini 2.5 Flash, ce qui aide les applications à fournir des réponses plus rapidement une fois l’invite envoyée.

Ces améliorations sont particulièrement pertinentes pour les systèmes qui gèrent des flux continus d’invites, comme la modération automatisée, la traduction à grande échelle ou d’autres services à fort volume, où même des gains modestes en vitesse de réponse peuvent s’accumuler sur des millions d’interactions.

Advertisement

Un examen plus attentif du bilan

Gemini 3.1 Flash-Lite se défend également très bien dans les benchmarks du secteur qui évaluent le raisonnement et la compréhension multimodale. Le modèle a obtenu un score Elo de 1 432 au classement d’Arena.ai, un système de classement qui compare les modèles d’IA en fonction de leurs performances lors de confrontations directes.

Lors d’évaluations de type universitaire, Flash-Lite a obtenu 86,9 % à GPQA Diamond, un benchmark axé sur les questions de raisonnement complexe, et 76,8 % à MMMU-Pro, qui mesure la capacité des modèles à interpréter et à raisonner sur du texte, des images et d’autres médias.

Selon Google, ces résultats placent Flash-Lite devant plusieurs modèles de la même catégorie et même au-dessus de certains modèles Gemini de générations précédentes.

Flash-Lite entame ses tests en conditions réelles

Google donne également aux développeurs davantage de contrôle sur la manière dont le modèle aborde les différentes tâches. Gemini 3.1 Flash-Lite introduit des « niveaux de réflexion » réglables, afin que les équipes puissent ajuster la quantité de raisonnement appliquée par le système avant de générer une réponse.

Les partenaires bénéficiant d’un accès anticipé ont déjà commencé à tester le modèle dans des environnements proches de la production. Des entreprises comme Latitude, Cartwheel et Whering expérimentent Flash-Lite dans leurs applications, les développeurs mettant en avant la constance des sorties structurées et la fiabilité du suivi des instructions.

Dans un exemple, Whering a fait état d’une cohérence de 100 % dans l’étiquetage des articles lors de l’utilisation du modèle pour la classification de produits. Un autre testeur précoce a indiqué que Flash-Lite produisait des résultats en moins de 10 secondes, avec une diffusion quasi instantanée et une conformité aux sorties structurées d’environ 97 % lors des premiers déploiements.

Advertisement

Alors que l’accès en version preview est désormais ouvert, Google invite les développeurs à commencer à expérimenter Flash-Lite à grande échelle.

Vous hésitez encore entre Gemini et ChatGPT ? Notre comparatif pratique met en évidence sept différences qui façonnent l’expérience.

Liz Ticong

Liz Ticong is a staff writer for eWeek and TechRepublic focused on AI, cybersecurity, enterprise software, and data. She has more than 10 years of editorial experience as a technology industry writer, combining reporting, product research, and hands-on software testing in her coverage. Her work has been published on Datamation, Enterprise Networking Planet, and TechnologyAdvice.com. She writes technology news, software reviews, product comparisons, and buyer’s guides for business and IT readers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.