Google a étoffé sa famille d’IA Gemma avec le lancement de Gemma 3 270M, un modèle léger doté de 270 millions de paramètres, conçu pour les développeurs qui ont besoin d’un affinage rapide et ciblé sans matériel informatique puissant.
Cette annonce fait suite à une série de lancements récents dans la gamme Gemma 3, notamment Gemma 3 QAT et Gemma 3n, pensé d’abord pour les appareils mobiles. Selon Google, les téléchargements au sein du « Gemmaverse » ont désormais dépassé les 200 millions.
Le modèle Gemma le plus économe en énergie à ce jour
Gemma 3 270M repose sur une architecture particulière : 170 millions de paramètres sont consacrés à un immense vocabulaire de 256 000 tokens, tandis que 100 millions de paramètres alimentent ses blocs Transformer.
Google affirme que la conception du modèle en fait « une base solide à affiner davantage dans des domaines et des langues spécifiques ». Des tests internes ont montré qu’une version quantifiée en INT4 ne consommait que 0,75 % de la batterie d’un Pixel 9 Pro pour 25 conversations, ce qui en fait le modèle Gemma le plus économe en énergie de l’entreprise à ce jour.
Disponible en versions préentraînée et affinée pour suivre les instructions, Gemma 3 270M suit efficacement les consignes structurées dès sa sortie de boîte. Il est destiné à des tâches ciblées, comme la classification de textes, l’extraction d’entités, le routage de requêtes, la génération de textes structurés et les contrôles de conformité, plutôt qu’à de longues conversations ouvertes.
Google présente Gemma 3 270M comme un exemple de choix de l’efficacité au détriment de la force brute.
« On n’utilise pas un marteau-pilon pour accrocher un cadre photo », a écrit Google dans son billet de présentation de Gemma 3 270M, expliquant que des modèles plus petits et spécialisés peuvent surpasser des systèmes généralistes plus volumineux lorsqu’ils sont optimisés pour des tâches bien définies.
Cette stratégie fait déjà ses preuves. Google a mis en avant le travail d’Adaptive ML avec SK Telecom, dans le cadre duquel un modèle Gemma 3 4B affiné pour la modération de contenus multilingues a surpassé des systèmes propriétaires beaucoup plus volumineux. La version 270M vise à permettre des résultats similaires à une échelle encore plus réduite, ouvrant la voie à des flottes de modèles spécialisés.
Performances et benchmarks
Sur le benchmark IFEval, qui évalue la capacité à suivre les instructions, Gemma 3 270M affiné pour suivre les instructions a obtenu 51,2 %, devant d’autres petits modèles comme SmolLM2 135M Instruct et Qwen 2.5 0.5B Instruct, et se rapprochant des résultats de certains systèmes dotés de plusieurs milliards de paramètres.
Comme il peut fonctionner entièrement sur l’appareil, Gemma 3 270M permet aux développeurs de créer des outils d’IA qui traitent les données sensibles sans envoyer d’informations vers le cloud. Les checkpoints issus du Quantization-Aware Training (QAT) permettent un déploiement en INT4 avec une perte de performances minime, pour un fonctionnement fluide sur du matériel aux ressources limitées.
Au-delà des usages en entreprise, les développeurs expérimentent des applications créatives. Une démonstration, un générateur d’histoires pour l’heure du coucher créé avec Transformers.js, fonctionne entièrement dans un navigateur web. Il permet aux utilisateurs de définir un personnage principal, un cadre, un rebondissement, un thème et la longueur de l’histoire, puis génère un récit cohérent et imaginatif, le tout sans traitement dans le cloud.
Google a rendu le modèle disponible via Hugging Face, Ollama, Kaggle, LM Studio et Docker, avec des possibilités d’essai sur Vertex AI et une compatibilité avec des outils comme llama.cpp, Gemma.cpp, LiteRT, Keras et MLX.
Pour en savoir plus sur la place de Gemma 3 dans la stratégie globale de Google en matière d’IA, notamment sur le modèle 4B plus volumineux et ses performances en conditions réelles, consultez notre analyse détaillée du modèle d’IA Gemma 3 de Google.


