Google a intégré un outil natif d'« utilisation de l'ordinateur » directement à Gemini 3.5 Flash, permettant au modèle de voir et d'interagir avec des interfaces graphiques dans les navigateurs, les applications mobiles et les logiciels de bureau.
Auparavant, cette fonctionnalité résidait dans un système expérimental distinct basé sur Gemini 2.5 Computer Use. Elle est désormais intégrée directement à Flash : les développeurs n'ont donc plus besoin d'un modèle séparé pour créer des agents capables de cliquer, de saisir du texte, de faire défiler des pages et de naviguer dans des applications.
Selon Google, cette intégration permet aux développeurs de « créer des agents personnalisés capables de voir, de raisonner et d'agir dans des environnements de navigateur, mobiles et de bureau », en réunissant compréhension visuelle et action au sein d'un même workflow.
Du modèle conversationnel à l'agent actif
La mise à niveau fait passer Gemini 3.5 Flash au-delà du raisonnement fondé sur le texte et des appels de fonctions traditionnels, pour aboutir à ce que Google décrit comme une véritable interaction agentique avec l'ordinateur. Les développeurs peuvent désormais créer des systèmes capables d'interpréter des captures d'écran, de comprendre les interfaces utilisateur et d'exécuter des tâches en plusieurs étapes, comme remplir des formulaires, lancer des workflows ou naviguer dans des tableaux de bord d'entreprise.
Des observateurs du secteur soulignent que cela supprime de fait un obstacle de longue date à l'automatisation par l'IA : la nécessité de créer des API personnalisées pour chaque application. Le modèle peut au contraire interagir directement avec les logiciels, de la même manière qu'un utilisateur humain.
Google a indiqué que la nouvelle intégration obtenait un score de 78,4 % au test de contrôle d'interface utilisateur OSWorld-Verified. À titre de comparaison, l'ancien Gemini 2.5 modèle autonome a obtenu environ 70 % lors d'un autre benchmark appelé Online-Mind2Web.
L'architecture de sécurité et les compromis pour les entreprises
Accorder à un modèle d'IA carte blanche pour cliquer partout dans un système d'exploitation en fonctionnement introduit d'immenses risques de sécurité. Si un agent autonome se retrouve sur un site malveillant ou ouvre un e-mail contenant des instructions cachées, il peut facilement être victime d'une injection indirecte de prompt.
Pour y remédier, Google adopte une approche qu'il qualifie de « défense en profondeur ». L'entreprise a eu recours à un entraînement contradictoire ciblé pour renforcer Gemini 3.5 Flash contre ces types précis d'exploits visuels. Elle propose également deux mesures de protection facultatives, activables par les entreprises :
- Confirmation explicite de l'utilisateur : nécessite qu'un humain clique manuellement pour donner son accord avant que l'agent puisse exécuter une action à haut risque ou irréversible.
- Arrêt automatique des tâches : Gèle immédiatement le workflow de l'agent lorsqu'une attaque par injection de prompt est signalée.
Le principal problème est que ces fonctionnalités sont entièrement facultatives et désactivées par défaut. Google reconnaît qu'aucune mesure de protection n'est infaillible, livrant un avertissement d'entreprise remarquablement franc : cette technologie reste trop imprévisible pour être laissée entièrement à elle-même.
Analyse : au-delà du battage médiatique
Même si les benchmarks techniques semblent impressionnants sur le papier, les acheteurs professionnels doivent aller au-delà des promesses marketing avant de remanier leurs workflows.
La décision d'intégrer cette fonctionnalité à Gemini 3.5 Flash plutôt qu'à un modèle phare plus lourd relève d'un choix économique délibéré de Google. Flash fonctionne selon un modèle tarifaire à l'usage et constitue l'une des options les moins chères du portefeuille de Google. Cela réduit considérablement le coût d'entrée pour les entreprises qui souhaitent déployer une automatisation à grande échelle.
Cependant, l'utilité concrète des agents d'IA visuels reste limitée par des contraintes pratiques. Les modèles d'IA qui fonctionnent selon une boucle capture d'écran-action sont notoirement fragiles. S'ils excellent dans des scénarios très prévisibles, comme les tests logiciels continus et répétitifs ou l'extraction standard de données depuis des tableaux de bord d'entreprise, ils trébuchent souvent face à des fenêtres contextuelles inattendues, des CAPTCHA ou des mises en page dynamiques de sites web qu'ils n'ont encore jamais rencontrées.
En outre, l'écosystème professionnel est déjà particulièrement encombré. Claude Computer Use d'Anthropic a ouvert la voie dans ce domaine grâce à une polyvalence accrue au niveau du système, et OpenAI se livre à une concurrence acharnée sur des fonctionnalités similaires.
Pour les entreprises qui cherchent à choisir un écosystème, le facteur décisif ne sera pas de savoir quelle IA peut cliquer le plus vite sur un bouton, mais quelle plateforme peut exécuter ces actions de manière fiable sans créer une brèche béante dans la cybersécurité de l'entreprise.
Si une entreprise déploie ces agents sans cloisonnement strict ni supervision humaine, les économies réalisées grâce à l'automatisation pourraient être rapidement anéanties par une seule erreur de sécurité automatisée.
À lire aussi : les utilisateurs qui souhaitent recevoir moins de suggestions d'IA pendant l'écriture peuvent désactiver Gemini dans Google Docs en modifiant les paramètres des fonctionnalités intelligentes de la barre inférieure et de Workspace.


