Gemini 3.5 Flash gagne une fonction native d'utilisation de l'ordinateur pour automatiser des tâches concrètes avec l'IA

Jun 25, 2026
4 minute read
A man presenting the Google Gemini.

Image: David Paul Morris / Bloomberg via Getty Images file

eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Google a intégré un outil natif d'« utilisation de l'ordinateur » directement à Gemini 3.5 Flash, permettant au modèle de voir et d'interagir avec des interfaces graphiques dans les navigateurs, les applications mobiles et les logiciels de bureau.

Auparavant, cette fonctionnalité résidait dans un système expérimental distinct basé sur Gemini 2.5 Computer Use. Elle est désormais intégrée directement à Flash : les développeurs n'ont donc plus besoin d'un modèle séparé pour créer des agents capables de cliquer, de saisir du texte, de faire défiler des pages et de naviguer dans des applications.

Selon Google, cette intégration permet aux développeurs de « créer des agents personnalisés capables de voir, de raisonner et d'agir dans des environnements de navigateur, mobiles et de bureau », en réunissant compréhension visuelle et action au sein d'un même workflow.

Du modèle conversationnel à l'agent actif

La mise à niveau fait passer Gemini 3.5 Flash au-delà du raisonnement fondé sur le texte et des appels de fonctions traditionnels, pour aboutir à ce que Google décrit comme une véritable interaction agentique avec l'ordinateur. Les développeurs peuvent désormais créer des systèmes capables d'interpréter des captures d'écran, de comprendre les interfaces utilisateur et d'exécuter des tâches en plusieurs étapes, comme remplir des formulaires, lancer des workflows ou naviguer dans des tableaux de bord d'entreprise.

Des observateurs du secteur soulignent que cela supprime de fait un obstacle de longue date à l'automatisation par l'IA : la nécessité de créer des API personnalisées pour chaque application. Le modèle peut au contraire interagir directement avec les logiciels, de la même manière qu'un utilisateur humain.

Google a indiqué que la nouvelle intégration obtenait un score de 78,4 % au test de contrôle d'interface utilisateur OSWorld-Verified. À titre de comparaison, l'ancien Gemini 2.5 modèle autonome a obtenu environ 70 % lors d'un autre benchmark appelé Online-Mind2Web.

L'architecture de sécurité et les compromis pour les entreprises

Accorder à un modèle d'IA carte blanche pour cliquer partout dans un système d'exploitation en fonctionnement introduit d'immenses risques de sécurité. Si un agent autonome se retrouve sur un site malveillant ou ouvre un e-mail contenant des instructions cachées, il peut facilement être victime d'une injection indirecte de prompt.

Advertisement

Pour y remédier, Google adopte une approche qu'il qualifie de « défense en profondeur ». L'entreprise a eu recours à un entraînement contradictoire ciblé pour renforcer Gemini 3.5 Flash contre ces types précis d'exploits visuels. Elle propose également deux mesures de protection facultatives, activables par les entreprises :

  • Confirmation explicite de l'utilisateur : nécessite qu'un humain clique manuellement pour donner son accord avant que l'agent puisse exécuter une action à haut risque ou irréversible.
  • Arrêt automatique des tâches : Gèle immédiatement le workflow de l'agent lorsqu'une attaque par injection de prompt est signalée.

Le principal problème est que ces fonctionnalités sont entièrement facultatives et désactivées par défaut. Google reconnaît qu'aucune mesure de protection n'est infaillible, livrant un avertissement d'entreprise remarquablement franc : cette technologie reste trop imprévisible pour être laissée entièrement à elle-même.

Analyse : au-delà du battage médiatique

Même si les benchmarks techniques semblent impressionnants sur le papier, les acheteurs professionnels doivent aller au-delà des promesses marketing avant de remanier leurs workflows.

La décision d'intégrer cette fonctionnalité à Gemini 3.5 Flash plutôt qu'à un modèle phare plus lourd relève d'un choix économique délibéré de Google. Flash fonctionne selon un modèle tarifaire à l'usage et constitue l'une des options les moins chères du portefeuille de Google. Cela réduit considérablement le coût d'entrée pour les entreprises qui souhaitent déployer une automatisation à grande échelle.

Cependant, l'utilité concrète des agents d'IA visuels reste limitée par des contraintes pratiques. Les modèles d'IA qui fonctionnent selon une boucle capture d'écran-action sont notoirement fragiles. S'ils excellent dans des scénarios très prévisibles, comme les tests logiciels continus et répétitifs ou l'extraction standard de données depuis des tableaux de bord d'entreprise, ils trébuchent souvent face à des fenêtres contextuelles inattendues, des CAPTCHA ou des mises en page dynamiques de sites web qu'ils n'ont encore jamais rencontrées.

Advertisement

En outre, l'écosystème professionnel est déjà particulièrement encombré. Claude Computer Use d'Anthropic a ouvert la voie dans ce domaine grâce à une polyvalence accrue au niveau du système, et OpenAI se livre à une concurrence acharnée sur des fonctionnalités similaires.

Pour les entreprises qui cherchent à choisir un écosystème, le facteur décisif ne sera pas de savoir quelle IA peut cliquer le plus vite sur un bouton, mais quelle plateforme peut exécuter ces actions de manière fiable sans créer une brèche béante dans la cybersécurité de l'entreprise.

Si une entreprise déploie ces agents sans cloisonnement strict ni supervision humaine, les économies réalisées grâce à l'automatisation pourraient être rapidement anéanties par une seule erreur de sécurité automatisée.

À lire aussi : les utilisateurs qui souhaitent recevoir moins de suggestions d'IA pendant l'écriture peuvent désactiver Gemini dans Google Docs en modifiant les paramètres des fonctionnalités intelligentes de la barre inférieure et de Workspace.

Aminu Abdullahi

Aminu Abdullahi

Content Writer

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.