3 nouvelles règles pour empêcher les bots d’IA d’envahir vos sites web

Flat vector illustration of a humanoid combined with programming code.

Image: Jackie Niam/Adobe Stock

Écrit par
Sam Rinko
Sam Rinko
Nov 28, 2024
3 minute read
eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Récemment, des dirigeants de Microsoft ont soumis à l’Internet Engineering Task Force une nouvelle proposition visant à protéger les données web en créant des règles supplémentaires permettant de distinguer les bots d’entraînement de l’IA des autres bots, afin que les propriétaires de sites puissent bloquer les robots d’exploration web d’IA indésirables. Comme les modèles d’IA nécessitent d’énormes quantités de données d’entraînement, les entreprises d’IA collectent généralement ces données sur des sites web publics en envoyant des robots d’exploration d’IA parcourir des articles de blog, des pages produit, des vidéos et d’autres formes de contenu web.

Alors que les entreprises technologiques soutiennent que les bots d’IA devraient pouvoir explorer les données accessibles au public comme les moteurs de recherche, certains propriétaires de sites y voient une atteinte à la vie privée, puisqu’ils n’ont jamais consenti à cette extraction de données. La nouvelle proposition offre trois méthodes pour empêcher les robots d’exploration d’IA d’envahir votre site web : de nouvelles règles robots.txt, des règles pour les en-têtes de réponse de la couche applicative et une balise meta HTML Robots.

Nouvelles règles robots.txt

La proposition de Microsoft créerait des règles supplémentaires pour le fichier robots.txt, que les sites web utilisent pour indiquer aux robots d’exploration web et aux bots des moteurs de recherche quelles parties du site ils peuvent ou non explorer.

« Bien que le Robots Exclusion Protocol permette aux propriétaires de services de contrôler si et comment les clients automatisés appelés robots d’exploration peuvent accéder aux URI de leurs services, comme le définit [RFC8288], » le projet de proposition indique : « le protocole ne permet pas de contrôler la manière dont les données renvoyées par leur service peuvent être utilisées pour entraîner des modèles de fondation d’IA générative. Il est demandé aux développeurs d’applications de respecter ces balises. »

La proposition suggère les valeurs suivantes pour contrôler la manière dont les bots d’IA interagissent avec les sites web:

  • DisallowAITraining : Indique à l’analyseur de ne pas utiliser les données pour l’entraînement de l’IA
  • AllowAITraining : Indique à l’analyseur que les données peuvent être utilisées pour l’entraînement de l’IA

Ces règles reprennent la même logique de correspondance que les règles standard d’autorisation et d’interdiction et ne sont pas sensibles à la casse.

Advertisement

En-tête de réponse de la couche applicative

La proposition indique également que les propriétaires de sites web devraient pouvoir définir ces mêmes règles robots.txt via l’en-tête de réponse de la couche applicative — un type de méthode de requête HTTP qui récupère uniquement les en-têtes d’une ressource web, sans télécharger le contenu lui-même. Comme pour robots.txt, les règles ne sont pas sensibles à la casse.

Balise meta HTML Robots

La troisième méthode proposée pour empêcher les robots d’exploration d’IA d’accéder à un site web consiste à utiliser les balises meta HTML suivantes :

  • <meta name=”robots” content=”DisallowAITraining”>
  • <meta name=”examplebot” content=”AllowAITraining”>

Si les recommandations de la proposition sont adoptées, les propriétaires de sites web auront davantage de contrôle sur les bots qui peuvent explorer leurs pages web. Si suffisamment de propriétaires de sites web tirent parti de ces nouvelles règles et restreignent les bots d’IA, le développement de l’IA générative pourrait ralentir.

Pour en savoir plus sur les défis et les problèmes liés à la confidentialité auxquels l’IA est confrontée ainsi que sur les bonnes pratiques et les solutions permettant d’y remédier.

Sam Rinko

Sam is a former SaaS sales rep turned technology journalist. He spent his career selling real estate technology to C-suite executives before switching over to writing, where he now covers a variety of enterprise IT topics. Sam specializes in today’s emerging tech, including AI, large language models, machine learning, and related technologies.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.