Récemment, des dirigeants de Microsoft ont soumis à l’Internet Engineering Task Force une nouvelle proposition visant à protéger les données web en créant des règles supplémentaires permettant de distinguer les bots d’entraînement de l’IA des autres bots, afin que les propriétaires de sites puissent bloquer les robots d’exploration web d’IA indésirables. Comme les modèles d’IA nécessitent d’énormes quantités de données d’entraînement, les entreprises d’IA collectent généralement ces données sur des sites web publics en envoyant des robots d’exploration d’IA parcourir des articles de blog, des pages produit, des vidéos et d’autres formes de contenu web.
Alors que les entreprises technologiques soutiennent que les bots d’IA devraient pouvoir explorer les données accessibles au public comme les moteurs de recherche, certains propriétaires de sites y voient une atteinte à la vie privée, puisqu’ils n’ont jamais consenti à cette extraction de données. La nouvelle proposition offre trois méthodes pour empêcher les robots d’exploration d’IA d’envahir votre site web : de nouvelles règles robots.txt, des règles pour les en-têtes de réponse de la couche applicative et une balise meta HTML Robots.
Nouvelles règles robots.txt
La proposition de Microsoft créerait des règles supplémentaires pour le fichier robots.txt, que les sites web utilisent pour indiquer aux robots d’exploration web et aux bots des moteurs de recherche quelles parties du site ils peuvent ou non explorer.
« Bien que le Robots Exclusion Protocol permette aux propriétaires de services de contrôler si et comment les clients automatisés appelés robots d’exploration peuvent accéder aux URI de leurs services, comme le définit [RFC8288], » le projet de proposition indique : « le protocole ne permet pas de contrôler la manière dont les données renvoyées par leur service peuvent être utilisées pour entraîner des modèles de fondation d’IA générative. Il est demandé aux développeurs d’applications de respecter ces balises. »
La proposition suggère les valeurs suivantes pour contrôler la manière dont les bots d’IA interagissent avec les sites web:
- DisallowAITraining : Indique à l’analyseur de ne pas utiliser les données pour l’entraînement de l’IA
- AllowAITraining : Indique à l’analyseur que les données peuvent être utilisées pour l’entraînement de l’IA
Ces règles reprennent la même logique de correspondance que les règles standard d’autorisation et d’interdiction et ne sont pas sensibles à la casse.
En-tête de réponse de la couche applicative
La proposition indique également que les propriétaires de sites web devraient pouvoir définir ces mêmes règles robots.txt via l’en-tête de réponse de la couche applicative — un type de méthode de requête HTTP qui récupère uniquement les en-têtes d’une ressource web, sans télécharger le contenu lui-même. Comme pour robots.txt, les règles ne sont pas sensibles à la casse.
Balise meta HTML Robots
La troisième méthode proposée pour empêcher les robots d’exploration d’IA d’accéder à un site web consiste à utiliser les balises meta HTML suivantes :
- <meta name=”robots” content=”DisallowAITraining”>
- <meta name=”examplebot” content=”AllowAITraining”>
Si les recommandations de la proposition sont adoptées, les propriétaires de sites web auront davantage de contrôle sur les bots qui peuvent explorer leurs pages web. Si suffisamment de propriétaires de sites web tirent parti de ces nouvelles règles et restreignent les bots d’IA, le développement de l’IA générative pourrait ralentir.
Pour en savoir plus sur les défis et les problèmes liés à la confidentialité auxquels l’IA est confrontée ainsi que sur les bonnes pratiques et les solutions permettant d’y remédier.


