Le 19 mars, Cloudflare, une entreprise de gestion des services informatiques, a lancé un outil gratuit destiné à semer la confusion chez les robots d’exploration web d’IA, afin de les empêcher d’encombrer les sites avec du trafic de bots ou d’en extraire des informations. Le labyrinthe IA utilise l’IA générative pour créer de fausses pages, qui distraient les bots et permettent de les identifier.
Pour utiliser le labyrinthe IA, les utilisateurs doivent être clients de Cloudflare, mais l’outil est disponible dès l’offre gratuite.
Ce que font les robots d’exploration IA et comment ils nuisent aux entreprises
« Comme tout outil récent, l’IA générative a des usages à la fois formidables et malveillants », ont écrit Senior Director of Product Reid Tatoris, Product Manager Harsh Saxena et Senior Software Engineer Luis Miglietti, de Cloudflare, dans un article de blog.
Les grandes entreprises de l’IA ont bâti leur fortune en aspirant des contenus sur Internet pour entraîner leurs modèles. De nombreux propriétaires de sites ont de bonnes raisons de vouloir empêcher ces aspirateurs de contenu d’agir, et plusieurs techniques existent à cette fin.
Comme l’a souligné Unite.AI, des nuées de bots peuvent ralentir les serveurs, augmenter les coûts d’hébergement et allonger les temps de chargement des pages. Si une IA génère un contenu trop proche de celui qui existe déjà sur un site, ce doublon peut faire baisser le classement du site d’origine dans les résultats SEO. Certains créateurs de contenu et certaines organisations peuvent vouloir bloquer les aspirateurs d’IA sur leurs sites pour des raisons liées au droit d’auteur, comme celles soulevées récemment par des créateurs après l’annonce que Meta avait utilisé une bibliothèque de contenus piratés pour entraîner son IA.
Comment le labyrinthe IA riposte
Le labyrinthe IA de Cloudflare a deux objectifs principaux : bloquer les robots d’exploration IA et identifier les bots. Il fonctionne en intégrant des liens cachés dans un site protégé. Le bot suivra ces liens vers des sites web préconçus remplis de contenu généré par l’IA. Ce contenu contient de véritables informations scientifiques – le personnel de Cloudflare a indiqué ne pas vouloir contribuer à la désinformation générée par l’IA –, mais pas de sujets liés au véritable site exploré par le bot. Toutes les informations présentes sur ces sites préconçus sont accessibles au public. Les bots perdront donc du temps à explorer des informations qu’ils connaissent déjà. Le site d’origine reste intact, tandis que les entreprises d’IA gaspillent des ressources, affirme Cloudflare.
Le deuxième objectif, l’identification des bots, est possible parce que seuls les bots interagiront avec les liens du labyrinthe ; grâce à ces informations, Cloudflare peut surveiller les nouveaux comportements et signatures de bots. L’automatisation est omniprésente : les informations sur ces bots sont réinjectées dans le système d’apprentissage automatique de Cloudflare afin d’analyser davantage de robots d’exploration.
Les humains ne verront pas le fatras généré par l’IA
Cloudflare a mis en place plusieurs garde-fous pour s’assurer que le remède ne soit pas pire que le mal. Les utilisateurs ne peuvent pas voir le contenu destiné aux bots ; le labyrinthe IA n’ajoute donc pas davantage de contenu générique de piètre qualité sur le web. Les moteurs de recherche ne peuvent pas indexer les pages générées par l’IA car Cloudflare a ajouté des directives meta à cette fin ; les faux sites n’auront donc aucune incidence sur le classement SEO.
Les utilisateurs de Cloudflare verront un bouton à bascule intitulé AI Labyrinth dans leur menu de contrôle. Accédez à Security | Bots ou Security | Settings pour l’activer.

