Das IT-Service-Management-Unternehmen Cloudflare hat am 19. März ein kostenloses Tool vorgestellt, das KI-Webcrawler verwirren und sie davon abhalten soll, Websites mit Bot-Traffic zu überfluten oder Informationen abzugreifen. Das KI-Labyrinth nutzt generative KI, um gefälschte Seiten zu erstellen, die Bots ablenken und identifizieren.
Um das KI-Labyrinth nutzen zu können, müssen Nutzer Cloudflare-Kunden sein; das Tool ist jedoch bereits im kostenlosen Tarif verfügbar.
Was KI-Crawler tun und wie sie Unternehmen schaden
„Wie jedes neuere Tool hat auch generative KI sowohl wunderbare als auch bösartige Einsatzmöglichkeiten“, schrieben Cloudflares Senior Director of Product Reid Tatoris, Product Manager Harsh Saxena und Senior Software Engineer Luis Miglietti in einem Blogbeitrag.
Große KI-Unternehmen haben ihre Vermögen darauf aufgebaut, Inhalte aus dem Internet abzugreifen, um ihre Modelle zu trainieren. Viele Website-Betreiber haben gute Gründe, solche Scraper verhindern zu wollen, und es gibt mehrere Techniken, um dies zu tun.
Wie von Unite.AI angemerkt, können Bot-Schwärme Server verlangsamen, die Hosting-Kosten erhöhen und die Ladezeiten von Seiten verlängern. Wenn eine KI Inhalte erzeugt, die bestehenden Website-Inhalten zu ähnlich sind, kann das Duplikat die SEO-Rankings der ursprünglichen Website verschlechtern. Einige Content-Ersteller und Organisationen möchten KI-Scraper möglicherweise wegen Urheberrechtsbedenken von ihren Websites fernhalten – etwa aufgrund der jüngst von Kreativen geäußerten Bedenken, nachdem bekannt wurde, dass Meta eine Bibliothek mit raubkopierten Inhalten zum Trainieren von KI verwendet hatte.
Wie sich das KI-Labyrinth wehrt
Cloudflares KI-Labyrinth verfolgt zwei Hauptziele: KI-Crawler zu blockieren und Bots zu identifizieren. Dazu werden versteckte Links in eine geschützte Website eingebettet. Der Bot folgt diesen Links zu vorgefertigten Websites, die mit KI-generierten Inhalten gefüllt sind. Diese Inhalte enthalten echte wissenschaftliche Informationen – die Cloudflare-Mitarbeiter erklärten, sie wollten nicht zur Verbreitung von durch KI erzeugten Falschinformationen beitragen –, behandeln aber keine Themen, die mit der tatsächlich vom Bot gecrawlten Website zusammenhängen. Alle Informationen auf den vorgefertigten Websites sind öffentlich verfügbar. Die Bots verschwenden daher Zeit damit, Informationen zu crawlen, die sie bereits kennen. Die ursprüngliche Website bleibt unangetastet, während die KI-Unternehmen Ressourcen verschwenden, erklärte Cloudflare.
Das zweite Ziel, die Identifizierung von Bots, ist möglich, weil nur Bots mit den Labyrinth-Links interagieren. Anhand dieser Informationen kann Cloudflare neue Bot-Muster und -Signaturen überwachen. Alles ist automatisiert: Informationen über diese Bots fließen zurück in Cloudflares Machine-Learning-System, um weitere Crawler zu analysieren.
Menschen werden das Labyrinth aus KI-Müll nicht sehen
Cloudflare hat mehrere Schutzvorkehrungen getroffen, um sicherzustellen, dass die Heilung nicht schlimmer ist als die Krankheit. Nutzer können die für Bots bestimmten Inhalte nicht sehen; das KI-Labyrinth fügt dem Web daher keinen weiteren generischen KI-Müll hinzu. Suchmaschinen können die KI-generierten Seiten nicht indexieren, weil Cloudflare zu diesem Zweck Meta-Direktiven hinzugefügt hat. Die gefälschten Websites wirken sich daher nicht auf die SEO-Rankings aus.
Cloudflare-Nutzer sehen in ihrem Kontrollmenü einen Schalter mit der Bezeichnung KI-Labyrinth. Um die Funktion zu aktivieren, gehen Sie zu „Security | Bots“ oder „Security | Settings“.


