So sperrst du KI-Bots aus

Wer nicht möchte, dass die Inhalte einer Website von allen möglichen KI-Crawlern abgegrast und für das Training von großen Sprachmodellen (Large Language Models, kurz LLMs) verwendet werden, kann die einschlägigen Bots über die gute alte robots.txt blockieren. Alle auf einen Streich erwischt man aktuell mit diesem Code:
User-Agent: GPTBot
User-Agent: ClaudeBot
User-Agent: Claude-Web
User-Agent: CCBot
User-Agent: Applebot-Extended
User-Agent: Facebookbot
User-Agent: Meta-ExternalAgent
User-Agent: diffbot
User-Agent: PerplexityBot
User-Agent: Omgili
User-Agent: Omgilibot
User-Agent: ImagesiftBot
User-Agent: Bytespider
User-Agent: Amazonbot
User-Agent: Youbot
Disallow: /Das Snippet habe ich auf https://robotstxt.com/ai gefunden, wo es auch gepflegt und laufend aktualisiert wird. Es gibt dort auch jeweils den Code für die einzelnen Crawler inklusive ausführlicher Erklärungen, was diese tun und welche unerwünschten Nebenwirkungen man sich durchs Aussperren möglicherweise einhandelt.
PS: Natürlich gibt es keine Garantie, dass die Crawler sich an die robots.txt halten. Zumindest bei den großen und seriösen Anbietern darf man aber wohl davon ausgehen.
PPS: In Antworten auf mein Sharing des Beitrags bei Mastodon bin ich auf eine noch ausführlichere Liste gestoßen (worden):
User-agent: AI2Bot
User-agent: Ai2Bot-Dolma
User-agent: Amazonbot
User-agent: anthropic-ai
User-agent: Applebot
User-agent: Applebot-Extended
User-agent: Bytespider
User-agent: CCBot
User-agent: ChatGPT-User
User-agent: Claude-Web
User-agent: ClaudeBot
User-agent: cohere-ai
User-agent: Diffbot
User-agent: DuckAssistBot
User-agent: FacebookBot
User-agent: FriendlyCrawler
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: GoogleOther-Image
User-agent: GoogleOther-Video
User-agent: GPTBot
User-agent: iaskspider/2.0
User-agent: ICC-Crawler
User-agent: ImagesiftBot
User-agent: img2dataset
User-agent: ISSCyberRiskCrawler
User-agent: Kangaroo Bot
User-agent: Meta-ExternalAgent
User-agent: Meta-ExternalFetcher
User-agent: OAI-SearchBot
User-agent: omgili
User-agent: omgilibot
User-agent: PanguBot
User-agent: PerplexityBot
User-agent: PetalBot
User-agent: Scrapy
User-agent: Sidetrade indexer bot
User-agent: Timpibot
User-agent: VelenPublicWebCrawler
User-agent: Webzio-Extended
User-agent: YouBot
Disallow: /Liegt auf https://raw.githubusercontent.com/ai-robots-txt/ai.robots.txt/main/robots.txt.
Außerdem gab es dort den Hinweis, dass man das noch besser auf Webserver-Ebene machen könnte. Letzteres Kommt für mich aktuell nicht in Frage, da ich bei meinem Hoster weder nginx noch ausreichend tiefen Durchgriff habe.