So sperrst du KI-Bots aus

Wer nicht möchte, dass die Inhalte einer Website von allen möglichen KI-Crawlern abgegrast und für das Training von großen Sprachmodellen (Large Language Models, kurz LLMs) verwendet werden, kann die einschlägigen Bots über die gute alte robots.txt blockieren. Alle auf einen Streich erwischt man aktuell mit diesem Code:
User-Agent: GPTBotUser-Agent: ClaudeBotUser-Agent: Claude-WebUser-Agent: CCBotUser-Agent: Applebot-ExtendedUser-Agent: FacebookbotUser-Agent: Meta-ExternalAgentUser-Agent: diffbotUser-Agent: PerplexityBotUser-Agent: OmgiliUser-Agent: OmgilibotUser-Agent: ImagesiftBotUser-Agent: BytespiderUser-Agent: AmazonbotUser-Agent: YoubotDisallow: / Das Snippet habe ich auf https://robotstxt.com/ai gefunden, wo es auch gepflegt und laufend aktualisiert wird. Es gibt dort auch jeweils den Code für die einzelnen Crawler inklusive ausführlicher Erklärungen, was diese tun und welche unerwünschten Nebenwirkungen man sich durchs Aussperren möglicherweise einhandelt.
PS: Natürlich gibt es keine Garantie, dass die Crawler sich an die robots.txt halten. Zumindest bei den großen und seriösen Anbietern darf man aber wohl davon ausgehen.
PPS: In Antworten auf mein Sharing des Beitrags bei Mastodon bin ich auf eine noch ausführlichere Liste gestoßen (worden):
User-agent: AI2BotUser-agent: Ai2Bot-DolmaUser-agent: AmazonbotUser-agent: anthropic-aiUser-agent: ApplebotUser-agent: Applebot-ExtendedUser-agent: BytespiderUser-agent: CCBotUser-agent: ChatGPT-UserUser-agent: Claude-WebUser-agent: ClaudeBotUser-agent: cohere-aiUser-agent: DiffbotUser-agent: DuckAssistBotUser-agent: FacebookBotUser-agent: FriendlyCrawlerUser-agent: Google-ExtendedUser-agent: GoogleOtherUser-agent: GoogleOther-ImageUser-agent: GoogleOther-VideoUser-agent: GPTBotUser-agent: iaskspider/2.0User-agent: ICC-CrawlerUser-agent: ImagesiftBotUser-agent: img2datasetUser-agent: ISSCyberRiskCrawlerUser-agent: Kangaroo BotUser-agent: Meta-ExternalAgentUser-agent: Meta-ExternalFetcherUser-agent: OAI-SearchBotUser-agent: omgiliUser-agent: omgilibotUser-agent: PanguBotUser-agent: PerplexityBotUser-agent: PetalBotUser-agent: ScrapyUser-agent: Sidetrade indexer botUser-agent: TimpibotUser-agent: VelenPublicWebCrawlerUser-agent: Webzio-ExtendedUser-agent: YouBotDisallow: / Liegt auf https://raw.githubusercontent.com/ai-robots-txt/ai.robots.txt/main/robots.txt.
Außerdem gab es dort den Hinweis, dass man das noch besser auf Webserver-Ebene machen könnte. Letzteres Kommt für mich aktuell nicht in Frage, da ich bei meinem Hoster weder nginx noch ausreichend tiefen Durchgriff habe.