Zugriff für KI-Crawler: was freizugeben ist und wie man es prüft

KI-Produkte rufen Ihre Seiten mit eigenen Crawlern ab. Sie steuern in robots.txt, welche dies dürfen. Erlauben Sie gewünschte Crawler, blockieren Sie unerwünschte und prüfen Sie, ob Firewalls berechtigte Bots nicht versehentlich abweisen.

Synopsis
Steuerung
robots.txt im Hauptverzeichnis Ihrer Domain mit einer Regelgruppe pro User-Agent.
OpenAI
GPTBot (Trainingsdaten), OAI-SearchBot (Suche) und ChatGPT-User (ruft Seiten im Nutzerauftrag ab).
Anthropic
ClaudeBot.
Perplexity
PerplexityBot.
Google
Google-Extended ist ein robots.txt-Token zur Steuerung der Nutzung für Googles KI-Modelle. Kein eigenständiger Crawler.
Apple
Applebot-Extended ist das entsprechende Token für Apples KI-Funktionen.
Hersteller prüfen
Namen und Verhalten ändern sich. Prüfen Sie stets die offizielle Dokumentation der einzelnen Anbieter.

Welche KI-Crawler sollten Sie erlauben?

Das hängt von Ihren Zielen ab. Trainings-Crawler zu blockieren und Such-Crawler zuzulassen ist ein gängiger Mittelweg – die Entscheidung liegt bei Ihnen.

Erlauben wenn

  • Sie in der KI-Suche gefunden und zitiert werden möchten
  • Ihre Inhalte öffentlich zugänglich sein sollen

Blockieren wenn

  • Teile Ihrer Website privat oder lizenziert sind
  • Sie nicht möchten, dass Inhalte zum Modelltraining genutzt werden

Beachten

Ein blockierter Crawler kann Ihre Seite nicht erfassen und sie folglich nicht in Antworten zitieren.

Wie sieht eine robots.txt für KI-Crawler aus?

Eine Gruppe pro User-Agent. Ein leeres Disallow oder Allow: / erlaubt alles. Disallow mit Pfad sperrt diesen Bereich.

# Allow the crawlers you want, block the ones you do not
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Disallow: /private/

Sitemap: https://example.com/sitemap.xml

Wie überprüfen Sie, ob Crawler Ihre Seiten erreichen können?

Regeln in robots.txt sind nur die halbe Miete. Firewalls, Bot-Schutz und Rate-Limits können Crawler blockieren, die in robots.txt freigegeben sind.

Schritte

  1. Öffnen Sie /robots.txt auf Ihrer Domain und prüfen Sie die Gruppen.
  2. Rufen Sie eine Seite mit einem Crawler User-Agent ab und prüfen Sie den HTTP-Status 200.
  3. Prüfen Sie Firewall- und CDN-Einstellungen auf Regeln gegen Bots oder unbekannte User-Agents.
  4. Kontrollieren Sie Ihre Server-Logs auf Anfragen der zugelassenen Crawler.
  5. Führen Sie einen Scan durch, um die Crawler-Zugriffsprüfungen für Ihre Seite einzusehen.

Verwandte Begriffe: robots.txt, KI-Crawler und User-Agent.

Fragen.

Direkte Antworten zum Zugriff von KI-Crawlern.

Schadet das Blockieren von KI-Crawlern meinem Such-Ranking?

Regeln für KI-Crawler verändern Ihr Ranking in traditionellen Suchmaschinen nicht, da diese eigene Crawler nutzen. Sie steuern jedoch, ob KI-Produkte Ihre Seiten lesen können.

Befolgen alle KI-Crawler robots.txt?

Seriöse Crawler tun dies und große Anbieter dokumentieren dies ausdrücklich. Prüfen Sie die Dokumentation der einzelnen Anbieter und nutzen Sie Ihre Firewall für strikte Durchsetzung.

Wie oft sollte ich den Zugriff von KI-Crawlern prüfen?

Nach jeder Änderung an robots.txt, Ihrer Firewall oder Ihrem CDN sowie bei neuen Crawler-Namen.

Crawler-Zugriff für Ihre Website prüfen

Starten Sie einen Scan und sehen Sie sofort, ob KI-Crawler Ihre Seiten abrufen können.