Toegang voor AI-crawlers: wat toe te staan en hoe te verifiëren

AI-producten halen uw pagina's op met eigen crawlers, en u bepaalt in robots.txt welke crawlers toegang hebben. Sta de gewenste crawlers toe, blokkeer wat u wilt uitsluiten en controleer of firewalls de toegestane bots niet onbedoeld tegenhouden.

Synopsis
Waar u dit beheert
robots.txt in de hoofdmap van uw domein, met één groep regels per user-agent.
OpenAI
GPTBot (trainingsdata), OAI-SearchBot (zoeken) en ChatGPT-User (haalt pagina's op namens een gebruiker).
Anthropic
ClaudeBot.
Perplexity
PerplexityBot.
Google
Google-Extended is een robots.txt-token dat het gebruik van uw content voor Google's AI-modellen regelt. Het is geen aparte crawler.
Apple
Applebot-Extended is het vergelijkbare token voor Apple's AI-functionaliteiten.
Controleer documentatie
Namen en gedrag van crawlers veranderen. Verifieer deze altijd in de officiële documentatie van de leverancier.

Welke AI-crawlers moet u toestaan?

Dat hangt af van uw doelstellingen. Het blokkeren van trainingscrawlers en toestaan van zoekcrawlers is een veelgekozen tussenweg, maar de uiteindelijke keuze is aan u.

Toestaan als

  • U gevonden en geciteerd wilt worden in AI-zoeksystemen
  • Uw content openbaar is en bedoeld is om gelezen te worden

Blokkeren als

  • Delen van uw site afgeschermd of gelicentieerd zijn
  • U niet wilt dat uw content wordt gebruikt om modellen te trainen

Belangrijk

Een geblokkeerde crawler kan uw pagina's niet lezen en kan deze dus niet citeren vanuit die crawl.

Hoe ziet een robots.txt voor AI-crawlers eruit?

Eén groep per user-agent. Een lege Disallow of Allow: / staat alles toe. Disallow met een specifiek pad blokkeert dat pad.

# Allow the crawlers you want, block the ones you do not
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Disallow: /private/

Sitemap: https://example.com/sitemap.xml

Hoe controleert u of crawlers uw pagina's kunnen bereiken?

Regels in robots.txt zijn slechts de helft van het verhaal. Firewalls, botbeveiliging en rate limits kunnen crawlers blokkeren die in robots.txt zijn toegestaan.

Stappenplan

  1. Open /robots.txt op uw domein en controleer de groepen.
  2. Haal een pagina op met een crawler user-agent en controleer of de statuscode 200 is.
  3. Controleer uw firewall- en CDN-instellingen op regels die bots of onbekende user-agents blokkeren.
  4. Controleer uw serverlogs op verzoeken van de toegestane crawlers.
  5. Start een scan om de crawlertoegangscontroles voor uw site te bekijken.

Gerelateerde begrippen: robots.txt, AI-crawler en user-agent.

Vragen.

Directe antwoorden over toegang voor AI-crawlers.

Schaadt het blokkeren van AI-crawlers mijn zoekposities?

Regels voor AI-crawlers beïnvloeden uw positie in traditionele zoekmachines niet, omdat die eigen crawlers gebruiken. Ze bepalen wel of AI-assistenten en antwoordmachines uw pagina's kunnen raadplegen.

Respecteren alle AI-crawlers robots.txt?

Gerespecteerde crawlers doen dat, en grote leveranciers documenteren dit expliciet. Raadpleeg de documentatie van elke aanbieder en gebruik uw firewall voor strikte handhaving.

Hoe vaak moet ik de toegang voor AI-crawlers controleren?

Na elke wijziging in robots.txt, uw firewall of CDN, en wanneer er nieuwe crawlernamen bijkomen.

Controleer crawlertoegang op uw site

Start een scan en ontdek direct of AI-crawlers uw pagina's kunnen bereiken.