Toegang voor AI-crawlers: wat toe te staan en hoe te verifiëren
AI-producten halen uw pagina's op met eigen crawlers, en u bepaalt in robots.txt welke crawlers toegang hebben. Sta de gewenste crawlers toe, blokkeer wat u wilt uitsluiten en controleer of firewalls de toegestane bots niet onbedoeld tegenhouden.
Synopsis
- Waar u dit beheert
- robots.txt in de hoofdmap van uw domein, met één groep regels per user-agent.
- OpenAI
- GPTBot (trainingsdata), OAI-SearchBot (zoeken) en ChatGPT-User (haalt pagina's op namens een gebruiker).
- Anthropic
- ClaudeBot.
- Perplexity
- PerplexityBot.
- Google-Extended is een robots.txt-token dat het gebruik van uw content voor Google's AI-modellen regelt. Het is geen aparte crawler.
- Apple
- Applebot-Extended is het vergelijkbare token voor Apple's AI-functionaliteiten.
- Controleer documentatie
- Namen en gedrag van crawlers veranderen. Verifieer deze altijd in de officiële documentatie van de leverancier.
Welke AI-crawlers moet u toestaan?
Dat hangt af van uw doelstellingen. Het blokkeren van trainingscrawlers en toestaan van zoekcrawlers is een veelgekozen tussenweg, maar de uiteindelijke keuze is aan u.
Toestaan als
- U gevonden en geciteerd wilt worden in AI-zoeksystemen
- Uw content openbaar is en bedoeld is om gelezen te worden
Blokkeren als
- Delen van uw site afgeschermd of gelicentieerd zijn
- U niet wilt dat uw content wordt gebruikt om modellen te trainen
Belangrijk
Een geblokkeerde crawler kan uw pagina's niet lezen en kan deze dus niet citeren vanuit die crawl.
Hoe ziet een robots.txt voor AI-crawlers eruit?
Eén groep per user-agent. Een lege Disallow of Allow: / staat alles toe. Disallow met een specifiek pad blokkeert dat pad.
# Allow the crawlers you want, block the ones you do not
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Disallow: /private/
Sitemap: https://example.com/sitemap.xmlHoe controleert u of crawlers uw pagina's kunnen bereiken?
Regels in robots.txt zijn slechts de helft van het verhaal. Firewalls, botbeveiliging en rate limits kunnen crawlers blokkeren die in robots.txt zijn toegestaan.
Stappenplan
- Open /robots.txt op uw domein en controleer de groepen.
- Haal een pagina op met een crawler user-agent en controleer of de statuscode 200 is.
- Controleer uw firewall- en CDN-instellingen op regels die bots of onbekende user-agents blokkeren.
- Controleer uw serverlogs op verzoeken van de toegestane crawlers.
- Start een scan om de crawlertoegangscontroles voor uw site te bekijken.
Gerelateerde begrippen: robots.txt, AI-crawler en user-agent.
Vragen.
Directe antwoorden over toegang voor AI-crawlers.
Schaadt het blokkeren van AI-crawlers mijn zoekposities?
Regels voor AI-crawlers beïnvloeden uw positie in traditionele zoekmachines niet, omdat die eigen crawlers gebruiken. Ze bepalen wel of AI-assistenten en antwoordmachines uw pagina's kunnen raadplegen.
Respecteren alle AI-crawlers robots.txt?
Gerespecteerde crawlers doen dat, en grote leveranciers documenteren dit expliciet. Raadpleeg de documentatie van elke aanbieder en gebruik uw firewall voor strikte handhaving.
Hoe vaak moet ik de toegang voor AI-crawlers controleren?
Na elke wijziging in robots.txt, uw firewall of CDN, en wanneer er nieuwe crawlernamen bijkomen.
Controleer crawlertoegang op uw site
Start een scan en ontdek direct of AI-crawlers uw pagina's kunnen bereiken.