Gratisrobots.txt-check voor AI-crawlers
AI-crawlercheck: mogen ChatGPT en Google AI je site lezen?
Of ChatGPT en Google AI je site mogen lezen, staat in je robots.txt. Vul je website in: de check haalt dat bestand op en toont voor 14 crawlers of ze toegelaten, deels of helemaal geblokkeerd zijn, met de regel die dat beslist. Voor ChatGPT telt vooral OAI-SearchBot, voor AI Overviews Googlebot en voor Gemini Google-Extended.
Door Jaap Meijer, oprichter · Laatst bijgewerkt:
24 uur
kan het duren voor de zoekfunctie van ChatGPT een wijziging in je robots.txt oppikt.
Bron: OpenAI5xx
als antwoord op je robots.txt betekent voor een crawler: behandel de hele site als verboden.
Bron: RFC 930914
crawlers en tokens leest de check, van Google, OpenAI, Anthropic, Perplexity, Apple, Amazon, Common Crawl en ByteDance.
Bron: deze check
De check
Wat checkt de tool (robots.txt per AI-crawler)?
De tool haalt de robots.txt van je site op en leest hem zoals de standaard RFC 9309 voorschrijft. Per crawler zoekt hij de groep die voor die crawler geldt en de regel die over je homepage beslist. Je ziet 14 crawlers van 8 bedrijven, gegroepeerd naar doel: zoeken, ophalen op vraag, training en overig.
Voorbeeld
aidigitals.nl
Onze eigen robots.txt, zoals https://aidigitals.nl/robots.txt hem toont. Vul hierboven je eigen site in.
14 open0 half open0 dicht
Per crawler
Zoekresultaten in de AI-dienst4 crawlers
Googlebot
Google · Google Zoeken, AI Overviews en AI-modus
Niet genoemd*-groep: toegelaten
User-agent: *Allow: / (deze regel beslist)
Allow: / in de *-groep zet de hele site open.
OAI-SearchBot
OpenAI · ChatGPT
Toegelaten
User-agent: OAI-SearchBotAllow: / (deze regel beslist)
Allow: / in de groep voor OAI-SearchBot zet de hele site open.
Claude-SearchBot
Anthropic · Claude
Toegelaten
User-agent: Claude-SearchBotAllow: / (deze regel beslist)
Allow: / in de groep voor Claude-SearchBot zet de hele site open.
PerplexityBot
Perplexity · Perplexity
Toegelaten
User-agent: PerplexityBotAllow: / (deze regel beslist)
Allow: / in de groep voor PerplexityBot zet de hele site open.
Ophalen op vraag van een gebruiker3 crawlers
ChatGPT-User
OpenAI · ChatGPT
Toegelaten
User-agent: ChatGPT-UserAllow: / (deze regel beslist)
Allow: / in de groep voor ChatGPT-User zet de hele site open.
Claude-User
Anthropic · Claude
Toegelaten
User-agent: Claude-UserAllow: / (deze regel beslist)
Allow: / in de groep voor Claude-User zet de hele site open.
Perplexity-User
Perplexity · Perplexity
Toegelaten
User-agent: Perplexity-UserAllow: / (deze regel beslist)
Allow: / in de groep voor Perplexity-User zet de hele site open.
Training van AI-modellen5 crawlers
GPTBot
OpenAI · ChatGPT
Toegelaten
User-agent: GPTBotAllow: / (deze regel beslist)
Allow: / in de groep voor GPTBot zet de hele site open.
ClaudeBot
Anthropic · Claude
Toegelaten
User-agent: ClaudeBotAllow: / (deze regel beslist)
Allow: / in de groep voor ClaudeBot zet de hele site open.
Google-Extended
Google · Gemini
Toegelaten
User-agent: Google-ExtendedAllow: / (deze regel beslist)
Allow: / in de groep voor Google-Extended zet de hele site open.
Applebot-Extended
Apple · Apple Intelligence
Toegelaten
User-agent: Applebot-ExtendedAllow: / (deze regel beslist)
Allow: / in de groep voor Applebot-Extended zet de hele site open.
Amazonbot
Amazon · Alexa en andere diensten van Amazon
Niet genoemd*-groep: toegelaten
User-agent: *Allow: / (deze regel beslist)
Allow: / in de *-groep zet de hele site open.
Archief of niet gedocumenteerd2 crawlers
CCBot
Common Crawl · Common Crawl (open webarchief)
Toegelaten
User-agent: CCBotAllow: / (deze regel beslist)
Allow: / in de groep voor CCBot zet de hele site open.
Bytespider
ByteDance · Diensten van ByteDance (TikTok)
Niet genoemd*-groep: toegelaten
User-agent: *Allow: / (deze regel beslist)
Allow: / in de *-groep zet de hele site open.
| Crawler | Bedrijf | Doel | Uitkomst | Regel die beslist |
|---|---|---|---|---|
| Googlebot | Zoeken | Niet genoemd (*-groep: toegelaten) | Allow: / | |
| OAI-SearchBot | OpenAI | Zoeken | Toegelaten | Allow: / |
| Claude-SearchBot | Anthropic | Zoeken | Toegelaten | Allow: / |
| PerplexityBot | Perplexity | Zoeken | Toegelaten | Allow: / |
| ChatGPT-User | OpenAI | Op vraag | Toegelaten | Allow: / |
| Claude-User | Anthropic | Op vraag | Toegelaten | Allow: / |
| Perplexity-User | Perplexity | Op vraag | Toegelaten | Allow: / |
| GPTBot | OpenAI | Training | Toegelaten | Allow: / |
| ClaudeBot | Anthropic | Training | Toegelaten | Allow: / |
| Google-Extended | Training | Toegelaten | Allow: / | |
| Applebot-Extended | Apple | Training | Toegelaten | Allow: / |
| Amazonbot | Amazon | Training | Niet genoemd (*-groep: toegelaten) | Allow: / |
| CCBot | Common Crawl | Overig | Toegelaten | Allow: / |
| Bytespider | ByteDance | Overig | Niet genoemd (*-groep: toegelaten) | Allow: / |
Voorbeeld: de robots.txt van aidigitals.nl, zoals deze site hem zelf schrijft.
Zo werkt de check
Van adres tot poort in vijf stappen
- 1
Adres
We maken er een domeinnaam van. IP-adressen, poortnummers en interne namen checken we niet.
- 2
Ophalen
Alleen /robots.txt: eerst via https, anders via http. Hooguit 3 doorverwijzingen, 5 seconden en 500 KiB.
- 3
Lezen
De regels per user-agent-groep, zoals RFC 9309 ze beschrijft. Andere regels, zoals Crawl-delay, tellen niet mee.
- 4
Beslissen
Per crawler: zijn eigen groep, anders de *-groep. De langste regel die op / past wint; bij gelijke lengte wint Allow.
- 5
Poort
Open, half open of dicht, met de regel die het beslist. We bewaren niets van je check.
Wat de check niet ziet
Robots.txt is één laag. Een crawler kan ook op je server of op de pagina zelf worden tegengehouden, en dat staat niet in dit bestand. Hoe die lagen samenhangen, lees je bij technische SEO.
Firewalls en botbescherming
Robots.txt is een verzoek. Weigert je hosting of CDN een crawler op IP-adres of user-agent, dan ziet deze check dat niet. Bij Cloudflare heet die functie AI Crawl Control.
Regels op de pagina zelf
Een noindex of nosnippet staat in de pagina, niet in robots.txt. Google noemt nosnippet, data-nosnippet, max-snippet en noindex als de knoppen voor wat AI Overviews van je pagina tonen.
Crawlers die op verzoek komen
OpenAI schrijft dat robots.txt mogelijk niet geldt voor ChatGPT-User, en Perplexity dat Perplexity-User robots.txt doorgaans negeert: een gebruiker doet dan het verzoek.
De uitkomst
Wat betekent de uitkomst?
Een open poort betekent dat de crawler je hele site mag lezen, half open dat een deel dicht zit en dicht dat hij vanaf je homepage niets mag. Niet genoemd betekent dat je robots.txt de crawler niet bij naam noemt: dan geldt de *-groep, en zonder *-groep mag alles.
Toegelaten
De crawler mag je hele site lezen: geen regel sluit iets af.
Deels geblokkeerd
Een deel zit dicht, zoals /account/, of alles zit dicht behalve een map die een Allow-regel openzet.
Geblokkeerd
Disallow: / zonder uitzondering. De crawler mag niets, ook je homepage niet.
Niet genoemd
Geen groep met de naam van de crawler. Dan beslist de *-groep; is die er niet, dan mag alles.
Welke regel wint?
Een crawler volgt alleen de groep met zijn eigen naam. Heeft hij er geen, dan volgt hij de *-groep. In die groep beslist de langste regel die op het pad past, en bij een gelijke lengte wint Allow. Zo staat het in de standaard, RFC 9309, en zo rekent de check.
Regel 1
Een eigen groep vervangt de *-groep
User-agent: *Disallow: /User-agent: GPTBotAllow: /
- GPTBot: open · Toegelaten
- OAI-SearchBot: dicht · Niet genoemd (*-groep: geblokkeerd)
GPTBot heeft een eigen groep en volgt alleen die. De *-groep geldt dan niet meer voor hem, ook niet gedeeltelijk.
Regel 2
De langste regel wint
User-agent: *Disallow: /Allow: /blog/
- PerplexityBot: half open · Niet genoemd (*-groep: deels geblokkeerd)
Disallow: / sluit alles, maar het langere Allow: /blog/ zet die map weer open. Uitkomst: half open.
Regel 3
Even lang? Dan wint Allow
User-agent: ClaudeBotDisallow: /shopAllow: /shop
- ClaudeBot: open · Toegelaten
Twee regels voor precies hetzelfde pad spreken elkaar tegen. De standaard kiest dan de minst strenge: Allow.
Regel 4
Een lege Disallow verbiedt niets
User-agent: Google-ExtendedDisallow:
- Google-Extended: open · Toegelaten
Disallow zonder pad is geen regel. Het lijkt op een blokkade, maar Google-Extended mag hier alles.
En als er geen robots.txt is?
Dan mag alles: een 404 op /robots.txt betekent voor een crawler dat er geen regels zijn. Een serverfout betekent het omgekeerde. Dan moet een crawler aannemen dat de hele site verboden is.
| Antwoord op /robots.txt | Wat de check toont | Wat een crawler dan doet |
|---|---|---|
| Status 200 met een tekstbestand | De regels per crawler | Volgt de regels die voor hem gelden |
| Status 200 met een webpagina | Geen robots.txt: alles mag | Vindt geen regels, dus mag alles lezen |
| 404, 410 of een andere 4xx | Geen robots.txt: alles mag | Mag alles lezen (RFC 9309, 2.3.1.3) |
| 401, 403, 407, 429 of een botcontrole | Niet gelezen: de server weigert ons | Een 4xx betekent geen regels, maar een server die ons weigert, weigert crawlers mogelijk ook |
| 500 tot 599 (serverfout) | Alles dicht | Moet aannemen dat de hele site verboden is (RFC 9309, 2.3.1.4) |
| Geen antwoord (time-out, verbinding) | Een foutmelding | Onbereikbaar: ook dan alles verboden (RFC 9309, 2.3.1.4) |
| Meer dan 3 doorverwijzingen | Een foutmelding: wij volgen er 3 | Volgt er minstens 5 (RFC 9309, 2.3.1.2) |
Bron: RFC 9309, de standaard voor robots.txt, gelezen op 29 september 2026.
Blokkeren
Wat doe je als je AI blokkeert?
Kijk eerst welk doel je blokkeert. Een zoekcrawler als OAI-SearchBot of PerplexityBot dicht betekent: niet in de zoekantwoorden van die dienst. Een trainingstoken dicht kost minder: met GPTBot dicht blijf je volgens OpenAI in de zoekantwoorden van ChatGPT, met Google-Extended dicht volgens Google in Google Zoeken. Wil je gevonden worden, zet dan de zoekcrawlers open.
Drie keuzes
Uitkomst berekend met dezelfde parser als de check
Vindbaar, maar geen training
User-agent: GPTBotUser-agent: ClaudeBotUser-agent: Google-ExtendedUser-agent: Applebot-ExtendedUser-agent: CCBotDisallow: /User-agent: *Allow: /
- OAI-SearchBotopen
- Googlebotopen
- PerplexityBotopen
- GPTBotdicht
- Google-Extendeddicht
- ClaudeBotdicht
De zoekcrawlers blijven open, de trainingstokens gaan dicht. OpenAI noemt deze combinatie zelf als voorbeeld.
Alles open
User-agent: *Allow: /
- OAI-SearchBotopen
- Googlebotopen
- PerplexityBotopen
- GPTBotopen
- Google-Extendedopen
- ClaudeBotopen
Eén regel voor alle crawlers. Wie het expliciet wil, geeft de AI-crawlers daarnaast een eigen groep met Allow: /.
Alles van AI dicht
User-agent: GPTBotUser-agent: OAI-SearchBotUser-agent: ChatGPT-UserUser-agent: ClaudeBotUser-agent: Claude-SearchBotUser-agent: PerplexityBotUser-agent: Google-ExtendedDisallow: /
- OAI-SearchBotdicht
- Googlebotopen
- PerplexityBotdicht
- GPTBotdicht
- Google-Extendeddicht
- ClaudeBotdicht
De crawlers van ChatGPT, Claude en Perplexity mogen niets, en Gemini mag je inhoud niet gebruiken. Googlebot staat nog open, en daarmee AI Overviews: daarvoor telt volgens Google de regel voor Googlebot.
Per ongeluk geblokkeerd? Zo los je het op
- 1Zoek de regel. De check toont per crawler de regel die beslist, en in welke groep die staat.
- 2Pas je robots.txt aan, in je CMS of in het bestand in de hoofdmap van je site. Haal Disallow: / weg bij de zoekcrawlers, of geef ze een eigen groep met Allow: /.
- 3Staat de regel er niet door jou in? Cloudflare's beheerde robots.txt zet zijn eigen AI-regels vóór je bestand. Zet die instelling uit of pas hem aan.
- 4Kijk ook naar je firewall. OpenAI raadt aan verzoeken van zijn gepubliceerde IP-adressen toe te laten; een blokkade daar gaat buiten robots.txt om.
- 5Geef het een dag en check opnieuw. OpenAI noemt ongeveer 24 uur voor de zoekfunctie, en RFC 9309 laat crawlers een kopie tot 24 uur gebruiken.
In ons eigen onderzoek sloot 12,5% van de 829 sites uit de Top 1.000 .nl-domeinen GPTBot bij naam helemaal uit (gemeten op 29 september 2026). Hoe dat per sector verschilt, lees je bij welke Nederlandse sites AI-crawlers blokkeren.
| Crawler | Doel | Als je hem blokkeert |
|---|---|---|
| Googlebot (Google) | Zoeken | Google leest je pagina's niet meer voor Zoeken. Volgens Google is robots.txt voor Googlebot ook de knop voor AI Overviews en AI-modus. |
| OAI-SearchBot (OpenAI) | Zoeken | Je site verschijnt niet in de zoekantwoorden van ChatGPT, hooguit als navigatielink. |
| Claude-SearchBot (Anthropic) | Zoeken | Je inhoud wordt niet geïndexeerd voor zoeken in Claude; je kunt minder zichtbaar worden. |
| PerplexityBot (Perplexity) | Zoeken | Perplexity raadt aan hem toe te laten, zodat je site in de zoekresultaten van Perplexity kan verschijnen. |
| ChatGPT-User (OpenAI) | Op vraag | Bepaalt niet of je in de zoekresultaten van ChatGPT komt. |
| Claude-User (Anthropic) | Op vraag | Claude kan je pagina niet ophalen als een gebruiker ernaar vraagt; je kunt minder zichtbaar worden. |
| Perplexity-User (Perplexity) | Op vraag | Heeft weinig effect: deze fetcher negeert robots.txt doorgaans. |
| GPTBot (OpenAI) | Training | Je inhoud wordt niet gebruikt voor de training van OpenAI's generatieve modellen. |
| ClaudeBot (Anthropic) | Training | Je toekomstige inhoud blijft buiten de trainingsdata van Anthropic's modellen. |
| Google-Extended (Google) | Training | Je inhoud wordt niet gebruikt voor de training van Gemini-modellen en niet voor grounding in de Gemini-apps en Vertex AI. Google Zoeken merkt er niets van: het is geen rankingsignaal. |
| Applebot-Extended (Apple) | Training | Je inhoud wordt niet gebruikt voor de training van Apple's generatieve modellen. Je blijft vindbaar via Siri, Spotlight en Safari. |
| Amazonbot (Amazon) | Training | Amazonbot volgt je Disallow en haalt die pagina's niet op; de zoekcrawler Amzn-SearchBot heeft een eigen regel. |
| CCBot (Common Crawl) | Overig | Common Crawl haalt je site niet meer op voor zijn archief. |
| Bytespider (ByteDance) | Overig | Onbekend: ByteDance zegt niet wat een blokkade doet. |
Volgens de eigen pagina van elk bedrijf, gelezen op 29 september 2026; de links staan bij de bronnen onderaan.
Zichtbaar worden in AI is meer dan open staan
Een open poort is de voorwaarde, geen garantie. Of ChatGPT, Perplexity of Google je daarna ook noemt, hangt af van wat er op je pagina's staat en wie er naar je verwijst. Wil je weten waar je nu staat, vraag de AI-scan aan: vijf klantvragen aan drie AI-assistenten. Wil je het werk uit handen geven, dan is dat GEO uitbesteden.
“Een blokkade van GPTBot haalt je niet uit ChatGPT, een blokkade van OAI-SearchBot wel. Kijk dus niet of je 'AI' blokkeert, maar welk doel: training dichtzetten is een keuze, zoeken dichtzetten kost je de klanten die het aan ChatGPT vragen.”
Jaap Meijer, oprichter van AI DigitalsMag AI je site lezen? Weet je dan ook of AI je noemt?
De AI-scan stelt vijf vragen van jouw klanten aan ChatGPT, Gemini en Perplexity en laat zien of je genoemd wordt, en wie wel. Gratis, en de uitkomst direct op je scherm.
Wat vragen mensen nog meer over robots.txt en AI?
Check je eigen site: de check staat bovenaan deze pagina. Meer gratis hulpmiddelen vind je bij onze gratis tools.
Hoe zie je of een website een robots.txt heeft?
Zet /robots.txt achter het domein in je browser, bijvoorbeeld jouwbedrijf.nl/robots.txt. Zie je tekst met regels als User-agent en Disallow, dan heeft de site er een. Krijg je een foutpagina of een gewone webpagina, dan niet, en mag volgens de standaard (RFC 9309) elke crawler alles lezen. Deze check doet hetzelfde en leest de regels meteen per AI-crawler.
Verdwijn ik uit Google als ik Google-Extended blokkeer?
Nee. Google schrijft dat Google-Extended geen invloed heeft op je opname in Google Zoeken en geen rankingsignaal is. Het token bepaalt of Google je inhoud mag gebruiken voor de training van Gemini-modellen en voor grounding in de Gemini-apps en Vertex AI. Voor AI Overviews en AI-modus in Google Zoeken telt Googlebot, niet Google-Extended.
Hoe snel werkt een wijziging in robots.txt?
Meestal binnen een dag. De standaard, RFC 9309, zegt dat een crawler een opgeslagen kopie niet langer dan 24 uur hoort te gebruiken, en OpenAI schrijft dat het voor de zoekfunctie van ChatGPT ongeveer 24 uur kan duren. Check je site na een wijziging dus de volgende dag opnieuw.
Houden AI-crawlers zich aan robots.txt?
Robots.txt is een verzoek, geen slot: Cloudflare schrijft dat naleving vrijwillig is. OpenAI, Google, Anthropic en Perplexity geven elk robots.txt-tokens waarmee je hun crawlers stuurt, met uitzonderingen. OpenAI schrijft dat robots.txt mogelijk niet geldt voor ChatGPT-User, omdat een gebruiker het verzoek doet, en Perplexity dat Perplexity-User robots.txt doorgaans negeert.
Is robots.txt genoeg om inhoud af te schermen?
Nee. RFC 9309 zegt zelf dat robots.txt geen vervanging is voor echte beveiliging, en dat paden die je erin zet juist openbaar vindbaar worden. Wil je een pagina echt afschermen, zet er dan een wachtwoord op. Wil je een crawler technisch tegenhouden, dan doe je dat in je firewall of bij je CDN.
Moet ik AI-crawlers bij naam toelaten?
Niet per se. Zonder eigen groep geldt de *-groep, en staat die open, dan mag elke crawler alles. Een eigen groep met Allow: / maakt je keuze wel expliciet, zodat hij blijft staan als iemand later de *-groep aanpast. Onze eigen robots.txt, het Voorbeeld op deze pagina, noemt daarom 12 crawlers bij naam.
Bronnen
10 onderzoeken en publicaties waar de cijfers op deze pagina vandaan komen
- RFC 9309: Robots Exclusion Protocol · IETF, september 2022Groepen, langste match, Allow bij gelijke lengte; 4xx betekent geen regels, 5xx en onbereikbaar betekenen alles verboden; minstens 5 doorverwijzingen volgen; een kopie hooguit 24 uur gebruiken; minstens 500 KiB lezen; robots.txt is geen beveiliging. Gelezen op 29 september 2026.
- Overview of OpenAI Crawlers · OpenAIOAI-SearchBot (zoeken) en GPTBot (training) werken los van elkaar; ongeveer 24 uur na een wijziging voor zoeken; IP-adressen toelaten; robots.txt geldt mogelijk niet voor ChatGPT-User. Gelezen op 29 september 2026.
- Google's common crawlers · Google, bijgewerkt 14 juli 2026Google-Extended is een controletoken voor Gemini-training en grounding, zonder invloed op Google Zoeken of de ranking. Gelezen op 29 september 2026.
- AI features and your website · Google Search Central, bijgewerkt 10 december 2025Robots.txt voor Googlebot is de knop voor Zoeken, ook voor AI Overviews en AI-modus; nosnippet, data-nosnippet, max-snippet en noindex bepalen wat er getoond wordt. Gelezen op 29 september 2026.
- Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic, Claude Help CenterClaudeBot, Claude-SearchBot en Claude-User en wat een blokkade doet. Gelezen op 29 september 2026.
- Perplexity Crawlers · PerplexityPerplexityBot en Perplexity-User, dat robots.txt doorgaans negeert. Gelezen op 29 september 2026.
- About Applebot · Apple, bijgewerkt 4 september 2026Applebot-Extended als controletoken voor training. Gelezen op 29 september 2026.
- Amazonbot · AmazonAmazonbot en wat hij doet. Gelezen op 29 september 2026.
- CCBot · Common CrawlCCBot en het open webarchief. Gelezen op 29 september 2026.
- robots.txt setting · Cloudflare, bijgewerkt 3 augustus 2026De beheerde robots.txt zet Cloudflare's AI-regels vóór je eigen bestand; naleving is vrijwillig; AI Crawl Control blokkeert echt. Gelezen op 29 september 2026.
Door Jaap Meijer, oprichter van AI DigitalsOver de auteurLaatst bijgewerkt: