Gratisrobots.txt-check voor AI-crawlers

AI-crawlercheck: mogen ChatGPT en Google AI je site lezen?

Of ChatGPT en Google AI je site mogen lezen, staat in je robots.txt. Vul je website in: de check haalt dat bestand op en toont voor 14 crawlers of ze toegelaten, deels of helemaal geblokkeerd zijn, met de regel die dat beslist. Voor ChatGPT telt vooral OAI-SearchBot, voor AI Overviews Googlebot en voor Gemini Google-Extended.

Door , oprichter · Laatst bijgewerkt:

Voorbeeld: OAI-SearchBot mag alles, PerplexityBot mag een deel, GPTBot mag niets. De gemarkeerde regels beslissen.
  • 24 uur

    kan het duren voor de zoekfunctie van ChatGPT een wijziging in je robots.txt oppikt.

    Bron: OpenAI
  • 5xx

    als antwoord op je robots.txt betekent voor een crawler: behandel de hele site als verboden.

    Bron: RFC 9309
  • 14

    crawlers en tokens leest de check, van Google, OpenAI, Anthropic, Perplexity, Apple, Amazon, Common Crawl en ByteDance.

    Bron: deze check

De check

Wat checkt de tool (robots.txt per AI-crawler)?

De tool haalt de robots.txt van je site op en leest hem zoals de standaard RFC 9309 voorschrijft. Per crawler zoekt hij de groep die voor die crawler geldt en de regel die over je homepage beslist. Je ziet 14 crawlers van 8 bedrijven, gegroepeerd naar doel: zoeken, ophalen op vraag, training en overig.

We halen alleen /robots.txt van dat domein op en bewaren niets van je check.

Voorbeeld

aidigitals.nl

Onze eigen robots.txt, zoals https://aidigitals.nl/robots.txt hem toont. Vul hierboven je eigen site in.

14 open0 half open0 dicht

Per crawler

Zoekresultaten in de AI-dienst4 crawlers

  • Googlebot

    Google · Google Zoeken, AI Overviews en AI-modus

    Niet genoemd*-groep: toegelaten

    User-agent: *Allow: / (deze regel beslist)

    Allow: / in de *-groep zet de hele site open.

  • OAI-SearchBot

    OpenAI · ChatGPT

    Toegelaten

    User-agent: OAI-SearchBotAllow: / (deze regel beslist)

    Allow: / in de groep voor OAI-SearchBot zet de hele site open.

  • Claude-SearchBot

    Anthropic · Claude

    Toegelaten

    User-agent: Claude-SearchBotAllow: / (deze regel beslist)

    Allow: / in de groep voor Claude-SearchBot zet de hele site open.

  • PerplexityBot

    Perplexity · Perplexity

    Toegelaten

    User-agent: PerplexityBotAllow: / (deze regel beslist)

    Allow: / in de groep voor PerplexityBot zet de hele site open.

Ophalen op vraag van een gebruiker3 crawlers

  • ChatGPT-User

    OpenAI · ChatGPT

    Toegelaten

    User-agent: ChatGPT-UserAllow: / (deze regel beslist)

    Allow: / in de groep voor ChatGPT-User zet de hele site open.

  • Claude-User

    Anthropic · Claude

    Toegelaten

    User-agent: Claude-UserAllow: / (deze regel beslist)

    Allow: / in de groep voor Claude-User zet de hele site open.

  • Perplexity-User

    Perplexity · Perplexity

    Toegelaten

    User-agent: Perplexity-UserAllow: / (deze regel beslist)

    Allow: / in de groep voor Perplexity-User zet de hele site open.

Training van AI-modellen5 crawlers

  • GPTBot

    OpenAI · ChatGPT

    Toegelaten

    User-agent: GPTBotAllow: / (deze regel beslist)

    Allow: / in de groep voor GPTBot zet de hele site open.

  • ClaudeBot

    Anthropic · Claude

    Toegelaten

    User-agent: ClaudeBotAllow: / (deze regel beslist)

    Allow: / in de groep voor ClaudeBot zet de hele site open.

  • Google-Extended

    Google · Gemini

    Toegelaten

    User-agent: Google-ExtendedAllow: / (deze regel beslist)

    Allow: / in de groep voor Google-Extended zet de hele site open.

  • Applebot-Extended

    Apple · Apple Intelligence

    Toegelaten

    User-agent: Applebot-ExtendedAllow: / (deze regel beslist)

    Allow: / in de groep voor Applebot-Extended zet de hele site open.

  • Amazonbot

    Amazon · Alexa en andere diensten van Amazon

    Niet genoemd*-groep: toegelaten

    User-agent: *Allow: / (deze regel beslist)

    Allow: / in de *-groep zet de hele site open.

Archief of niet gedocumenteerd2 crawlers

  • CCBot

    Common Crawl · Common Crawl (open webarchief)

    Toegelaten

    User-agent: CCBotAllow: / (deze regel beslist)

    Allow: / in de groep voor CCBot zet de hele site open.

  • Bytespider

    ByteDance · Diensten van ByteDance (TikTok)

    Niet genoemd*-groep: toegelaten

    User-agent: *Allow: / (deze regel beslist)

    Allow: / in de *-groep zet de hele site open.

Voorbeeld: de robots.txt van aidigitals.nl. Elke crawler is een poort: open, half open of dicht. De regel die beslist, is gemarkeerd. Dezelfde uitkomst staat in de tabel hieronder.
Voorbeeld: uitkomst per crawler voor aidigitals.nl
CrawlerBedrijfDoelUitkomstRegel die beslist
GooglebotGoogleZoekenNiet genoemd (*-groep: toegelaten)Allow: /
OAI-SearchBotOpenAIZoekenToegelatenAllow: /
Claude-SearchBotAnthropicZoekenToegelatenAllow: /
PerplexityBotPerplexityZoekenToegelatenAllow: /
ChatGPT-UserOpenAIOp vraagToegelatenAllow: /
Claude-UserAnthropicOp vraagToegelatenAllow: /
Perplexity-UserPerplexityOp vraagToegelatenAllow: /
GPTBotOpenAITrainingToegelatenAllow: /
ClaudeBotAnthropicTrainingToegelatenAllow: /
Google-ExtendedGoogleTrainingToegelatenAllow: /
Applebot-ExtendedAppleTrainingToegelatenAllow: /
AmazonbotAmazonTrainingNiet genoemd (*-groep: toegelaten)Allow: /
CCBotCommon CrawlOverigToegelatenAllow: /
BytespiderByteDanceOverigNiet genoemd (*-groep: toegelaten)Allow: /

Voorbeeld: de robots.txt van aidigitals.nl, zoals deze site hem zelf schrijft.

Zo werkt de check

Van adres tot poort in vijf stappen

  1. 1

    Adres

    We maken er een domeinnaam van. IP-adressen, poortnummers en interne namen checken we niet.

  2. 2

    Ophalen

    Alleen /robots.txt: eerst via https, anders via http. Hooguit 3 doorverwijzingen, 5 seconden en 500 KiB.

  3. 3

    Lezen

    De regels per user-agent-groep, zoals RFC 9309 ze beschrijft. Andere regels, zoals Crawl-delay, tellen niet mee.

  4. 4

    Beslissen

    Per crawler: zijn eigen groep, anders de *-groep. De langste regel die op / past wint; bij gelijke lengte wint Allow.

  5. 5

    Poort

    Open, half open of dicht, met de regel die het beslist. We bewaren niets van je check.

Zo werkt de check: van het adres dat je invult tot een poort per crawler. We halen één bestand op en bewaren niets.

Wat de check niet ziet

Robots.txt is één laag. Een crawler kan ook op je server of op de pagina zelf worden tegengehouden, en dat staat niet in dit bestand. Hoe die lagen samenhangen, lees je bij technische SEO.

  • Firewalls en botbescherming

    Robots.txt is een verzoek. Weigert je hosting of CDN een crawler op IP-adres of user-agent, dan ziet deze check dat niet. Bij Cloudflare heet die functie AI Crawl Control.

  • Regels op de pagina zelf

    Een noindex of nosnippet staat in de pagina, niet in robots.txt. Google noemt nosnippet, data-nosnippet, max-snippet en noindex als de knoppen voor wat AI Overviews van je pagina tonen.

  • Crawlers die op verzoek komen

    OpenAI schrijft dat robots.txt mogelijk niet geldt voor ChatGPT-User, en Perplexity dat Perplexity-User robots.txt doorgaans negeert: een gebruiker doet dan het verzoek.

De uitkomst

Wat betekent de uitkomst?

Een open poort betekent dat de crawler je hele site mag lezen, half open dat een deel dicht zit en dicht dat hij vanaf je homepage niets mag. Niet genoemd betekent dat je robots.txt de crawler niet bij naam noemt: dan geldt de *-groep, en zonder *-groep mag alles.

  • Toegelaten

    De crawler mag je hele site lezen: geen regel sluit iets af.

  • Deels geblokkeerd

    Een deel zit dicht, zoals /account/, of alles zit dicht behalve een map die een Allow-regel openzet.

  • Geblokkeerd

    Disallow: / zonder uitzondering. De crawler mag niets, ook je homepage niet.

  • Niet genoemd

    Geen groep met de naam van de crawler. Dan beslist de *-groep; is die er niet, dan mag alles.

Welke regel wint?

Een crawler volgt alleen de groep met zijn eigen naam. Heeft hij er geen, dan volgt hij de *-groep. In die groep beslist de langste regel die op het pad past, en bij een gelijke lengte wint Allow. Zo staat het in de standaard, RFC 9309, en zo rekent de check.

  1. Regel 1

    Een eigen groep vervangt de *-groep

    User-agent: *Disallow: /User-agent: GPTBotAllow: /
    • GPTBot: open · Toegelaten
    • OAI-SearchBot: dicht · Niet genoemd (*-groep: geblokkeerd)

    GPTBot heeft een eigen groep en volgt alleen die. De *-groep geldt dan niet meer voor hem, ook niet gedeeltelijk.

  2. Regel 2

    De langste regel wint

    User-agent: *Disallow: /Allow: /blog/
    • PerplexityBot: half open · Niet genoemd (*-groep: deels geblokkeerd)

    Disallow: / sluit alles, maar het langere Allow: /blog/ zet die map weer open. Uitkomst: half open.

  3. Regel 3

    Even lang? Dan wint Allow

    User-agent: ClaudeBotDisallow: /shopAllow: /shop
    • ClaudeBot: open · Toegelaten

    Twee regels voor precies hetzelfde pad spreken elkaar tegen. De standaard kiest dan de minst strenge: Allow.

  4. Regel 4

    Een lege Disallow verbiedt niets

    User-agent: Google-ExtendedDisallow:
    • Google-Extended: open · Toegelaten

    Disallow zonder pad is geen regel. Het lijkt op een blokkade, maar Google-Extended mag hier alles.

En als er geen robots.txt is?

Dan mag alles: een 404 op /robots.txt betekent voor een crawler dat er geen regels zijn. Een serverfout betekent het omgekeerde. Dan moet een crawler aannemen dat de hele site verboden is.

Wat de check en een crawler doen bij elk antwoord op /robots.txt
Antwoord op /robots.txtWat de check toontWat een crawler dan doet
Status 200 met een tekstbestandDe regels per crawlerVolgt de regels die voor hem gelden
Status 200 met een webpaginaGeen robots.txt: alles magVindt geen regels, dus mag alles lezen
404, 410 of een andere 4xxGeen robots.txt: alles magMag alles lezen (RFC 9309, 2.3.1.3)
401, 403, 407, 429 of een botcontroleNiet gelezen: de server weigert onsEen 4xx betekent geen regels, maar een server die ons weigert, weigert crawlers mogelijk ook
500 tot 599 (serverfout)Alles dichtMoet aannemen dat de hele site verboden is (RFC 9309, 2.3.1.4)
Geen antwoord (time-out, verbinding)Een foutmeldingOnbereikbaar: ook dan alles verboden (RFC 9309, 2.3.1.4)
Meer dan 3 doorverwijzingenEen foutmelding: wij volgen er 3Volgt er minstens 5 (RFC 9309, 2.3.1.2)

Bron: RFC 9309, de standaard voor robots.txt, gelezen op 29 september 2026.

Blokkeren

Wat doe je als je AI blokkeert?

Kijk eerst welk doel je blokkeert. Een zoekcrawler als OAI-SearchBot of PerplexityBot dicht betekent: niet in de zoekantwoorden van die dienst. Een trainingstoken dicht kost minder: met GPTBot dicht blijf je volgens OpenAI in de zoekantwoorden van ChatGPT, met Google-Extended dicht volgens Google in Google Zoeken. Wil je gevonden worden, zet dan de zoekcrawlers open.

Drie keuzes

Uitkomst berekend met dezelfde parser als de check

  • Vindbaar, maar geen training

    User-agent: GPTBotUser-agent: ClaudeBotUser-agent: Google-ExtendedUser-agent: Applebot-ExtendedUser-agent: CCBotDisallow: /User-agent: *Allow: /
    • OAI-SearchBotopen
    • Googlebotopen
    • PerplexityBotopen
    • GPTBotdicht
    • Google-Extendeddicht
    • ClaudeBotdicht

    De zoekcrawlers blijven open, de trainingstokens gaan dicht. OpenAI noemt deze combinatie zelf als voorbeeld.

  • Alles open

    User-agent: *Allow: /
    • OAI-SearchBotopen
    • Googlebotopen
    • PerplexityBotopen
    • GPTBotopen
    • Google-Extendedopen
    • ClaudeBotopen

    Eén regel voor alle crawlers. Wie het expliciet wil, geeft de AI-crawlers daarnaast een eigen groep met Allow: /.

  • Alles van AI dicht

    User-agent: GPTBotUser-agent: OAI-SearchBotUser-agent: ChatGPT-UserUser-agent: ClaudeBotUser-agent: Claude-SearchBotUser-agent: PerplexityBotUser-agent: Google-ExtendedDisallow: /
    • OAI-SearchBotdicht
    • Googlebotopen
    • PerplexityBotdicht
    • GPTBotdicht
    • Google-Extendeddicht
    • ClaudeBotdicht

    De crawlers van ChatGPT, Claude en Perplexity mogen niets, en Gemini mag je inhoud niet gebruiken. Googlebot staat nog open, en daarmee AI Overviews: daarvoor telt volgens Google de regel voor Googlebot.

Drie robots.txt-bestanden en wat ze doen voor zes crawlers. Een trainingstoken dicht laat de zoekcrawlers open; wie alles van AI dichtzet, houdt Googlebot en daarmee AI Overviews open.

Per ongeluk geblokkeerd? Zo los je het op

  1. 1Zoek de regel. De check toont per crawler de regel die beslist, en in welke groep die staat.
  2. 2Pas je robots.txt aan, in je CMS of in het bestand in de hoofdmap van je site. Haal Disallow: / weg bij de zoekcrawlers, of geef ze een eigen groep met Allow: /.
  3. 3Staat de regel er niet door jou in? Cloudflare's beheerde robots.txt zet zijn eigen AI-regels vóór je bestand. Zet die instelling uit of pas hem aan.
  4. 4Kijk ook naar je firewall. OpenAI raadt aan verzoeken van zijn gepubliceerde IP-adressen toe te laten; een blokkade daar gaat buiten robots.txt om.
  5. 5Geef het een dag en check opnieuw. OpenAI noemt ongeveer 24 uur voor de zoekfunctie, en RFC 9309 laat crawlers een kopie tot 24 uur gebruiken.

In ons eigen onderzoek sloot 12,5% van de 829 sites uit de Top 1.000 .nl-domeinen GPTBot bij naam helemaal uit (gemeten op 29 september 2026). Hoe dat per sector verschilt, lees je bij welke Nederlandse sites AI-crawlers blokkeren.

Wat een blokkade doet, per crawler, zoals het bedrijf het zelf schrijft
CrawlerDoelAls je hem blokkeert
Googlebot (Google)ZoekenGoogle leest je pagina's niet meer voor Zoeken. Volgens Google is robots.txt voor Googlebot ook de knop voor AI Overviews en AI-modus.
OAI-SearchBot (OpenAI)ZoekenJe site verschijnt niet in de zoekantwoorden van ChatGPT, hooguit als navigatielink.
Claude-SearchBot (Anthropic)ZoekenJe inhoud wordt niet geïndexeerd voor zoeken in Claude; je kunt minder zichtbaar worden.
PerplexityBot (Perplexity)ZoekenPerplexity raadt aan hem toe te laten, zodat je site in de zoekresultaten van Perplexity kan verschijnen.
ChatGPT-User (OpenAI)Op vraagBepaalt niet of je in de zoekresultaten van ChatGPT komt.
Claude-User (Anthropic)Op vraagClaude kan je pagina niet ophalen als een gebruiker ernaar vraagt; je kunt minder zichtbaar worden.
Perplexity-User (Perplexity)Op vraagHeeft weinig effect: deze fetcher negeert robots.txt doorgaans.
GPTBot (OpenAI)TrainingJe inhoud wordt niet gebruikt voor de training van OpenAI's generatieve modellen.
ClaudeBot (Anthropic)TrainingJe toekomstige inhoud blijft buiten de trainingsdata van Anthropic's modellen.
Google-Extended (Google)TrainingJe inhoud wordt niet gebruikt voor de training van Gemini-modellen en niet voor grounding in de Gemini-apps en Vertex AI. Google Zoeken merkt er niets van: het is geen rankingsignaal.
Applebot-Extended (Apple)TrainingJe inhoud wordt niet gebruikt voor de training van Apple's generatieve modellen. Je blijft vindbaar via Siri, Spotlight en Safari.
Amazonbot (Amazon)TrainingAmazonbot volgt je Disallow en haalt die pagina's niet op; de zoekcrawler Amzn-SearchBot heeft een eigen regel.
CCBot (Common Crawl)OverigCommon Crawl haalt je site niet meer op voor zijn archief.
Bytespider (ByteDance)OverigOnbekend: ByteDance zegt niet wat een blokkade doet.

Volgens de eigen pagina van elk bedrijf, gelezen op 29 september 2026; de links staan bij de bronnen onderaan.

Zichtbaar worden in AI is meer dan open staan

Een open poort is de voorwaarde, geen garantie. Of ChatGPT, Perplexity of Google je daarna ook noemt, hangt af van wat er op je pagina's staat en wie er naar je verwijst. Wil je weten waar je nu staat, vraag de AI-scan aan: vijf klantvragen aan drie AI-assistenten. Wil je het werk uit handen geven, dan is dat GEO uitbesteden.

“Een blokkade van GPTBot haalt je niet uit ChatGPT, een blokkade van OAI-SearchBot wel. Kijk dus niet of je 'AI' blokkeert, maar welk doel: training dichtzetten is een keuze, zoeken dichtzetten kost je de klanten die het aan ChatGPT vragen.”
Jaap MeijerJaap Meijer, oprichter van AI Digitals

Mag AI je site lezen? Weet je dan ook of AI je noemt?

De AI-scan stelt vijf vragen van jouw klanten aan ChatGPT, Gemini en Perplexity en laat zien of je genoemd wordt, en wie wel. Gratis, en de uitkomst direct op je scherm.

Wat vragen mensen nog meer over robots.txt en AI?

Check je eigen site: de check staat bovenaan deze pagina. Meer gratis hulpmiddelen vind je bij onze gratis tools.

Hoe zie je of een website een robots.txt heeft?

Zet /robots.txt achter het domein in je browser, bijvoorbeeld jouwbedrijf.nl/robots.txt. Zie je tekst met regels als User-agent en Disallow, dan heeft de site er een. Krijg je een foutpagina of een gewone webpagina, dan niet, en mag volgens de standaard (RFC 9309) elke crawler alles lezen. Deze check doet hetzelfde en leest de regels meteen per AI-crawler.

Verdwijn ik uit Google als ik Google-Extended blokkeer?

Nee. Google schrijft dat Google-Extended geen invloed heeft op je opname in Google Zoeken en geen rankingsignaal is. Het token bepaalt of Google je inhoud mag gebruiken voor de training van Gemini-modellen en voor grounding in de Gemini-apps en Vertex AI. Voor AI Overviews en AI-modus in Google Zoeken telt Googlebot, niet Google-Extended.

Hoe snel werkt een wijziging in robots.txt?

Meestal binnen een dag. De standaard, RFC 9309, zegt dat een crawler een opgeslagen kopie niet langer dan 24 uur hoort te gebruiken, en OpenAI schrijft dat het voor de zoekfunctie van ChatGPT ongeveer 24 uur kan duren. Check je site na een wijziging dus de volgende dag opnieuw.

Houden AI-crawlers zich aan robots.txt?

Robots.txt is een verzoek, geen slot: Cloudflare schrijft dat naleving vrijwillig is. OpenAI, Google, Anthropic en Perplexity geven elk robots.txt-tokens waarmee je hun crawlers stuurt, met uitzonderingen. OpenAI schrijft dat robots.txt mogelijk niet geldt voor ChatGPT-User, omdat een gebruiker het verzoek doet, en Perplexity dat Perplexity-User robots.txt doorgaans negeert.

Is robots.txt genoeg om inhoud af te schermen?

Nee. RFC 9309 zegt zelf dat robots.txt geen vervanging is voor echte beveiliging, en dat paden die je erin zet juist openbaar vindbaar worden. Wil je een pagina echt afschermen, zet er dan een wachtwoord op. Wil je een crawler technisch tegenhouden, dan doe je dat in je firewall of bij je CDN.

Moet ik AI-crawlers bij naam toelaten?

Niet per se. Zonder eigen groep geldt de *-groep, en staat die open, dan mag elke crawler alles. Een eigen groep met Allow: / maakt je keuze wel expliciet, zodat hij blijft staan als iemand later de *-groep aanpast. Onze eigen robots.txt, het Voorbeeld op deze pagina, noemt daarom 12 crawlers bij naam.

Bronnen

10 onderzoeken en publicaties waar de cijfers op deze pagina vandaan komen
  1. RFC 9309: Robots Exclusion Protocol · IETF, september 2022Groepen, langste match, Allow bij gelijke lengte; 4xx betekent geen regels, 5xx en onbereikbaar betekenen alles verboden; minstens 5 doorverwijzingen volgen; een kopie hooguit 24 uur gebruiken; minstens 500 KiB lezen; robots.txt is geen beveiliging. Gelezen op 29 september 2026.
  2. Overview of OpenAI Crawlers · OpenAIOAI-SearchBot (zoeken) en GPTBot (training) werken los van elkaar; ongeveer 24 uur na een wijziging voor zoeken; IP-adressen toelaten; robots.txt geldt mogelijk niet voor ChatGPT-User. Gelezen op 29 september 2026.
  3. Google's common crawlers · Google, bijgewerkt 14 juli 2026Google-Extended is een controletoken voor Gemini-training en grounding, zonder invloed op Google Zoeken of de ranking. Gelezen op 29 september 2026.
  4. AI features and your website · Google Search Central, bijgewerkt 10 december 2025Robots.txt voor Googlebot is de knop voor Zoeken, ook voor AI Overviews en AI-modus; nosnippet, data-nosnippet, max-snippet en noindex bepalen wat er getoond wordt. Gelezen op 29 september 2026.
  5. Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic, Claude Help CenterClaudeBot, Claude-SearchBot en Claude-User en wat een blokkade doet. Gelezen op 29 september 2026.
  6. Perplexity Crawlers · PerplexityPerplexityBot en Perplexity-User, dat robots.txt doorgaans negeert. Gelezen op 29 september 2026.
  7. About Applebot · Apple, bijgewerkt 4 september 2026Applebot-Extended als controletoken voor training. Gelezen op 29 september 2026.
  8. Amazonbot · AmazonAmazonbot en wat hij doet. Gelezen op 29 september 2026.
  9. CCBot · Common CrawlCCBot en het open webarchief. Gelezen op 29 september 2026.
  10. robots.txt setting · Cloudflare, bijgewerkt 3 augustus 2026De beheerde robots.txt zet Cloudflare's AI-regels vóór je eigen bestand; naleving is vrijwillig; AI Crawl Control blokkeert echt. Gelezen op 29 september 2026.

Door , oprichter van AI DigitalsOver de auteurLaatst bijgewerkt: