Welke Nederlandse websites blokkeren AI-crawlers? (onderzoek 2026)

Weinig, behalve nieuwsmedia. Van de 1.000 meest bezochte .nl-domeinen konden we op 29 september 2026 van 829 de robots.txt lezen: 12,5% blokkeert GPTBot, 10,0% ClaudeBot en 7,4% PerplexityBot, en 83,6% noemt GPTBot niet. Van de nieuwsmedia blokkeert 90,2% GPTBot; overheden blokkeren vrijwel niets.

Door , oprichterOver de auteurLaatst bijgewerkt:

Geblokkeerd in robots.txt, top 1.000 .nl-domeinen (829 leesbaar), 29 september 2026
  • GPTBotOpenAI12,5%
  • ClaudeBotAnthropic10,0%
  • PerplexityBotPerplexity7,4%

Ter vergelijking: 90,2% van 41 Nederlandse nieuwsmedia blokkeert GPTBot.

Gratis AI-zichtbaarheidscheck

Vijf vragen van jouw klanten, gesteld aan ChatGPT, Gemini en Perplexity. Je ziet of je genoemd wordt, en wie wel.

Hoeveel .nl-sites blokkeren GPTBot, ClaudeBot en PerplexityBot?

Weinig. Van de 829 leesbare sites in de top 1.000 .nl blokkeert 12,5% GPTBot helemaal, 10,0% ClaudeBot en 7,4% PerplexityBot. Trainingscrawlers worden vaker geweerd dan zoekcrawlers: OAI-SearchBot, de zoekcrawler van ChatGPT, staat bij 6,6% dicht. 16,9% blokkeert minstens één van de 13 AI-crawlers die we volgden.

De blokkeerkaart

Top 1.000 .nl-domeinen: 829 sites met een leesbaar antwoord.

Aandeel sites per status in robots.txt, per AI-crawler, op 29 september 2026. Standaard de top 1.000 .nl-domeinen (829 met een leesbaar antwoord); de knoppen tonen de andere steekproeven. Zoekcrawlers en trainingscrawlers staan in aparte vakken. Geblokkeerd betekent: het pad / is dicht en geen Allow opent een ander pad. De tabel hieronder heeft alle cijfers.
Status van 13 AI-crawlers in robots.txt, top 1.000 .nl-domeinen, 829 leesbare sites, 29 september 2026
CrawlerDoelDichtDeelsOpenNiet genoemd
OAI-SearchBot (OpenAI)Zoeken6,6%1,3%1,4%90,6%
Claude-SearchBot (Anthropic)Zoeken4,6%0,6%0,8%94,0%
PerplexityBot (Perplexity)Zoeken7,4%1,4%1,2%90,0%
ChatGPT-User (OpenAI)Op vraag8,1%1,3%1,4%89,1%
Claude-User (Anthropic)Op vraag3,7%0,5%0,7%95,1%
Perplexity-User (Perplexity)Op vraag5,9%0,2%0,5%93,4%
GPTBot (OpenAI)Training12,5%2,5%1,3%83,6%
ClaudeBot (Anthropic)Training10,0%1,9%1,3%86,7%
Google-Extended (Google)Training8,6%1,1%1,1%89,3%
Applebot-Extended (Apple)Training6,5%0,7%0,6%92,2%
Amazonbot (Amazon)Training10,5%1,0%0,5%88,1%
CCBot (Common Crawl)Overig10,5%1,0%0,5%88,1%
Bytespider (ByteDance)Overig10,5%0,6%0,4%88,5%

De meeste sites hebben dus niet gekozen: 83,6% noemt GPTBot niet bij naam. Voor zo'n site gelden de regels onder User-agent: *, en die sluiten zelden alles af: bij 13 van de 829 sites (1,6%) staat de algemene regel helemaal dicht. Tel je die mee, dan is GPTBot bij 14,1% werkelijk buitengesloten en OAI-SearchBot bij 8,2%.

Wie wel kiest, kiest vaker tegen training dan tegen zoeken. 10,1% van de leesbare sites sluit minstens één zoekcrawler van OpenAI, Anthropic of Perplexity buiten, 5,7% alle drie. 5,9% weert alleen een trainingscrawler of -token en laat de zoekcrawlers binnen.

Hoe hebben we gemeten (methode en steekproef)?

We haalden op 29 september 2026 van 1.492 Nederlandse sites alleen het bestand robots.txt op, één keer per site, en lazen het met een parser die de standaard RFC 9309 volgt. De steekproef is de top 1.000 .nl-domeinen van de Tranco-lijst, aangevuld met vier sectoren: nieuwsmedia, overheden, marketing- en AI-bureaus en webbouwers.

  • 140 blokkeren minstens één AI-crawler bij naam helemaal
  • 20 blokkeren er een deels, geen enkele helemaal
  • 586 hebben een robots.txt die geen AI-crawler bij naam blokkeert
  • 83 hebben geen robots.txt
  • 49 weigerden ons verzoek (vaak een firewall)
  • 122 gaven geen antwoord of een serverfout
De top 1.000 .nl-domeinen van de Tranco-lijst als 1.000 vakjes, één per domein, gegroepeerd naar wat het ophalen op 29 september 2026 opleverde. Alleen de 829 sites met een robots.txt of zonder robots.txt tellen mee in de percentages; geweigerde verzoeken en sites zonder antwoord niet.
De vijf steekproeven: bron, aantal sites en hoeveel we konden lezen op 29 september 2026
SteekproefBronSitesLeesbaarNiet leesbaar
Top 1.000 .nl-domeinenTranco-lijst N2PGW (30 augustus tot 28 september 2026, gemaakt op 28 september 2026)1.000829171
NieuwsmediaWikipedia, Lijst van kranten in Nederland (versie 71876451) en Regionale Publieke Omroep (versie 71451377)41410
Gemeenten, provincies en waterschappenRegister van Overheidsorganisaties, export van 29 september 202637534035
Marketing- en AI-bureausEigen marktonderzoek van AI Digitals, september 202671710
WebbouwersEigen prijsonderzoek van AI Digitals, september 202651510
  1. 1

    De steekproef

    De eerste 1.000 domeinen in de Tranco-lijst die op .nl eindigen (rang 1 tot 143.886 wereldwijd). Daarnaast: alle 342 gemeenten, 12 provincies en 21 waterschappen die in het register nog bestaan, met de website die daar staat. De 27 landelijke en regionale dagbladen uit de lijst, de 13 regionale publieke omroepen en de NOS. De 60 Nederlandse bureaus uit onze scan van 73 AI- en marketingbureaus (22 september 2026), plus de bureaus in onze vergelijkingen van AI-marketingbureaus en SEO-prijzen; dubbele sites één keer. De webbouwers, website-abonnementen en webshopbouwers uit onze prijsonderzoeken; dubbele sites één keer. Een site die in twee steekproeven valt, halen we één keer op en telt in beide mee.

  2. 2

    Het ophalen

    Eén verzoek per site naar https://<host>/robots.txt, met de user-agent AIDigitalsResearch/1.0 (+hallo@aidigitals.nl), acht tegelijk, een time-out van 15 seconden en hooguit 3 redirects. Had de host zelf geen DNS-record of weigerde hij de verbinding, dan probeerden we één keer www.<host>. Verder haalden we niets van deze sites op.

  3. 3

    Het lezen

    Onze parser volgt RFC 9309: een crawler volgt de groepen met zijn eigen naam (hoofdletters maken niet uit) en anders de groep voor *; de langste passende regel wint en bij gelijke lengte wint Allow. We beoordelen het pad /: dicht als / dicht is en geen Allow iets opent, deels als een deel dicht is, open als niets dicht is.

  4. 4

    Het tellen

    Percentages gaan over de sites met een leesbaar antwoord: een robots.txt, of geen (dan mag volgens RFC 9309 alles). Een 401, 403 of 429, een botcontrole, een serverfout of geen antwoord telt niet mee. Alle cijfers zijn in code berekend uit de rijen in de dataset.

Welke sectoren blokkeren AI-crawlers het meest?

De verschillen zijn groot. Nieuwsmedia blokkeren bijna allemaal: 90,2% weert GPTBot en 82,9% ook OAI-SearchBot, de zoekcrawler van ChatGPT. Van de 340 leesbare sites van gemeenten, provincies en waterschappen blokkeert er één een AI-crawler bij naam. Marketing- en AI-bureaus noemen AI-crawlers vaker dan de top 1.000, maar om ze toe te laten.

Nieuwsmedia41 leesbare sites

90,2% GPTBot·
82,9% OAI-SearchBot

Top 1.000 .nl-domeinen829 leesbare sites

12,5% GPTBot·
6,6% OAI-SearchBot

Marketing- en AI-bureaus71 leesbare sites

1,4% GPTBot·
0,0% OAI-SearchBot

Webbouwers51 leesbare sites

0,0% GPTBot·
0,0% OAI-SearchBot

Gemeenten, provincies en waterschappen340 leesbare sites

0,0% GPTBot·
0,0% OAI-SearchBot

Aandeel sites dat GPTBot (training) en OAI-SearchBot (zoeken in ChatGPT) blokkeert, per steekproef, op 29 september 2026. Hoe verder de twee punten uit elkaar liggen, hoe vaker een sector training weert maar zoeken openlaat. De tabel hieronder heeft alle crawlers.
Aandeel sites dat een AI-crawler bij naam helemaal blokkeert, per steekproef, 29 september 2026
KenmerkNieuwsTop 1.000 .nlBureausWebbouwersOverheid
Leesbare sites418297151340
Noemt een AI-crawler92,7%21,1%40,8%19,6%0,3%
Blokkeert er minstens één90,2%16,9%5,6%2,0%0,3%
OAI-SearchBot82,9%6,6%0,0%0,0%0,0%
Claude-SearchBot63,4%4,6%0,0%0,0%0,0%
PerplexityBot85,4%7,4%0,0%0,0%0,0%
ChatGPT-User87,8%8,1%0,0%0,0%0,0%
Claude-User56,1%3,7%0,0%0,0%0,0%
Perplexity-User82,9%5,9%0,0%0,0%0,0%
GPTBot90,2%12,5%1,4%0,0%0,0%
ClaudeBot87,8%10,0%1,4%0,0%0,0%
Google-Extended90,2%8,6%1,4%0,0%0,0%
Applebot-Extended61,0%6,5%1,4%0,0%0,0%
Amazonbot85,4%10,5%0,0%0,0%0,0%
CCBot90,2%10,5%1,4%2,0%0,0%
Bytespider87,8%10,5%5,6%2,0%0,3%

Nieuwsmedia sluiten niet alleen training uit. 36 van de 41 dagbladen en omroepen houden minstens één zoekcrawler buiten, 27 alle drie. Veel regionale titels horen bij dezelfde uitgever, dus hun bestanden lijken op elkaar: deze sector is minder divers dan 41 losse sites doen vermoeden.

Overheden kiezen niet: 339 van de 340 leesbare sites van gemeenten, provincies en waterschappen noemen geen enkele AI-crawler, dus voor die crawlers geldt de algemene regel. Wel weigerden 34 van de 375 overheidssites ons verzoek om robots.txt, meestal met een 403.

Marketing- en AI-bureaus noemen een AI-crawler bij 40,8% van de sites, tegen 21,1% in de top 1.000, en laten ze dan meestal toe: GPTBot staat bij 25,4% uitdrukkelijk open. Bij webbouwers noemt 19,6% een AI-crawler, ongeveer even vaak als in de top 1.000.

Wat betekent blokkeren voor AI-vindbaarheid?

Dat hangt af van de crawler. Blokkeer je OAI-SearchBot, dan verschijnt je site volgens OpenAI niet in de zoekantwoorden van ChatGPT, hooguit als navigatielink, en Perplexity raadt aan PerplexityBot toe te laten. Blokkeer je alleen een trainingscrawler of -token, zoals GPTBot of Google-Extended, dan blijft zoeken open: Google-Extended raakt Google Zoeken volgens Google niet.

Wat de top 1.000 .nl koos (829 leesbare sites)

Zoeken dicht

10,1%84 sites

Minstens één zoekcrawler kan er niet in. OpenAI: dan niet in de zoekantwoorden van ChatGPT, hooguit als navigatielink. Anthropic: je kunt minder zichtbaar worden in Claude. Perplexity raadt aan PerplexityBot toe te laten.

Alleen training dicht

5,9%49 sites

Een trainingscrawler of -token is dicht, alle drie de zoekcrawlers kunnen erin. OpenAI noemt GPTBot en OAI-SearchBot onafhankelijk van elkaar; Google-Extended raakt Google Zoeken volgens Google niet.

Alleen andere crawlers dicht

2,2%18 sites

Alleen een fetcher op vraag van een gebruiker, Common Crawl of Bytespider is dicht. Zoeken en training staan open.

Niets dicht

81,8%678 sites

Geen van de 13 crawlers is helemaal buitengesloten. Wat een crawler met je inhoud doet, staat dan in zijn eigen documentatie.

De 829 leesbare sites in de top 1.000 .nl, verdeeld naar wat ze werkelijk buitensluiten (ook via de regel voor *), op 29 september 2026. Wat elke keuze doet, komt uit de documentatie van OpenAI, Anthropic, Perplexity en Google, gelezen op 29 september 2026.
Wat blokkeren in robots.txt doet volgens de leverancier, per crawler, gelezen op 29 september 2026
CrawlerWat hij doetWat blokkeren doet
OAI-SearchBot (OpenAI)Toont websites in de zoekresultaten van ChatGPT.Je site verschijnt niet in de zoekantwoorden van ChatGPT, hooguit als navigatielink.
Claude-SearchBot (Anthropic)Doorzoekt het web om de zoekresultaten in Claude beter te maken.Je inhoud wordt niet geïndexeerd voor zoeken in Claude; je kunt minder zichtbaar worden.
PerplexityBot (Perplexity)Toont en linkt websites in de zoekresultaten van Perplexity; niet voor training.Perplexity raadt aan hem toe te laten, zodat je site in de zoekresultaten van Perplexity kan verschijnen.
ChatGPT-User (OpenAI)Bezoekt een pagina als een gebruiker ChatGPT iets vraagt. Robots.txt geldt hierbij mogelijk niet, omdat een gebruiker het verzoek doet.Bepaalt niet of je in de zoekresultaten van ChatGPT komt.
Claude-User (Anthropic)Haalt een pagina op als een gebruiker Claude iets vraagt.Claude kan je pagina niet ophalen als een gebruiker ernaar vraagt; je kunt minder zichtbaar worden.
Perplexity-User (Perplexity)Haalt een pagina op als een gebruiker Perplexity iets vraagt; niet voor training. Perplexity schrijft dat deze fetcher robots.txt doorgaans negeert.Heeft weinig effect: deze fetcher negeert robots.txt doorgaans.
GPTBot (OpenAI)Verzamelt inhoud die OpenAI kan gebruiken voor de training van zijn modellen.Je inhoud wordt niet gebruikt voor de training van OpenAI's generatieve modellen.
ClaudeBot (Anthropic)Verzamelt inhoud die kan bijdragen aan de training van Anthropic's modellen.Je toekomstige inhoud blijft buiten de trainingsdata van Anthropic's modellen.
Google-Extended (Google)Geen eigen crawler maar een controletoken: Google haalt pagina's op met zijn gewone crawlers en leest dit token om te bepalen of Gemini ze mag gebruiken.Je inhoud wordt niet gebruikt voor de training van Gemini-modellen en niet voor grounding in de Gemini-apps en Vertex AI. Google Zoeken merkt er niets van: het is geen rankingsignaal.
Applebot-Extended (Apple)Geen eigen crawler maar een controletoken: Apple leest het om te bepalen of wat Applebot ophaalt zijn modellen mag trainen.Je inhoud wordt niet gebruikt voor de training van Apple's generatieve modellen. Je blijft vindbaar via Siri, Spotlight en Safari.
Amazonbot (Amazon)Verbetert de producten en diensten van Amazon en kan worden gebruikt om Amazon's AI-modellen te trainen.Amazonbot volgt je Disallow en haalt die pagina's niet op; de zoekcrawler Amzn-SearchBot heeft een eigen regel.
CCBot (Common Crawl)Bouwt een open archief van het web dat iedereen mag gebruiken en analyseren.Common Crawl haalt je site niet meer op voor zijn archief.
Bytespider (ByteDance)ByteDance publiceert geen documentatie over deze crawler die we konden openen.Onbekend: ByteDance zegt niet wat een blokkade doet.

Wie gevonden wil worden in ChatGPT, Claude of Perplexity, moet dus vooral de zoekcrawlers binnenlaten. Dat is het eerste wat we controleren bij GEO optimalisatie: een verkeerde regel in robots.txt maakt al het andere werk onzichtbaar voor die dienst. Hoe robots.txt, statuscodes en sitemaps samenwerken, staat in de technische basis van SEO.

Let op de namen. 82 van de 829 sites in de top 1.000 noemen nog anthropic-ai of Claude-Web, namen die niet in de documentatie van Anthropic staan; die noemt alleen ClaudeBot, Claude-SearchBot en Claude-User. Een regel voor een naam die geen crawler gebruikt, doet niets. En een llms.txt-bestand is iets anders dan robots.txt: lees wat llms.txt wel en niet doet.

Wat jouw eigen robots.txt met deze 13 crawlers doet, zie je met onze AI-crawlercheck. Die gebruikt dezelfde parser als dit onderzoek.

“De meeste Nederlandse sites hebben nooit gekozen en laten AI-crawlers dus gewoon binnen. Wie wel een regel schrijft, moet weten welke crawler hij raakt: GPTBot weren kost je geen plek in ChatGPT, OAI-SearchBot weren wel.”
Jaap Meijer, oprichter van AI Digitals

Download de data

Je kunt de volledige dataset gratis downloaden als CSV: één rij per site, 1.492 in totaal, met de uitkomst van het ophalen en de status van elke AI-crawler. Je mag de data en de cijfers vrij gebruiken onder de licentie CC BY 4.0, met AI Digitals als bron en een link naar deze pagina.

De dataset

Bestand
ai-crawlers-nederland-2026-09-29.csv
Rijen
1.492 sites
Kolommen
36
Licentie
CC BY 4.0
Download de data (CSV): AI-crawlers in Nederland

Zo citeer je dit onderzoek

AI Digitals (2026). Welke Nederlandse websites blokkeren AI-crawlers? Versie van 29 september 2026, robots.txt van 1.492 sites. https://aidigitals.nl/onderzoek/ai-crawlers-nederland. Licentie: CC BY 4.0.
Je mag de cijfers, de grafieken en de dataset vrij gebruiken, ook commercieel, onder Creative Commons Naamsvermelding 4.0. Noem AI Digitals als bron en link naar https://aidigitals.nl/onderzoek/ai-crawlers-nederland.
De kolommen in de CSV
KolomInhoud
domeinHet domein, zonder www.
steekproevenIn welke steekproeven de site zit, gescheiden door een puntkomma.
tranco_rangDe rang in de Tranco-lijst, alleen voor de top 1.000 .nl.
uitkomstWat het ophalen opleverde: robots, html, geen, geweigerd, serverfout of fout.
http_statusDe HTTP-status van het laatste antwoord.
laatste_urlDe URL na redirects.
foutcodeDe foutcode als er geen antwoord kwam.
<crawler>Per crawler: geblokkeerd, deels, toegelaten of niet genoemd. Leeg als het bestand niet te lezen was.
<crawler>_werkelijkPer crawler de werkelijke toegang, ook via de regel voor *.
ster_regelToegang voor een crawler die nergens bij naam staat.
aantal_user_agentsHoeveel user-agents het bestand bij naam noemt.
datumDe dag van het ophalen: 2026-09-29.

In de kolom uitkomst staat robots (gelezen), html of geen (geen robots.txt, dus alles toegestaan), geweigerd, serverfout of fout. Alleen de eerste drie tellen mee in de percentages. Sites met een geweigerd verzoek of zonder antwoord staan er wel in, met lege kolommen per crawler.

Meer cijfers over de Nederlandse markt vind je in ons eigen onderzoek.

Veelgestelde vragen

Wat is een AI-crawler?

Een AI-crawler is een programma van een AI-bedrijf dat webpagina's ophaalt. Er zijn drie soorten: zoekcrawlers zoals OAI-SearchBot en PerplexityBot, die bepalen of je in de zoekantwoorden van ChatGPT of Perplexity kunt staan; fetchers zoals ChatGPT-User, die een pagina ophalen als een gebruiker erom vraagt; en trainingscrawlers zoals GPTBot en ClaudeBot, die inhoud verzamelen voor de training van modellen.

Wat is het verschil tussen GPTBot en OAI-SearchBot?

GPTBot verzamelt inhoud die OpenAI kan gebruiken om zijn modellen te trainen. OAI-SearchBot zorgt dat websites in de zoekresultaten van ChatGPT verschijnen. OpenAI schrijft dat de twee los van elkaar werken: je kunt GPTBot blokkeren en OAI-SearchBot toelaten. Blokkeer je OAI-SearchBot, dan verschijnt je site volgens OpenAI niet in de zoekantwoorden van ChatGPT, hooguit als navigatielink.

Hoe blokkeer je GPTBot in robots.txt?

Zet twee regels in het robots.txt-bestand in de hoofdmap van je domein: 'User-agent: GPTBot' en daaronder 'Disallow: /'. Een eigen groep voor GPTBot gaat voor op de regels onder 'User-agent: *'. Wil je in ChatGPT blijven verschijnen, laat OAI-SearchBot dan open. Voor de zoekresultaten van ChatGPT duurt het volgens OpenAI ongeveer 24 uur voordat een wijziging werkt.

Heeft het blokkeren van Google-Extended invloed op je plek in Google?

Nee. Google schrijft dat Google-Extended geen invloed heeft op of je site in Google Zoeken staat en geen rankingsignaal is. Het is geen eigen crawler maar een token: Google haalt je pagina's op met zijn gewone crawlers en leest Google-Extended om te bepalen of ze Gemini-modellen mogen trainen en gebruikt mogen worden voor grounding in de Gemini-apps en Vertex AI.

Houden AI-crawlers zich aan robots.txt?

Voor hun automatische crawlers beschrijven OpenAI, Anthropic, Perplexity, Google, Apple, Amazon en Common Crawl hoe je ze met robots.txt tegenhoudt; Anthropic en Amazon schrijven er uitdrukkelijk bij dat hun crawlers robots.txt volgen. Voor ophalen op vraag van een gebruiker ligt het anders: volgens OpenAI geldt robots.txt dan mogelijk niet, en Perplexity schrijft dat Perplexity-User het doorgaans negeert. ByteDance publiceert over Bytespider geen documentatie die we konden openen.

Wat betekent 'niet genoemd' in dit onderzoek?

Niet genoemd betekent dat geen enkele groep in het robots.txt-bestand de naam van die crawler draagt. Dan volgt de crawler volgens de standaard RFC 9309 de regels onder 'User-agent: *', en zonder die groep mag hij alles. Een site zonder robots.txt noemt dus ook niemand. In de tabellen tellen we daarom apart hoeveel sites een crawler werkelijk buitensluiten, ook via de regel voor *.

Bronnen

  1. Tranco-lijst N2PGW, top 1 miljoen · Tranco, gemaakt op 28 september 2026Rangschikking van domeinen over 30 augustus tot 28 september 2026, samengesteld uit vijf bronnen (Chrome UX Report, Farsight, Majestic, Cloudflare Radar en Cisco Umbrella).
  2. Register van Overheidsorganisaties · Overheid.nl, export van 29 september 2026
  3. Lijst van kranten in Nederland · Wikipedia, versie 71876451
  4. Regionale Publieke Omroep · Wikipedia, versie 71451377
  5. RFC 9309: Robots Exclusion Protocol · IETF, september 2022
  6. Overview of OpenAI Crawlers · OpenAI, gelezen op 29 september 2026
  7. Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic, Claude Help Center, gelezen op 29 september 2026
  8. Perplexity Crawlers · Perplexity, gelezen op 29 september 2026
  9. Google's common crawlers · Google, bijgewerkt 14 juli 2026, gelezen op 29 september 2026
  10. About Applebot · Apple, bijgewerkt 4 september 2026, gelezen op 29 september 2026
  11. CCBot · Common Crawl, gelezen op 29 september 2026
  12. Amazonbot · Amazon, gelezen op 29 september 2026

Benieuwd of AI jouw bedrijf al noemt?

Vijf vragen van jouw klanten, gesteld aan ChatGPT, Gemini en Perplexity. Je ziet of je genoemd wordt, en wie wel.