01Hoe het werkt
Hoe werkt crawlen?
Een crawler begint bij adressen die hij al kent en bij adressen uit sitemaps. Hij vraagt elke pagina op bij je server, net als een browser, leest de tekst en volgt de links naar nieuwe pagina's. Voordat hij iets ophaalt, kijkt hij in robots.txt welke paden hij mag bezoeken.
Googlebot, de crawler van Google, bepaalt volgens Google met een algoritme welke sites hij bezoekt, hoe vaak en hoeveel pagina's per keer. Hij probeert een site niet te overbelasten: bij de meeste sites komt hij gemiddeld niet vaker dan eens per paar seconden langs. De meeste bezoeken doet hij als smartphone, omdat Google de mobiele versie van een site indexeert.
Tijdens het crawlen rendert Google een pagina ook met een recente versie van Chrome, zodat tekst die met JavaScript wordt geladen zichtbaar wordt. Veelvoorkomende problemen bij het crawlen zijn volgens Google een server die de aanvragen niet aankan, netwerkproblemen en regels in robots.txt die de crawler buitensluiten. Wat daarna met de opgehaalde pagina gebeurt, heet indexeren.
02Een voorbeeld
Hoe ziet crawlen eruit in de praktijk?
In de praktijk zie je crawlen terug in het logbestand van je server. Elke keer dat een crawler iets ophaalt, staat er een regel met de tijd, het adres, de statuscode en de naam van de crawler. Hieronder een vereenvoudigde ochtend bij een installatiebedrijf, met Googlebot en twee crawlers van OpenAI.
Eén ochtend in het serverlog
Voorbeeld08:14 · Googlebot
1.GET /robots.txt · 200
Eerst de regels: welke paden mag deze crawler ophalen?
08:14 · Googlebot
2.GET /cv-ketel-vervangen · 200
De pagina zelf. Googlebot leest de tekst en noteert de links naar andere pagina's.
08:15 · Googlebot
3.GET /oude-actie · 404
Een link naar een pagina die niet meer bestaat. Een 404 komt niet in de index.
09:02 · OAI-SearchBot
4.GET /warmtepomp-installeren · 200
De zoekcrawler van ChatGPT haalt een dienstpagina op, voor de zoekantwoorden van ChatGPT.
11:40 · GPTBot
5.GET /robots.txt · 200, verder niets
De trainingscrawler van OpenAI leest de regels, ziet Disallow: / bij zijn naam en haalt verder niets op.
03Waarom het ertoe doet
Waarom doet crawlen ertoe voor Google en AI?
Crawlen doet ertoe omdat het de eerste stap is: wat een crawler niet kan ophalen, kan Google niet indexeren en kan een AI-dienst niet als bron gebruiken. Dat geldt voor Googlebot, en net zo goed voor de crawlers van ChatGPT, Claude en Perplexity. Een pagina die geen crawler kan ophalen, bestaat voor zoekmachines niet.
AI-diensten sturen eigen crawlers, vaak gescheiden naar doel. OpenAI gebruikt OAI-SearchBot voor de zoekfunctie van ChatGPT en GPTBot voor het trainen van modellen. Sites die OAI-SearchBot weigeren, verschijnen volgens OpenAI niet in de zoekantwoorden van ChatGPT. Voor AI Overviews en AI Mode noemt Google als eerste advies dat crawlen is toegestaan in robots.txt en door je CDN of hosting.
Hoe vaak Nederlandse sites AI-crawlers buitensluiten, hebben wij gemeten. Van de 1.000 meest bezochte .nl-domeinen konden we op 29 september 2026 van 829 de robots.txt lezen: 12,5% blokkeert GPTBot, tegenover 6,6% voor de zoekcrawler OAI-SearchBot. De meeste sites laten de zoekcrawlers van AI-diensten dus gewoon binnen. De cijfers per crawler en per sector staan in welke Nederlandse sites AI-crawlers blokkeren.
“Wij kijken bij elke site eerst naar wat een crawler ziet, niet naar wat een bezoeker ziet. Een mooie pagina die geen crawler kan ophalen, levert in Google en in ChatGPT niets op.”
04Wat je ermee doet
Hoe zorg je dat crawlers je site goed kunnen lezen?
Zorg dat crawlers je site makkelijk kunnen ophalen en snel de belangrijke pagina's vinden. Laat de crawlers toe die je wilt, link duidelijk naar elke pagina, zet je tekst in de HTML en houd een sitemap bij. Controleer daarna in Search Console en in je serverlog of de crawlers ook echt langskomen.
- 1
Bepaal wie er binnen mag
Laat Googlebot en de zoekcrawlers van AI-diensten toe in robots.txt. De AI-crawlercheck laat zien wat jouw bestand nu toestaat.
- 2
Link naar elke belangrijke pagina
Crawlers volgen links. Een pagina waar geen enkele link naartoe gaat, vinden ze alleen via je XML-sitemap.
- 3
Zet je tekst in de HTML
Prijzen, diensten en antwoorden als gewone tekst, niet alleen in een afbeelding of pdf. Google vraagt voor zijn AI-functies om belangrijke inhoud als tekst.
- 4
Kijk wat er gebeurt
Search Console toont per pagina wanneer Google haar voor het laatst crawlde; in je serverlog zie je ook de AI-crawlers. Hoe je dat stap voor stap nagaat, staat in de technische basis van SEO.
Veelgestelde vragen
Wat betekent crawlen letterlijk?
Crawlen komt van het Engelse to crawl, kruipen. Een crawler kruipt als het ware langs de links van het web, van pagina naar pagina. Daarom heet hij ook spider, een spin in het web, of bot. In het zwembad betekent crawlen iets anders: zwemmen met de crawlslag. Met websites heeft die betekenis niets te maken.
Wat is een crawler?
Een crawler is een programma dat automatisch webpagina's ophaalt door links te volgen. Zoekmachines gebruiken crawlers om pagina's te vinden voor hun index, zoals Googlebot voor Google. AI-diensten hebben eigen crawlers, zoals OAI-SearchBot en GPTBot van OpenAI. Ook SEO-tools crawlen: ze lopen je site af zoals een zoekmachine dat doet, om fouten te vinden.
Wat betekent gecrawld?
Gecrawld betekent dat een crawler de pagina heeft opgehaald. Dat is nog niet hetzelfde als geïndexeerd. Search Console kent de status Gecrawld - momenteel niet geïndexeerd, voor pagina's die Google wel ophaalde maar niet in de index opnam. Volgens Google kan zo'n pagina later alsnog geïndexeerd worden, maar dat is niet zeker.
Bronnen
- In-depth guide to how Google Search works · Google Search Central, gelezen op 29 september 2026Drie stappen: crawlen, indexeren en resultaten tonen.
- Googlebot · Google Search Central, gelezen op 30 september 2026Googlebot Smartphone en Desktop; de meeste bezoeken als smartphone; bij de meeste sites gemiddeld niet vaker dan eens per paar seconden.
- Overview of OpenAI crawlers · OpenAI, gelezen op 30 september 2026OAI-SearchBot haalt pagina's op voor de zoekfunctie van ChatGPT, GPTBot teksten voor training. Een wijziging in robots.txt werkt na ongeveer 24 uur.
- AI features and your website · Google Search Central, gelezen op 29 september 2026AI Overviews en AI Mode: query fan-out, alleen getoond als het iets toevoegt, geen extra eisen, geen AI-bestanden of speciale schema-opmaak nodig.
- Welke Nederlandse websites blokkeren AI-crawlers? · AI Digitals, onderzoekOnze meting van 29 september 2026: de robots.txt van 1.492 Nederlandse websites, met per site de status van elke AI-crawler.
- Het rapport Pagina-indexering · Help voor Search Console, gelezen op 30 september 2026De statussen van niet-geïndexeerde pagina's, letterlijk. Verwacht niet dat elke URL op je site wordt geïndexeerd.
Door Jaap Meijer, oprichter van AI DigitalsOver de auteurLaatst bijgewerkt: