Wat is crawlen? Uitleg met een voorbeeld

Crawlen is het ophalen van pagina's door een programma van een zoekmachine of AI-dienst, een crawler of bot. Googlebot is de crawler van Google; ook AI-diensten sturen eigen crawlers. Een crawler volgt links en downloadt tekst, afbeeldingen en video's. Wat niet gecrawld kan worden, kan Google niet indexeren en een AI-dienst niet als bron gebruiken.

Door , oprichterOver de auteurLaatst bijgewerkt:

In het kort

Crawlen in het kort
Voluitcrawling
Ook genoemdcrawler
VakgebiedTechniek
Belangrijkste bronGoogle, hoe Zoeken werkt

01Hoe het werkt

Hoe werkt crawlen?

Een crawler begint bij adressen die hij al kent en bij adressen uit sitemaps. Hij vraagt elke pagina op bij je server, net als een browser, leest de tekst en volgt de links naar nieuwe pagina's. Voordat hij iets ophaalt, kijkt hij in robots.txt welke paden hij mag bezoeken.

Googlebot, de crawler van Google, bepaalt volgens Google met een algoritme welke sites hij bezoekt, hoe vaak en hoeveel pagina's per keer. Hij probeert een site niet te overbelasten: bij de meeste sites komt hij gemiddeld niet vaker dan eens per paar seconden langs. De meeste bezoeken doet hij als smartphone, omdat Google de mobiele versie van een site indexeert.

Tijdens het crawlen rendert Google een pagina ook met een recente versie van Chrome, zodat tekst die met JavaScript wordt geladen zichtbaar wordt. Veelvoorkomende problemen bij het crawlen zijn volgens Google een server die de aanvragen niet aankan, netwerkproblemen en regels in robots.txt die de crawler buitensluiten. Wat daarna met de opgehaalde pagina gebeurt, heet indexeren.

02Een voorbeeld

Hoe ziet crawlen eruit in de praktijk?

In de praktijk zie je crawlen terug in het logbestand van je server. Elke keer dat een crawler iets ophaalt, staat er een regel met de tijd, het adres, de statuscode en de naam van de crawler. Hieronder een vereenvoudigde ochtend bij een installatiebedrijf, met Googlebot en twee crawlers van OpenAI.

Eén ochtend in het serverlog

Voorbeeld
  1. 08:14 · Googlebot

    1.GET /robots.txt · 200

    Eerst de regels: welke paden mag deze crawler ophalen?

  2. 08:14 · Googlebot

    2.GET /cv-ketel-vervangen · 200

    De pagina zelf. Googlebot leest de tekst en noteert de links naar andere pagina's.

  3. 08:15 · Googlebot

    3.GET /oude-actie · 404

    Een link naar een pagina die niet meer bestaat. Een 404 komt niet in de index.

  4. 09:02 · OAI-SearchBot

    4.GET /warmtepomp-installeren · 200

    De zoekcrawler van ChatGPT haalt een dienstpagina op, voor de zoekantwoorden van ChatGPT.

  5. 11:40 · GPTBot

    5.GET /robots.txt · 200, verder niets

    De trainingscrawler van OpenAI leest de regels, ziet Disallow: / bij zijn naam en haalt verder niets op.

Voorbeeld, vereenvoudigd: de tijden en adressen zijn verzonnen. In een echt serverlog staan ook het IP-adres en de volledige user-agent, met daarin bijvoorbeeld Googlebot/2.1 of OAI-SearchBot/1.4. Deze site laat de zoekcrawler van ChatGPT toe en weigert de trainingscrawler.

03Waarom het ertoe doet

Waarom doet crawlen ertoe voor Google en AI?

Crawlen doet ertoe omdat het de eerste stap is: wat een crawler niet kan ophalen, kan Google niet indexeren en kan een AI-dienst niet als bron gebruiken. Dat geldt voor Googlebot, en net zo goed voor de crawlers van ChatGPT, Claude en Perplexity. Een pagina die geen crawler kan ophalen, bestaat voor zoekmachines niet.

AI-diensten sturen eigen crawlers, vaak gescheiden naar doel. OpenAI gebruikt OAI-SearchBot voor de zoekfunctie van ChatGPT en GPTBot voor het trainen van modellen. Sites die OAI-SearchBot weigeren, verschijnen volgens OpenAI niet in de zoekantwoorden van ChatGPT. Voor AI Overviews en AI Mode noemt Google als eerste advies dat crawlen is toegestaan in robots.txt en door je CDN of hosting.

Hoe vaak Nederlandse sites AI-crawlers buitensluiten, hebben wij gemeten. Van de 1.000 meest bezochte .nl-domeinen konden we op 29 september 2026 van 829 de robots.txt lezen: 12,5% blokkeert GPTBot, tegenover 6,6% voor de zoekcrawler OAI-SearchBot. De meeste sites laten de zoekcrawlers van AI-diensten dus gewoon binnen. De cijfers per crawler en per sector staan in welke Nederlandse sites AI-crawlers blokkeren.

“Wij kijken bij elke site eerst naar wat een crawler ziet, niet naar wat een bezoeker ziet. Een mooie pagina die geen crawler kan ophalen, levert in Google en in ChatGPT niets op.”
Jaap Meijer, oprichter van AI Digitals

04Wat je ermee doet

Hoe zorg je dat crawlers je site goed kunnen lezen?

Zorg dat crawlers je site makkelijk kunnen ophalen en snel de belangrijke pagina's vinden. Laat de crawlers toe die je wilt, link duidelijk naar elke pagina, zet je tekst in de HTML en houd een sitemap bij. Controleer daarna in Search Console en in je serverlog of de crawlers ook echt langskomen.

  1. 1

    Bepaal wie er binnen mag

    Laat Googlebot en de zoekcrawlers van AI-diensten toe in robots.txt. De AI-crawlercheck laat zien wat jouw bestand nu toestaat.

  2. 2

    Link naar elke belangrijke pagina

    Crawlers volgen links. Een pagina waar geen enkele link naartoe gaat, vinden ze alleen via je XML-sitemap.

  3. 3

    Zet je tekst in de HTML

    Prijzen, diensten en antwoorden als gewone tekst, niet alleen in een afbeelding of pdf. Google vraagt voor zijn AI-functies om belangrijke inhoud als tekst.

  4. 4

    Kijk wat er gebeurt

    Search Console toont per pagina wanneer Google haar voor het laatst crawlde; in je serverlog zie je ook de AI-crawlers. Hoe je dat stap voor stap nagaat, staat in de technische basis van SEO.

Veelgestelde vragen

Wat betekent crawlen letterlijk?

Crawlen komt van het Engelse to crawl, kruipen. Een crawler kruipt als het ware langs de links van het web, van pagina naar pagina. Daarom heet hij ook spider, een spin in het web, of bot. In het zwembad betekent crawlen iets anders: zwemmen met de crawlslag. Met websites heeft die betekenis niets te maken.

Wat is een crawler?

Een crawler is een programma dat automatisch webpagina's ophaalt door links te volgen. Zoekmachines gebruiken crawlers om pagina's te vinden voor hun index, zoals Googlebot voor Google. AI-diensten hebben eigen crawlers, zoals OAI-SearchBot en GPTBot van OpenAI. Ook SEO-tools crawlen: ze lopen je site af zoals een zoekmachine dat doet, om fouten te vinden.

Wat betekent gecrawld?

Gecrawld betekent dat een crawler de pagina heeft opgehaald. Dat is nog niet hetzelfde als geïndexeerd. Search Console kent de status Gecrawld - momenteel niet geïndexeerd, voor pagina's die Google wel ophaalde maar niet in de index opnam. Volgens Google kan zo'n pagina later alsnog geïndexeerd worden, maar dat is niet zeker.

Bronnen

  1. In-depth guide to how Google Search works · Google Search Central, gelezen op 29 september 2026Drie stappen: crawlen, indexeren en resultaten tonen.
  2. Googlebot · Google Search Central, gelezen op 30 september 2026Googlebot Smartphone en Desktop; de meeste bezoeken als smartphone; bij de meeste sites gemiddeld niet vaker dan eens per paar seconden.
  3. Overview of OpenAI crawlers · OpenAI, gelezen op 30 september 2026OAI-SearchBot haalt pagina's op voor de zoekfunctie van ChatGPT, GPTBot teksten voor training. Een wijziging in robots.txt werkt na ongeveer 24 uur.
  4. AI features and your website · Google Search Central, gelezen op 29 september 2026AI Overviews en AI Mode: query fan-out, alleen getoond als het iets toevoegt, geen extra eisen, geen AI-bestanden of speciale schema-opmaak nodig.
  5. Welke Nederlandse websites blokkeren AI-crawlers? · AI Digitals, onderzoekOnze meting van 29 september 2026: de robots.txt van 1.492 Nederlandse websites, met per site de status van elke AI-crawler.
  6. Het rapport Pagina-indexering · Help voor Search Console, gelezen op 30 september 2026De statussen van niet-geïndexeerde pagina's, letterlijk. Verwacht niet dat elke URL op je site wordt geïndexeerd.

Door , oprichter van AI DigitalsOver de auteurLaatst bijgewerkt:

Hoe staat jouw site ervoor in Google?

Vul je domein in en je krijgt direct een rapportcijfer voor vindbaarheid, techniek, AI-leesbaarheid en snelheid, met de drie punten om mee te beginnen.