Hoe werken LLM's en AI-crawlers? Van crawl tot antwoord
11 september 2026

Wij helpen bedrijven groeien met AI-gedreven marketing.
AI-zoekmachines beantwoorden steeds vaker vragen die vroeger in Google werden getypt. Wil je zichtbaar zijn in die antwoorden, dan moet je weten hoe een LLM aan zijn informatie komt. In dit artikel lopen we de hele keten door: van hoe een taalmodel werkt, via crawlen en indexeren, tot de praktische instellingen waarmee je AI-bots toelaat of buiten de deur houdt.
1. Hoe werkt een LLM eigenlijk?
Een large language model (LLM) is getraind op enorme hoeveelheden tekst. Het model leert daarin statistische patronen: welk woord volgt waarschijnlijk op welk woord, in welke context. Het model slaat geen pagina's op als een database, maar comprimeert taalpatronen in miljarden parameters.
Daaruit volgen drie belangrijke gevolgen voor marketeers:
- Trainingsdata is een momentopname. Wat na de trainingsdatum is gepubliceerd, kent het model niet uit zichzelf.
- Het model onthoudt bronnen niet letterlijk. Merkvermeldingen tellen mee als patroon, niet als link.
- Actuele antwoorden komen uit live ophalen. Daarvoor gebruiken de modellen retrieval.
2. Twee manieren waarop AI aan je content komt
Training
Bij training worden grote webarchieven (zoals Common Crawl) en gelicentieerde datasets verwerkt. Dit gebeurt eenmalig per modelversie. Je content beinvloedt hier vooral hoe het model over jouw onderwerp en merk praat.
Retrieval (RAG)
Bij retrieval-augmented generation zoekt het systeem op het moment van de vraag naar actuele bronnen, haalt de pagina op, knipt die in stukken en geeft de meest relevante stukken mee aan het model. Het antwoord wordt daarna geschreven met bronvermelding. Dit is de route waarlangs je op korte termijn zichtbaar wordt.
3. Wat gebeurt er tijdens een crawl?
Een crawl verloopt in vaste stappen:
- Ontdekken: de bot vindt je URL via je sitemap, interne links, externe links of een zoekindex.
- Ophalen: de bot doet een HTTP-request met een eigen user-agent, en controleert eerst je robots.txt.
- Renderen: sommige bots voeren JavaScript uit, veel AI-crawlers doen dat beperkt of niet. Server-side gerenderde HTML is daarom veiliger.
- Extractie: navigatie, footers en scripts worden weggefilterd; kop-, tekst-, tabel- en schemastructuur blijft over.
- Chunking en embedding: de tekst wordt in blokken geknipt en omgezet naar vectoren, zodat er op betekenis gezocht kan worden.
- Opslaan en hergebruiken: het blok komt in een index en kan bij een passende vraag als bron worden gebruikt.
4. De belangrijkste AI-bots en wat ze doen
| Bot | Van | Doel | Blokkeren betekent |
|---|---|---|---|
| GPTBot | OpenAI | Verzamelt data voor training | Minder invloed op toekomstige modellen |
| OAI-SearchBot | OpenAI | Indexeert voor ChatGPT Search | Niet meer zichtbaar in ChatGPT-zoekresultaten |
| ChatGPT-User | OpenAI | Haalt een pagina live op tijdens een gesprek | Gebruiker krijgt jouw pagina niet te zien |
| Google-Extended | Gebruik in Gemini-training | Geen effect op gewone Google-index | |
| PerplexityBot | Perplexity | Index voor antwoorden met bronnen | Geen citaties meer in Perplexity |
| ClaudeBot | Anthropic | Training en ophalen | Minder zichtbaarheid in Claude |
| Bingbot | Microsoft | Voedt Bing en Copilot | Verlies van Copilot-zichtbaarheid |
| CCBot | Common Crawl | Open webarchief, basis voor veel modellen | Uit veel toekomstige datasets |
5. Hoe voorkom je dat AI-bots langskomen?
Wil je juist niet dat je content wordt gebruikt, dan heb je een paar knoppen:
robots.txt
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Dit is een vriendelijk verzoek: nette bots houden zich eraan, kwaadwillende scrapers niet.
Meta-tags per pagina
<meta name="robots" content="noai, noimageai">
Harde blokkades
Wil je het echt afdwingen, dan blokkeer je op serverniveau of via je CDN op user-agent en IP-reeks, of zet je content achter een login. Let op: alles wat je afschermt voor AI-bots is meestal ook onzichtbaar in AI-antwoorden.
6. Hoe zorg je juist dat ze zo vaak mogelijk langskomen?
Voor de meeste bedrijven is dit het interessantere doel. Deze acties helpen direct:
- Laat alle relevante bots toe in robots.txt en controleer dat je CDN of firewall ze niet stilzwijgend blokkeert.
- Server-side rendering: zorg dat de volledige tekst in de HTML staat, niet pas na JavaScript.
- Actuele XML-sitemap met correcte lastmod-datums, gelinkt vanuit robots.txt.
- Snelle en stabiele server: time-outs en 5xx-fouten verlagen je crawlfrequentie.
- Structuur die makkelijk te knippen is: duidelijke H2/H3-koppen, korte alinea's, lijsten en tabellen. Elk blok moet los begrijpelijk zijn.
- Antwoord bovenaan: geef in de eerste twee zinnen onder een kop het directe antwoord.
- Structured data: FAQPage, Article, Organization en Product helpen bij interpretatie.
- Publiceer en update regelmatig: pagina's die vaak wijzigen worden vaker opgehaald.
- Bouw externe signalen: vermeldingen op Reddit, vakmedia en review-sites vergroten de kans dat je als bron wordt gekozen.
7. Hoe controleer je of AI-bots echt langskomen?
Kijk in je serverlogs of CDN-statistieken naar user-agents als GPTBot, PerplexityBot, ClaudeBot en OAI-SearchBot. Meet daarnaast:
- Aantal crawlverzoeken per bot per week
- Statuscodes (veel 404 of 5xx = verspilde crawl)
- Referral-verkeer vanuit chatgpt.com en perplexity.ai
- Hoe vaak je merk als bron wordt genoemd in testprompts
8. Veelgemaakte fouten
- Een firewallregel die AI-bots blokkeert terwijl je juist zichtbaar wilt zijn.
- Belangrijke tekst die pas na JavaScript verschijnt.
- Alle informatie in een pdf of afbeelding in plaats van in HTML.
- Lange lappen tekst zonder koppen, waardoor er geen bruikbare blokken ontstaan.
- Geen datum of auteur, waardoor het model de betrouwbaarheid niet kan inschatten.
Veelgestelde vragen
Wat is het verschil tussen een gewone crawler en een AI-crawler?
Een klassieke zoekmachinecrawler bouwt een index met links naar pagina's. Een AI-crawler verzamelt tekst die als bron of trainingsmateriaal wordt gebruikt in een gegenereerd antwoord, vaak zonder dat de gebruiker doorklikt.
Blokkeert Google-Extended mijn gewone Google-rankings?
Nee. Google-Extended gaat alleen over gebruik in Gemini en aanverwante AI-producten. Je organische zoekresultaten blijven ongewijzigd.
Helpt robots.txt tegen scrapers?
Alleen tegen bots die zich netjes gedragen. Wil je het afdwingen, dan heb je blokkades op server-, CDN- of firewallniveau nodig.
Hoe vaak komen AI-bots langs?
Dat verschilt sterk per site. Actieve sites met regelmatige updates en een schone technische basis worden vaak dagelijks opgehaald, statische sites soms maar eens per maand.
Moet ik mijn content in tabellen en lijsten zetten?
Het helpt. Gestructureerde blokken zijn makkelijker te knippen en over te nemen in een antwoord, waardoor de kans op een citatie stijgt.
Verlies ik verkeer als AI mijn antwoord overneemt?
Klikken kunnen dalen, maar de kwaliteit van het resterende verkeer stijgt meestal. Bovendien levert een bronvermelding merkbekendheid op bij mensen die anders nooit op je site kwamen.
Verder lezen
Vrijblijvend advies over Hoe werken LLM's en AI-crawlers? Van crawl tot antwoord
Laat je gegevens achter en we nemen binnen één werkdag contact met je op met een concreet voorstel.