Er is geen goed antwoord dat voor iedereen geldt. Wel vier vragen die het antwoord voor jouw situatie bepalen, en een overzicht van wat er technisch mogelijk is.
Tot een paar jaar geleden was er één antwoord op de vraag "mag deze bot mijn site lezen": ja, want elke crawler was uiteindelijk een zoekmachine die je bezoekers stuurde. Die ruil was helder.
Bij AI-crawlers ligt dat anders. Sommige leveren nog steeds bezoek op — een assistent die je noemt en naar je linkt. Andere halen je content op om er een model mee te trainen dat vervolgens antwoorden geeft waar jij niet in voorkomt. Dezelfde handeling, een compleet andere ruil.
Daarbij komt het volume. Op één van onze eigen sites kwamen in dertig dagen bijna 98.000 verzoeken binnen bij ruim 30.000 werkelijke paginaweergaven. Het verschil bestaat grotendeels uit geautomatiseerd verkeer.
1. Is je content uniek of algemeen? Een pagina over hoe je een lekkende kraan repareert staat in duizend varianten op het internet; die weggeven kost je niets en levert misschien een vermelding op. Een geïndexeerd archief, een eigen onderzoek of een prijslijst die nergens anders bestaat, is een ander verhaal.
2. Verdien je aan bezoek of aan de content zelf? Verdien je aan bezoekers die op je site iets doen, dan is genoemd worden pure winst. Verkoop je toegang tót de content, dan geef je je product weg.
3. Hoeveel kost het je? Bij een statische site die op de edge staat, kost een crawler letterlijk niets. Bij een zware CMS-installatie op één server kan intensief crawlen je site merkbaar vertragen — dan is begrenzen een technische noodzaak, los van de principiële vraag.
4. Wil je het per crawler kunnen bepalen? Het is geen aan-uitknop. Je kunt zoekassistenten binnenlaten en trainingsbots weren, of andersom. Dat vraagt wel dat je bijhoudt welke er zijn — en dat is een bewegend doel.
| Middel | Werkt tegen | Afdwingbaar | Opmerking |
|---|---|---|---|
| robots.txt | nette crawlers | nee | Een verzoek. Partijen die zich er niets van aantrekken negeren het. |
| Blokkade op netwerkniveau | alle herkende bots | ja | Het verzoek bereikt je site niet. Werkt ook als robots.txt genegeerd wordt. |
| Snelheidslimiet | intensief crawlen | ja | Toelaten, maar begrensd. Goede tussenweg voor webshops. |
| Doolhof | crawlers die regels negeren | ja | Gegenereerde nepinhoud in plaats van een blokkade. Kost hún capaciteit. |
| Uitdaging vooraf | eenvoudige scripts | ja | Rekenpuzzel voor de machine, onzichtbaar voor mensen. |
Belangrijk om te weten: robots.txt is een verzoek, geen slot. Nette partijen houden zich eraan; de rest niet. Wil je het afdwingen, dan is een blokkade op netwerkniveau de enige manier die werkt.
De doolhofoptie is daarbij de interessantste. In plaats van een crawler te blokkeren — waarna hij het via een ander adres opnieuw probeert — krijgt hij een reeks automatisch gegenereerde pagina's voorgeschoteld. Hij blijft daar rondlopen, het kost hem rekentijd, en je echte inhoud blijft ongemoeid. Menselijke bezoekers en nette bots komen er nooit terecht.
Dienstverlener met een marketingsite: alles toelaten en zorgen dat je pagina's goed leesbaar zijn. Je wíl genoemd worden; je content is je visitekaartje, niet je product.
Webshop: toelaten, maar begrenzen op snelheid. Productpagina's mogen gevonden worden; duizend verzoeken per minuut is geen crawler die je helpt.
Uitgever, archief of kennisbank: hier is de afweging het scherpst. Wij adviseren doorgaans: zoekassistenten toelaten, trainingsbots weigeren, en de rest het doolhof in. Je wilt vindbaar zijn zonder je archief cadeau te doen.
Organisatie met gevoelige of persoonsgebonden content: standaard weigeren, en per uitzondering toelaten. Bij persoonsgegevens is dit niet alleen een commerciële afweging maar ook een juridische.
Geschreven door het team van Neuralex Edge. Alle genoemde meetwaarden zijn eigen metingen; methode en datum staan in onze meetlat. Zie je een fout of mis je iets? Laat het weten via contact — correcties vermelden we erbij.
De nulmeting is gratis en je krijgt het rapport ook als je verder niets afneemt.