Naar de inhoud
ceeme

Welke AI-crawlers laat ik toe op mijn site?

Deze generator schrijft een robots.txt waarin per AI-crawler staat of hij je site mag lezen. De lijst komt uit hetzelfde register als onze meting — 23 crawlers, waarvan er 15 na te rekenen zijn tegen een gepubliceerde IP-lijst of via DNS. Het bestand wordt volledig in je browser samengesteld: er gaat geen adres naar onze server, want er valt niets op te halen.

Door Njusja Orban, oprichter van ceeme4 min lezen

Meet je eigen bedrijf → Liever eerst een gesprek

Kies een instelling

Per crawler

Geavanceerd
robots.txt

      

In het kort

Wat het bestand doet
Het zegt per crawler of hij binnen mag. Het is de enige van de drie bestanden op je domein waar een crawler zich aan hóórt te houden.
Training tegenover live
Sommige crawlers verzamelen voor modeltraining, andere halen op tijdens een antwoord. Beide blokkeren is een andere keuze dan één van beide.
De prijs van dichtzetten
Wat een crawler niet mag lezen, komt in geen enkel antwoord terecht. Dat is niet omkeerbaar met een goede tekst — er is niemand die hem leest.

Welke instelling past bij mij?

Als je gevonden wil worden in AI-antwoorden: alles toelaten. Dat is de instelling die bovenaan staat, en ze is de enige die niets kost — een crawler die je site leest, gebruikt bandbreedte en verder niets.

De tweede instelling is voor wie er bezwaar tegen heeft dat zijn teksten een model trainen, maar wél in de antwoorden wil staan. Dat is een verdedigbare positie en het is geen tussenweg: bij sommige aanbieders is het dezelfde crawler, en dan kies je in de praktijk toch.

Wat is het verschil tussen een training-crawler en een live-crawler?

Een training-crawler verzamelt tekst die later in een model terechtkomt; wat hij vandaag ophaalt, zie je maanden later terug. Een live-crawler haalt op tijdens het gesprek: wat hij vindt, staat in het antwoord dat iemand nú leest.

Voor zichtbaarheid op korte termijn telt de tweede soort, en die is ook degene waarvan je het effect kan meten. De eerste is een keuze over de lange termijn en over wat je van je eigen teksten vindt.

Wat doet dit bestand niet?

Het regelt toegang en verder niets. Of je gelezen wordt is één vraag; of je genoemd wordt is een tweede, en die wordt hier niet beantwoord.

Wat deze tool doetWat hij niet doet
Schrijft een geldig robots.txt met een regel per crawlerPlaatst het bestand niet — dat doe jij of je websitebouwer
Toont per crawler of hij te verifiëren isControleert niet of ze werkelijk langskomen — daarvoor is je serverlogboek nodig
Werkt volledig in je browserDwingt niets af: een crawler die zich niet aan het bestand houdt, wordt er niet door tegengehouden

Veelgestelde vragen

Verlies ik mijn plaats in Google als ik AI-crawlers blokkeer?

Niet automatisch: de crawler die de klassieke index bijhoudt is een andere dan die welke voor AI verzamelt, en de generator laat de eerste altijd binnen. Let wel op wat je met de hand toevoegt — één te brede regel raakt allebei, en dat is de meest voorkomende manier waarop een site per ongeluk uit de index verdwijnt.

Waarom staan er meer crawlers in dan ik elders zie?

Omdat de lijst uit ons eigen register komt en niet uit een artikel. Er staan er 23 in, met per crawler of hij na te rekenen is; bij 8 van hen kan dat vandaag niet, en dat staat erbij omdat een naam die iedereen kan intikken geen bewijs van bezoek is.

Verder lezen

Gratis, zonder account en zonder kaart.