Naar de inhoud
ceeme

Welke AI komt werkelijk langs op mijn site?

Elke AI-assistent haalt pagina's op onder een eigen naam, en die naam staat in je serverlogboek naast het tijdstip en de opgevraagde pagina. Dat logboek is de enige bron die over jouw site gaat in plaats van over de markt — en het is tegelijk de bron waar de meeste bedrijven nog nooit in gekeken hebben, terwijl hij al maanden meeschrijft.

Door Njusja Orban, oprichter van ceeme5 min lezen

Meet je eigen bedrijf → Liever eerst een gesprek

In het kort

Drie soorten bezoek
Verzamelen voor training, bijhouden van een index, en live ophalen tijdens een antwoord. Alleen dat laatste hangt samen met een gesprek dat nu gebeurt.
Na te rekenen
Een deel van de crawlers publiceert IP-lijsten of laat zich via DNS narekenen. De rest geeft alleen een naam op, en die kan iedereen intikken.
Wat je logboek wél zegt
Welke pagina's opgehaald worden en welke nooit. Dat is een lijst met werk, en ze is van jou alleen.

Wie komt er langs, en van wie is die crawler?

Hieronder de crawlers die AI-antwoorden voeden, per uitbater, met de vraag erbij die er werkelijk toe doet: kan je narekenen dat het er ook echt één was? Bij ongeveer een derde is het antwoord nee, en dat is geen detail — een naam die iedereen kan intikken, is geen bewijs van bezoek.

Let bij één uitbater op de tweedeling: de crawler die de index bijhoudt is een andere dan die welke tijdens een gesprek live ophaalt. Zie je alleen de eerste in je logboek, dan word je verzameld maar niet aangehaald.

UitbaterCrawlersNa te rekenen?
GoogleGoogle-Extended · Googlebot · GoogleOtherja — omgekeerde DNS op het gepubliceerde domein
MicrosoftBingbotja — omgekeerde DNS op het gepubliceerde domein
AppleApplebot-Extended · Applebotja — omgekeerde DNS op het gepubliceerde domein
OpenAIGPTBot · OAI-SearchBot · ChatGPT-Userja — tegen de gepubliceerde IP-lijst
AnthropicClaudeBot · Claude-User · Claude-SearchBot · anthropic-aija — tegen de gepubliceerde IP-lijst
PerplexityPerplexityBot · Perplexity-Userja — tegen de gepubliceerde IP-lijst
AmazonAmazonbotnee — alleen de naam die de bezoeker zelf opgeeft, dus na te maken
MetaMeta-ExternalAgentnee — alleen de naam die de bezoeker zelf opgeeft, dus na te maken
ByteDanceBytespidernee — alleen de naam die de bezoeker zelf opgeeft, dus na te maken
Coherecohere-ainee — alleen de naam die de bezoeker zelf opgeeft, dus na te maken
DuckDuckGoDuckAssistBotnee — alleen de naam die de bezoeker zelf opgeeft, dus na te maken
You.comYouBotnee — alleen de naam die de bezoeker zelf opgeeft, dus na te maken
DiffbotDiffbotnee — alleen de naam die de bezoeker zelf opgeeft, dus na te maken
TimpiTimpibotnee — alleen de naam die de bezoeker zelf opgeeft, dus na te maken

Hoe lees ik mijn eigen logboek zonder ontwikkelaar?

De meeste hostingpakketten laten de ruwe toegangslogboeken downloaden, en dan is dit een kwestie van zoeken op de namen hierboven. Draait je site achter een dienst die het verkeer filtert, dan zit het overzicht daar vaak al kant-en-klaar onder een noemer als bots of geverifieerde crawlers.

Wat je zoekt is niet het aantal maar de verdeling: welke pagina's worden opgehaald. Een crawler die alleen je homepagina en je contactpagina bezoekt, heeft de rest van je site nooit gezien — en dat verklaart een antwoord waarin je bestaat maar niets specifieks over je gezegd wordt.

Waarom zie ik zo weinig verkeer uit AI in mijn statistieken?

Omdat een genoemd worden vaak geen klik oplevert. Het antwoord bevat je naam, de vraagsteller heeft wat hij nodig had, en er wordt niets aangeklikt. Dat is geen mislukking van de meting maar het wezen van het kanaal: de winst is dat je naam viel, niet dat er een bezoeker binnenkwam.

Wat je in je statistieken wél ziet, is het verkeer dat na zo'n antwoord alsnog doorklikt, en dat komt binnen met een herkenbare herkomst. Dat aantal is bijna altijd kleiner dan het aantal keren dat je genoemd bent — en juist dat verschil is de reden om beide te meten.

Moet ik sommige van deze crawlers buitenhouden?

Dat is een keuze en geen technische vraag, en ze valt in twee stukken uiteen. Verzamelen voor training buitensluiten en tegelijk gevonden willen worden in antwoorden, kan bij sommige uitbaters wel en bij andere niet — bij een deel is het dezelfde crawler.

De praktische raad: sluit niets uit zolang je niet weet wat er binnenkomt. Wie eerst blokkeert en daarna meet, meet zijn eigen instelling.

Veelgestelde vragen

Mijn hostingpartij geeft me geen logboeken. Wat dan?

Dan kan je het langs de andere kant benaderen: vraag hetzelfde aan verschillende assistenten en kijk of ze inhoud van je site aanhalen die alleen op een diepe pagina staat. Kennen ze alleen je homepagina, dan is er nooit verder gekeken. Dat is minder precies dan een logboek en het kost je niets.

Betekent veel crawlerbezoek dat ik het goed doe?

Nee. Bezoek betekent dat je gelezen wordt, niet dat je gekozen wordt. Het is een noodzakelijke voorwaarde en een slechte maat: een site die dagelijks volledig opgehaald wordt en in geen enkel antwoord voorkomt, bestaat — en dat geval wijst meestal naar wat er buiten je site over je te vinden is.

Verder lezen

Gratis, zonder account en zonder kaart.