Aller au contenu
ceeme

Quelle IA passe réellement sur mon site ?

Chaque assistant IA récupère des pages sous un nom propre, et ce nom figure dans vos journaux serveur à côté de l'heure et de la page demandée. Ce journal est la seule source qui parle de votre site plutôt que du marché — et c'est en même temps celle que la plupart des entreprises n'ont jamais consultée, alors qu'elle enregistre depuis des mois.

Par Njusja Orban, fondatrice de ceeme5 min de lecture

Mesurez votre entreprise → Plutôt en parler d'abord

En bref

Trois types de passage
Collecte pour l'entraînement, tenue d'un index, et récupération en direct pendant une réponse. Seul le dernier correspond à une conversation en cours.
Vérifiable
Une partie des crawlers publie des listes d'IP ou se vérifie par DNS. Le reste ne fournit qu'un nom, et n'importe qui peut le taper.
Ce que votre journal dit
Quelles pages sont récupérées et lesquelles jamais. C'est une liste de travail, et elle n'appartient qu'à vous.

Qui passe, et à qui appartient ce crawler ?

Ci-dessous les crawlers qui alimentent les réponses IA, par opérateur, avec la question qui compte vraiment : pouvez-vous vérifier que c'en était bien un ? Pour environ un tiers, la réponse est non, et ce n'est pas un détail — un nom que chacun peut taper ne prouve aucun passage.

Notez chez un opérateur la scission : le crawler qui tient l'index n'est pas celui qui récupère en direct pendant une conversation. Si vous ne voyez que le premier, vous êtes collecté mais pas cité.

OpérateurCrawlersVérifiable ?
GoogleGoogle-Extended · Googlebot · GoogleOtheroui — DNS inverse sur le domaine publié
MicrosoftBingbotoui — DNS inverse sur le domaine publié
AppleApplebot-Extended · Applebotoui — DNS inverse sur le domaine publié
OpenAIGPTBot · OAI-SearchBot · ChatGPT-Useroui — contre la liste d'IP publiée
AnthropicClaudeBot · Claude-User · Claude-SearchBot · anthropic-aioui — contre la liste d'IP publiée
PerplexityPerplexityBot · Perplexity-Useroui — contre la liste d'IP publiée
AmazonAmazonbotnon — uniquement le nom que le visiteur déclare, donc imitable
MetaMeta-ExternalAgentnon — uniquement le nom que le visiteur déclare, donc imitable
ByteDanceBytespidernon — uniquement le nom que le visiteur déclare, donc imitable
Coherecohere-ainon — uniquement le nom que le visiteur déclare, donc imitable
DuckDuckGoDuckAssistBotnon — uniquement le nom que le visiteur déclare, donc imitable
You.comYouBotnon — uniquement le nom que le visiteur déclare, donc imitable
DiffbotDiffbotnon — uniquement le nom que le visiteur déclare, donc imitable
TimpiTimpibotnon — uniquement le nom que le visiteur déclare, donc imitable

Comment lire mon propre journal sans développeur ?

La plupart des hébergements permettent de télécharger les journaux d'accès bruts ; il suffit alors de chercher les noms ci-dessus. Si votre site passe par un service qui filtre le trafic, le récapitulatif s'y trouve souvent déjà, sous une rubrique du type bots ou crawlers vérifiés.

Ce que vous cherchez n'est pas le nombre mais la répartition : quelles pages sont récupérées. Un crawler qui ne visite que votre page d'accueil et votre page de contact n'a jamais vu le reste — et cela explique une réponse où vous existez sans que rien de précis ne soit dit.

Pourquoi si peu de trafic issu de l'IA dans mes statistiques ?

Parce qu'être nommé ne produit souvent aucun clic. La réponse contient votre nom, le demandeur a ce qu'il voulait, et rien n'est cliqué. Ce n'est pas un échec de mesure mais la nature du canal : le gain est que votre nom soit tombé, pas qu'un visiteur soit venu.

Ce que vous voyez dans vos statistiques, c'est le trafic qui clique malgré tout après une telle réponse, et il arrive avec une provenance identifiable. Ce nombre est presque toujours inférieur au nombre de mentions — et c'est justement cet écart qui justifie de mesurer les deux.

Dois-je en bloquer certains ?

C'est un choix, pas une question technique, et il se scinde en deux. Exclure la collecte pour l'entraînement tout en voulant apparaître dans les réponses est possible chez certains opérateurs et pas chez d'autres — pour une partie, c'est le même crawler.

Conseil pratique : n'excluez rien tant que vous ne savez pas ce qui entre. Qui bloque d'abord et mesure ensuite mesure son propre réglage.

Questions fréquentes

Mon hébergeur ne me donne pas de journaux. Et alors ?

Alors abordez-le par l'autre bout : posez la même question à différents assistants et voyez s'ils citent du contenu qui ne figure que sur une page profonde. S'ils ne connaissent que votre accueil, rien n'a été exploré au-delà. C'est moins précis qu'un journal et cela ne coûte rien.

Beaucoup de passages de crawlers signifie-t-il que je m'en sors bien ?

Non. Un passage signifie qu'on vous lit, pas qu'on vous choisit. C'est une condition nécessaire et une mauvaise mesure : un site intégralement récupéré chaque jour et absent de toute réponse, cela existe — et ce cas renvoie généralement à ce qui se trouve sur vous hors de votre site.

Pour aller plus loin

Gratuit, sans compte ni carte bancaire.