En bref
- Trois types de passage
- Collecte pour l'entraînement, tenue d'un index, et récupération en direct pendant une réponse. Seul le dernier correspond à une conversation en cours.
- Vérifiable
- Une partie des crawlers publie des listes d'IP ou se vérifie par DNS. Le reste ne fournit qu'un nom, et n'importe qui peut le taper.
- Ce que votre journal dit
- Quelles pages sont récupérées et lesquelles jamais. C'est une liste de travail, et elle n'appartient qu'à vous.
Qui passe, et à qui appartient ce crawler ?
Ci-dessous les crawlers qui alimentent les réponses IA, par opérateur, avec la question qui compte vraiment : pouvez-vous vérifier que c'en était bien un ? Pour environ un tiers, la réponse est non, et ce n'est pas un détail — un nom que chacun peut taper ne prouve aucun passage.
Notez chez un opérateur la scission : le crawler qui tient l'index n'est pas celui qui récupère en direct pendant une conversation. Si vous ne voyez que le premier, vous êtes collecté mais pas cité.
| Opérateur | Crawlers | Vérifiable ? |
|---|---|---|
| Google-Extended · Googlebot · GoogleOther | oui — DNS inverse sur le domaine publié | |
| Microsoft | Bingbot | oui — DNS inverse sur le domaine publié |
| Apple | Applebot-Extended · Applebot | oui — DNS inverse sur le domaine publié |
| OpenAI | GPTBot · OAI-SearchBot · ChatGPT-User | oui — contre la liste d'IP publiée |
| Anthropic | ClaudeBot · Claude-User · Claude-SearchBot · anthropic-ai | oui — contre la liste d'IP publiée |
| Perplexity | PerplexityBot · Perplexity-User | oui — contre la liste d'IP publiée |
| Amazon | Amazonbot | non — uniquement le nom que le visiteur déclare, donc imitable |
| Meta | Meta-ExternalAgent | non — uniquement le nom que le visiteur déclare, donc imitable |
| ByteDance | Bytespider | non — uniquement le nom que le visiteur déclare, donc imitable |
| Cohere | cohere-ai | non — uniquement le nom que le visiteur déclare, donc imitable |
| DuckDuckGo | DuckAssistBot | non — uniquement le nom que le visiteur déclare, donc imitable |
| You.com | YouBot | non — uniquement le nom que le visiteur déclare, donc imitable |
| Diffbot | Diffbot | non — uniquement le nom que le visiteur déclare, donc imitable |
| Timpi | Timpibot | non — uniquement le nom que le visiteur déclare, donc imitable |
Comment lire mon propre journal sans développeur ?
La plupart des hébergements permettent de télécharger les journaux d'accès bruts ; il suffit alors de chercher les noms ci-dessus. Si votre site passe par un service qui filtre le trafic, le récapitulatif s'y trouve souvent déjà, sous une rubrique du type bots ou crawlers vérifiés.
Ce que vous cherchez n'est pas le nombre mais la répartition : quelles pages sont récupérées. Un crawler qui ne visite que votre page d'accueil et votre page de contact n'a jamais vu le reste — et cela explique une réponse où vous existez sans que rien de précis ne soit dit.
Pourquoi si peu de trafic issu de l'IA dans mes statistiques ?
Parce qu'être nommé ne produit souvent aucun clic. La réponse contient votre nom, le demandeur a ce qu'il voulait, et rien n'est cliqué. Ce n'est pas un échec de mesure mais la nature du canal : le gain est que votre nom soit tombé, pas qu'un visiteur soit venu.
Ce que vous voyez dans vos statistiques, c'est le trafic qui clique malgré tout après une telle réponse, et il arrive avec une provenance identifiable. Ce nombre est presque toujours inférieur au nombre de mentions — et c'est justement cet écart qui justifie de mesurer les deux.
Dois-je en bloquer certains ?
C'est un choix, pas une question technique, et il se scinde en deux. Exclure la collecte pour l'entraînement tout en voulant apparaître dans les réponses est possible chez certains opérateurs et pas chez d'autres — pour une partie, c'est le même crawler.
Conseil pratique : n'excluez rien tant que vous ne savez pas ce qui entre. Qui bloque d'abord et mesure ensuite mesure son propre réglage.
Questions fréquentes
Mon hébergeur ne me donne pas de journaux. Et alors ?
Alors abordez-le par l'autre bout : posez la même question à différents assistants et voyez s'ils citent du contenu qui ne figure que sur une page profonde. S'ils ne connaissent que votre accueil, rien n'a été exploré au-delà. C'est moins précis qu'un journal et cela ne coûte rien.
Beaucoup de passages de crawlers signifie-t-il que je m'en sors bien ?
Non. Un passage signifie qu'on vous lit, pas qu'on vous choisit. C'est une condition nécessaire et une mauvaise mesure : un site intégralement récupéré chaque jour et absent de toute réponse, cela existe — et ce cas renvoie généralement à ce qui se trouve sur vous hors de votre site.
Pour aller plus loin
Gratuit, sans compte ni carte bancaire.