Aller au contenu
ceeme

Quels crawlers IA autoriser sur mon site ?

Ce générateur écrit un robots.txt indiquant pour chaque crawler IA s'il peut lire votre site. La liste provient du même registre que notre mesure — 23 crawlers, dont 15 sont vérifiables contre une liste d'IP publiée ou par DNS. Le fichier est assemblé entièrement dans votre navigateur : aucune adresse ne part vers notre serveur, car il n'y a rien à récupérer.

Par Njusja Orban, fondatrice de ceeme3 min de lecture

Mesurez votre entreprise → Plutôt en parler d'abord

Choisissez un réglage

Crawler par crawler

Avancé
robots.txt

      

En bref

Ce que fait le fichier
Il dit, crawler par crawler, qui peut entrer. C'est le seul des trois fichiers de votre domaine qu'un crawler doit respecter.
Entraînement contre direct
Certains crawlers collectent pour l'entraînement, d'autres récupèrent pendant une réponse. Bloquer les deux est un autre choix que n'en bloquer qu'un.
Le prix d'une fermeture
Ce qu'un crawler ne peut pas lire n'apparaît dans aucune réponse. Un bon texte n'y change rien — personne ne le lit.

Quel réglage me convient ?

Si vous voulez être trouvé dans les réponses IA : tout autoriser. C'est le réglage en tête, et le seul qui ne coûte rien — un crawler qui lit votre site consomme de la bande passante et c'est tout.

Le deuxième réglage vise ceux qui refusent que leurs textes entraînent un modèle mais veulent figurer dans les réponses. Position défendable, et pas une demi-mesure : chez certains fournisseurs c'est le même crawler, et vous tranchez donc quand même.

Quelle différence entre un crawler d'entraînement et un crawler en direct ?

Un crawler d'entraînement collecte du texte qui entrera plus tard dans un modèle ; ce qu'il prend aujourd'hui réapparaît des mois plus tard. Un crawler en direct récupère pendant la conversation : ce qu'il trouve figure dans la réponse que quelqu'un lit maintenant.

Pour la visibilité à court terme, c'est le second type qui compte, et c'est aussi celui dont on peut mesurer l'effet. Le premier est un choix de long terme et une position sur vos propres textes.

Que ne fait pas ce fichier ?

Il règle l'accès et rien de plus. Être lu est une question ; être nommé en est une autre, et elle n'est pas traitée ici.

Ce que fait cet outilCe qu'il ne fait pas
Écrit un robots.txt valide avec une règle par crawlerNe dépose pas le fichier — c'est vous ou votre développeur
Indique par crawler s'il est vérifiableNe vérifie pas s'ils passent vraiment — vos journaux serveur sont nécessaires
Fonctionne entièrement dans votre navigateurN'impose rien : un crawler qui ignore le fichier n'est pas arrêté

Questions fréquentes

Vais-je perdre ma place dans Google si je bloque les crawlers IA ?

Pas automatiquement : le crawler qui tient l'index classique n'est pas celui qui collecte pour l'IA, et le générateur laisse toujours entrer le premier. Attention à ce que vous ajoutez à la main — une règle trop large touche les deux, et c'est la façon la plus courante de disparaître de l'index par accident.

Pourquoi y a-t-il plus de crawlers qu'ailleurs ?

Parce que la liste vient de notre propre registre et non d'un article. Il y en a 23, avec pour chacun s'il est vérifiable ; pour 8 d'entre eux ce n'est pas possible aujourd'hui, et c'est indiqué, car un nom que chacun peut taper ne prouve aucun passage.

Pour aller plus loin

Gratuit, sans compte ni carte bancaire.