Choisissez un réglage
Avancé
En bref
- Ce que fait le fichier
- Il dit, crawler par crawler, qui peut entrer. C'est le seul des trois fichiers de votre domaine qu'un crawler doit respecter.
- Entraînement contre direct
- Certains crawlers collectent pour l'entraînement, d'autres récupèrent pendant une réponse. Bloquer les deux est un autre choix que n'en bloquer qu'un.
- Le prix d'une fermeture
- Ce qu'un crawler ne peut pas lire n'apparaît dans aucune réponse. Un bon texte n'y change rien — personne ne le lit.
Quel réglage me convient ?
Si vous voulez être trouvé dans les réponses IA : tout autoriser. C'est le réglage en tête, et le seul qui ne coûte rien — un crawler qui lit votre site consomme de la bande passante et c'est tout.
Le deuxième réglage vise ceux qui refusent que leurs textes entraînent un modèle mais veulent figurer dans les réponses. Position défendable, et pas une demi-mesure : chez certains fournisseurs c'est le même crawler, et vous tranchez donc quand même.
Quelle différence entre un crawler d'entraînement et un crawler en direct ?
Un crawler d'entraînement collecte du texte qui entrera plus tard dans un modèle ; ce qu'il prend aujourd'hui réapparaît des mois plus tard. Un crawler en direct récupère pendant la conversation : ce qu'il trouve figure dans la réponse que quelqu'un lit maintenant.
Pour la visibilité à court terme, c'est le second type qui compte, et c'est aussi celui dont on peut mesurer l'effet. Le premier est un choix de long terme et une position sur vos propres textes.
Que ne fait pas ce fichier ?
Il règle l'accès et rien de plus. Être lu est une question ; être nommé en est une autre, et elle n'est pas traitée ici.
| Ce que fait cet outil | Ce qu'il ne fait pas |
|---|---|
| Écrit un robots.txt valide avec une règle par crawler | Ne dépose pas le fichier — c'est vous ou votre développeur |
| Indique par crawler s'il est vérifiable | Ne vérifie pas s'ils passent vraiment — vos journaux serveur sont nécessaires |
| Fonctionne entièrement dans votre navigateur | N'impose rien : un crawler qui ignore le fichier n'est pas arrêté |
Questions fréquentes
Vais-je perdre ma place dans Google si je bloque les crawlers IA ?
Pas automatiquement : le crawler qui tient l'index classique n'est pas celui qui collecte pour l'IA, et le générateur laisse toujours entrer le premier. Attention à ce que vous ajoutez à la main — une règle trop large touche les deux, et c'est la façon la plus courante de disparaître de l'index par accident.
Pourquoi y a-t-il plus de crawlers qu'ailleurs ?
Parce que la liste vient de notre propre registre et non d'un article. Il y en a 23, avec pour chacun s'il est vérifiable ; pour 8 d'entre eux ce n'est pas possible aujourd'hui, et c'est indiqué, car un nom que chacun peut taper ne prouve aucun passage.
Pour aller plus loin
Gratuit, sans compte ni carte bancaire.