Faut-il bloquer les robots des IA dans son robots.txt ?
Je produis du contenu original et je n’ai pas envie qu’il serve à entraîner des modèles sans contrepartie. Mais je ne veux pas non plus disparaître des réponses IA.
Thème : GEO
La réponse
La question mérite d’être coupée en deux, parce qu’il n’y a pas un robot mais deux familles de robots, et les bloquer n’a pas du tout les mêmes conséquences.
Deux usages, deux robots
Les robots d’entraînement collectent du contenu pour construire les futures versions des modèles. Les bloquer vous retire du corpus d’entraînement. Cela ne vous fait perdre aucune visibilité immédiate, puisque ces données ne servent pas à répondre en temps réel.
Les robots de recherche vont chercher des pages au moment où l’utilisateur pose sa question, pour construire une réponse sourcée. Les bloquer vous retire des citations. Concrètement, vous n’apparaissez plus dans les réponses de Perplexity ou dans les recherches web de ChatGPT.
Chez OpenAI, GPTBot relève de l’entraînement, OAI-SearchBot de la recherche. Chez Anthropic, ClaudeBot relève de l’entraînement, Claude-SearchBot de la recherche. Chez Google, Google-Extended concerne l’usage pour les modèles Gemini, sans affecter l’indexation classique par Googlebot. Chez Perplexity, PerplexityBot sert la recherche.
La liste et les noms évoluent. Vérifiez-les à la source, dans la documentation publiée par chaque éditeur, plutôt que dans un article de blog recopié.
La configuration qui a du sens pour la plupart des sites
Pour une entreprise dont le site est un outil de visibilité et non un produit payant, la position raisonnable est : refuser l’entraînement, accepter la recherche. Vous ne nourrissez pas gratuitement les modèles, et vous restez citable quand un prospect pose une question.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /Les cas où bloquer tout se défend
Si votre contenu est votre produit, une base documentaire payante, une méthode propriétaire, un catalogue construit à grands frais, le calcul est différent. Vous n’avez pas d’intérêt à ce qu’un assistant restitue votre valeur sans que personne ne vienne chez vous. Bloquez tout, et acceptez la perte de visibilité qui va avec.
Les limites qu’il faut connaître
Le fichier robots.txt est une convention, pas une barrière technique. Il est respecté par les acteurs identifiés qui ont un intérêt de réputation à le faire. Il ne protège de rien face à un collecteur qui décide de l’ignorer, et il ne protège pas non plus des reprises de votre contenu par des tiers qui, eux, sont bien indexés.
Autre point souvent oublié : bloquer aujourd’hui ne retire pas ce qui a déjà été collecté hier. Le blocage vaut pour l’avenir.
Enfin, vérifiez ce que fait votre pare-feu applicatif. Beaucoup de solutions de sécurité bloquent par défaut des agents peu connus. Vous pouvez très bien avoir un robots.txt permissif et un site inaccessible aux robots IA sans le savoir. Le contrôle se fait dans les logs serveur, pas dans le fichier.
Pour aller plus loin
Une question qui n’a pas encore sa réponse ?
Posez-la, j’y réponds publiquement et gratuitement.
