ChatGPT, Bytespider, PetalBot… de plus en plus de bots visitent votre WordPress non pas pour vous trouver sur Google, mais pour copier votre contenu et l’utiliser pour entraîner des modèles d’intelligence artificielle. Et beaucoup d’entre eux ne respectent même pas les règles que vous leur imposez.
Pourquoi c’est un problème nouveau et croissant
Des bots d’entraînement IA qui explorent votre contenu sans permission
Contrairement à Googlebot (qui explore pour vous indexer et vous envoyer du trafic), ces bots collectent votre contenu pour entraîner des modèles de langage — sans attribution, sans lien retour, sans aucun bénéfice pour votre site.
Hausse du trafic des bots IA en 2025-2026
Le volume de ce type de trafic a beaucoup augmenté en peu de temps, et sur des sites riches en contenu, il peut représenter une part notable du trafic total — consommant bande passante et ressources serveur sans aucun retour.
Pourquoi robots.txt ne suffit pas
Bytespider et d’autres bots qui l’ignorent purement et simplement
Le fichier robots.txt n’est qu’une demande polie : il dit à un bot “merci de ne pas explorer ceci”, mais rien ne l’oblige à s’y conformer. Plusieurs bots IA connus, dont Bytespider (de ByteDance), ont la réputation de l’ignorer fréquemment.
Comment bloquer réellement ces bots, au niveau du serveur
Liste des user-agents de bots IA connus
Parmi les plus courants : GPTBot et ChatGPT-User (OpenAI), ClaudeBot (Anthropic), Bytespider (ByteDance), PetalBot (Huawei), CCBot (Common Crawl, utilisé par de nombreux modèles), Google-Extended (crawler d’entraînement de Google, distinct de Googlebot).
Blocage réel au niveau du pare-feu, pas juste une suggestion que le bot peut ignorer
La seule façon de vraiment bloquer un bot qui ne respecte pas robots.txt est au niveau du serveur : identifier son user-agent (ou son comportement, s’il falsifie le user-agent) et lui opposer un blocage réel avant qu’il ne consomme la moindre ressource de votre WordPress. La couche UA Blocklist de SeenSecure maintient cette liste de user-agents de bots IA connus à jour, donc vous n’avez pas à les ajouter vous-même à chaque fois qu’un nouveau apparaît.

Quels bots IA vous avez vraiment intérêt à laisser passer
Différence entre les bots d’entraînement et les bots qui citent votre contenu avec attribution
Tous les bots liés à l’IA ne se valent pas. Certains (comme ceux qui alimentent des réponses avec un lien direct vers votre page) vous génèrent bien du trafic réel. Avant de bloquer en bloc “tout ce qui ressemble à de l’IA”, mieux vaut distinguer lesquels vous avez intérêt à garder.
Questions fréquentes
robots.txt suffit-il à bloquer les bots IA comme Bytespider ?
Pas toujours — robots.txt est une demande volontaire, et certains bots IA l’ignorent purement et simplement. Pour un blocage réel, il faut agir au niveau du pare-feu/serveur.
Bloquer les bots IA affecte-t-il mon positionnement Google ?
Non, si vous distinguez bien les user-agents : Googlebot est un crawler de recherche, pas un bot d’entraînement IA, et ce sont des blocages indépendants.
Que se passe-t-il si je ne bloque pas les bots d’entraînement IA ?
Votre contenu peut être utilisé pour entraîner des modèles d’IA sans votre consentement ni attribution, en plus de consommer les ressources de votre serveur avec leur exploration.
