Pourquoi les bots IA ne peuvent pas explorer votre site (et comment y remédier)
Mis à jour le 29 août 2026 · 9 min de lecture
Si les réponses IA de ChatGPT, Perplexity ou Google ne mentionnent jamais votre site, la cause est souvent invisible : un hébergeur, un CDN ou un pare-feu renvoie discrètement un 403 aux robots IA pour économiser de la bande passante — alors que votre robots.txt dit qu'ils sont les bienvenus. Voici comment ce blocage se produit, comment le trouver, et comment ouvrir la porte aux robots que vous voulez vraiment.
Ce que « bloqué » signifie réellement pour les réponses IA
Les moteurs de réponse — ChatGPT, Perplexity, Google AI Overviews, Claude — n'inventent pas de faits sur votre entreprise. Ils récupèrent vos pages, les lisent et les citent. Si leur robot ne peut pas atteindre vos pages, vous n'existez tout simplement pas dans la réponse. Aucune erreur ne vous est montrée ; la citation va à un concurrent dont les pages, elles, se sont chargées.
C'est le cœur de l'AEO (Answer Engine Optimization) : être explorable par les robots qui alimentent les réponses IA. Et la raison la plus fréquente d'un échec n'est pas un llms.txt manquant ou des données structurées pauvres — c'est que le robot a été refoulé à la porte, avant même d'avoir vu le HTML.
robots.txt est une demande ; le serveur est le mur
Il existe deux endroits totalement différents où un bot IA peut être bloqué, et ils ne se comportent pas du tout pareil.
robots.txt est une demande polie. C'est un fichier texte qui dit « merci de ne pas explorer ces chemins ». Les robots bien élevés — GPTBot, PerplexityBot, ClaudeBot, Google-Extended — le lisent et obéissent. Mais c'est volontaire : techniquement, il ne bloque rien et repose sur la bonne volonté du robot.
Un blocage au niveau serveur ou WAF est un mur. Votre hébergeur, CDN ou pare-feu inspecte le user-agent de la requête entrante et renvoie un 403 Forbidden, un 429 ou une page de défi avant même que votre site ne s'exécute. Le robot n'obtient rien. Point crucial : cela peut arriver alors que le robots.txt dit joyeusement « autorisé » — les deux systèmes s'ignorent l'un l'autre.
C'est dans cet écart que vit l'essentiel de l'invisibilité IA silencieuse : vous (ou un plugin, ou un tutoriel) avez autorisé les robots dans le robots.txt, mais le serveur les bloque quand même — et rien ne vous avertit.
Pourquoi les hébergeurs et WAF bloquent les bots IA en premier lieu
Bloquer les robots IA est rarement une décision consciente. Cela arrive généralement comme un réglage par défaut :
Bande passante et CPU. Les robots IA peuvent être agressifs — un robot d'entraînement peut demander des milliers d'URL par jour. Les hébergeurs économiques et mutualisés livrent de plus en plus des listes de blocage par user-agent qui écartent les bots IA pour protéger leur infrastructure, et ils ne vous le disent pas toujours.
Interrupteurs CDN en un clic. Le réglage géré « Bloquer les bots IA » de Cloudflare est un simple interrupteur. On l'active facilement en croyant n'arrêter que les scrapers d'entraînement — mais la même règle bloque GPTBot, ClaudeBot, Amazonbot, CCBot, Bytespider et d'autres, y compris les robots qui vous citeraient autrement.
Plugins de sécurité et règles de pare-feu. Les plugins de sécurité WordPress et les jeux de règles WAF regroupent souvent des listes de « mauvais bots » qui ratissent les robots IA avec les vrais scrapers. Une règle écrite pour stopper le vol de contenu stoppe aussi discrètement les citations.
Le résultat est le même : un blocage que vous n'avez jamais voulu, qui économise un peu de bande passante au prix de chaque future citation IA.
Comment savoir si votre site bloque les bots IA
Vous pouvez le tester vous-même avec une requête par robot — demandez votre page d'accueil en présentant le user-agent du bot, et observez le code de statut.
Depuis un terminal : curl -sI -A "Mozilla/5.0 (compatible; GPTBot/1.1; +https://openai.com/gptbot)" https://votresite.com/ — un 200 OK signifie que le bot entre ; un 403, 429, 451 ou 503, ou un défi Cloudflare (« Just a moment… »), signifie qu'il est bloqué.
Exécutez-le pour chaque robot qui vous importe (GPTBot, PerplexityBot, ClaudeBot, OAI-SearchBot). Si un user-agent de navigateur normal reçoit 200 mais que ceux des bots reçoivent 403, le blocage est basé sur le user-agent — le type courant et bon marché, et le plus facile à corriger. Si même Googlebot est bloqué, votre hébergeur refoule les robots en bloc, ce qui nuit aussi au SEO classique.
Une réserve : ceci teste le blocage par chaîne de user-agent. Les blocages sophistiqués qui vérifient un robot par ses plages d'IP publiées ne peuvent pas être reproduits depuis votre ordinateur — mais ils sont plus rares, et un blocage par user-agent est ce que vous trouverez dans la grande majorité des cas.
Comment débloquer les robots que vous voulez
Corriger cela concerne le mur, pas le robots.txt — modifier le robots.txt ne sert à rien si le serveur renvoie un 403. Allez à la couche qui bloque réellement :
Cloudflare / CDN. Désactivez la règle gérée « Bloquer les bots IA », ou remplacez-la par une règle personnalisée qui autorise les robots de citation (GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot) tout en continuant à défier le reste. Cloudflare permet aussi de limiter le débit plutôt que de bloquer, ce qui plafonne la bande passante sans vous éteindre.
Pare-feu de l'hébergeur / ModSecurity. Demandez à votre hébergeur (ou vérifiez les règles du pare-feu) une liste de blocage par user-agent incluant GPTBot, ClaudeBot ou PerplexityBot, et mettez en liste blanche ceux par qui vous voulez être cité.
Plugin de sécurité. Dans la section de blocage des mauvais bots ou des user-agents de votre plugin de sécurité WordPress, retirez les robots de citation IA de la liste de blocage.
Décidez ensuite qui vous voulez vraiment. Bloquer est un choix légitime pour les robots d'entraînement — les autoriser contribue votre contenu à l'entraînement des modèles. Mais les robots de citation sont différents : bloquer GPTBot, OAI-SearchBot, PerplexityBot ou ClaudeBot vous retire des réponses IA en direct sans aucun avantage. Une posture courante et défendable : autoriser les robots de citation et de recherche, bloquer ou limiter ceux d'entraînement pur. OpenAI et Anthropic prennent en charge cette séparation, vous pouvez donc autoriser OAI-SearchBot pour la recherche tout en interdisant GPTBot pour l'entraînement.
Quel que soit votre choix, retestez ensuite avec la commande curl ci-dessus pour confirmer que le serveur sert bien les bots — ne supposez pas que l'interrupteur a fonctionné.
Comment Relvato surveille l'accès des robots IA pour vous
Tester une fois à la main, c'est bien ; le problème, c'est que ce blocage revient. Un changement de forfait CDN, une mise à jour de plugin de sécurité, un nouveau réglage par défaut du pare-feu de l'hébergeur, ou un collègue qui bascule l'interrupteur Cloudflare peuvent rebloquer les robots IA des mois plus tard — en silence, exactement comme la première fois.
Le contrôle de préparation AEO de Relvato exécute ce test à chaque vérification. Il demande votre page d'accueil en tant que chaque robot de moteur de réponse (GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot) et confirme que le serveur les sert réellement — pas seulement que le robots.txt les autorise. Un contrôle avec user-agent de navigateur évite les fausses alertes, et un contrôle Googlebot distingue le blocage spécifique à l'IA du blocage de bots en bloc.
Parce qu'il s'exécute en continu et revérifie après les mises à jour du site, vous êtes averti au moment où un déploiement ou un changement de réglage commence à refouler les robots IA — par une alerte, avant que des semaines de citations perdues ne passent. À côté, le même contrôle vérifie la politique robots.txt, llms.txt, les données structurées, un sitemap, les métadonnées de snippet et le contenu rendu côté serveur — ainsi « l'IA peut-elle me trouver et me citer ? » reçoit une réponse de bout en bout. Il fonctionne sur tout site avec un domaine vérifié, sans plugin.
Quels robots IA autoriser — et ce que coûte le blocage de chacun
| Robot | Exploité par / utilisé pour | Si vous le bloquez | Recommandation courante |
|---|---|---|---|
| GPTBot | OpenAI — navigation ChatGPT et entraînement | Ni lu ni cité par ChatGPT | Autoriser pour l'AEO |
| OAI-SearchBot | OpenAI — résultats ChatGPT Search | Exclu de ChatGPT Search | Autoriser pour l'AEO |
| PerplexityBot | Perplexity — réponses en temps réel (pas d'entraînement) | Aucune citation dans Perplexity | Autoriser pour l'AEO |
| ClaudeBot | Anthropic — indexation Claude et entraînement | Non cité par Claude | Autoriser pour l'AEO |
| Google-Extended | Google — socle pour Gemini et AI Overviews | Hors des réponses IA de Google (Recherche intacte) | Autoriser sauf refus |
| CCBot | Common Crawl — jeu de données ouvert utilisé par de nombreux modèles | Moins de présence dans les modèles entraînés dessus | Optionnel |
| Bytespider | ByteDance — robot d'entraînement, souvent agressif | Données d'entraînement uniquement | Souvent limité ou bloqué |
FAQ sur le blocage des robots IA
Est-ce mauvais de bloquer les bots IA ?
Cela dépend de quels bots, et si c'était intentionnel. Bloquer les robots d'entraînement uniquement (CCBot, Bytespider) est un choix légitime de confidentialité et de bande passante. Bloquer les robots de citation (GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot) vous retire des réponses de ChatGPT, Perplexity et Claude — généralement par accident, et presque toujours à annuler.
Ajouter les bots IA au robots.txt les bloque-t-il ?
Pas au niveau du serveur. Le robots.txt est une demande volontaire que les robots conformes respectent, mais il n'arrête rien techniquement. Un blocage serveur ou WAF est imposé et indépendant — c'est pourquoi un site peut « autoriser » un bot dans le robots.txt tandis que son hébergeur renvoie toujours un 403 à ce même bot.
Comment vérifier si mon hébergeur bloque les bots IA ?
Demandez votre page d'accueil avec le user-agent du bot et lisez le code de statut — curl -sI -A "…GPTBot…" https://votresite.com/. Un 403, 429 ou 503, ou une page de défi, signifie bloqué. Relvato exécute ce test en continu pour GPTBot, PerplexityBot, ClaudeBot et OAI-SearchBot et vous alerte si un blocage apparaît.
Autoriser les robots IA va-t-il surcharger mon serveur ?
Cela peut ajouter de la charge, surtout les robots d'entraînement. Si la bande passante est le souci, limitez le débit plutôt que de bloquer — la plupart des CDN et hébergeurs vous laissent brider le taux d'exploration d'un user-agent, et Anthropic et d'autres respectent une directive Crawl-delay. Ainsi les réponses IA continuent de vous citer sans qu'un robot ne martyrise le site.
Puis-je autoriser les bots de citation et bloquer les bots d'entraînement ?
Oui, et c'est une posture courante. OpenAI vous laisse autoriser OAI-SearchBot (recherche) et interdire GPTBot (entraînement) ; Anthropic sépare ClaudeBot, Claude-User et Claude-SearchBot. Autorisez les agents de recherche et de citation pour apparaître dans les réponses, et bloquez ou limitez les robots d'entraînement pur si vous préférez ne pas alimenter l'entraînement des modèles.
Sources
- OpenAI — Overview of OpenAI crawlers (GPTBot, OAI-SearchBot, ChatGPT-User)
- Anthropic — Does Anthropic crawl the web, and how to block the crawler
- Perplexity — Perplexity crawlers (PerplexityBot, Perplexity-User)
- Google — Google's common crawlers (Google-Extended)
- Cloudflare — Control content use for AI training (block AI bots)