Crawlers IA et robots.txt : faut-il les bloquer ?

Dernière mise à jour :

Si votre robots.txt bloque les crawlers IA, des assistants comme ChatGPT, Claude ou Perplexity ne peuvent pas lire vos fiches produit, et n'ont donc guère de raison de recommander votre boutique. Beaucoup de boutiques les bloquent sans le savoir, à cause d'un modèle copié ou d'un plugin de sécurité. La vérification prend deux minutes.

Comment les crawlers IA lisent le robots.txt

Un robot respectueux télécharge https://votre-boutique.fr/robots.txt avant toute chose et applique le groupe correspondant à son nom. S'il n'en existe pas, il se rabat sur le groupe User-agent: *. C'est la cause la plus fréquente des blocages involontaires.

Les crawlers à connaître

Les noms évoluent : référez-vous à la documentation de chaque éditeur. Parmi les plus courants :

  • GPTBot, OAI-SearchBot, ChatGPT-User (OpenAI)
  • ClaudeBot, anthropic-ai (Anthropic)
  • PerplexityBot (Perplexity)
  • Google-Extended et Applebot-Extended (déterminent si Google et Apple utilisent votre contenu pour leurs produits d'IA)
  • CCBot (Common Crawl), Bytespider, Amazonbot

Certains servent à l'entraînement des modèles, d'autres consultent les pages en direct pour répondre à une question. Vous pouvez appliquer des règles différentes selon le type.

Autoriser les crawlers IA

Pour leur laisser lire vos pages publiques tout en protégeant les zones privées :

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: PerplexityBot
Allow: /
Disallow: /cart
Disallow: /checkout
Disallow: /account

User-agent: *
Disallow: /cart
Disallow: /checkout
Disallow: /account

Sitemap: https://votre-boutique.fr/sitemap.xml

Autoriser un robot ne débloque pas les autres : chacun a besoin de son propre groupe, ou d'un groupe * permissif. Adaptez les chemins à votre plateforme (par exemple /panier ou /commande).

Quand bloquer a du sens

Certains marchands refusent volontairement l'entraînement des IA, par exemple pour protéger des photos originales ou des contenus éditoriaux. C'est une décision légitime. L'erreur, c'est de bloquer par accident, ou de tout bloquer alors que vous visiez seulement l'entraînement. Si vous voulez être cité, autorisez au moins les agents de recherche et de navigation.

Comment vérifier

  1. Ouvrez /robots.txt et cherchez Disallow: / sous User-agent: * ou sous le nom d'un robot IA.
  2. Vérifiez que votre plateforme ou un plugin n'a pas ajouté ses propres règles de blocage des IA.
  3. Revérifiez après un changement de thème, de plugin ou d'hébergeur, et après une mise en ligne depuis un site de préproduction.

Associez cela à un fichier llms.txt clair : bloquer les crawlers tout en publiant un llms.txt envoie des signaux contradictoires.

Comment Averifly vous aide

La règle AI_CRAWLERS_BLOCKED d'Averifly lit votre robots.txt et signale les principaux crawlers IA interdits, en complément des contrôles llms.txt et données structurées de nos règles GEO. Lancez un scan gratuit pour savoir si les assistants IA peuvent lire votre boutique.

Questions fréquentes

Bloquer GPTBot retire-t-il ma boutique de ChatGPT ?

Bloquer GPTBot indique à OpenAI de ne pas utiliser vos pages pour entraîner ses modèles. D'autres agents, comme OAI-SearchBot et ChatGPT-User, ont des rôles distincts pour la recherche et la navigation : vous pouvez les traiter séparément.

Une règle Disallow globale peut-elle bloquer les crawlers IA par erreur ?

Oui. Un groupe `User-agent: *` avec `Disallow: /` bloque tous les robots qui n'ont pas de groupe dédié, y compris les crawlers IA. Cela arrive souvent quand le robots.txt d'un site de préproduction est copié en production.

Autoriser les crawlers IA est-il sans risque pour ma boutique ?

Vous leur permettez de lire vos pages publiques, celles que voit n'importe quel visiteur. Gardez les zones privées (panier, paiement, compte client) interdites pour tous les robots.

Autres guides GEO