Aller au contenu principal
VotreAgenceWeb
GEO4 min de lecture

Faut-il autoriser GPTBot, ClaudeBot et PerplexityBot sur votre site ?

Beaucoup de sites bloquent les robots IA sans l'avoir décidé. Pour un média, le calcul se défend. Pour une PME qui veut être trouvée, c'est se retirer d'un canal. Le guide de décision.

La réponse courte : pour une PME dont l'enjeu est d'être trouvée, autorisez-les. Pour un éditeur qui vit de la publicité ou de l'abonnement, la question est légitime. Le problème, c'est que la plupart des sites bloqués le sont par défaut, sans que personne n'ait tranché.

Vérifiez d'abord ce que fait votre site

Ouvrez https://votredomaine.ch/robots.txt dans un navigateur. Cherchez ces noms :

Robot Opérateur Rôle
GPTBot OpenAI Collecte pour l'entraînement
OAI-SearchBot OpenAI Alimente la recherche de ChatGPT
ChatGPT-User OpenAI Récupération en direct quand un utilisateur pose une question
ClaudeBot Anthropic Collecte
PerplexityBot Perplexity Indexation pour les réponses
Google-Extended Google Contrôle l'usage pour Gemini — sans effet sur le classement Search
Applebot-Extended Apple Contrôle l'usage pour l'IA d'Apple

Si vous trouvez des lignes Disallow: / associées à ces agents, votre site est invisible pour eux. Beaucoup de thèmes, d'extensions et de configurations d'hébergeur les ont ajoutées automatiquement en 2024-2025, souvent sans que le propriétaire du site le sache.

La distinction que presque tout le monde rate

Ces robots ne font pas tous la même chose, et les confondre mène à de mauvaises décisions.

Les robots d'entraînement (GPTBot, ClaudeBot) collectent du contenu pour améliorer les modèles. Les bloquer ne vous retire pas des réponses ; cela retire votre contenu des jeux d'entraînement futurs.

Les robots de récupération (OAI-SearchBot, ChatGPT-User, PerplexityBot) vont chercher des pages au moment où un utilisateur pose une question. Les bloquer, c'est vous exclure des réponses en direct — donc des citations, donc des clics.

C'est là que se joue la vraie décision. Bloquer l'entraînement est un choix défendable sur la propriété intellectuelle. Bloquer la récupération, c'est refuser d'apparaître quand un prospect pose une question sur votre métier.

Un cas fréquent : un site bloque GPTBot par prudence, croit avoir « protégé son contenu », et bloque en réalité aussi sa propre visibilité parce que la règle a été écrite trop largement.

Le cas de Google-Extended

Celui-ci mérite une mention à part, parce qu'il génère beaucoup de confusion.

Google-Extended contrôle l'utilisation de votre contenu pour Gemini. Il n'a aucun effet sur votre classement dans Google Search, ni sur votre présence dans les AI Overviews — celles-ci s'appuient sur l'index Search normal, comme Google l'a confirmé dans son guide du 15 mai 2026.

Autrement dit : le bloquer ne vous retire pas des AI Overviews. Si votre objectif était de sortir des réponses génératives de Google, ce n'est pas le bon levier — et il n'y en a pas d'autre que sortir de l'index tout court.

Comment décider, selon votre situation

Vous êtes une PME, un commerce, un cabinet, un artisan → autorisez tout.

Votre problème n'est pas qu'on vous copie, c'est qu'on ne vous trouve pas. Une citation dans ChatGPT ou Perplexity est une recommandation gratuite devant un prospect en phase de décision. Le contenu que vous publiez existe pour être vu.

Vous êtes un média, un éditeur, une base de données payante → la question est réelle.

Si votre modèle économique repose sur les visites ou l'abonnement, un moteur qui répond à la place de vos lecteurs vous coûte directement. Le calcul mérite d'être fait, et plusieurs éditeurs négocient désormais des accords de licence. Ce n'est pas notre marché, et nous n'avons pas d'avis tranché à vous donner.

Vous avez du contenu réellement confidentiel → ce n'est pas le bon outil.

Le robots.txt est une convention, pas une protection. Ce qui doit rester privé se met derrière une authentification, pas derrière une ligne de texte que rien n'oblige à respecter.

La configuration que nous recommandons

Pour une PME suisse qui veut être trouvée :

User-agent: *
Allow: /
Disallow: /api/

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Google-Extended
Allow: /

Sitemap: https://votredomaine.ch/sitemap.xml

C'est exactement la configuration de ce site — vous pouvez la vérifier sur notre robots.txt. L'autorisation y est explicite plutôt qu'implicite : cela évite qu'une future modification du bloc générique ne bloque involontairement un moteur.

Ce que bloquer ne fait pas

Cela ne protège pas votre contenu déjà appris. Les modèles actuels ont été entraînés sur des données antérieures à votre décision. Bloquer aujourd'hui n'efface rien.

Cela n'empêche pas la copie. Un concurrent qui veut reprendre vos textes le fera à la main. Le robots.txt ne l'arrête pas une seconde.

Cela ne vous fait pas gagner de classement Google. Aucun de ces réglages n'influence le SEO classique.

Sujet voisin, souvent confondu avec celui-ci : llms.txt, utile ou effet de mode ?

Questions fréquentes

Faut-il bloquer GPTBot sur son site ?
Pour une PME dont le problème est d'être trouvée, non : bloquer revient à se retirer d'un canal d'acquisition. Pour un éditeur qui vit de la vente de son contenu, le calcul est légitime et dépend du modèle économique. Dans les deux cas, la décision doit être consciente — le blocage est le plus souvent hérité d'une configuration ancienne.
Quelle différence entre GPTBot et OAI-SearchBot ?
GPTBot et ClaudeBot collectent des données d'entraînement ; OAI-SearchBot, ChatGPT-User et PerplexityBot vont chercher des pages au moment de répondre à un utilisateur. Seuls les seconds déterminent votre présence dans les réponses : bloquer l'entraînement tout en autorisant la récupération est une position cohérente que beaucoup de sites manquent.
Bloquer Google-Extended retire-t-il mon site des AI Overviews ?
Non. Google-Extended ne concerne que Gemini et n'a aucun effet sur la recherche Google ni sur les AI Overviews, qui utilisent l'index principal. Le confondre avec un contrôle sur les AI Overviews est l'erreur la plus fréquente sur ce sujet.
Le robots.txt protège-t-il un contenu confidentiel ?
Non, ce n'est pas un mécanisme de sécurité. Le fichier est public, il indique où regarder, et rien n'oblige un robot à le respecter. Ce qui est confidentiel se met derrière une authentification.

Prochaine étape

Parlons de votre projet.

Un échange de 20 minutes suffit pour savoir si nous sommes le bon partenaire — et pour repartir avec une estimation chiffrée, gratuite et sans engagement.

Réponse sous 24 heures ouvrables · Devis détaillé sous 48 h · Sans engagement