Faut-il bloquer les robots des IA sur son site ? La décision à prendre avant le 15 septembre

🗓️ Mis à jour le 31 août 2026

L’essentiel

Protéger son contenu ou rester visible dans ChatGPT : à partir du 15 septembre 2026, beaucoup de sites trancheront cette question sans même s’en apercevoir.

  • Le 1er juillet 2026, Cloudflare a annoncé trois catégories de trafic automatisé : Search, Agent et Training.
  • Au 15 septembre 2026, les catégories Training et Agent sont bloquées par défaut sur les pages qui affichent de la publicité ; Search reste autorisé.
  • Piège à connaître : les robots multi-usages suivent la règle la plus stricte — bloquer Training peut aussi bloquer Googlebot, Bingbot et Applebot.
  • Bloquer protège le contenu mais retire le site des réponses des assistants. C’est un arbitrage éditorial, pas un simple réglage technique.

Que se passe-t-il exactement le 15 septembre 2026 ?

À cette date, Cloudflare applique de nouveaux réglages par défaut au trafic automatisé. Sur les pages qui affichent de la publicité, les robots classés Training et Agent sont bloqués ; les robots classés Search restent autorisés. L’annonce date du 1er juillet 2026.

Le raisonnement de Cloudflare tient en une phrase : « une publicité est le signe que le propriétaire du site voulait qu’un être humain arrive là ». Une page monétisée par la publicité est donc présumée destinée à un lecteur, pas à un aspirateur de contenu.

Cloudflare protège une part considérable du web, souvent sans que le propriétaire du site l’ait choisi lui-même. Beaucoup d’entreprises y sont passées via leur hébergeur ou leur agence, et n’ouvrent jamais le tableau de bord.

Le billet de Cloudflare est explicite pour les nouveaux domaines. Pour les comptes gratuits déjà existants qui n’ont jamais touché à ces réglages, plusieurs reprises affirment que la bascule s’appliquera aussi.

La source primaire ne le dit pas noir sur blanc. Plutôt que de vous fier à un article, ouvrez votre tableau de bord.

Search, Agent, Training : quelle est la différence ?

Cloudflare distingue trois comportements, et cette grille est la vraie nouveauté. Jusqu’ici, un site n’avait qu’un choix binaire : laisser entrer les robots, ou les bloquer. Désormais, la réponse peut varier selon ce que le robot vient faire.

Cette distinction compte parce que les trois usages n’ont pas du tout la même valeur pour une entreprise. Être indexé fait venir des clients. Être absorbé dans l’entraînement d’un modèle ne rapporte, directement, rien.

📁 Dans cet article
Ce qui bascule le 15 septembre 2026
Ce qui bascule le 15 septembre 2026 — Cloudflare, billet du 1er juillet 2026

Faut-il bloquer, alors ?

La réponse dépend de ce que le site sert à faire, et diffère entre un journal et un garage. Un site dont le contenu est le produit a intérêt à protéger l’entraînement. Un site dont le contenu sert à faire venir des clients a tout à perdre à disparaître des réponses.

Trois cas concrets de la Grande Région :

  • Un restaurant à Arlon. La carte, les horaires et l’adresse n’ont aucune valeur marchande en soi, mais une valeur énorme si ces informations sont reprises quand quelqu’un demande où manger. Bloquer serait une faute.
  • Un média qui vit de la publicité. Les articles sont le produit, et chaque réponse générée sans clic est un revenu perdu. Le blocage de l’entraînement se défend.
  • Un bureau d’études ou un cabinet. Les fiches méthodes attirent des prospects qualifiés. Rester lisible par les assistants vaut mieux que protéger un contenu que personne ne revend.

La question utile n’est donc pas « suis-je pour ou contre l’intelligence artificielle », mais : mon contenu est-il ma marchandise, ou ma vitrine ?

Quel est le piège qui peut coûter votre référencement Google ?

Les robots multi-usages. Cloudflare l’écrit noir sur blanc : les robots qui font plusieurs choses à la fois — « Googlebot, Applebot et Bingbot » — sont bloqués chez les clients qui ont choisi de bloquer Training, même si Search reste autorisé par ailleurs.

Traduisons. Un propriétaire de site coche « je bloque l’entraînement des IA », geste qui semble prudent et sans conséquence. Résultat possible : Googlebot n’accède plus aux pages. Le site ne perd pas seulement sa visibilité dans ChatGPT, le site perd son référencement tout court.

C’est exactement le genre de réglage qu’un dirigeant coche de bonne foi, un vendredi soir, en pensant se protéger. Les effets, eux, mettent des semaines à se voir dans Google Search Console — quand il est déjà tard.

Et le fichier robots.txt dans tout ça ?

Le fichier robots.txt reste la pièce maîtresse, et Cloudflare a précisément cherché à en finir avec les contradictions. Le 21 août 2026, l’entreprise a lancé Bot Preference Sync.

Le principe : la politique choisie dans le tableau de bord génère automatiquement le fichier robots.txt correspondant, sur tous les plans, y compris gratuits.

Le problème résolu est très banal : des milliers de sites disent une chose dans leur robots.txt et l’inverse dans leur pare-feu. Les robots respectueux lisent le premier, se font refouler par le second, et le propriétaire n’y comprend rien.

Étape 1 — Vérifier ce que dit votre fichier aujourd’hui

Ouvrez votresite.be/robots.txt dans un navigateur. Cherchez les lignes GPTBot, ClaudeBot, PerplexityBot, Google-Extended et OAI-SearchBot.

Étape 2 — Se rappeler qu’un groupe nommé annule le groupe général

Piège classique : dès qu’un fichier robots.txt contient un bloc User-agent: GPTBot, ce robot ignore totalement les règles du bloc User-agent: *. Les interdictions générales — répertoire d’administration, pages privées — doivent être répétées dans chaque bloc nommé, sinon les interdictions sautent.

Étape 3 — Vérifier le tableau de bord Cloudflare, pas seulement le fichier

Si le site passe par Cloudflare, le pare-feu peut bloquer ce que le fichier autorise. Les deux doivent dire la même chose.

Étape 4 — Contrôler après le 15 septembre

Notez la date. Une semaine après, vérifiez dans Google Search Console que l’exploration se poursuit normalement, et refaites une recherche sur vos questions métier dans ChatGPT et Perplexity.

Quelle position info-lux a-t-il prise pour son propre site ?

Info-lux laisse passer les robots des IA, et l’assume. Le fichier robots.txt du site autorise explicitement GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot et Google-Extended. Ce choix est cohérent avec ce que le média défend : la visibilité de ses partenaires dans les réponses des assistants.

Bloquer l’accès tout en promettant à des clients d’être cités serait contradictoire. Un assistant ne peut reprendre qu’une information qu’il a pu lire.

Cette position n’est pas un conseil universel. La position d’info-lux découle d’un arbitrage précis : sur ce site, le contenu sert de vitrine à des entreprises, le contenu n’est pas la marchandise. Un éditeur qui vend de l’abonnement raisonnerait autrement, et aurait raison.

À lire aussi sur la visibilité dans les IA

Questions fréquentes

Que change Cloudflare le 15 septembre 2026 ?

À partir du 15 septembre 2026, Cloudflare bloque par défaut les robots classés Training et Agent sur les pages qui affichent de la publicité, tandis que les robots classés Search restent autorisés. L’annonce a été publiée le 1er juillet 2026. Les réglages peuvent être modifiés à tout moment depuis le tableau de bord Cloudflare.

Quelle est la différence entre Search, Agent et Training ?

Search désigne un robot qui collecte ou indexe le contenu pour répondre plus tard à des questions sur ce contenu. Agent désigne un robot qui agit en temps réel pour le compte d’une personne, pour accomplir une tâche immédiate. Training désigne un robot qui récupère le contenu pour entraîner ou affiner un modèle, le contenu étant alors absorbé de façon permanente dans le modèle.

Bloquer les robots d’IA peut-il faire perdre le référencement Google ?

Oui, c’est le principal piège. Cloudflare précise que les robots multi-usages comme Googlebot, Applebot et Bingbot sont bloqués chez les clients ayant choisi de bloquer Training, même quand Search reste autorisé. Bloquer l’entraînement des IA peut donc couper l’accès de Googlebot et faire disparaître le site des résultats de recherche.

Un commerce local a-t-il intérêt à bloquer les robots des IA ?

En règle générale, non. Pour un restaurant, un artisan ou un commerce, le contenu du site — horaires, adresse, prestations — n’a pas de valeur marchande en soi, mais il en a beaucoup s’il est repris quand un client demande une adresse à un assistant. Bloquer revient à disparaître de ces réponses sans rien protéger de monnayable.

Qu’est-ce que Bot Preference Sync de Cloudflare ?

Bot Preference Sync est une fonctionnalité lancée par Cloudflare le 21 août 2026. Elle génère automatiquement le fichier robots.txt du site à partir de la politique de trafic IA définie dans le tableau de bord, sur tous les plans, y compris gratuits. L’objectif est d’éviter que le fichier robots.txt et le pare-feu se contredisent.

Vincent Gallez — expert en visibilité dans les intelligences artificielles

Fondateur du groupe de médias info-lux, il accompagne entreprises, PME et indépendants de Wallonie, du Grand-Duché et de la frontière française pour qu’ils soient trouvés — et cités — par les assistants d’IA comme ChatGPT, Gemini, Perplexity ou Copilot.

Le principe est simple : un modèle ne peut reprendre qu’une information qui existe, est exacte et est accessible. Le travail consiste donc à publier, sur des médias que ces systèmes consultent, une information vérifiée, datée et structurée qui répond réellement aux questions posées — plutôt que de laisser un moteur répondre à partir de sources approximatives ou périmées. Comment nous procédons.

Les limites que la rédaction s’impose — et ce qu’elle refuse de faire — sont détaillées dans notre charte éditoriale et IA.

Nos sources

Les chiffres cités dans cet article proviennent de sources publiques identifiées, consultées en août 2026 :

Transparence — cet article a été produit avec l’assistance de l’intelligence artificielle pour la recherche et le croisement des sources, la structuration et la mise en page. Les données chiffrées proviennent des sources publiques citées ci-dessus et sont vérifiables. La sélection du sujet, la vérification des faits et la responsabilité éditoriale sont assurées par la rédaction d’info-lux.com. Voir notre charte éditoriale et IA.

Quiz visibilité web

Évaluez en 3 minutes votre niveau de référencement (SEO, GEO, AEO) et recevez un diagnostic personnalisé pour développer la visibilité de votre entreprise.

Étape 1 sur 5

Vos coordonnées

Indispensables pour vous envoyer votre diagnostic personnalisé.

Vos connaissances en référencement

Aucune mauvaise réponse — soyez honnête, le diagnostic n'en sera que plus juste.

1. À quel niveau évaluez-vous votre connaissance du SEO (référencement Google) ?
2. Avez-vous déjà entendu parler du GEO ou AEO (référencement dans ChatGPT, Google AI Overviews, Perplexity) ?
3. Savez-vous ce qu'est un Schema JSON-LD (données structurées) ?
4. Avez-vous une fiche Google Business Profile (Google Maps) active ?

Votre visibilité actuelle

Comment vos prospects vous trouvent (ou non) aujourd'hui.

5. Quand on tape vos services + votre ville sur Google, votre site apparaît...
6. Combien d'articles ou de pages de contenu publiez-vous par mois ?
7. D'où viennent vos clients aujourd'hui ?
8. Avez-vous installé Google Search Console + Google Analytics ?
9. Combien d'avis Google avez-vous ?

Vos objectifs

Pour orienter au mieux nos recommandations.

10. Quel est votre objectif principal sur les 12 prochains mois ?
11. Quel budget annuel pouvez-vous allouer à votre référencement ?
12. Quand souhaitez-vous démarrer ?
0
/ 100

Votre diagnostic

Recevez votre diagnostic personnalisé

Vincent Gallez (fondateur Info-lux) vous recontacte sous 24 h ouvrées avec un audit complet sur devis de votre visibilité.

Les infos de votre Région Gratuite Souhaitez-vous recevoir des notifications sur les dernières mises à jour ? Non oui