Aller au contenu
SEO Records
Choisir la langue : Français

Test gratuit · Assistants IA

Votre site est-il ouvert aux IA ?

ChatGPT, Claude, Perplexity, Copilot et Google ne citent que ce qu’ils peuvent lire. Un robots.txt trop large, un pare-feu réglé une fois puis oublié, une page qui n’existe qu’en JavaScript : la porte peut se fermer à l’insu de tous. Collez votre adresse, nous regardons.

Nous lisons votre robots.txt, votre page d’accueil comme un navigateur, puis la même page au nom de huit robots d’IA. Onze lectures en tout, oubliées aussitôt faites. Nous lisons les adresses publiques, et elles seules.

Ce que le test regarde, et ce qu’il prouve

Trois lectures, trois forces de preuve différentes. Le résultat dit toujours laquelle a parlé.

  1. 1. Votre robots.txt — certain

    Le fichier est public et sa lecture est normée (RFC 9309). Nous le lisons comme les robots le lisent : le groupe qui nomme le robot l’emporte sur le groupe général, la règle la plus longue gagne, et à égalité c’est l’autorisation qui l’emporte. Un robots.txt qui répond en erreur serveur ferme tout le site pour un robot respectueux : nous le signalons.

  2. 2. La réponse faite au robot — probable

    Nous demandons votre page d’accueil comme un navigateur, puis au nom de GPTBot, ClaudeBot, PerplexityBot et des autres. Si le navigateur reçoit la page et le robot un refus, un pare-feu trie les robots d’IA. Nous disons « probable » et non « certain » : le vrai robot arrive des adresses de son éditeur, et certains pare-feu le traitent autrement. Googlebot et Bingbot sont jugés sur robots.txt seul : les pare-feu bloquent les faux par principe, et vous méritez un verdict exact.

  3. 3. Ce que la page contient telle qu’elle est servie

    Les robots des assistants lisent la page telle qu’elle arrive. Ils n’exécutent pas le JavaScript. Une page montée dans le navigateur leur parvient presque vide : nous comptons les mots réellement servis. Nous relevons aussinoindexetnosnippet, qui retirent la page des moteurs sur lesquels les assistants s’appuient.

Les robots, un par un

Chaque éditeur envoie plusieurs robots, et chacun a son rôle. Les robots de recherche décident si vous pouvez être trouvé, donc cité. Les robots de lecture à la demande ouvrent votre page quand un utilisateur la donne à l’assistant. Les robots d’entraînement collectent pour entraîner les modèles : les fermer est un choix légitime, et vous garde dans toutes les réponses.

RobotPourRôleSi vous le fermez
OAI-SearchBotChatGPTRechercheVos pages ne remontent plus dans les réponses de ChatGPT avec recherche.
ChatGPT-UserChatGPTLecture à la demandeChatGPT ne peut plus ouvrir votre page quand un utilisateur la lui demande.
GPTBotOpenAIEntraînementVos pages ne servent plus à entraîner les modèles. La recherche reste entière.
Claude-SearchBotClaudeRechercheVos pages ne remontent plus dans les réponses de Claude avec recherche.
Claude-UserClaudeLecture à la demandeClaude ne peut plus ouvrir votre page à la demande d’un utilisateur.
ClaudeBotAnthropicEntraînementVos pages ne servent plus à entraîner les modèles. La recherche reste entière.
PerplexityBotPerplexityRechercheVos pages sortent de l’index de Perplexity.
Perplexity-UserPerplexityLecture à la demandePerplexity ne peut plus ouvrir votre page à la demande.
BingbotCopilotRechercheVous sortez de Bing — et de tout ce qui s’appuie sur son index, Copilot compris.
GooglebotGoogleRechercheVous sortez de Google, AI Overviews compris.
Google-ExtendedGoogleEntraînementGemini n’utilise plus vos pages pour s’entraîner. Google Search reste entier.
MistralAI-UserLe ChatLecture à la demandeLe Chat de Mistral ne peut plus ouvrir votre page à la demande.
CCBotCommon CrawlEntraînementVos pages sortent de l’archive ouverte dont se servent de nombreux modèles.

Fermer l’entraînement, rester dans les réponses

C’est la confusion la plus fréquente : on veut que ses textes n’entraînent pas les modèles, on ferme « les IA » en bloc, et l’on sort aussi de leurs réponses. Les deux se séparent. Ce robots.txt ferme l’entraînement chez OpenAI, Anthropic, Google et Common Crawl, et laisse la recherche ouverte partout :

# Fermer l'entraînement, garder la recherche ouverte
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

# Tous les autres robots, dont ceux de la recherche
User-agent: *
Allow: /

Plusieurs lignes User-agent à la suite forment un seul groupe ; un robot qui a son propre groupe ignore le groupe *. Passez votre site au test après chaque modification : une ligne de trop suffit à fermer la recherche.

Le pare-feu : la porte qui se ferme en silence

Un robots.txt se lit ; un pare-feu, non. Cloudflare, certaines extensions de sécurité et certains hébergeurs proposent de bloquer « les robots d’IA » d’un seul réglage. Ce réglage répond 403 aux robots et laisse robots.txt intact : le site paraît ouvert à qui lit le fichier, et fermé à qui frappe à la porte. C’est exactement ce que la deuxième lecture du test fait apparaître.

Chez Cloudflare, le réglage se trouve dans le tableau de bord du domaine, à la rubrique consacrée aux robots d’IA. Il permet de traiter chaque robot à part : fermer l’entraînement, garder la recherche. Cloudflare peut aussi gérer votre robots.txt à votre place et y écrire des signaux de contenu (Content-Signal: search=yes, ai-train=no) ; le test les lit et vous les montre.

Ouvert, puis cité : deux étapes

Une porte ouverte est la condition, pas le résultat. Les assistants citent les pages qu’ils trouvent dans leurs index de recherche, et ils y trouvent d’abord les pages déjà bien placées. Ce test dit si la voie est libre ; qui passe réellement chez vous se mesure ailleurs.

Cela se mesure au bord du réseau, là où les demandes arrivent : quel robot a lu quelle page, et quand, chaque lecture certifiée par les plages d’adresses que publient les éditeurs. C’est ce que fait GEO SEO Records. Le guide Être cité par les assistants IA détaille ce qui rend une page citable une fois la porte ouverte.

À lire ensuite