Quaryan
Commencer gratuitement Tableau de bord

Langue

Outil gratuit · Sans compte

Vérificateur robots.txt des robots d'IA

Collez votre adresse web et voyez, robot par robot, quels assistants d'IA votre robots.txt laisse lire votre site — ChatGPT, Claude, Perplexity, Gemini, Apple Intelligence et d'autres — et lesquels il tient à l'écart. Gratuit, immédiat, sans compte.

Gratuit · Sans compte · Quelques secondes

Comment ça marche

Comment fonctionne le vérificateur de robots d'IA

01

Il lit votre robots.txt comme un robot

Quaryan demande votre robots.txt comme le fait un robot : en suivant les redirections, en traitant un fichier absent comme une permission de tout lire et une erreur serveur comme « accès interdit ».

02

Il applique à chaque robot ses règles

Pour chacun des dix-huit robots, il cherche le groupe qui le nomme — ou, si aucun ne le fait, celui de tous les robots (*) — et applique la règle la plus précise à votre page d'accueil, exactement comme le prescrit la norme robots.txt, RFC 9309.

03

Il vous montre la ligne qui décide

Autorisé, autorisé avec exceptions ou bloqué — avec la ligne de votre robots.txt qui en décide, pour que vous sachiez exactement quoi changer, et si c'était voulu.

Les robots

Les robots d'IA que nous vérifions, et ce que fait chacun

Trois sortes de robots lisent votre site pour l'IA, et ils méritent d'être traités différemment. Les robots de recherche indexent les pages pour les réponses que donnent les assistants aujourd'hui, et renvoient vers le site. Les lecteurs à la demande lisent une page quand quelqu'un interroge l'assistant à son sujet. Les robots d'entraînement collectent des pages pour entraîner les futurs modèles. Bloquer les deux premiers vous exclut des réponses ; bloquer le troisième garde vos pages hors de l'entraînement. S'y ajoutent deux moteurs de recherche — Google et Bing — dont l'index alimente des réponses IA.

User-agentEntrepriseCe qu'il fait
Recherche et réponses IA
OAI-SearchBot OpenAI Indexe les pages pour que la recherche de ChatGPT puisse les afficher et les citer en lien. Pas utilisé pour l'entraînement.
Claude-SearchBot Anthropic Indexe les pages pour améliorer les résultats de recherche dans les réponses de Claude.
PerplexityBot Perplexity Indexe les pages pour les réponses de Perplexity, qui citent leurs sources en lien.
DuckAssistBot DuckDuckGo Lit des pages pour rédiger les réponses assistées par IA de DuckDuckGo.
Lecture à la demande d'une personne
ChatGPT-User OpenAI Lit une page quand quelqu'un interroge ChatGPT à son sujet ou partage un lien.
Claude-User Anthropic Lit une page quand quelqu'un interroge Claude à son sujet.
Perplexity-User Perplexity Lit une page quand quelqu'un interroge Perplexity à son sujet.
MistralAI-User Mistral AI Lit une page quand quelqu'un l'évoque dans Le Chat de Mistral.
Entraînement de l'IA
GPTBot OpenAI Collecte des pages pour entraîner les modèles d'OpenAI.
ClaudeBot Anthropic Collecte des pages pour entraîner les modèles Claude d'Anthropic.
Google-Extended Google Pas un robot mais un jeton : décide si les pages explorées par Google peuvent servir à ses modèles Gemini. Sans effet sur la recherche Google.
Applebot-Extended Apple Un jeton : décide si les pages explorées par Applebot peuvent entraîner les modèles d'IA d'Apple. Sans effet sur Siri et Spotlight.
Meta-ExternalAgent Meta Collecte des pages pour l'IA de Meta, y compris pour entraîner ses modèles.
Amazonbot Amazon Le robot d'Amazon, utilisé pour améliorer ses services, y compris pour entraîner des modèles d'IA.
CCBot Common Crawl Le robot de Common Crawl. Son archive web gratuite est une source courante de données d'entraînement pour l'IA.
Bytespider ByteDance Le robot de ByteDance, utilisé pour entraîner ses modèles d'IA.
Moteurs de recherche derrière les réponses IA
Googlebot Google La recherche Google, y compris les aperçus IA et le mode IA.
Bingbot Microsoft La recherche Bing, dont s'inspirent les réponses de Microsoft Copilot.

Autoriser ou bloquer

Comment autoriser ou bloquer les robots d'IA dans le robots.txt

Le robots.txt est un simple fichier texte à la racine de votre site. Chaque groupe commence par les robots qu'il concerne (User-agent) et liste ce qu'ils ne peuvent pas lire (Disallow) ou peuvent lire (Allow). Trois configurations courantes :

Laisser entrer tous les robots

Le réglage par défaut, et l'équivalent de ne pas avoir de robots.txt du tout.

User-agent: *
Allow: /

Hors de l'entraînement IA, présent dans les réponses

Tient à l'écart les robots qui collectent des pages pour l'entraînement, et laisse entrer ceux qui vous font figurer dans les réponses et vous envoient des visiteurs.

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

Tenir un seul robot à l'écart

Un groupe le nomme ; tout le reste est inchangé.

User-agent: GPTBot
Disallow: /
Vérifier le robots.txt

Gratuit · Sans compte · Quelques secondes

FAQ

Questions sur les robots d'IA et le robots.txt

Comment vérifier si mon robots.txt bloque les robots d'IA ?

Collez votre adresse web dans le vérificateur en haut de cette page. Il lit votre robots.txt comme le fait un robot et indique, pour GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended et treize autres, si chacun peut lire votre site — et quelle ligne en décide.

Quelle est la différence entre GPTBot, OAI-SearchBot et ChatGPT-User ?

Ce sont trois robots d'OpenAI aux trois rôles différents. GPTBot collecte des pages pour entraîner les modèles d'OpenAI. OAI-SearchBot indexe les pages pour que la recherche de ChatGPT puisse les afficher et les citer en lien. ChatGPT-User lit une page quand quelqu'un interroge ChatGPT à son sujet. Bloquer GPTBot garde vos pages hors de l'entraînement sans vous exclure des réponses de ChatGPT ; bloquer OAI-SearchBot fait l'inverse.

Faut-il bloquer les robots d'IA ?

Bloquez ceux que vous avez une raison de bloquer, et pas davantage. Tenir à l'écart les robots d'entraînement comme GPTBot, ClaudeBot ou Google-Extended garde vos pages hors des futurs modèles. Tenir à l'écart les robots de recherche comme OAI-SearchBot, Claude-SearchBot ou PerplexityBot vous exclut des réponses que les gens lisent aujourd'hui — ce qui, pour la plupart des entreprises, coûte des clients.

Bloquer Google-Extended retire-t-il mon site de la recherche Google ou des aperçus IA ?

Non. Google-Extended n'est pas un robot mais un jeton du robots.txt : il décide si les pages que Google a explorées peuvent servir à ses modèles Gemini. La recherche Google, aperçus IA compris, suit les règles de Googlebot : bloquer Google-Extended ne change ni votre classement ni votre présence.

Le robots.txt empêche-t-il les entreprises d'IA d'utiliser mon contenu ?

Le robots.txt est une demande, pas un verrou. Les grandes entreprises d'IA disent que leurs robots le respectent, mais il ne vaut que pour ce qui est exploré à partir de maintenant — les pages déjà collectées le restent — et les lecteurs qui agissent à la demande d'une personne peuvent ne pas suivre les mêmes règles. Pour garder une page privée, placez-la derrière une connexion.

Que se passe-t-il si mon robots.txt renvoie une erreur ?

Si le robots.txt répond par une erreur serveur (un statut 5xx), les robots doivent considérer tout votre site comme interdit jusqu'à ce qu'il réponde à nouveau. S'il est absent (un 404), ils peuvent tout lire. Le vérificateur vous dit dans lequel des deux cas se trouve votre site.

Qu'est-ce que llms.txt ?

llms.txt est un fichier proposé à la racine d'un site, qui donne aux assistants d'IA un court résumé du site en texte brut et des liens vers ses pages les plus utiles. Ce n'est pas une norme, et aucun assistant n'est tenu de le lire ; le vérificateur indique si votre site en a un. Générez un fichier llms.txt pour votre site

Le vérificateur de robots d'IA est-il gratuit ?

Oui. Il est gratuit, sans compte, et prend quelques secondes. Chaque visiteur peut faire trente vérifications par heure, et un résultat est conservé dix minutes pour qu'un même site ne soit pas interrogé deux fois de suite.

Ensuite

Les robots peuvent vous lire. ChatGPT vous cite-t-il ?

Être lisible est la première étape. Le test gratuit de visibilité sur ChatGPT pose à ChatGPT les questions de vos clients et montre s'il vous cite — et qui il cite à votre place.

Gratuit · sans carte

Commencer gratuitement