Outil gratuit · Sans compte
Vérificateur robots.txt des robots d'IA
Collez votre adresse web et voyez, robot par robot, quels assistants d'IA votre robots.txt laisse lire votre site — ChatGPT, Claude, Perplexity, Gemini, Apple Intelligence et d'autres — et lesquels il tient à l'écart. Gratuit, immédiat, sans compte.
Comment ça marche
Comment fonctionne le vérificateur de robots d'IA
01
Il lit votre robots.txt comme un robot
Quaryan demande votre robots.txt comme le fait un robot : en suivant les redirections, en traitant un fichier absent comme une permission de tout lire et une erreur serveur comme « accès interdit ».
02
Il applique à chaque robot ses règles
Pour chacun des dix-huit robots, il cherche le groupe qui le nomme — ou, si aucun ne le fait, celui de tous les robots (*) — et applique la règle la plus précise à votre page d'accueil, exactement comme le prescrit la norme robots.txt, RFC 9309.
03
Il vous montre la ligne qui décide
Autorisé, autorisé avec exceptions ou bloqué — avec la ligne de votre robots.txt qui en décide, pour que vous sachiez exactement quoi changer, et si c'était voulu.
Les robots
Les robots d'IA que nous vérifions, et ce que fait chacun
Trois sortes de robots lisent votre site pour l'IA, et ils méritent d'être traités différemment. Les robots de recherche indexent les pages pour les réponses que donnent les assistants aujourd'hui, et renvoient vers le site. Les lecteurs à la demande lisent une page quand quelqu'un interroge l'assistant à son sujet. Les robots d'entraînement collectent des pages pour entraîner les futurs modèles. Bloquer les deux premiers vous exclut des réponses ; bloquer le troisième garde vos pages hors de l'entraînement. S'y ajoutent deux moteurs de recherche — Google et Bing — dont l'index alimente des réponses IA.
| User-agent | Entreprise | Ce qu'il fait |
|---|---|---|
| Recherche et réponses IA | ||
OAI-SearchBot |
OpenAI | Indexe les pages pour que la recherche de ChatGPT puisse les afficher et les citer en lien. Pas utilisé pour l'entraînement. |
Claude-SearchBot |
Anthropic | Indexe les pages pour améliorer les résultats de recherche dans les réponses de Claude. |
PerplexityBot |
Perplexity | Indexe les pages pour les réponses de Perplexity, qui citent leurs sources en lien. |
DuckAssistBot |
DuckDuckGo | Lit des pages pour rédiger les réponses assistées par IA de DuckDuckGo. |
| Lecture à la demande d'une personne | ||
ChatGPT-User |
OpenAI | Lit une page quand quelqu'un interroge ChatGPT à son sujet ou partage un lien. |
Claude-User |
Anthropic | Lit une page quand quelqu'un interroge Claude à son sujet. |
Perplexity-User |
Perplexity | Lit une page quand quelqu'un interroge Perplexity à son sujet. |
MistralAI-User |
Mistral AI | Lit une page quand quelqu'un l'évoque dans Le Chat de Mistral. |
| Entraînement de l'IA | ||
GPTBot |
OpenAI | Collecte des pages pour entraîner les modèles d'OpenAI. |
ClaudeBot |
Anthropic | Collecte des pages pour entraîner les modèles Claude d'Anthropic. |
Google-Extended |
Pas un robot mais un jeton : décide si les pages explorées par Google peuvent servir à ses modèles Gemini. Sans effet sur la recherche Google. | |
Applebot-Extended |
Apple | Un jeton : décide si les pages explorées par Applebot peuvent entraîner les modèles d'IA d'Apple. Sans effet sur Siri et Spotlight. |
Meta-ExternalAgent |
Meta | Collecte des pages pour l'IA de Meta, y compris pour entraîner ses modèles. |
Amazonbot |
Amazon | Le robot d'Amazon, utilisé pour améliorer ses services, y compris pour entraîner des modèles d'IA. |
CCBot |
Common Crawl | Le robot de Common Crawl. Son archive web gratuite est une source courante de données d'entraînement pour l'IA. |
Bytespider |
ByteDance | Le robot de ByteDance, utilisé pour entraîner ses modèles d'IA. |
| Moteurs de recherche derrière les réponses IA | ||
Googlebot |
La recherche Google, y compris les aperçus IA et le mode IA. | |
Bingbot |
Microsoft | La recherche Bing, dont s'inspirent les réponses de Microsoft Copilot. |
Autoriser ou bloquer
Comment autoriser ou bloquer les robots d'IA dans le robots.txt
Le robots.txt est un simple fichier texte à la racine de votre site. Chaque groupe commence par les robots qu'il concerne (User-agent) et liste ce qu'ils ne peuvent pas lire (Disallow) ou peuvent lire (Allow). Trois configurations courantes :
Laisser entrer tous les robots
Le réglage par défaut, et l'équivalent de ne pas avoir de robots.txt du tout.
User-agent: *
Allow: /
Hors de l'entraînement IA, présent dans les réponses
Tient à l'écart les robots qui collectent des pages pour l'entraînement, et laisse entrer ceux qui vous font figurer dans les réponses et vous envoient des visiteurs.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
User-agent: Bytespider
Disallow: /
User-agent: *
Allow: /
Tenir un seul robot à l'écart
Un groupe le nomme ; tout le reste est inchangé.
User-agent: GPTBot
Disallow: /
Gratuit · Sans compte · Quelques secondes
FAQ
Questions sur les robots d'IA et le robots.txt
Comment vérifier si mon robots.txt bloque les robots d'IA ?
Quelle est la différence entre GPTBot, OAI-SearchBot et ChatGPT-User ?
Faut-il bloquer les robots d'IA ?
Bloquer Google-Extended retire-t-il mon site de la recherche Google ou des aperçus IA ?
Le robots.txt empêche-t-il les entreprises d'IA d'utiliser mon contenu ?
Que se passe-t-il si mon robots.txt renvoie une erreur ?
Qu'est-ce que llms.txt ?
Le vérificateur de robots d'IA est-il gratuit ?
Ensuite
Les robots peuvent vous lire. ChatGPT vous cite-t-il ?
Être lisible est la première étape. Le test gratuit de visibilité sur ChatGPT pose à ChatGPT les questions de vos clients et montre s'il vous cite — et qui il cite à votre place.