Strumento gratuito · Senza account
Controllo robots.txt per i crawler IA
Incolla il tuo indirizzo web e vedi, crawler per crawler, quali assistenti IA il tuo robots.txt lascia leggere il tuo sito — ChatGPT, Claude, Perplexity, Gemini, Apple Intelligence e altri — e quali tiene fuori. Gratis, immediato, senza account.
Come funziona
Come funziona il controllo dei crawler IA
01
Legge il tuo robots.txt come un crawler
Quaryan richiede il tuo robots.txt come fa un crawler: seguendo i reindirizzamenti, trattando un file mancante come permesso di leggere tutto e un errore del server come «vietato l'accesso».
02
Applica a ogni crawler le sue regole
Per ciascuno dei diciotto crawler trova il gruppo che lo nomina — o, se nessuno lo fa, quello per tutti i crawler (*) — e applica la regola più specifica alla tua home page, esattamente come prescrive lo standard del robots.txt, RFC 9309.
03
Ti mostra la riga che decide
Consentito, consentito con eccezioni o bloccato, con la riga del tuo robots.txt che lo decide: così sai esattamente cosa cambiare, e se era quello che volevi.
I crawler
I crawler IA che controlliamo e cosa fa ciascuno
Tre tipi di crawler leggono il tuo sito per l'IA, e conviene trattarli in modo diverso. I crawler di ricerca indicizzano le pagine per le risposte che gli assistenti danno oggi, e rimandano al sito. I lettori su richiesta leggono una pagina quando qualcuno la chiede all'assistente. I crawler di addestramento raccolgono pagine per addestrare i modelli futuri. Bloccare i primi due ti tiene fuori dalle risposte; bloccare il terzo tiene le tue pagine fuori dall'addestramento. In più, due motori di ricerca — Google e Bing — alimentano le risposte IA con il proprio indice.
| User-agent | Azienda | Cosa fa |
|---|---|---|
| Ricerca e risposte IA | ||
OAI-SearchBot |
OpenAI | Indicizza le pagine perché la ricerca di ChatGPT possa mostrarle e linkarle. Non usato per l'addestramento. |
Claude-SearchBot |
Anthropic | Indicizza le pagine per migliorare i risultati di ricerca nelle risposte di Claude. |
PerplexityBot |
Perplexity | Indicizza le pagine per le risposte di Perplexity, che citano e linkano le fonti. |
DuckAssistBot |
DuckDuckGo | Legge le pagine per scrivere le risposte assistite dall'IA di DuckDuckGo. |
| Lettura su richiesta di una persona | ||
ChatGPT-User |
OpenAI | Legge una pagina quando qualcuno ne chiede a ChatGPT o condivide un link. |
Claude-User |
Anthropic | Legge una pagina quando qualcuno ne chiede a Claude. |
Perplexity-User |
Perplexity | Legge una pagina quando qualcuno ne chiede a Perplexity. |
MistralAI-User |
Mistral AI | Legge una pagina quando qualcuno ne chiede a Le Chat di Mistral. |
| Addestramento IA | ||
GPTBot |
OpenAI | Raccoglie pagine per addestrare i modelli di OpenAI. |
ClaudeBot |
Anthropic | Raccoglie pagine per addestrare i modelli Claude di Anthropic. |
Google-Extended |
Non è un crawler ma un token: decide se le pagine che Google scansiona possono essere usate per i modelli Gemini. Non influisce sulla Ricerca Google. | |
Applebot-Extended |
Apple | Un token: decide se le pagine scansionate da Applebot possono addestrare i modelli IA di Apple. Non influisce su Siri e Spotlight. |
Meta-ExternalAgent |
Meta | Raccoglie pagine per l'IA di Meta, anche per addestrarne i modelli. |
Amazonbot |
Amazon | Il crawler di Amazon, usato per migliorare i suoi servizi, anche addestrando modelli IA. |
CCBot |
Common Crawl | Il crawler di Common Crawl. Il suo archivio web gratuito è una fonte comune di dati per addestrare l'IA. |
Bytespider |
ByteDance | Il crawler di ByteDance, usato per addestrare i suoi modelli IA. |
| Motori di ricerca dietro le risposte IA | ||
Googlebot |
La Ricerca Google, comprese le AI Overview e la Modalità IA. | |
Bingbot |
Microsoft | La ricerca di Bing, da cui attingono le risposte di Microsoft Copilot. |
Consentire o bloccare
Come consentire o bloccare i crawler IA nel robots.txt
Il robots.txt è un semplice file di testo nella radice del tuo sito. Ogni gruppo inizia con i crawler a cui si applica (User-agent) ed elenca cosa non possono leggere (Disallow) o sì (Allow). Tre configurazioni comuni:
Lasciare entrare tutti i crawler
L'impostazione predefinita, e come non avere alcun robots.txt.
User-agent: *
Allow: /
Fuori dall'addestramento IA, dentro le risposte
Tiene fuori i crawler che raccolgono pagine per l'addestramento e lascia entrare quelli che ti portano nelle risposte e ti mandano visitatori.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
User-agent: Bytespider
Disallow: /
User-agent: *
Allow: /
Tenere fuori un solo crawler
Un gruppo lo nomina; tutto il resto resta com'è.
User-agent: GPTBot
Disallow: /
Gratis · Senza account · Pochi secondi
FAQ
Domande sui crawler IA e sul robots.txt
Come controllo se il mio robots.txt blocca i crawler IA?
Che differenza c'è tra GPTBot, OAI-SearchBot e ChatGPT-User?
Dovrei bloccare i crawler IA?
Bloccare Google-Extended toglie il mio sito dalla Ricerca Google o dalle AI Overview?
Il robots.txt impedisce alle aziende di IA di usare i miei contenuti?
Cosa succede se il mio robots.txt restituisce un errore?
Cos'è llms.txt?
Il controllo dei crawler IA è gratuito?
E poi
I crawler possono leggerti. ChatGPT fa il tuo nome?
Essere leggibili è il primo passo. Il controllo gratuito di visibilità su ChatGPT fa a ChatGPT le domande dei tuoi clienti e mostra se ti nomina, e chi nomina al posto tuo.