Quaryan
Inizia gratis Dashboard

Lingua

Strumento gratuito · Senza account

Controllo robots.txt per i crawler IA

Incolla il tuo indirizzo web e vedi, crawler per crawler, quali assistenti IA il tuo robots.txt lascia leggere il tuo sito — ChatGPT, Claude, Perplexity, Gemini, Apple Intelligence e altri — e quali tiene fuori. Gratis, immediato, senza account.

Gratis · Senza account · Pochi secondi

Come funziona

Come funziona il controllo dei crawler IA

01

Legge il tuo robots.txt come un crawler

Quaryan richiede il tuo robots.txt come fa un crawler: seguendo i reindirizzamenti, trattando un file mancante come permesso di leggere tutto e un errore del server come «vietato l'accesso».

02

Applica a ogni crawler le sue regole

Per ciascuno dei diciotto crawler trova il gruppo che lo nomina — o, se nessuno lo fa, quello per tutti i crawler (*) — e applica la regola più specifica alla tua home page, esattamente come prescrive lo standard del robots.txt, RFC 9309.

03

Ti mostra la riga che decide

Consentito, consentito con eccezioni o bloccato, con la riga del tuo robots.txt che lo decide: così sai esattamente cosa cambiare, e se era quello che volevi.

I crawler

I crawler IA che controlliamo e cosa fa ciascuno

Tre tipi di crawler leggono il tuo sito per l'IA, e conviene trattarli in modo diverso. I crawler di ricerca indicizzano le pagine per le risposte che gli assistenti danno oggi, e rimandano al sito. I lettori su richiesta leggono una pagina quando qualcuno la chiede all'assistente. I crawler di addestramento raccolgono pagine per addestrare i modelli futuri. Bloccare i primi due ti tiene fuori dalle risposte; bloccare il terzo tiene le tue pagine fuori dall'addestramento. In più, due motori di ricerca — Google e Bing — alimentano le risposte IA con il proprio indice.

User-agentAziendaCosa fa
Ricerca e risposte IA
OAI-SearchBot OpenAI Indicizza le pagine perché la ricerca di ChatGPT possa mostrarle e linkarle. Non usato per l'addestramento.
Claude-SearchBot Anthropic Indicizza le pagine per migliorare i risultati di ricerca nelle risposte di Claude.
PerplexityBot Perplexity Indicizza le pagine per le risposte di Perplexity, che citano e linkano le fonti.
DuckAssistBot DuckDuckGo Legge le pagine per scrivere le risposte assistite dall'IA di DuckDuckGo.
Lettura su richiesta di una persona
ChatGPT-User OpenAI Legge una pagina quando qualcuno ne chiede a ChatGPT o condivide un link.
Claude-User Anthropic Legge una pagina quando qualcuno ne chiede a Claude.
Perplexity-User Perplexity Legge una pagina quando qualcuno ne chiede a Perplexity.
MistralAI-User Mistral AI Legge una pagina quando qualcuno ne chiede a Le Chat di Mistral.
Addestramento IA
GPTBot OpenAI Raccoglie pagine per addestrare i modelli di OpenAI.
ClaudeBot Anthropic Raccoglie pagine per addestrare i modelli Claude di Anthropic.
Google-Extended Google Non è un crawler ma un token: decide se le pagine che Google scansiona possono essere usate per i modelli Gemini. Non influisce sulla Ricerca Google.
Applebot-Extended Apple Un token: decide se le pagine scansionate da Applebot possono addestrare i modelli IA di Apple. Non influisce su Siri e Spotlight.
Meta-ExternalAgent Meta Raccoglie pagine per l'IA di Meta, anche per addestrarne i modelli.
Amazonbot Amazon Il crawler di Amazon, usato per migliorare i suoi servizi, anche addestrando modelli IA.
CCBot Common Crawl Il crawler di Common Crawl. Il suo archivio web gratuito è una fonte comune di dati per addestrare l'IA.
Bytespider ByteDance Il crawler di ByteDance, usato per addestrare i suoi modelli IA.
Motori di ricerca dietro le risposte IA
Googlebot Google La Ricerca Google, comprese le AI Overview e la Modalità IA.
Bingbot Microsoft La ricerca di Bing, da cui attingono le risposte di Microsoft Copilot.

Consentire o bloccare

Come consentire o bloccare i crawler IA nel robots.txt

Il robots.txt è un semplice file di testo nella radice del tuo sito. Ogni gruppo inizia con i crawler a cui si applica (User-agent) ed elenca cosa non possono leggere (Disallow) o sì (Allow). Tre configurazioni comuni:

Lasciare entrare tutti i crawler

L'impostazione predefinita, e come non avere alcun robots.txt.

User-agent: *
Allow: /

Fuori dall'addestramento IA, dentro le risposte

Tiene fuori i crawler che raccolgono pagine per l'addestramento e lascia entrare quelli che ti portano nelle risposte e ti mandano visitatori.

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

Tenere fuori un solo crawler

Un gruppo lo nomina; tutto il resto resta com'è.

User-agent: GPTBot
Disallow: /
Controlla robots.txt

Gratis · Senza account · Pochi secondi

FAQ

Domande sui crawler IA e sul robots.txt

Come controllo se il mio robots.txt blocca i crawler IA?

Incolla il tuo indirizzo web nel controllo in cima a questa pagina. Legge il tuo robots.txt come fa un crawler e mostra, per GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended e altri tredici, se ciascuno può leggere il tuo sito e quale riga lo decide.

Che differenza c'è tra GPTBot, OAI-SearchBot e ChatGPT-User?

Sono tre crawler di OpenAI con tre compiti. GPTBot raccoglie pagine per addestrare i modelli di OpenAI. OAI-SearchBot indicizza le pagine perché la ricerca di ChatGPT possa mostrarle e linkarle. ChatGPT-User legge una pagina quando qualcuno ne chiede a ChatGPT. Bloccare GPTBot tiene le tue pagine fuori dall'addestramento senza toglierti dalle risposte di ChatGPT; bloccare OAI-SearchBot fa il contrario.

Dovrei bloccare i crawler IA?

Blocca quelli che hai motivo di bloccare, e nessun altro. Tenere fuori i crawler di addestramento come GPTBot, ClaudeBot o Google-Extended tiene le tue pagine fuori dai modelli futuri. Tenere fuori quelli di ricerca come OAI-SearchBot, Claude-SearchBot o PerplexityBot ti tiene fuori dalle risposte che le persone leggono oggi, e per la maggior parte delle attività questo costa clienti.

Bloccare Google-Extended toglie il mio sito dalla Ricerca Google o dalle AI Overview?

No. Google-Extended non è un crawler ma un token del robots.txt: decide se le pagine che Google ha scansionato possono essere usate per i modelli Gemini. La Ricerca Google, AI Overview comprese, segue le regole di Googlebot, quindi bloccare Google-Extended non cambia né il tuo posizionamento né la tua presenza lì.

Il robots.txt impedisce alle aziende di IA di usare i miei contenuti?

Il robots.txt è una richiesta, non una serratura. Le grandi aziende di IA dicono che i loro crawler lo rispettano, ma vale solo per ciò che viene scansionato da ora in poi — le pagine già raccolte restano raccolte — e i lettori che agiscono su richiesta di una persona potrebbero non seguire le stesse regole. Per tenere privata una pagina, mettila dietro un login.

Cosa succede se il mio robots.txt restituisce un errore?

Se il robots.txt risponde con un errore del server (uno stato 5xx), i crawler devono trattare l'intero sito come vietato finché non torna a rispondere. Se manca (un 404), possono leggere tutto. Il controllo ti dice in quale dei due casi si trova il tuo sito.

Cos'è llms.txt?

llms.txt è un file proposto nella radice di un sito che offre agli assistenti IA un breve riassunto del sito in testo semplice e i link alle sue pagine più utili. Non è uno standard e nessun assistente è tenuto a leggerlo; il controllo mostra se il tuo sito ne ha uno. Genera un file llms.txt per il tuo sito

Il controllo dei crawler IA è gratuito?

Sì. È gratuito, non richiede un account e richiede pochi secondi. Ogni visitatore può fare trenta controlli all'ora, e un risultato viene conservato per dieci minuti, così lo stesso sito non viene interrogato due volte di fila.

E poi

I crawler possono leggerti. ChatGPT fa il tuo nome?

Essere leggibili è il primo passo. Il controllo gratuito di visibilità su ChatGPT fa a ChatGPT le domande dei tuoi clienti e mostra se ti nomina, e chi nomina al posto tuo.

Gratis · senza carta

Inizia gratis