Quaryan
Empezar gratis Panel

Idioma

Herramienta gratis · Sin cuenta

Comprobador de robots.txt para rastreadores de IA

Pega tu dirección web y mira, rastreador por rastreador, qué asistentes de IA deja leer tu web tu robots.txt —ChatGPT, Claude, Perplexity, Gemini, Apple Intelligence y más— y a cuáles les cierra la puerta. Gratis, al instante y sin cuenta.

Gratis · Sin cuenta · Unos segundos

Cómo funciona

Cómo funciona el comprobador de rastreadores de IA

01

Lee tu robots.txt como un rastreador

Quaryan pide tu robots.txt como lo hace un rastreador: siguiendo redirecciones, tratando un archivo que falta como permiso para leerlo todo y un error del servidor como «prohibido el paso».

02

Aplica a cada rastreador sus reglas

Para cada uno de los dieciocho rastreadores busca el grupo que lo nombra —o, si ninguno lo hace, el de todos los rastreadores (*)— y aplica la regla más específica a tu página de inicio, tal como establece el estándar de robots.txt, RFC 9309.

03

Te muestra la línea que decide

Permitido, permitido con excepciones o bloqueado, con la línea de tu robots.txt que lo decide, para que sepas exactamente qué cambiar y si era lo que querías.

Los rastreadores

Los rastreadores de IA que comprobamos y qué hace cada uno

Tres tipos de rastreadores leen tu web para la IA, y conviene tratarlos de forma distinta. Los de búsqueda indexan páginas para las respuestas que dan hoy los asistentes, y enlazan de vuelta. Los lectores bajo petición leen una página cuando alguien le pregunta por ella al asistente. Los de entrenamiento recopilan páginas para entrenar modelos futuros. Bloquear los dos primeros te deja fuera de las respuestas; bloquear el tercero mantiene tus páginas fuera del entrenamiento. Además, dos buscadores —Google y Bing— alimentan respuestas de IA con su propio índice.

User-agentEmpresaQué hace
Búsqueda y respuestas de IA
OAI-SearchBot OpenAI Indexa páginas para que la búsqueda de ChatGPT pueda mostrarlas y enlazarlas. No se usa para entrenar.
Claude-SearchBot Anthropic Indexa páginas para mejorar los resultados de búsqueda en las respuestas de Claude.
PerplexityBot Perplexity Indexa páginas para las respuestas de Perplexity, que citan y enlazan sus fuentes.
DuckAssistBot DuckDuckGo Lee páginas para escribir las respuestas asistidas por IA de DuckDuckGo.
Lectura cuando alguien pregunta por una página
ChatGPT-User OpenAI Lee una página cuando alguien pregunta por ella en ChatGPT o comparte un enlace.
Claude-User Anthropic Lee una página cuando alguien pregunta por ella en Claude.
Perplexity-User Perplexity Lee una página cuando alguien pregunta por ella en Perplexity.
MistralAI-User Mistral AI Lee una página cuando alguien pregunta por ella en Le Chat de Mistral.
Entrenamiento de IA
GPTBot OpenAI Recopila páginas para entrenar los modelos de OpenAI.
ClaudeBot Anthropic Recopila páginas para entrenar los modelos Claude de Anthropic.
Google-Extended Google No es un rastreador sino un token: decide si las páginas que rastrea Google pueden usarse para sus modelos Gemini. No afecta a la Búsqueda de Google.
Applebot-Extended Apple Un token: decide si las páginas que rastrea Applebot pueden entrenar los modelos de IA de Apple. No afecta a Siri ni a Spotlight.
Meta-ExternalAgent Meta Recopila páginas para la IA de Meta, incluido el entrenamiento de sus modelos.
Amazonbot Amazon El rastreador de Amazon, usado para mejorar sus servicios, incluido el entrenamiento de modelos de IA.
CCBot Common Crawl El rastreador de Common Crawl. Su archivo web gratuito es una fuente habitual de datos de entrenamiento de IA.
Bytespider ByteDance El rastreador de ByteDance, usado para entrenar sus modelos de IA.
Buscadores detrás de las respuestas de IA
Googlebot Google La Búsqueda de Google, incluidas las Vistas creadas con IA y el Modo IA.
Bingbot Microsoft La búsqueda de Bing, de la que beben las respuestas de Microsoft Copilot.

Permitir o bloquear

Cómo permitir o bloquear rastreadores de IA en robots.txt

El robots.txt es un archivo de texto sencillo en la raíz de tu web. Cada grupo empieza con los rastreadores a los que se aplica (User-agent) y enumera lo que no pueden leer (Disallow) o sí (Allow). Tres configuraciones habituales:

Dejar entrar a todos los rastreadores

La opción por defecto, y lo mismo que no tener robots.txt.

User-agent: *
Allow: /

Fuera del entrenamiento de IA, dentro de las respuestas

Cierra el paso a los rastreadores que recopilan páginas para entrenar y deja entrar a los que te ponen en las respuestas y te envían visitas.

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

Cerrar el paso a un solo rastreador

Un grupo lo nombra; todo lo demás sigue igual.

User-agent: GPTBot
Disallow: /
Comprobar robots.txt

Gratis · Sin cuenta · Unos segundos

FAQ

Preguntas sobre rastreadores de IA y robots.txt

¿Cómo compruebo si mi robots.txt bloquea a los rastreadores de IA?

Pega tu dirección web en el comprobador de arriba. Lee tu robots.txt como lo hace un rastreador y muestra, para GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended y trece más, si cada uno puede leer tu web y qué línea lo decide.

¿Qué diferencia hay entre GPTBot, OAI-SearchBot y ChatGPT-User?

Son tres rastreadores de OpenAI con tres funciones. GPTBot recopila páginas para entrenar los modelos de OpenAI. OAI-SearchBot indexa páginas para que la búsqueda de ChatGPT pueda mostrarlas y enlazarlas. ChatGPT-User lee una página cuando alguien pregunta por ella en ChatGPT. Bloquear GPTBot mantiene tus páginas fuera del entrenamiento sin sacarte de las respuestas de ChatGPT; bloquear OAI-SearchBot hace lo contrario.

¿Debería bloquear a los rastreadores de IA?

Bloquea los que tengas motivos para bloquear, y ninguno más. Cerrar el paso a los rastreadores de entrenamiento como GPTBot, ClaudeBot o Google-Extended mantiene tus páginas fuera de los modelos futuros. Cerrárselo a los de búsqueda como OAI-SearchBot, Claude-SearchBot o PerplexityBot te deja fuera de las respuestas que la gente lee hoy, y a la mayoría de los negocios eso les cuesta clientes.

¿Bloquear Google-Extended saca mi web de la Búsqueda de Google o de las Vistas creadas con IA?

No. Google-Extended no es un rastreador sino un token de robots.txt: decide si las páginas que Google ha rastreado pueden usarse para sus modelos Gemini. La Búsqueda de Google, incluidas las Vistas creadas con IA, sigue las reglas de Googlebot, así que bloquear Google-Extended no cambia tu posicionamiento ni si apareces allí.

¿El robots.txt impide que las empresas de IA usen mi contenido?

El robots.txt es una petición, no un candado. Las grandes empresas de IA dicen que sus rastreadores lo respetan, pero solo afecta a lo que se rastree a partir de ahora —lo ya recopilado sigue recopilado— y los lectores que actúan a petición de una persona pueden no seguir las mismas reglas. Para mantener una página en privado, ponla detrás de un inicio de sesión.

¿Qué pasa si mi robots.txt devuelve un error?

Si el robots.txt responde con un error del servidor (un estado 5xx), los rastreadores deben tratar toda tu web como prohibida hasta que vuelva a responder. Si no existe (un 404), pueden leerlo todo. El comprobador te dice en cuál de los dos casos está tu web.

¿Qué es llms.txt?

llms.txt es un archivo propuesto en la raíz de una web que da a los asistentes de IA un resumen breve en texto plano de la web y enlaces a sus páginas más útiles. No es un estándar y ningún asistente está obligado a leerlo; el comprobador muestra si tu web tiene uno. Genera un llms.txt para tu web

¿El comprobador de rastreadores de IA es gratis?

Sí. Es gratis, no necesita cuenta y tarda unos segundos. Cada visitante puede hacer treinta comprobaciones por hora, y un resultado se guarda diez minutos para no consultar la misma web dos veces seguidas.

Siguiente

Los rastreadores pueden leerte. ¿Te nombra ChatGPT?

Ser legible es el primer paso. El chequeo gratuito de visibilidad en ChatGPT le hace a ChatGPT las preguntas de tus clientes y muestra si te nombra, y a quién nombra en tu lugar.

Gratis · sin tarjeta

Empezar gratis