Herramienta gratis · Sin cuenta
Comprobador de robots.txt para rastreadores de IA
Pega tu dirección web y mira, rastreador por rastreador, qué asistentes de IA deja leer tu web tu robots.txt —ChatGPT, Claude, Perplexity, Gemini, Apple Intelligence y más— y a cuáles les cierra la puerta. Gratis, al instante y sin cuenta.
Cómo funciona
Cómo funciona el comprobador de rastreadores de IA
01
Lee tu robots.txt como un rastreador
Quaryan pide tu robots.txt como lo hace un rastreador: siguiendo redirecciones, tratando un archivo que falta como permiso para leerlo todo y un error del servidor como «prohibido el paso».
02
Aplica a cada rastreador sus reglas
Para cada uno de los dieciocho rastreadores busca el grupo que lo nombra —o, si ninguno lo hace, el de todos los rastreadores (*)— y aplica la regla más específica a tu página de inicio, tal como establece el estándar de robots.txt, RFC 9309.
03
Te muestra la línea que decide
Permitido, permitido con excepciones o bloqueado, con la línea de tu robots.txt que lo decide, para que sepas exactamente qué cambiar y si era lo que querías.
Los rastreadores
Los rastreadores de IA que comprobamos y qué hace cada uno
Tres tipos de rastreadores leen tu web para la IA, y conviene tratarlos de forma distinta. Los de búsqueda indexan páginas para las respuestas que dan hoy los asistentes, y enlazan de vuelta. Los lectores bajo petición leen una página cuando alguien le pregunta por ella al asistente. Los de entrenamiento recopilan páginas para entrenar modelos futuros. Bloquear los dos primeros te deja fuera de las respuestas; bloquear el tercero mantiene tus páginas fuera del entrenamiento. Además, dos buscadores —Google y Bing— alimentan respuestas de IA con su propio índice.
| User-agent | Empresa | Qué hace |
|---|---|---|
| Búsqueda y respuestas de IA | ||
OAI-SearchBot |
OpenAI | Indexa páginas para que la búsqueda de ChatGPT pueda mostrarlas y enlazarlas. No se usa para entrenar. |
Claude-SearchBot |
Anthropic | Indexa páginas para mejorar los resultados de búsqueda en las respuestas de Claude. |
PerplexityBot |
Perplexity | Indexa páginas para las respuestas de Perplexity, que citan y enlazan sus fuentes. |
DuckAssistBot |
DuckDuckGo | Lee páginas para escribir las respuestas asistidas por IA de DuckDuckGo. |
| Lectura cuando alguien pregunta por una página | ||
ChatGPT-User |
OpenAI | Lee una página cuando alguien pregunta por ella en ChatGPT o comparte un enlace. |
Claude-User |
Anthropic | Lee una página cuando alguien pregunta por ella en Claude. |
Perplexity-User |
Perplexity | Lee una página cuando alguien pregunta por ella en Perplexity. |
MistralAI-User |
Mistral AI | Lee una página cuando alguien pregunta por ella en Le Chat de Mistral. |
| Entrenamiento de IA | ||
GPTBot |
OpenAI | Recopila páginas para entrenar los modelos de OpenAI. |
ClaudeBot |
Anthropic | Recopila páginas para entrenar los modelos Claude de Anthropic. |
Google-Extended |
No es un rastreador sino un token: decide si las páginas que rastrea Google pueden usarse para sus modelos Gemini. No afecta a la Búsqueda de Google. | |
Applebot-Extended |
Apple | Un token: decide si las páginas que rastrea Applebot pueden entrenar los modelos de IA de Apple. No afecta a Siri ni a Spotlight. |
Meta-ExternalAgent |
Meta | Recopila páginas para la IA de Meta, incluido el entrenamiento de sus modelos. |
Amazonbot |
Amazon | El rastreador de Amazon, usado para mejorar sus servicios, incluido el entrenamiento de modelos de IA. |
CCBot |
Common Crawl | El rastreador de Common Crawl. Su archivo web gratuito es una fuente habitual de datos de entrenamiento de IA. |
Bytespider |
ByteDance | El rastreador de ByteDance, usado para entrenar sus modelos de IA. |
| Buscadores detrás de las respuestas de IA | ||
Googlebot |
La Búsqueda de Google, incluidas las Vistas creadas con IA y el Modo IA. | |
Bingbot |
Microsoft | La búsqueda de Bing, de la que beben las respuestas de Microsoft Copilot. |
Permitir o bloquear
Cómo permitir o bloquear rastreadores de IA en robots.txt
El robots.txt es un archivo de texto sencillo en la raíz de tu web. Cada grupo empieza con los rastreadores a los que se aplica (User-agent) y enumera lo que no pueden leer (Disallow) o sí (Allow). Tres configuraciones habituales:
Dejar entrar a todos los rastreadores
La opción por defecto, y lo mismo que no tener robots.txt.
User-agent: *
Allow: /
Fuera del entrenamiento de IA, dentro de las respuestas
Cierra el paso a los rastreadores que recopilan páginas para entrenar y deja entrar a los que te ponen en las respuestas y te envían visitas.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
User-agent: Bytespider
Disallow: /
User-agent: *
Allow: /
Cerrar el paso a un solo rastreador
Un grupo lo nombra; todo lo demás sigue igual.
User-agent: GPTBot
Disallow: /
Gratis · Sin cuenta · Unos segundos
FAQ
Preguntas sobre rastreadores de IA y robots.txt
¿Cómo compruebo si mi robots.txt bloquea a los rastreadores de IA?
¿Qué diferencia hay entre GPTBot, OAI-SearchBot y ChatGPT-User?
¿Debería bloquear a los rastreadores de IA?
¿Bloquear Google-Extended saca mi web de la Búsqueda de Google o de las Vistas creadas con IA?
¿El robots.txt impide que las empresas de IA usen mi contenido?
¿Qué pasa si mi robots.txt devuelve un error?
¿Qué es llms.txt?
¿El comprobador de rastreadores de IA es gratis?
Siguiente
Los rastreadores pueden leerte. ¿Te nombra ChatGPT?
Ser legible es el primer paso. El chequeo gratuito de visibilidad en ChatGPT le hace a ChatGPT las preguntas de tus clientes y muestra si te nombra, y a quién nombra en tu lugar.