¿Pueden leer tu web los rastreadores de IA?
Escribe un dominio y mira tu robots.txt en vivo resuelto bot a bot, con la regla que decide cada respuesta.
Qué hace esta herramienta
Un comprobador de robots.txt lee el fichero robots.txt de una web y resuelve, para cada rastreador de IA, si tiene permiso para entrar. Este descarga tu fichero en vivo, resuelve el grupo que aplica a cada uno de los 13 rastreadores de IA que seguimos (GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, Google-Extended, CCBot, Bytespider, Applebot-Extended y Amazonbot) por el user agent que casa más largo, y te dice la línea exacta que lo permite o lo bloquea. Además lista los sitemaps que declaras y el Content-Signal que publiques. Sin cuenta y sin email.
Preguntas frecuentes
Es una herramienta que lee el robots.txt de una web y resuelve, para cada rastreador de IA, si tiene permiso para leerla. Leer el fichero a ojo es poco fiable porque la regla que aplica a un bot es la del grupo cuyo user agent casa más largo con su nombre, no la del primer grupo del fichero.
Deja abiertos los de respuesta, que son los que te meten dentro de una cita: OAI-SearchBot, ChatGPT-User, Claude-User, Claude-SearchBot, PerplexityBot, Perplexity-User y Google-Extended. Los de entrenamiento como GPTBot, ClaudeBot, CCBot o Bytespider son otra decisión, y bloquearlos no te saca de las respuestas.
No. El robots.txt es un cartel, no una puerta. Lo cumple quien quiere, y un scraper que lo ignora va a leer tus páginas igualmente. Lo que cierra de verdad es un login, las reglas de bots en el edge de tu CDN y un límite por IP. Tómalo como una declaración de preferencia.
Esta es la trampa que se lleva a casi todos. Un grupo con user agent nombrado SUSTITUYE al del asterisco para ese bot en vez de sumarse, así que cualquier regla que escribas en el asterisco es invisible para todos los bots que tienen grupo propio. Si añades un Disallow más adelante, repítelo dentro de cada grupo con nombre o esos bots no lo verán.
Content-Signal es una línea que declara cómo pueden usar tu contenido las empresas de IA, con valores como search, ai-input y ai-train. Sirve para seguir visible en buscadores y en respuestas citadas mientras declaras que no permites el entrenamiento. Declara una preferencia y no la impone.
Cada vez que cambies de hosting, instales un plugin de seguridad o enciendas una protección de bots en tu CDN. Casi todos los bloqueos que encontramos no los escribió nadie a mano: llegaron con un valor por defecto. Esta herramienta lee tu fichero en vivo cada vez, sin caché, así que volver a comprobar justo después de un arreglo te dice la verdad de ese momento.