¿Qué es robots.txt?

Centro de aprendizaje6 min de lectura

Robots.txt es un archivo de texto plano situado en la raíz de un sitio web (por ejemplo, example.com/robots.txt) que indica a los programas automatizados qué partes del sitio pueden obtener y cuáles no. Esos programas se llaman rastreadores o bots: software que solicita páginas una tras otra para recopilar su contenido. Un rastreador que se comporta correctamente descarga primero robots.txt y sigue sus reglas antes de solicitar cualquier otra cosa.

El archivo sigue una convención llamada Robots Exclusion Protocol (protocolo de exclusión de robots). Existe desde los inicios de la web y hoy está redactado como estándar de internet, por lo que los motores de búsqueda y la mayoría de las grandes empresas de IA lo leen de la misma manera.

¿Cómo funciona robots.txt?

Cuando un rastreador llega a un host, solicita /robots.txt a ese host y protocolo exactos. El archivo en https://example.com/robots.txt se aplica solo a https://example.com. Un subdominio como shop.example.com necesita su propio archivo.

Después, el rastreador busca el grupo de reglas dirigido a él. Cada rastreador se identifica con un user agent, un nombre que envía con cada solicitud, como Googlebot o GPTBot. Si el archivo tiene un grupo para ese nombre, el rastreador sigue ese grupo. Si no, recurre al grupo para todos los bots, escrito con un asterisco. Dentro de un grupo, gana la regla coincidente más específica, lo que en la práctica significa la regla con la ruta coincidente más larga.

El código de estado del archivo también importa:

  • Si robots.txt devuelve una página normal, el rastreador aplica sus reglas.
  • Si devuelve "no encontrado", la mayoría de los rastreadores consideran que todo el sitio está permitido.
  • Si el servidor devuelve un error, muchos rastreadores pausan el rastreo hasta poder leer el archivo, porque no pueden saber qué está permitido.

Los rastreadores suelen guardar el archivo en caché durante un tiempo, así que un cambio no surte efecto en la siguiente solicitud inmediata.

¿Cómo son las reglas de un archivo robots.txt?

Un archivo robots.txt es una lista de grupos. Cada grupo empieza con una o más líneas de user agent, seguidas de las reglas para esos agentes.

User-agent: *
Disallow: /cart/
Disallow: /search
Allow: /search/help

User-agent: GPTBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

En este archivo, todos los bots pueden rastrear el sitio excepto el carrito y las páginas de búsqueda interna, con una excepción para la página de ayuda de búsqueda. GPTBot tiene bloqueado todo el sitio. La línea del sitemap indica a todos los bots una lista de URL que el propietario quiere que se rastreen.

DirectivaQué hace
User-agentNombra el rastreador al que se aplican las reglas siguientes. Un asterisco significa cualquier rastreador.
DisallowIndica una ruta que el rastreador no debe obtener. "Disallow: /" bloquea todo el sitio. Un valor vacío no bloquea nada.
AllowIndica una ruta que el rastreador puede obtener, y se usa para crear una excepción dentro de una carpeta bloqueada.
SitemapDa la URL completa de un sitemap XML. Se aplica a todos los rastreadores independientemente del grupo.

Las rutas coinciden desde el inicio de la ruta de la URL y distinguen entre mayúsculas y minúsculas. Los principales rastreadores también admiten dos comodines: un asterisco coincide con cualquier secuencia de caracteres y un signo de dólar marca el final de una URL, así que "Disallow: /*.pdf$" bloquea todas las URL que terminan en .pdf. Algunos rastreadores aceptan líneas adicionales como Crawl-delay, pero la compatibilidad varía y Google la ignora.

¿Qué no puede hacer robots.txt?

Robots.txt controla el rastreo, que es la acción de obtener una página. La indexación, la acción de almacenar una página para que pueda aparecer en los resultados, es un paso distinto. Un motor de búsqueda puede seguir mostrando una URL bloqueada si otros sitios enlazan a ella, normalmente con la dirección y sin descripción porque nunca leyó el contenido.

Para mantener una página fuera de los resultados de búsqueda, la página necesita una instrucción noindex, ya sea en una etiqueta meta robots o en un encabezado HTTP. Esa instrucción solo funciona si el rastreador puede obtener la página y verla. Si una página está bloqueada en robots.txt y además lleva noindex, el noindex nunca se lee.

Robots.txt es además una petición sin ningún mecanismo que la haga cumplir. Los rastreadores de confianza lo respetan, mientras que los scrapers y los bots maliciosos pueden ignorarlo. Como el archivo es público, incluir en él una carpeta privada le indica a cualquiera dónde está esa carpeta. El contenido que debe seguir siendo privado necesita autenticación o reglas de acceso en el servidor.

¿Cómo se aplica robots.txt a los rastreadores de IA?

Los rastreadores de IA leen robots.txt igual que los rastreadores de los motores de búsqueda, y la mayoría de las empresas de IA usan varios bots con distintos user agents para distintas tareas. OpenAI, por ejemplo, usa GPTBot para recopilar datos de entrenamiento, OAI-SearchBot para su índice de búsqueda y ChatGPT-User para las solicitudes que una persona activa dentro de una conversación. Anthropic usa ClaudeBot y Perplexity usa PerplexityBot.

Como cada bot tiene su propio nombre, un sitio puede tomar decisiones por separado:

  • Permitir los bots de búsqueda y bloquear los de entrenamiento, para que las páginas puedan recibir citas en las respuestas sin añadirse a los datos de entrenamiento.
  • Bloquear todos los bots de IA, lo que elimina el sitio de las fuentes en tiempo real que leen esos productos.
  • Permitirlo todo, que es lo predeterminado cuando ninguna regla los nombra.

Algunas empresas usan un token de control en lugar de un rastreador independiente. Google-Extended es un nombre de user agent que determina si el contenido que recopila Googlebot puede usarse para los modelos Gemini. Bloquearlo no cambia cómo aparecen las páginas en Google Search ni en Google AI Overviews, porque estos siguen dependiendo de Googlebot.

¿Qué significa robots.txt para la visibilidad en IA de un sitio web?

La búsqueda con IA redacta respuestas a partir de páginas que puede recuperar. Si el bot de búsqueda de un producto concreto está bloqueado, ese producto no puede obtener las páginas del sitio y la respuesta se construye con otras fuentes. El proceso descrito en cómo elige la búsqueda con IA qué fuentes citar no tiene nada que evaluar en una página que nunca se obtuvo.

Los bloqueos suelen producirse por accidente. Puede causarlos una regla antigua escrita para todos los bots, un archivo de staging copiado a producción o un plugin de seguridad que añade user agents de IA a una lista de bloqueo, y el sitio desaparece de las respuestas de IA sin que nadie lo note. El firewall o la red de distribución de contenido situados delante de un sitio también pueden bloquear bots antes de que lleguen a robots.txt, así que hay que revisar ambas capas.

Cuando el propietario de un sitio ve una caída en las menciones o las citas, robots.txt es uno de los primeros archivos que debe leer. Comparar sus reglas con los user agents de cada plataforma de IA muestra qué productos pueden leer el sitio. Hacer un seguimiento de la visibilidad en IA a lo largo del tiempo muestra después si un cambio en el archivo fue seguido de un cambio en la frecuencia con la que se cita el sitio.

Pruébalo gratis 14 días
y recibe tu informe de IA