¿Qué es robots.txt?
Visibilidad en buscadores, rastreo y datos estructurados
Un archivo robots.txt es un archivo de texto plano ubicado en la raíz de un sitio web que indica a los rastreadores que lo respetan qué rutas de URL pueden solicitar. Gestiona el rastreo, no la privacidad, la seguridad ni la eliminación de contenido. Bloquear una ruta no elimina una página ni garantiza que quede fuera de los resultados de búsqueda, ya que una URL bloqueada puede seguir apareciendo en listados si otras páginas enlazan a ella. Las reglas se estandarizaron como RFC 9309 en septiembre de 2022. Para contenido genuinamente privado, conviene usar autenticación o eliminación, no robots.txt.
Revisado por Jackie, Head of Learning & Development, Levellers - Última revisión: 8 de junio de 2026
Qué significa esto
Piense en robots.txt como un cartel en la recepción que indica a los robots visitantes qué pasillos deben evitar. Es una solicitud, no una puerta con llave. Los rastreadores bien comportados de los principales motores de búsqueda leen el archivo antes de acceder a cualquier otro recurso y respetan lo que indica. Los rastreadores que deciden comportarse de forma indebida pueden ignorarlo por completo.
El archivo reside en una ubicación fija: la raíz de cada host; por ejemplo, https://www.example.com/robots.txt. Controla las solicitudes, no la posesión del contenido. Puede pedir a un rastreador que no acceda a una página, pero no puede impedir que esa página sea conocida ni eliminar una página que ya ha sido indexada. Si otro sitio enlaza a una URL bloqueada, esa URL puede seguir apareciendo en los resultados, normalmente sin descripción porque el rastreador nunca tuvo permiso para leer el contenido.
Por qué es importante
Para la mayoría de los sitios pequeños, robots.txt es algo que se configura una vez y rara vez se modifica. Cobra importancia a medida que el sitio crece, porque los sistemas de gestión de contenidos generan grandes cantidades de URLs casi duplicadas y de utilidad, como vistas de categorías filtradas, resultados de búsqueda interna y versiones para imprimir. Si no se gestionan, pueden absorber el tiempo de un rastreador en páginas que no aportan ningún valor.
El punto comercial más relevante es que robots.txt se malinterpreta con frecuencia, y esas malinterpretaciones causan daños reales. Los equipos lo utilizan para intentar ocultar sitios de prueba, eliminar páginas de los resultados o mantener contenido privado, y ninguna de esas cosas funciona de forma fiable. Una sola línea descuidada también puede bloquear el rastreo de un sitio completo, lo que puede eliminarlo silenciosamente de los resultados de búsqueda. Saber qué hace el archivo, y qué no hace, evita tanto el autosabotaje accidental como la falsa confianza.
Cómo funciona
Un estándar, no solo una convención
El método de exclusión de robots fue propuesto por primera vez por Martijn Koster en 1994 y se utilizó de forma informal durante décadas. Se estandarizó formalmente como RFC 9309, el Robots Exclusion Protocol, publicado por el Internet Engineering Task Force en septiembre de 2022. El estándar establece cómo debe analizarse el archivo, cómo deben gestionarse los errores y cómo puede almacenarse en caché. Los rastreadores no deben depender de una copia en caché durante más de 24 horas y deben ser capaces de analizar al menos 500 kibibytes del archivo. El estándar es explícito en que el protocolo no sustituye a las medidas válidas de seguridad del contenido, y que listar rutas en el archivo las expone públicamente, lo que facilita su descubrimiento.
Ámbito, agentes de usuario y reglas
Las reglas de un archivo robots.txt se aplican únicamente al host, protocolo y puerto donde se sirve el archivo. Un archivo en https://www.example.com/robots.txt no rige un subdominio como shop.example.com, ni la versión http si el sitio canónico es https. Dentro del archivo, las reglas se agrupan por agente de usuario, el nombre con el que un rastreador se identifica. Cada grupo contiene reglas Allow y Disallow que especifican rutas de URL. Cuando más de una regla coincide con una URL, gana la más específica, es decir, la de mayor longitud coincidente.
La línea Sitemap
Es posible incluir una o más líneas Sitemap que apunten a la URL completa de un sitemap XML. Los principales motores de búsqueda admiten esto y es una forma práctica de indicar dónde se encuentra el sitemap, aunque no obliga a que nada sea rastreado ni indexado.
Cómo interactúa con otros controles
El rastreo y la indexación son pasos separados, y robots.txt solo afecta al primero. Esto crea una trampa de secuenciación bien conocida. Si se desea eliminar una página de los resultados, se aplica una instrucción noindex, pero el rastreador debe tener permiso para acceder a la página para ver esa instrucción. Si se bloquea la misma URL en robots.txt, el rastreador nunca lee la página, nunca ve el noindex y la URL puede permanecer en los resultados. El orden correcto es permitir el rastreo, dejar que el noindex sea detectado y que la página desaparezca, y solo entonces considerar bloquear la ruta si se desea ahorrar esfuerzo de rastreo.
Gestión de rastreadores de IA
Desde 2023, las principales empresas de IA han publicado sus propios nombres de agente de usuario, lo que permite tomar decisiones sobre ellos de forma independiente. Google introdujo el token de control Google-Extended en septiembre de 2023. Bloquear Google-Extended solicita a Google que no utilice el contenido para entrenar sus modelos de IA generativa, pero no elimina el sitio de Google Search ni impide que el contenido aparezca en AI Overviews, ya que estos se nutren del índice de búsqueda normal controlado por Googlebot. OpenAI utiliza GPTBot para el entrenamiento y un agente independiente para su función de búsqueda, por lo que bloquear uno no afecta al otro. Anthropic utiliza ClaudeBot y agentes relacionados, y Common Crawl utiliza CCBot. Al igual que con todas las reglas de robots.txt, estas se respetan de forma voluntaria. Son una señal clara para los operadores responsables, no un mecanismo de cumplimiento forzoso.
Ejemplos
Un minorista con navegación por facetas detecta que las combinaciones de filtros, como color, talla y criterio de ordenación, generan decenas de miles de URLs casi idénticas. Utiliza reglas Disallow para mantener a los rastreadores alejados de las rutas con muchos parámetros, de modo que el esfuerzo de rastreo se concentre en las páginas reales de productos y categorías.
Una empresa lanza una nueva sección y quiere eliminar de los resultados de búsqueda páginas antiguas con poco contenido. Primero confirma que esas URLs no están bloqueadas en robots.txt, aplica noindex, espera a que las páginas desaparezcan y luego añade una regla Disallow para mantener a los rastreadores fuera de esa ruta en el futuro.
Un equipo de marketing quiere que su blog pueda ser citado por herramientas de búsqueda con IA, pero no desea que el resto del sitio se utilice para entrenar modelos. Permite los agentes de búsqueda y recuperación, se excluye del entrenamiento mediante Google-Extended y reglas Disallow explícitas sobre los rastreadores de entrenamiento, y asume que se necesita un cortafuegos para cualquier rastreador que ignore el archivo.
Malentendidos frecuentes
El error más común es creer que robots.txt oculta contenido. No es así. Una URL bloqueada puede seguir apareciendo en listados si está enlazada desde otro lugar, mostrada sin una descripción útil.
El segundo es asumir que Disallow equivale a desindexar. No es así. Bloquear el rastreo puede, de hecho, impedir que una página sea eliminada, porque el rastreador no puede ver la instrucción noindex.
El tercero es pensar que un solo archivo lo rige todo. Rige un único host, protocolo y puerto, por lo que los subdominios y las variantes de protocolo necesitan sus propios archivos.
El cuarto es la idea de que bloquear más siempre es más seguro. Un bloqueo excesivo puede ocultar páginas importantes, romper el renderizado cuando se bloquean archivos CSS o JavaScript, y dejar un sitio fuera de los resultados de búsqueda.
Riesgos y limitaciones
El riesgo principal es el autosabotaje accidental. Un Disallow: / fuera de lugar puede eliminar un sitio de los resultados de búsqueda y, como robots.txt rara vez se revisa, el error puede pasar desapercibido.
El segundo es confundir la gestión del rastreo con el control de acceso. Listar una ruta en robots.txt anuncia que esa ruta existe, por lo que es la herramienta equivocada para cualquier contenido sensible. Los organismos de normalización, incluido el US National Institute of Standards and Technology, desaconsejan depender de este tipo de secreto, ya que la seguridad de un sistema no debe basarse en ocultar la existencia de un recurso.
El tercero es el riesgo de secuenciación entre noindex y un bloqueo en robots.txt, descrito anteriormente.
El cuarto es la falsa confianza respecto a los bots de IA. Los rastreadores responsables respetan el archivo, pero este no puede imponer el cumplimiento. En agosto de 2025, Cloudflare informó de que Perplexity utilizaba rastreadores encubiertos y no declarados para eludir las directivas de no rastreo, incluido un agente de usuario de navegador genérico que se hacía pasar por Google Chrome en macOS cuando su rastreador declarado estaba bloqueado, tras lo cual Cloudflare eliminó a Perplexity de su lista de bots verificados. Conviene tratar robots.txt como una solicitud pública y cortés, y utilizar controles del lado del servidor cuando el cumplimiento sea imprescindible.
Próximos pasos
Comience por hacer un inventario de qué secciones del sitio deben permanecer abiertas al rastreo y cuáles deben excluirse, siendo honesto en que excluir del rastreo no equivale a mantener privado ni a excluir de los resultados.
Revise los controles de rastreo de forma conjunta y no de manera aislada, porque robots.txt, los sitemaps, las etiquetas canónicas y el noindex interactúan entre sí. Asigne a una persona responsable la gestión del archivo, manténgalo breve y comentado, y vuelva a probarlo antes de cualquier lanzamiento o migración importante. Para cualquier contenido genuinamente confidencial, utilice autenticación o un entorno restringido, nunca robots.txt por sí solo.
¿Tiene alguna pregunta o sugerencia, o desea saber cómo investigamos y revisamos estas guías? Lea sobre nuestros estándares editoriales y cómo contactarnos.
Preguntas frecuentes
¿Debo bloquear las páginas de resultados de búsqueda interna en robots.txt?
Es posible hacerlo, y muchos sitios grandes lo hacen, porque las páginas de búsqueda interna generan URLs de escaso valor y casi duplicadas. Si esas páginas ya están indexadas, permita el rastreo y aplique noindex primero para que desaparezcan; luego bloquee la ruta. Bloquear sin más puede dejarlas atascadas en los resultados.
¿Puede robots.txt impedir que las herramientas de IA utilicen mi contenido?
Solo las que decidan cumplirlo. Las principales empresas de IA publican nombres de agente de usuario que se pueden permitir o bloquear, y Google-Extended permite excluirse del entrenamiento de los modelos generativos de Google sin dejar de aparecer en Search. Nada de esto es ejecutable de forma forzosa, así que utilice controles del lado del servidor para lo que sea imprescindible impedir.
Si bloqueo una página en robots.txt, ¿desaparecerá de Google?
No de forma fiable. El bloqueo controla el rastreo, no la indexación. Una URL bloqueada puede seguir apareciendo si otras páginas enlazan a ella, normalmente sin descripción. Para eliminar una página, permita el rastreo y utilice noindex, o elimine la página y devuelva un 404 o 410.
¿Es robots.txt una medida de seguridad?
No. El archivo es público y listar una ruta simplemente anuncia que existe. Utilice autenticación, protección con contraseña o un entorno restringido para el contenido sensible.
¿Un solo archivo robots.txt cubre todo mi sitio?
Cubre un único host, protocolo y puerto. Los subdominios como shop.example.com y las variantes de protocolo necesitan su propio archivo en su propia raíz.
¿Puedo combinar robots.txt con noindex?
Es posible, pero el orden importa. El rastreador debe tener permiso para acceder a la página y ver el noindex. Permita el rastreo hasta que la página haya desaparecido de los resultados y, después, añada un bloqueo si desea ahorrar esfuerzo de rastreo.
¿Qué tamaño puede tener un archivo robots.txt?
Los rastreadores que siguen el estándar deben analizar al menos 500 kibibytes. Mantener el archivo breve y bien comentado es una buena práctica y reduce la posibilidad de errores.
¿Sigo necesitando robots.txt si mi sitio es pequeño?
A menudo no, en ningún sentido activo. Un sitio pequeño y limpio puede rastrearse perfectamente sin reglas elaboradas. Un archivo sencillo, o ninguno en absoluto, suele ser suficiente.
Fuentes
RFC 9309: Robots Exclusion Protocol (Internet Engineering Task Force (IETF)). The formal standard, its September 2022 publication, parsing and caching rules, and the statement that the protocol is not a content security measure.
About /robots.txt (The Web Robots Pages (robotstxt.org)). The original de facto standard, file location, and the point that robots can ignore the file and that it is publicly visible.
Sitemaps XML format and protocol (sitemaps.org). How the Sitemap directive in robots.txt advertises a sitemap location to search engines.
How Google Interprets the robots.txt Specification (Google Search Central). How a major crawler applies RFC 9309, longest match precedence, and the separation of crawling from indexing.
