Raíz de un sitio web que muestra llms.txt junto a robots.txt, sitemap.xml, noindex y capas de datos estructurados
Raíz de un sitio web que muestra llms.txt junto a robots.txt, sitemap.xml, noindex y capas de datos estructurados

¿Qué es llms.txt?

Visibilidad en buscadores, rastreo y datos estructurados

llms.txt es un archivo propuesto, basado en Markdown, que algunos propietarios de sitios publican en /llms.txt para ayudar a las herramientas de modelos de lenguaje grande o a los agentes de IA a identificar las partes más útiles de un sitio web. Conviene tratarlo como un experimento o convención emergente, no como un estándar web consolidado ni como una vía garantizada para aparecer en las respuestas de la IA. Tampoco es un sustituto de robots.txt, sitemap.xml, noindex, los datos estructurados ni el trabajo habitual de calidad de contenido. Para la mayoría de las organizaciones, llms.txt solo merece considerarse cuando los fundamentos de rastreabilidad, indexación, metadatos y gobernanza ya están en orden.

Revisado por Jackie, Head of Learning & Development, Levellers - Última revisión: 8 de junio de 2026

Qué significa esto

El atractivo de llms.txt es fácil de entender. Los sitios web suelen estar diseñados para personas y navegadores, no para modelos de lenguaje que intentan encontrar la página más importante sobre un tema. Un sitio de documentación extenso puede tener múltiples niveles de navegación, plantillas, scripts, texto repetido y páginas desactualizadas. Desde esa perspectiva, una guía breve y legible por máquinas que diga "esto es de lo que trata este sitio y estas son las páginas que más importan" parece razonable.

Eso es lo que la propuesta llms.txt intenta hacer. El sitio de la propuesta la describe como una forma de proporcionar información que ayuda a los LLMs a utilizar un sitio web en el momento de la inferencia. En otras palabras, cuando un sistema de IA intenta responder a la pregunta de un usuario, el archivo está pensado para actuar como una señal concisa. La propuesta utiliza Markdown en lugar de XML y recomienda un archivo estructurado con un título, un resumen y listas agrupadas de enlaces relevantes. También sugiere versiones limpias en Markdown de las páginas de contenido cuando resulte útil.

La palabra clave aquí es propuesta. llms.txt no equivale a los bloques de construcción consolidados de la publicación web. Es más reciente, menos estable, no cuenta con soporte universal y no es obligatorio para las principales plataformas de búsqueda. Algunos sitios de documentación oficial ya publican uno, lo que refleja experimentación real. Eso no demuestra adopción universal ni beneficio en el posicionamiento.

Por qué importa

llms.txt importa porque las organizaciones intentan entender cómo se descubren y reutilizan los sitios web en experiencias asistidas por IA. Los propietarios de contenido pueden ver la dirección del cambio: cada vez más personas formulan preguntas en herramientas de búsqueda con IA, asistentes de navegador y motores de respuesta, en lugar de depender únicamente de los resultados de búsqueda clásicos. Eso genera un problema real de documentación. Si el mejor material está enterrado en una navegación pesada, mezclado con páginas obsoletas y difícil de procesar para las máquinas, puede ser conveniente disponer de un resumen ligero que oriente a los sistemas hacia las páginas públicas más sólidas.

También existe un beneficio práctico interno. Aunque llms.txt no aportara ninguna ventaja de descubrimiento externo, el proceso de redactarlo puede revelar si el sitio tiene realmente una arquitectura de información pública coherente. Se aprende rápidamente si es posible identificar las páginas canónicas, si las políticas están actualizadas, si la documentación está claramente agrupada y si hay páginas que no se querría que los agentes pusieran en primer plano.

Sin embargo, quienes toman decisiones deben resistir una conclusión precipitada: "el descubrimiento por IA está cambiando, por lo tanto llms.txt debe ser el nuevo archivo técnico imprescindible". Esa conclusión no está respaldada por la orientación oficial de búsqueda actual. La documentación de Google Search Central indica ahora que no existen requisitos técnicos adicionales para aparecer en AI Overviews o AI Mode, que las mismas buenas prácticas de SEO siguen siendo relevantes y que los propietarios de sitios no necesitan crear nuevos archivos legibles por máquinas, archivos de texto de IA ni esquemas especiales para aparecer en esas funciones. Eso no hace que llms.txt sea inútil. Sí significa que debe plantearse como un experimento complementario, no como un sustituto moderno de los fundamentos consolidados de rastreo e indexación.

Cómo funciona

La propuesta actual de llms.txt indica que el archivo normalmente reside en la ruta raíz /llms.txt de un sitio, aunque también es posible una subruta. La propuesta describe una estructura Markdown específica. El archivo debe contener un H1 con el nombre del sitio o proyecto, un resumen en blockquote, texto explicativo opcional y una o más secciones H2 con listas de URLs importantes y descripciones opcionales. También existe una sección especial Optional cuyos enlaces pueden omitirse cuando se necesita un contexto más breve. La propuesta sugiere además que los sitios pueden publicar versiones limpias en Markdown de las páginas clave añadiendo .md al patrón de URL original, y analiza archivos de contexto relacionados como llms-ctx.txt o llms-ctx-full.txt como opciones de implementación, no como estándares obligatorios.

Esto convierte a llms.txt en un archivo de orientación, no de control. Para entender lo que no es, resulta útil compararlo con los controles web existentes.

robots.txt trata sobre el acceso de los rastreadores. La documentación de Google indica que un archivo robots.txt comunica a los rastreadores a qué URLs pueden acceder y se utiliza principalmente para gestionar el tráfico de rastreo. Google también señala que robots.txt no es un mecanismo para mantener una página fuera de Google ni una forma segura de ocultar contenido privado. Por tanto, robots.txt se refiere al comportamiento de las solicitudes, no a una orientación semántica enriquecida para los LLMs.

sitemap.xml trata sobre el descubrimiento de URLs. Google indica que un sitemap es un archivo que proporciona información sobre las páginas y archivos de un sitio para que los motores de búsqueda puedan rastrearlos de forma más eficiente. Es un inventario amplio, no un explicador curado de las pocas páginas que más importan a un sistema de IA que responde una pregunta.

noindex trata sobre el control de indexación donde está soportado. Google indica que noindex puede bloquear la indexación de una página para que no aparezca en los resultados de búsqueda. Es una señal de control sobre la inclusión, no un mapa de contenido para herramientas de IA.

JSON-LD y otros datos estructurados tratan sobre hechos legibles por máquinas en una página. Google indica que utiliza los datos estructurados para comprender el contenido y la web en general. Eso es diferente a entregar una guía orientada a LLMs sobre una colección de recursos públicos.

La conclusión clave de esas comparaciones es sencilla. llms.txt puede coexistir con estos archivos, pero no los reemplaza. De hecho, la orientación actual de Google sobre funciones de IA va más lejos y señala que no es necesario crear nuevos archivos de texto de IA para aparecer en las funciones de IA de Google. Por tanto, si se construye llms.txt antes de corregir la rastreabilidad, los enlaces internos, la indexabilidad, el contenido canónico, los datos estructurados y la higiene de metadatos, probablemente se está optimizando la capa equivocada en primer lugar.

Ejemplos

Una empresa SaaS con documentación extensa es el ejemplo más claro. Supongamos que tiene documentación de producto, documentación de API, páginas de precios, páginas legales, notas de versión, entradas de blog y material archivado distribuido en varias secciones. Un archivo llms.txt cuidadosamente mantenido podría apuntar únicamente a las páginas públicas más útiles para comprender el producto, los pasos de implementación y el modelo de soporte. Eso puede ayudar a algunas herramientas de IA a navegar por el sitio. Aunque el efecto externo sea modesto, el archivo puede seguir actuando como filtro editorial para el equipo que mantiene la documentación.

Una universidad o entidad de formación podría usar llms.txt para orientar a los sistemas de IA hacia la información actualizada sobre programas, orientación de admisiones, información de accesibilidad y páginas de política pública, dejando las noticias de menor valor en una sección opcional o fuera del archivo por completo. Eso solo tiene sentido si las páginas listadas son públicas, están actualizadas y tienen una titularidad clara.

Un editor de contenido que construye una biblioteca de explicadores podría usar llms.txt después de corregir los fundamentos del sitio para destacar las páginas de referencia perennes. El valor no es ningún "jugo GEO" misterioso. Es una expresión más clara de qué páginas describen mejor el área temática. Si el sitio ya es internamente coherente, llms.txt podría reforzar esa coherencia.

Pero también hay razones igualmente válidas para no publicar uno todavía. Si un sitio aún tiene enlaces internos rotos, problemas de duplicación, canónicos débiles, titularidad de páginas poco clara o URLs públicas que no deberían promoverse ante los agentes, añadir llms.txt puede simplemente formalizar el mapa equivocado. Puede convertirse en un resumen ordenado de un sitio desordenado.

Por eso llms.txt debe tratarse mucho más como un trabajo de arquitectura de información que como un truco técnico rápido.

Malentendidos frecuentes

El mayor malentendido es que llms.txt es el nuevo robots.txt. No lo es. robots.txt trata sobre instrucciones de acceso para rastreadores. llms.txt se propone como una guía de contenido para LLMs y agentes. Función diferente, garantías diferentes.

El segundo malentendido es que publicar llms.txt mejorará por defecto las citas o el posicionamiento en IA. No existe respaldo oficial general para esa afirmación. La propia orientación de Google indica explícitamente que no se requieren archivos de IA especiales para sus funciones de IA. Por tanto, la descripción más honesta hoy es "posible experimento de bajo coste", no "garantía de visibilidad".

Otro error es tratar llms.txt como un sustituto de sitemap.xml, noindex o JSON-LD. Cada uno resuelve problemas distintos: descubrimiento, control de indexación y comprensión estructurada. Un archivo de orientación no reemplaza los controles consolidados de rastreo e indexación.

Un malentendido adicional es que llms.txt puede proteger contenido privado. No puede. Si algo no debe ser accesible o no debe indexarse, hay que recurrir a la autenticación, el control de acceso y las directivas adecuadas de rastreo o indexación. No se debe confiar en un archivo de orientación voluntario para proteger nada importante.

Riesgos y límites

El primer riesgo de llms.txt es la distracción estratégica. Los equipos pueden pasar horas debatiendo un nuevo archivo de descubrimiento por IA mientras el sitio aún carece de enlaces internos limpios, un sitemap mantenido, títulos fiables, metadatos útiles y una titularidad de contenido público coherente. Ese es el orden de trabajo equivocado.

El segundo riesgo es publicar un mapa deficiente. Un archivo llms.txt desactualizado puede apuntar a los agentes hacia precios antiguos, documentación retirada, políticas superadas o páginas débiles que en realidad no se pretendía destacar. Como el archivo es intencionalmente conciso, cada URL listada tiene peso.

El tercer riesgo es la exposición accidental. Algunos equipos pueden verse tentados a incluir URLs que son técnicamente públicas pero que no deberían promoverse, como archivos poco conocidos, experimentos de baja calidad o páginas que generan confusión cuando se sacan de contexto. llms.txt es una capa de señalización, por lo que debe tratarse como un activo editorial.

También existe un límite de soporte. El sitio de la propuesta presenta llms.txt como una propuesta para estandarizar un comportamiento, no como un estándar terminado con adopción universal. Al mismo tiempo, los ecosistemas actuales de rastreadores de IA siguen organizados principalmente en torno a la documentación de rastreadores y el control al estilo robots. OpenAI documenta OAI-SearchBot y GPTBot. Anthropic documenta ClaudeBot, Claude-SearchBot y Claude-User. Perplexity documenta PerplexityBot y Perplexity-User. Esos documentos oficiales muestran que la realidad operativa actual sigue girando en torno a la identidad del rastreador, el comportamiento de las solicitudes y las reglas de acceso, mucho más que en torno a cualquier requisito universal de llms.txt.

Por último, llms.txt no es un sustituto de la gobernanza. Si se publica uno, hay que asignar un responsable, mantenerlo conciso, revisarlo con regularidad y alinearlo con la fuente de verdad pública real. Dado que el espacio aún evoluciona rápidamente, una cadencia de revisión trimestral es razonable.

Qué hacer a continuación

Tratar llms.txt como una posible capa final, no como un punto de partida. Primero hay que asegurarse de que el sitio tiene páginas públicas rastreables, enlaces internos coherentes, un sitemap mantenido, un comportamiento de robots adecuado, un uso correcto de noindex donde sea necesario, contenido canónico claro y cualquier dato estructurado que realmente corresponda al contenido visible.

Después, decidir si una pequeña guía curada sería útil. Si la respuesta es sí, mantenerla breve. Listar solo las páginas públicas con las que se estaría cómodo si un sistema de IA las tratara como el mejor resumen del tema. Evitar el volcado de enlaces. Evitar URLs especulativas o temporales. Reutilizar la arquitectura de información existente en lugar de inventar una segunda taxonomía paralela solo para bots.

Asignar un responsable al archivo. Revisarlo al menos cada tres meses. Si no se obtiene nada más, esa disciplina de revisión indicará si llms.txt está siendo útil como instrumento editorial. Si la visibilidad en IA externa mejora, tratarlo como un beneficio adicional, no como una promesa.

¿Tiene alguna pregunta o sugerencia, o quiere entender cómo investigamos y revisamos estas guías? Lea sobre nuestros estándares editoriales y cómo contactarnos.

Preguntas frecuentes

¿Es llms.txt un estándar oficial?

No en el sentido en que robots.txt o los sitemaps suelen tratarse. El sitio oficial de la propuesta describe llms.txt como una propuesta para estandarizar un archivo en la raíz que ayuda a los LLMs a utilizar un sitio web en el momento de la inferencia. Esa formulación importa. Señala intención y estructura, pero no adopción universal, soporte obligatorio ni comportamiento garantizado en los sistemas que lo consumen.

¿Exige Google llms.txt para AI Overviews o AI Mode?

No. La orientación actual de Google Search Central indica que no existen requisitos técnicos adicionales para aparecer en AI Overviews o AI Mode y que los propietarios de sitios no necesitan crear nuevos archivos legibles por máquinas, archivos de texto de IA ni esquemas especiales para esas funciones. Si el objetivo es la visibilidad en las experiencias de búsqueda con IA de Google, los fundamentos siguen siendo lo que más importa.

¿Debería llms.txt reemplazar a robots.txt, sitemap.xml, noindex o JSON-LD?

No. Todos resuelven problemas distintos. robots.txt gestiona las instrucciones de acceso para rastreadores, sitemap.xml facilita el descubrimiento, noindex controla la indexación donde está soportado y JSON-LD proporciona hechos estructurados a nivel de página. llms.txt, en el mejor de los casos, es una señal curada para la navegación orientada a LLMs. Capa diferente, propósito diferente, nivel de madurez diferente.

¿Quién debería considerar publicar llms.txt ahora?

Los equipos con documentación pública sólida o contenido explicativo pueden considerarlo como un experimento de bajo coste una vez que el sitio principal ya está en orden. Es más justificable cuando existe un conjunto claro de páginas públicas canónicas y un responsable dispuesto a mantener el archivo. Es mucho menos justificable como atajo para sitios con arquitectura de información débil, contenido desactualizado o problemas de gobernanza sin resolver.

Fuentes

  • The /llms.txt file - llms-txt (llms-txt). Core definition of llms.txt as a proposal, plus its stated purpose, format and relationship to existing standards.