Equipo revisando un gran conjunto de documentos y notas para decidir qué información debe permanecer en el contexto de trabajo.
Equipo revisando un gran conjunto de documentos y notas para decidir qué información debe permanecer en el contexto de trabajo.

¿Qué es una ventana de contexto?

Fundamentos, modelos y capacidades de IA

Una ventana de contexto es el presupuesto total de tokens que un modelo puede utilizar en una sola solicitud, incluyendo el prompt, el material recuperado, los turnos anteriores y la respuesta del modelo. Funciona como memoria de trabajo, no como conocimiento a largo plazo. Las ventanas más grandes permiten procesar más material, pero un contexto más extenso puede reducir la recuperación y la precisión si la información está mal estructurada.

Revisado por Jackie, Head of Learning & Development, Levellers - Última revisión: 8 de junio de 2026

Qué significa esto

Una ventana de contexto es la cantidad de texto que un modelo puede usar activamente al generar la siguiente respuesta. En la documentación de los proveedores, ese presupuesto incluye tokens de entrada y de salida, y en algunos modelos también tokens de razonamiento. Anthropic la describe también como memoria de trabajo, lo que ayuda a entender por qué es diferente del conjunto de datos más amplio con el que se entrenó el modelo.

En la práctica, la ventana de contexto es donde reside la tarea activa: instrucciones del sistema, el último prompt del usuario, la conversación previa, fragmentos recuperados, resultados de herramientas y la respuesta que el modelo está a punto de generar. Si el total supera el límite, el sistema debe truncar, compactar, rechazar la solicitud o reducir lo que envía.

Por qué importa

En el trabajo empresarial, la ventana de contexto determina cuánta información puede ver el modelo a la vez. Esto afecta a tareas habituales como responder preguntas sobre políticas, revisar documentos extensos o mantener el hilo de una conversación de soporte u operaciones. El límite práctico no es solo si el texto cabe, sino si el modelo puede seguir utilizándolo bien.

Este último punto es importante porque más contexto no es automáticamente mejor. Anthropic señala que la precisión y la recuperación pueden degradarse a medida que crece el número de tokens, y el estudio Lost in the Middle encontró que los modelos suelen rendir peor cuando la información clave se encuentra en el centro de entradas largas. Así, una ventana más grande elimina una restricción, pero no suprime la necesidad de una buena recuperación, segmentación y diseño de prompts.

Cómo funciona

Cuando se envía una solicitud, la aplicación ensambla un paquete de prompt. Este puede incluir turnos de conversación anteriores, instrucciones actuales, extractos de fuentes y resultados de herramientas. OpenAI indica que la ventana de contexto es el número máximo de tokens disponibles en una sola solicitud, y Anthropic aplica la misma lógica de presupuesto para mensajes de usuario, configuración de herramientas, resultados de herramientas y salida del modelo.

A medida que las conversaciones se alargan, los sistemas necesitan gestionar el contexto. OpenAI ofrece compactación para que una ventana de contexto completa pueda transformarse en una ventana canónica más pequeña para el siguiente turno, y Anthropic recomienda la compactación en el servidor cuando las conversaciones se acercan regularmente a los límites. En otras palabras, los sistemas en producción suelen apoyarse en la recuperación, el resumen o la compactación, en lugar de intentar mantener todo el historial sin procesar indefinidamente.

El tamaño del contexto también varía según el modelo. Las páginas de modelos de OpenAI listan distintas ventanas de contexto por familia de modelos, y Anthropic documenta ventanas de 200k y 1M tokens en los modelos Claude. Por eso, el diseño de flujos de trabajo debe partir del presupuesto real del modelo, no de una suposición genérica sobre lo que los modelos de lenguaje grande pueden manejar.

Ejemplos

Revisión de contratos. Un equipo legal o comercial puede querer que el modelo compare un borrador con cláusulas del manual de referencia y comentarios anteriores. La pregunta útil no es solo si el borrador cabe, sino si las secciones, definiciones y excepciones relevantes están en el contexto al mismo tiempo.

Traspaso de soporte. Un asistente de servicio puede necesitar el problema original, los pasos de resolución, las notas del CRM y la última respuesta del cliente. La memoria de sesión puede preservar el historial entre turnos, pero la siguiente ejecución sigue necesitando un paquete de contexto efectivo.

Asistente de políticas internas. Si un usuario pregunta cómo se aplica la política de permisos, compras o seguridad a un caso concreto, la recuperación puede traer los fragmentos relevantes en lugar de incluir el manual completo en cada prompt. Esto suele producir un prompt más limpio y una mejor relación señal-ruido.

Malentendidos frecuentes

Una ventana de contexto no es lo mismo que la memoria. Es el presupuesto de tokens activo para una sola solicitud. Los almacenes de sesión externos pueden guardar historiales más largos, pero solo el material enviado en la siguiente solicitud está realmente en contexto.

Una ventana de contexto no es lo mismo que los datos de entrenamiento ni que el corte de conocimiento. Anthropic distingue explícitamente la ventana de contexto del corpus más amplio con el que se entrenó el modelo.

Una ventana más grande no garantiza mejores respuestas. Tanto las guías de los proveedores como la investigación advierten que el rendimiento en contextos largos sigue dependiendo de la estructura, la relevancia y la ubicación de la información.

Riesgos y límites

El primer límite es mecánico: si se supera el límite de contexto del modelo, las salidas pueden truncarse o la solicitud puede fallar la validación, según la plataforma y el modelo.

El segundo límite es de calidad: los prompts largos pueden ocultar la señal entre demasiado texto. El estudio Lost in the Middle encontró que la información relevante situada en el centro de contextos largos se utiliza con menor fiabilidad. Esto convierte el diseño del contexto en un problema de flujo de trabajo, no solo de especificación del modelo.

El tercer límite es operativo: mantener historiales completos, trazas de herramientas y documentos extensos aumenta el coste y la complejidad. Por eso la compactación, el conteo de tokens y la recuperación selectiva son importantes en producción.

Próximos pasos

Tome un flujo de trabajo real y mapee su presupuesto de tokens. Identifique qué debe permanecer siempre en el prompt, qué puede recuperarse bajo demanda y qué puede compactarse o resumirse entre turnos. Luego estime la carga de tokens antes de construir. OpenAI y Anthropic ofrecen orientación sobre conteo de tokens y gestión del contexto para esta etapa.

¿Tiene alguna pregunta o sugerencia, o desea entender cómo investigamos y revisamos estas guías? Lea sobre nuestros estándares editoriales y cómo contactarnos.

Preguntas frecuentes

¿Es una ventana de contexto lo mismo que la memoria?

No. Es el presupuesto activo para una sola solicitud. Las capas de sesión o memoria externas pueden almacenar más historial, pero solo la parte enviada en la siguiente llamada al modelo está en contexto.

¿Qué ocurre si se supera la ventana de contexto?

OpenAI indica que los tokens que superan el límite pueden truncarse, mientras que Anthropic documenta errores de validación en los modelos Claude más recientes cuando los tokens de prompt y de salida superan el límite.

¿Las ventanas de contexto más largas eliminan la necesidad de RAG?

Por lo general, no. Las ventanas largas ayudan, pero tanto la investigación como las guías de los proveedores siguen señalando una degradación en contextos largos, lo que mantiene la utilidad de la recuperación, la segmentación y la compactación.

¿Se mide una ventana de contexto en palabras?

No. Los proveedores documentan estos límites en tokens, no en palabras, y tanto el uso de tokens de entrada como el de salida cuentan para el total.