¿Qué es la inferencia de IA?
Entrega, operaciones e infraestructura de IA
La inferencia de IA es el acto de ejecutar un modelo entrenado sobre una nueva entrada para producir una salida, como una predicción, clasificación, resumen, puntuación o respuesta generada. El entrenamiento es cuando un modelo aprende de los datos; la inferencia es cuando realiza el trabajo. La inferencia es donde se manifiesta la realidad comercial: los tiempos de respuesta, las tasas de error, los costes operativos, la seguridad y la calidad se deciden aquí. La inferencia no es lo mismo que el serving, que es la maquinaria de producción circundante, incluida la gestión de solicitudes, el escalado y la monitorización que entrega la inferencia de forma fiable a los usuarios.
Revisado por Jackie, Head of Learning & Development, Levellers - Última revisión: 8 de junio de 2026
Qué significa esto
Conviene imaginar un modelo en dos modos. El entrenamiento es el modo de estudio, en el que aprende patrones a partir de grandes cantidades de datos, un proceso lento y costoso que se realiza con antelación. La inferencia es el modo de examen, en el que aplica lo aprendido a una nueva pregunta y devuelve una respuesta. Cada vez que se obtiene una respuesta de un asistente de IA, se clasifica un documento o se puntúa una transacción, eso es inferencia.
La distinción importa porque la mayor parte del coste, la velocidad y el riesgo cotidianos de la IA residen en la inferencia, no en el entrenamiento. Se entrena una vez, o de forma ocasional; la inferencia se ejecuta de manera constante. El serving es una idea relacionada pero distinta: es el sistema de producción que rodea a la inferencia, acepta solicitudes, gestiona la carga, devuelve resultados y detecta problemas.
Por qué importa
La inferencia es donde se gana o se pierde en coste, velocidad y fiabilidad. Un modelo preciso en las pruebas puede seguir siendo demasiado lento, demasiado caro o demasiado frágil en producción. Esas propiedades son cuestiones de inferencia y serving, y condicionan directamente la experiencia del usuario.
También importa para la gobernanza y la presupuestación. Los datos sensibles suelen pasar por los prompts en el momento de la inferencia, por lo que los controles deben aplicarse aquí. Y dado que se paga por uso, el coste de la inferencia escala con el volumen de una manera que el entrenamiento no lo hace. La buena noticia es que el coste unitario ha caído de forma pronunciada: el Stanford AI Index 2025 informa de que el coste de inferencia para un sistema que puntúa al nivel de GPT-3.5 se redujo más de 280 veces, de aproximadamente 20 dólares por millón de tokens en noviembre de 2022 a aproximadamente 0,07 dólares por millón de tokens en octubre de 2024. La contrapartida es que ejecutar inferencia en tiempo real por solicitud o inferencia en lote nocturna sigue cambiando tanto el coste como la experiencia que se puede ofrecer.
Cómo funciona
El flujo básico
Se prepara la entrada, el modelo ejecuta un pase hacia adelante para calcular una salida, y el resultado se posprocesa y se devuelve. En un modelo de lenguaje, la entrada incluye el prompt, y los prompts más largos implican más procesamiento, lo que aumenta tanto la latencia como el coste.
Latencia frente a rendimiento
La latencia es el tiempo que tarda una respuesta; el rendimiento es cuántas respuestas se gestionan por unidad de tiempo. Optimizar uno puede perjudicar al otro. Las herramientas interactivas priorizan la baja latencia; los trabajos en lote priorizan el alto rendimiento.
Inferencia en línea frente a inferencia en lote
La inferencia en línea responde a las solicitudes en tiempo real, de una en una o de pocas en pocas, para uso interactivo. La inferencia en lote procesa muchos elementos juntos, a menudo de forma nocturna, cuando la inmediatez no es necesaria. Una técnica relacionada, el batching dinámico o continuo, agrupa las solicitudes en tiempo real sobre la marcha para aprovechar mejor el hardware. Los sistemas de serving modernos programan nuevas solicitudes en un lote en ejecución a medida que se liberan espacios, lo que aumenta el rendimiento de forma sustancial; el proyecto vLLM reporta un rendimiento hasta 24 veces superior al de la biblioteca estándar Hugging Face Transformers gracias a este tipo de gestión de memoria y batching.
Hardware y cuantización
La inferencia se ejecuta en CPUs, GPUs, TPUs u otros aceleradores. La cuantización reduce la precisión numérica de un modelo, por ejemplo de punto flotante de 16 bits o 32 bits a entero de 8 bits (INT8), punto flotante de 8 bits (FP8) o incluso 4 bits, para reducir el uso de memoria y acelerar la inferencia. Evaluaciones recientes concluyen que FP8 es prácticamente sin pérdidas en todos los tamaños de modelo, que INT8 bien ajustado pierde típicamente solo entre uno y tres por ciento de precisión, y que los formatos de solo pesos de 4 bits son más competitivos de lo que se asumía. La clave es que la cuantización implica compromisos que conviene medir, no dar por supuestos.
La capa de serving
Una capa de serving envuelve el modelo para que las aplicaciones puedan invocarlo. Las opciones consolidadas incluyen ONNX Runtime y NVIDIA Triton; para los modelos de lenguaje grandes, sistemas como vLLM se utilizan ampliamente porque su gestión de memoria y el batching continuo aumentan el rendimiento. La recuperación, cuando se utiliza, añade latencia porque el sistema debe obtener contenido antes de generar.
Ejemplos
Un asistente de atención al cliente que responde en tiempo real, donde la baja latencia es lo más importante.
Un trabajo en lote nocturno que puntúa miles de facturas, donde importa el rendimiento y la latencia no.
Visión en el borde en una línea de producción que detecta defectos, donde la inferencia se ejecuta localmente por velocidad y resiliencia.
Búsqueda y resumen, donde la recuperación añade un paso antes de que el modelo genere.
Puntuación nocturna de clientes potenciales, donde un modelo clasifica registros en bloque para que el equipo de ventas actúe al día siguiente.
Malentendidos frecuentes
"La inferencia y el entrenamiento son lo mismo." Son etapas distintas. El entrenamiento aprende; la inferencia aplica.
"Una solicitud en tiempo real actualiza el modelo." No es así. La inferencia estándar no modifica los pesos del modelo.
"La inferencia solo tiene que ver con la velocidad del modelo." También abarca el coste, la fiabilidad, la seguridad y el sistema de serving que la rodea.
"La inferencia en lote es simplemente tiempo real lento." El lote es un diseño deliberado para el volumen, no un servicio en tiempo real degradado.
"La optimización no tiene compromisos." La cuantización y el batching intercambian algo de precisión o latencia por velocidad o coste. Conviene medir el efecto.
"El modelo es el producto." El producto es el sistema servido: modelo más pipeline, controles y monitorización.
Riesgos y límites
Las entradas sensibles en los prompts requieren tratamiento, porque los datos pasan por el sistema en el momento de la inferencia.
Los retrasos y los umbrales importan. Las respuestas lentas o los umbrales de decisión mal configurados degradan la experiencia y pueden provocar acciones incorrectas.
La obsolescencia de la recuperación socava las respuestas cuando el contenido subyacente está desactualizado.
Subestimar el coste de la inferencia es habitual, porque el coste por uso escala con el volumen. Conviene modelarlo antes de escalar.
No hay garantía de veracidad factual. Un modelo puede producir una salida fluida pero incorrecta; la inferencia no verifica hechos.
La huella ambiental y de coste de ejecutar modelos a escala es real y debe monitorizarse.
Qué hacer a continuación
Conviene definir primero la necesidad del servicio: ¿es interactivo o en lote, y qué tiempo de respuesta es aceptable? Hay que hacer pruebas de rendimiento con carga realista antes de escalar, no solo con un único prompt de prueba. Separar el modelo del pipeline permite cambiar cada uno de forma independiente. Controlar el tamaño de la entrada es importante, ya que la longitud del prompt determina el coste y la latencia. Evaluar optimizaciones como la cuantización con los propios datos, midiendo cualquier cambio en la precisión. Instrumentar el servicio para latencia, tasa de error y coste, y diseñar alternativas para cuando el modelo sea lento o no esté disponible. La terminología de IA estandarizada y los marcos de riesgo reconocidos ayudan a establecer estas expectativas de forma coherente entre los equipos.
¿Tiene alguna pregunta o sugerencia, o desea saber cómo investigamos y revisamos estas guías? Lea sobre nuestros estándares editoriales y cómo contactarnos.
Preguntas frecuentes
¿La inferencia es lo mismo que hacerle una pregunta a ChatGPT?
Sí, ese es un ejemplo. Cuando el modelo genera una respuesta a su prompt, está ejecutando inferencia.
¿La inferencia entrena el modelo?
No. La inferencia estándar aplica un modelo fijo y no modifica sus pesos. El aprendizaje ocurre en el entrenamiento.
¿Cuál es la diferencia entre inferencia y serving?
La inferencia es ejecutar el modelo sobre una entrada. El serving es la maquinaria de producción que lo rodea y que gestiona las solicitudes, el escalado y la monitorización.
¿Cuál es la diferencia entre inferencia en lote e inferencia en línea?
La inferencia en línea responde a las solicitudes en tiempo real para uso interactivo. La inferencia en lote procesa muchos elementos juntos, a menudo de forma nocturna, cuando la inmediatez no es necesaria.
¿Por qué importa la longitud del prompt?
Los prompts más largos dan al modelo más que procesar, lo que aumenta tanto la latencia como el coste de cada respuesta.
¿Qué es la cuantización?
Reducir la precisión numérica de un modelo, por ejemplo a entero de 8 bits, punto flotante de 8 bits o 4 bits, para reducir la memoria y acelerar la inferencia, con un compromiso en precisión que conviene medir.
¿Por qué es una preocupación el coste de la inferencia si llamar a los modelos es barato?
Porque se paga por uso y el volumen se acumula. Los costes unitarios han caído de forma pronunciada, pero las cargas de trabajo de alto volumen siguen requiriendo presupuestación.
¿Qué hardware ejecuta la inferencia?
CPUs, GPUs, TPUs y otros aceleradores, elegidos según la carga de trabajo, el objetivo de latencia y el coste.
Fuentes
ISO/IEC 22989:2022 Information technology, Artificial intelligence, AI concepts and terminology (ISO/IEC). Standard definitions for training, inference and related AI concepts.
Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST AI 100-1 (NIST). Risk and measurement framing for deployed AI systems including testing and monitoring.
The 2025 AI Index Report (Stanford HAI). Evidence on the more-than-280-fold fall in inference cost and improving hardware efficiency.
Give Me BF16 or Give Me Death? Accuracy-Performance Trade-Offs in LLM Quantization (arXiv). Current evidence on FP8, INT8 and 4-bit quantization accuracy and deployment trade-offs.
