¿Qué es la destilación de modelos?
Fundamentos, modelos y capacidades de IA
La destilación de modelos es el proceso de entrenar un modelo más pequeño, llamado estudiante, para que imite el comportamiento útil de un modelo más potente, llamado profesor. El objetivo es conservar gran parte de la capacidad práctica del profesor reduciendo el coste de ejecución, la latencia o los requisitos de hardware. Es una técnica de compresión y transferencia, no una categoría de modelo. Un modelo destilado puede ser pequeño, pero la destilación en sí es el método de entrenamiento utilizado para llegar a ese resultado.
Revisado por Jackie, Head of Learning & Development, Levellers - Última revisión: 8 de junio de 2026
Qué significa esto
La forma más sencilla de entender la destilación es a través de la metáfora del profesor y el estudiante. Ya se dispone de un modelo potente que funciona bien. En lugar de desplegarlo en todas partes a un coste elevado, se utiliza para generar señal de entrenamiento para un modelo más pequeño y económico. El modelo más pequeño aprende a copiar las partes que importan para la tarea.
Esa señal de entrenamiento puede adoptar varias formas. Puede ser la respuesta final del profesor, su distribución de probabilidad sobre las respuestas más probables, una justificación elaborada, una explicación o un estilo de respuesta preferido. El estudiante se entrena entonces con esas salidas para que su comportamiento se parezca más al del profesor de lo que lograría aprendiendo únicamente de datos etiquetados convencionales.
Por eso la destilación resulta atractiva en la práctica: permite a una organización usar un modelo más potente para generar una supervisión de mayor calidad para uno más débil. El resultado suele ser un modelo más barato de ejecutar y suficientemente bueno para una tarea más acotada.
También por eso la destilación no debe confundirse con el ajuste fino, la cuantización o la poda. Todos estos métodos pueden hacer un modelo más útil o eficiente, pero la destilación se refiere específicamente a transferir comportamiento de un profesor a un estudiante.
Por qué importa
Para quienes lideran organizaciones, la destilación importa porque cambia la economía de las tareas de IA repetitivas. Si un modelo premium es excelente pero caro, lento o difícil de desplegar a gran escala, la destilación ofrece una vía para capturar parte de ese valor en una forma más desplegable.
Esto es especialmente relevante cuando un flujo de trabajo es acotado pero de alto volumen: clasificación de solicitudes de soporte, verificación de políticas, redacción basada en plantillas, extracción controlada o asistencia de codificación guiada dentro de un entorno específico. En esos casos, un estudiante destilado más pequeño suele ofrecer la mayor parte del valor práctico a un coste por solicitud mucho menor.
La destilación también importa para la privacidad y el diseño del despliegue. Un modelo destilado puede ser lo suficientemente pequeño como para ejecutarse en un entorno más restringido, más cerca de los datos o bajo una infraestructura propia. Eso puede hacer que la adopción de la IA sea más viable en contextos que no pueden depender por completo de un modelo frontera remoto para cada interacción.
Igualmente importante: la destilación es una forma de convertir el conocimiento experimental en un activo de producción. Un equipo puede explorar una tarea con un modelo profesor más potente, aprender cómo es un resultado "bueno" y luego comprimir ese comportamiento en un modelo más adecuado para el uso operativo cotidiano.
Cómo funciona
La destilación clásica parte de un modelo profesor y un modelo estudiante. El profesor suele ser más grande, más capaz, o ambas cosas. El estudiante es más pequeño, más económico o más fácil de desplegar. La idea no es copiar los parámetros directamente, sino entrenar al estudiante en el comportamiento del profesor.
En las primeras formas de destilación, el profesor proporcionaba objetivos suaves. En lugar de aprender únicamente a partir de una etiqueta dura como "clase A", el estudiante aprendía de la distribución de probabilidad completa del profesor, que contiene información más rica sobre qué alternativas el profesor consideraba plausibles. Eso ayuda al estudiante a aprender las relaciones entre clases y los límites de decisión de forma más eficaz.
En los modelos de lenguaje, la destilación puede ocurrir en distintos niveles. Un enfoque utiliza texto de salida: se envían instrucciones representativas al profesor, se recopilan las respuestas y se entrena al estudiante con esos pares entrada-salida. Otro enfoque utiliza probabilidades a nivel de token o representaciones intermedias, lo que puede transferir más matices si la pila de entrenamiento lo permite. Un tercer enfoque utiliza justificaciones o pasos intermedios elaborados, de modo que el estudiante no aprende solo la respuesta final, sino también parte del patrón de razonamiento que la sustenta.
Un proyecto de destilación práctico suele tener varias etapas.
En primer lugar, se elige la tarea. La destilación funciona mejor cuando el comportamiento objetivo está claro. "Ser brillante en general" es demasiado amplio. "Clasificar los correos electrónicos de compras entrantes en cinco categorías y extraer el ID del proveedor si está presente" es mucho mejor.
En segundo lugar, se define el profesor. Puede ser un modelo frontera, un modelo abierto potente o incluso un conjunto de varios sistemas. En algunos casos, el profesor no es un único modelo sino una combinación de salida de modelo y corrección humana.
En tercer lugar, se construye el conjunto de datos de destilación. Este es un paso crucial. Las instrucciones utilizadas para la destilación deben reflejar el tráfico real y los casos límite que importan. Si el conjunto de datos es estrecho, el estudiante también lo será. Si el profesor recibe instrucciones deficientes, el estudiante puede heredar esa debilidad. Si los datos no son representativos, el proyecto puede parecer bueno fuera de línea y decepcionar en la práctica.
En cuarto lugar, se entrena al estudiante. Esto puede parecerse al ajuste fino supervisado, pero la supervisión proviene en parte o en gran medida del profesor. En algunos flujos de trabajo, la destilación se integra con el ajuste fino para que el estudiante aprenda tanto de las salidas del profesor como de las etiquetas de referencia. En otros, el profesor produce justificaciones además de respuestas, lo que proporciona al estudiante una supervisión más rica.
Este enfoque basado en justificaciones es importante porque muestra que la destilación está evolucionando. Ya no se trata solo de comprimir las salidas finales de un modelo. Algunos métodos más recientes buscan transferir un patrón interno más útil de resolución de problemas. Un ejemplo destacado es la "destilación paso a paso", en la que un modelo más grande produce primero justificaciones intermedias y un modelo más pequeño se entrena con esas justificaciones junto con las etiquetas finales de la tarea. Eso puede reducir la cantidad de datos etiquetados necesarios y, en ocasiones, permitir que un modelo más pequeño supere al ajuste fino estándar.
También existen variantes arquitectónicas. Algunos proyectos de destilación comprimen un modelo durante el preentrenamiento; otros ocurren después del preentrenamiento para una tarea específica. Algunos métodos destilan capas intermedias, patrones de atención o embeddings. Otros utilizan la autodestilación, en la que un modelo entrena a una versión más pequeña de sí mismo o incluso a una versión posterior.
Es importante señalar que la destilación no produce magia. Un modelo estudiante tiene un techo de capacidad. No conservará perfectamente todas las capacidades de un profesor mucho más grande, especialmente si la tarea objetivo es amplia o requiere mucho razonamiento. La destilación consiste en una transferencia selectiva bajo restricciones.
También interactúa con otros métodos de eficiencia. Un equipo puede destilar primero y luego cuantizar al estudiante para el despliegue, o podar un modelo y usar la destilación para recuperar parte de la calidad perdida. Esta es una razón por la que la destilación y los modelos de lenguaje pequeños están relacionados pero son distintos: la destilación es un método, y el estudiante resultante puede convertirse en un SLM, pero el método también puede producir modelos especializados de tamaño intermedio.
En producción, el proyecto debe terminar con la evaluación, no con el entrenamiento. Se necesita un conjunto de pruebas de referencia, comparaciones directas con el profesor, verificaciones de regresiones de seguridad y muestreo de tráfico realista. Es habitual que un estudiante imite tanto los puntos fuertes del profesor como sus atajos. Por tanto, si el profesor es excesivamente confiado, frágil o sesgado de alguna manera, el estudiante puede heredar esas características también.
Un aspecto que ha ganado visibilidad recientemente son los límites de permisos y contratos. La destilación es técnicamente habitual y legítima cuando se destilan modelos propios o cuando el proveedor lo permite. Puede volverse problemática si se utilizan las salidas de un modelo de terceros para entrenar un modelo competidor incumpliendo la licencia o los términos de uso. Quienes lideran proyectos deben separar el método técnico del derecho legal a aplicarlo.
En su mejor versión, la destilación es imitación disciplinada: se usa un profesor potente para generar señal de entrenamiento que de otro modo sería costosa de obtener, y luego se comprime esa señal en un estudiante más barato de ejecutar donde realmente importa.
Ejemplos
Un equipo de soporte puede comenzar con un modelo premium que gestiona bien los correos electrónicos difíciles de clientes. Tras recopilar un conjunto representativo de instrucciones y respuestas revisadas, el equipo destila ese comportamiento en un modelo más pequeño que clasifica la intención, redacta notas estructuradas y sugiere el siguiente paso a un coste menor.
Un equipo de políticas puede usar un modelo profesor más potente para evaluar si el contenido borrador cumple con un estilo interno o un estándar de riesgo, y luego destilar ese patrón de juicio en un estudiante especializado para la revisión inicial cotidiana.
Un equipo de operaciones financieras puede destilar el comportamiento de codificación de facturas de un modelo grande en un modelo interno más pequeño utilizado para envíos rutinarios, mientras sigue escalando los casos inusuales al profesor original o a un revisor humano.
Una organización de software puede usar un modelo de codificación potente como profesor para tareas específicas del repositorio, y luego desplegar un estudiante más pequeño para asistencia local, autocompletado o transformaciones de código restringidas dentro del flujo de trabajo de desarrollo.
Malentendidos frecuentes
Un malentendido habitual es creer que la destilación equivale a copiar un modelo. No es así: el estudiante se entrena para imitar el comportamiento, no para heredar los pesos directamente.
Otro es que la destilación y el ajuste fino son sinónimos. Pueden parecerse en la forma del flujo de trabajo, pero el ajuste fino generalmente consiste en adaptar un modelo a una tarea con datos de entrenamiento, mientras que la destilación utiliza específicamente la supervisión generada por el profesor como parte de esa adaptación.
Un tercer malentendido es que un estudiante destilado conservará todos los puntos fuertes del profesor. Por lo general, conserva los más transferibles para la tarea elegida y pierde algo de amplitud.
Los equipos también asumen que si el estudiante es más barato de ejecutar, el proyecto es automáticamente más económico en su conjunto. La destilación tiene un coste inicial en generación de datos, entrenamiento, evaluación y gobernanza. Resulta rentable cuando la carga de trabajo objetivo es suficientemente frecuente.
Por último, algunas personas asocian la destilación exclusivamente con los laboratorios de modelos frontera. En realidad, el método está cada vez más disponible a través de plataformas de IA convencionales y herramientas abiertas, aunque la calidad de la ejecución sigue siendo muy importante.
Riesgos y límites
El primer riesgo es el error heredado. Los sesgos, los puntos ciegos y los malos hábitos del profesor pueden transferirse al estudiante. Si el profesor ofrece un razonamiento pulido pero incorrecto, el estudiante puede aprender el mismo patrón.
El segundo es la falsa confianza en los benchmarks. Un estudiante puede obtener buenas puntuaciones en conjuntos de pruebas acotados y aun así fallar en los casos límite que importan para el negocio. La calidad de la destilación depende en gran medida de las instrucciones y los ejemplos elegidos para el entrenamiento.
El tercero es de carácter legal y contractual. Usar las salidas de otro proveedor para entrenar un modelo competidor puede vulnerar los términos de licencia o de servicio. Eso no cambia la definición técnica de la destilación, pero sí cambia absolutamente si conviene aplicarla.
El cuarto es la deriva en materia de seguridad. Un modelo más pequeño entrenado para imitar respuestas útiles puede no conservar todo el comportamiento de seguridad y rechazo del profesor, a menos que esos comportamientos se incluyan y prueben explícitamente.
Este artículo no constituye asesoramiento jurídico. Si se utilizan salidas de modelos de terceros, contenido de clientes o datos regulados en un flujo de destilación, conviene revisar los derechos exactos, los contratos y las obligaciones de tratamiento de datos antes de proceder.
Próximos pasos
Elija un único flujo de trabajo acotado con volumen suficiente para justificar el esfuerzo. La destilación resulta más rentable cuando la tarea se repite con frecuencia y el modelo profesor actual es claramente demasiado caro o pesado para cada solicitud.
A continuación, cree un conjunto de evaluación sólido antes de entrenar. Incluya casos normales, casos difíciles y casos de fallo críticos para el negocio. Sin esto, no es posible determinar si el estudiante es realmente suficientemente bueno.
Después, confirme los derechos y las entradas. Asegúrese de que está autorizado a usar las salidas del profesor de la forma prevista, y de que los datos sensibles se gestionan adecuadamente a lo largo del registro, el almacenamiento y el entrenamiento.
Luego, genere los datos del profesor con cuidado. Las instrucciones de calidad y los ejemplos revisados son fundamentales. Destilar un comportamiento descuidado solo produce un modelo más pequeño igualmente descuidado.
Por último, despliegue de forma gradual. Comience con una evaluación en paralelo o con tráfico limitado, mida el desacuerdo con el profesor y con personas, y defina rutas de respaldo explícitas. Un buen programa de destilación trata al estudiante como un modelo operativo que gana confianza paso a paso.
¿Tiene alguna pregunta o sugerencia, o desea saber cómo investigamos y revisamos estas guías? Lea sobre nuestros estándares editoriales y cómo contactarnos.
Preguntas frecuentes
¿Es la destilación lo mismo que la compresión de modelos?
La destilación es una forma de compresión de modelos y transferencia de capacidades, pero no la única. La cuantización y la poda son otros métodos habituales.
¿Es la destilación lo mismo que el ajuste fino?
No. El ajuste fino adapta un modelo con datos de entrenamiento. La destilación utiliza específicamente el comportamiento de un modelo profesor como supervisión.
¿La destilación siempre produce un modelo de lenguaje pequeño?
No siempre. El estudiante suele ser más pequeño, pero la idea central es el proceso de transferencia profesor-estudiante, no un tamaño objetivo fijo.
¿Puede un modelo destilado igualar al profesor?
En una tarea acotada, a veces casi. En tareas más amplias o complejas, generalmente no de forma completa.
¿Qué tipo de datos necesita la destilación?
Necesita instrucciones representativas y salidas del profesor, combinadas habitualmente con etiquetas de referencia, justificaciones o revisión humana para la calibración.
¿Existen problemas legales con la destilación?
Sí, pueden existir. El método es técnicamente habitual, pero si se pueden usar las salidas de un profesor concreto para el entrenamiento depende de los derechos y los términos aplicables.
Fuentes
Distilling the Knowledge in a Neural Network (arXiv). Primary academic source for the original teacher-student distillation concept and the idea of compressing stronger systems into cheaper deployable models.
DistilBERT: a distilled version of BERT (arXiv). Primary academic source for a widely known distillation example, including the claim that DistilBERT reduced BERT size by 40 percent while retaining 97 percent of language understanding performance and running 60 percent faster.
TinyBERT: Distilling BERT for Natural Language Understanding (arXiv). Primary academic source for another canonical distillation example, including the two-stage distillation framework and the 7.5x smaller and 9.4x faster result.
AI Insights: Model Distillation (GOV.UK). Primary public-sector source for a concise practical summary of benefits, implementation phases, and use case framing for leaders.
