¿Qué es el aprendizaje federado?
Conocimiento, datos e integración
El aprendizaje federado es una forma de entrenar un modelo de IA compartido a partir de datos que permanecen en múltiples ubicaciones distintas, en lugar de copiarse en una base de datos central. Cada participante entrena localmente con sus propios datos y envía actualizaciones del modelo para su agregación, en vez de enviar registros sin procesar. Su principal atractivo es la minimización de datos y la colaboración entre conjuntos de datos fragmentados, pero el aprendizaje federado no es una garantía mágica de privacidad por sí solo y a menudo requiere controles adicionales como la agregación segura, la gobernanza y, en ocasiones, la privacidad diferencial.
Revisado por Jackie, Head of Learning & Development, Levellers - Última revisión: 8 de junio de 2026
Qué significa esto
El aprendizaje federado se entiende mejor como entrenamiento distribuido sin centralizar los datos sin procesar. En lugar de trasladar los registros de todos a un único lugar y entrenar allí, el proceso de entrenamiento se acerca a donde ya se encuentran los datos. Esos datos pueden residir en teléfonos, portátiles, vehículos, sensores, hospitales, bancos o unidades de negocio independientes.
Un modelo mental sencillo es el de un grupo de estudio. Cada participante trabaja de forma privada con sus propios apuntes y luego comparte únicamente lo que aprendió en forma de resumen, para que todo el grupo pueda mejorar una respuesta común. En el aprendizaje federado, esos resúmenes son actualizaciones del modelo, no los registros sin procesar subyacentes.
Existen dos patrones generales. El aprendizaje federado entre dispositivos implica un número muy elevado de dispositivos de usuario final, como teléfonos. El aprendizaje federado entre silos suele involucrar a un número menor de organizaciones o sistemas de gran escala, como hospitales, fabricantes, aseguradoras o bancos. La idea básica es la misma, pero el modelo operativo es diferente. Uno se enfrenta a una escala enorme y a la falta de fiabilidad de los dispositivos. El otro se ocupa más de la gobernanza del consorcio, la confianza y la coordinación entre organizaciones.
Es importante no exagerar lo que hace el aprendizaje federado. Reduce la necesidad de centralizar los datos sin procesar, lo cual es valioso. Pero eso no significa automáticamente que el sistema sea completamente privado, completamente seguro o automáticamente conforme. Las actualizaciones del modelo pueden seguir filtrando información si no se aplican protecciones adicionales. Por eso, el aprendizaje federado se entiende mejor como una elección de arquitectura orientada a la privacidad, no como una garantía completa de privacidad.
Por qué importa
El aprendizaje federado es relevante cuando los datos que se necesitan están fragmentados, son sensibles, difíciles de mover o políticamente complicados de agrupar. Muchas organizaciones se enfrentan exactamente a ese problema. Quieren un modelo que aprenda de patrones distribuidos entre sitios, regiones, dispositivos o unidades de negocio, pero no quieren, o no tienen permitido, reunir todos los datos sin procesar en un único lugar.
Para los responsables de tomar decisiones, el atractivo no es solo la privacidad, sino también el acceso. Un proyecto centralizado puede estancarse porque los propietarios de los datos se niegan a ceder sus conjuntos de datos, porque la confianza de los clientes se vería dañada, porque los costes de transferencia son elevados o porque los datos pierden valor al salir del entorno de origen. El aprendizaje federado puede desbloquear la colaboración allí donde la centralización no es viable.
Dicho esto, cambia la carga en lugar de eliminarla. Se intercambia un problema difícil, centralizar los datos, por otros problemas difíciles como la orquestación distribuida, la seguridad, la confianza entre participantes, la deriva del modelo y la gobernanza. Por eso los responsables deben entender no solo la promesa del aprendizaje federado, sino también la realidad operativa.
Cómo funciona
En una configuración típica de aprendizaje federado, un coordinador central parte de un modelo compartido. Ese modelo se envía a los clientes participantes. Un cliente puede ser un teléfono, un portátil, un nodo sensor o una organización con su propio entorno de entrenamiento local.
Cada cliente entrena el modelo localmente con sus propios datos. Los registros sin procesar permanecen donde están. Tras el entrenamiento local, el cliente devuelve una actualización del modelo, generalmente un conjunto de pesos o gradientes modificados, en lugar de los datos de entrenamiento subyacentes. El coordinador agrega entonces las actualizaciones de muchos clientes en un modelo global actualizado y envía la versión mejorada para una nueva ronda.
Este ciclo repetido es el núcleo del método: entrenamiento local, envío de una actualización, agregación, redistribución y repetición. Un enfoque conocido es el promediado federado, en el que el coordinador combina las actualizaciones del modelo entrenadas localmente en un nuevo modelo global. A lo largo de muchas rondas, el modelo compartido aprende de los patrones distribuidos entre los titulares de datos participantes.
En la práctica, los detalles importan mucho. Los entornos entre dispositivos pueden tener millones de participantes potenciales, pero solo un pequeño subconjunto está disponible en cada momento. Los dispositivos se desconectan, las redes son lentas, la batería y el ancho de banda son factores relevantes, y los conjuntos de datos locales varían considerablemente. Los entornos entre silos son más estables, pero suelen implicar una gobernanza más exigente. Las organizaciones participantes necesitan reglas sobre membresía, plazos, seguridad, propiedad del modelo, reversión, gestión de incidentes y quién asume cada coste.
Con frecuencia se añaden capas de privacidad adicionales. La agregación segura está diseñada para que el coordinador vea únicamente la actualización combinada de muchos participantes, no la contribución individual de cada uno. La privacidad diferencial puede incorporarse para limitar la influencia de cualquier participante en el modelo final y reducir el riesgo de memorización. Estas son técnicas relacionadas, pero no son lo mismo que el aprendizaje federado. El aprendizaje federado indica dónde ocurre el entrenamiento. La privacidad diferencial dice algo sobre la filtración de privacidad acotada. La agregación segura dice algo sobre quién puede ver qué actualizaciones.
La evaluación también es diferente en entornos federados. Como los datos no se agrupan de forma centralizada, las pruebas, la depuración y el análisis de equidad se vuelven más difíciles. Las distribuciones de datos no idénticas son habituales. Un sitio puede tener usuarios, dispositivos, idiomas o procesos muy distintos a los de otro. Un modelo que funciona bien en promedio puede seguir sirviendo mal a un participante concreto. Por eso, un proyecto federado serio necesita una medición y una gobernanza sólidas, no solo código de entrenamiento distribuido.
Por último, el aprendizaje federado no elimina los problemas de seguridad. Los participantes maliciosos o defectuosos pueden envenenar las actualizaciones. Los participantes honestos pueden seguir filtrando información a través de señales del modelo mal protegidas. La auditabilidad puede ser más difícil porque los datos permanecen en local. Por eso, un diseño práctico suele combinar el aprendizaje federado con controles de acceso, autenticación, agregación segura, métodos de agregación robustos, monitorización y acuerdos claros de consorcio.
Ejemplos
Un proveedor de teclado para móviles puede entrenar la predicción de la siguiente palabra en muchos teléfonos sin subir el texto escrito por cada usuario a un servidor central. Los teléfonos aportan actualizaciones del modelo, y el modelo compartido mejora a partir de los patrones de comportamiento generales de la base de usuarios.
Un grupo de hospitales puede colaborar en un modelo de apoyo al diagnóstico sin reunir todos los registros de pacientes en un único conjunto de datos maestro. Cada hospital mantiene el control local de sus propios datos y contribuye al entrenamiento a través de una infraestructura y una gobernanza acordadas.
Un grupo financiero con entidades regionales independientes puede entrenar modelos de detección de fraude a partir de almacenes de datos locales donde las restricciones regulatorias, contractuales o de confianza hacen poco atractiva la agrupación de datos sin procesar. El modelo compartido puede aprender patrones más amplios de los que cualquier región podría aprender por sí sola.
Una empresa industrial puede entrenar modelos de mantenimiento predictivo en flotas de equipos distribuidas entre distintas instalaciones o sitios de clientes. Los datos permanecen cerca de las máquinas que los generaron, lo que puede favorecer la confidencialidad y reducir los costes de transferencia de datos.
Malentendidos frecuentes
Un malentendido habitual es creer que "los datos nunca salen del dispositivo" significa que no se comparte nada sensible. Los registros sin procesar pueden permanecer en local, pero las actualizaciones del modelo, los metadatos o los registros de actividad pueden seguir generando riesgos de privacidad y seguridad.
Otro es confundir el aprendizaje federado con la privacidad diferencial. No son lo mismo. El aprendizaje federado es una arquitectura para el entrenamiento distribuido. La privacidad diferencial es una técnica adicional de privacidad que puede añadirse como capa superior.
Un tercer malentendido es que el aprendizaje federado elimina la necesidad de un coordinador central. Algunos diseños son más descentralizados, pero muchas implementaciones prácticas siguen dependiendo de un servidor orquestador o de un propietario de la federación.
Un cuarto malentendido es que el aprendizaje federado siempre es mejor que la centralización. Resulta útil en el contexto adecuado, pero si los datos pueden agruparse de forma segura y económica, el entrenamiento centralizado puede seguir siendo más sencillo y robusto.
Riesgos y limitaciones
El aprendizaje federado no es una solución mágica para la privacidad. Tanto la investigación como la práctica del sector demuestran que las actualizaciones individuales pueden seguir filtrando información si no están adecuadamente protegidas. Por eso importan la agregación segura, el recorte, el ruido y otros controles.
También introduce nuevas superficies de ataque. Las actualizaciones envenenadas, las puertas traseras, los participantes poco fiables y los datos locales sesgados pueden degradar el modelo compartido. En algunos entornos, el hecho de que el servidor vea menos puede dificultar el diagnóstico de ciertos fallos.
Existen también limitaciones de gobernanza. En los entornos entre silos, las organizaciones necesitan marcos de confianza para la participación, la gestión del cambio, la resolución de disputas y la retención. Si estos elementos faltan, el proyecto puede fracasar por razones administrativas aunque el diseño técnico sea sólido.
Y, como ocurre con cualquier método de IA intensivo en datos, este artículo no constituye asesoramiento legal, de seguridad ni de privacidad. Si se está considerando el aprendizaje federado para datos regulados o sensibles, sigue siendo necesaria una revisión especializada.
Qué hacer a continuación
En primer lugar, conviene tener clara la razón de negocio para considerar el aprendizaje federado. Si el problema es principalmente de conveniencia, puede existir un enfoque más sencillo. Si el problema es la sensibilidad de los datos, la fragmentación, la propiedad o las restricciones de transferencia, el aprendizaje federado puede justificar la complejidad adicional.
En segundo lugar, hay que identificar en qué patrón se encuentra la organización. Unas pocas organizaciones estables cooperando es un problema distinto al de millones de dispositivos de usuario que se incorporan y abandonan las rondas de entrenamiento.
En tercer lugar, conviene definir desde el principio los supuestos de confianza y amenaza. Quién coordina el entrenamiento, quién puede ver las actualizaciones, qué ocurre si un participante se ve comprometido y qué protecciones adicionales son necesarias.
En cuarto lugar, hay que preguntar cómo se refuerza la privacidad más allá de que "los datos permanezcan en local". Se debe buscar agregación segura, autenticación de participantes, recorte de actualizaciones, privacidad diferencial donde corresponda y monitorización frente al envenenamiento o la deriva.
En quinto lugar, conviene ejecutar un piloto que mida no solo la calidad del modelo, sino también la carga operativa. El aprendizaje federado solo merece la pena si el beneficio en privacidad y acceso a los datos justifica el esfuerzo adicional de coordinación e ingeniería.
¿Tiene alguna pregunta o sugerencia, o desea saber cómo investigamos y revisamos estas guías? Lea sobre nuestros estándares editoriales y cómo contactarnos.
Preguntas frecuentes
¿El aprendizaje federado es solo para teléfonos móviles?
No. Comenzó con ejemplos sólidos entre dispositivos, pero también se utiliza en entornos entre silos como la sanidad, las finanzas, la fabricación y otros entornos de múltiples organizaciones.
¿El aprendizaje federado significa que ningún dato sin procesar se centraliza nunca?
Ese suele ser el objetivo para los datos de entrenamiento, pero algunos metadatos, artefactos del modelo o estadísticas agregadas pueden seguir centralizándose según el diseño.
¿Es el aprendizaje federado suficientemente privado por sí solo?
No siempre. Mejora la minimización de datos, pero muchas implementaciones siguen necesitando agregación segura, privacidad diferencial u otras salvaguardas para reducir el riesgo de filtración.
¿Cuándo es el aprendizaje federado una mala opción?
Puede ser una mala opción cuando la gobernanza es débil, los participantes no están dispuestos a coordinarse, la depuración del modelo requiere visibilidad central, o los datos podrían agruparse de forma segura con mucha menos complejidad.
¿Qué debería preguntar primero un comprador a un proveedor?
Conviene preguntar por qué se utiliza el aprendizaje federado, qué datos permanecen en local, qué actualizaciones se comparten, qué controles de privacidad adicionales existen y quién posee y gobierna el modelo compartido.
Fuentes
Communication-Efficient Learning of Deep Networks from Decentralized Data (arXiv). Primary source. Introduced federated learning as training from decentralised data by aggregating locally computed updates and described the communication efficient FedAvg style approach. cite.
Advances and Open Problems in Federated Learning (arXiv and Foundations and Trends in Machine Learning). Primary survey source. Supported the description of federated learning as server orchestrated collaborative training with decentralised data and linked it to focused data collection and data minimisation. cite.
