¿Qué son los datos sintéticos?
Conocimiento, datos e integración
Los datos sintéticos son datos generados artificialmente en lugar de recopilados directamente de personas reales, transacciones, dispositivos o eventos. Por lo general, se crean para imitar la estructura o los patrones estadísticos de datos reales, de modo que los equipos puedan probar sistemas, entrenar modelos, compartir datos de forma más segura o cubrir vacíos donde los datos reales escasean. Pueden ser muy útiles, pero no son automáticamente anónimos, precisos ni adecuados para todos los fines, por lo que siguen requiriendo una evaluación cuidadosa en cuanto a utilidad, privacidad y sesgo.
Revisado por Jackie, Head of Learning & Development, Levellers - Última revisión: 8 de junio de 2026
Qué significa esto
Una forma sencilla de entender los datos sintéticos es como un sustituto realista. En lugar de entregar a un equipo una base de datos de clientes en producción, un conjunto de registros hospitalarios o un mes de registros de producción, se generan nuevos registros que se parecen y se comportan lo suficiente como los reales para ser útiles. Las filas, imágenes, textos o eventos son inventados, pero el objetivo es que los patrones que contienen sigan reflejando algo importante sobre el mundo real. Esto distingue a los datos sintéticos de los simples "datos de prueba", que a menudo tienen el formato correcto pero carecen de estructura útil.
Los datos sintéticos se presentan en varias formas. Pueden ser completamente sintéticos, cuando los registros publicados son generados íntegramente por un modelo, o parcialmente sintéticos, cuando algunos campos se reemplazan mientras otras partes permanecen vinculadas a los registros originales. También pueden usarse como aumento de datos, donde los datos reales siguen siendo el activo principal y se añaden ejemplos sintéticos para mejorar la cobertura de casos poco frecuentes o situaciones límite. En la práctica, quienes lideran equipos no necesitan memorizar estas etiquetas, pero sí deben saber que "sintético" no es una sola cosa. La forma en que se generan afecta su fiabilidad.
Este tema suele confundirse con los datos de entrenamiento, pero no son lo mismo. Los datos sintéticos describen de dónde provienen los datos y cómo se generaron. Los datos de entrenamiento describen el papel que desempeñan los datos cuando un modelo aprende. Algunos datos sintéticos se usan para el entrenamiento. Otros se usan para pruebas, validación o desarrollo de software. Algunos solo se usan para compartir información de forma más segura entre equipos. La distinción importa porque un conjunto de datos puede ser sintético sin intervenir nunca en el entrenamiento de un modelo, y un conjunto de entrenamiento puede contener pocos o ningún dato sintético.
También es importante separar los datos sintéticos de la anonimización. La ICO señala explícitamente que los datos sintéticos pueden ser o no anónimos. Si el conjunto sintético se parece demasiado a los datos fuente reales, o si aún es posible inferir a personas concretas a partir de él, puede seguir generando riesgos para la privacidad. Por tanto, el modelo mental correcto no es "falso equivale a seguro", sino "los datos generados pueden reducir algunos riesgos, pero el riesgo residual depende del método, el contexto y las pruebas realizadas".
Por qué es importante
Los datos sintéticos importan porque las cosas que las organizaciones más desean hacer con los datos son, con frecuencia, las que los datos reales hacen más difíciles. Los registros de clientes en producción, los datos de pacientes y los registros de sistemas conllevan obligaciones de privacidad, restricciones de acceso y consecuencias reales si se filtran. Los sustitutos sintéticos permiten a los equipos construir, probar y compartir con mayor libertad, manteniendo el original sensible fuera de peligro.
También es una respuesta práctica a la escasez. Cuando un equipo necesita probar un escenario poco frecuente, entrenar un modelo con casos que casi nunca ocurren, o trabajar antes de que existan suficientes datos reales, generar ejemplos realistas puede desbloquear un trabajo que de otro modo quedaría paralizado. Bien utilizado, acelera el desarrollo y amplía quién puede trabajar con datos de forma segura.
La razón por la que merece un manejo cuidadoso es que los datos sintéticos son fáciles de malinterpretar como exentos de riesgo. No son automáticamente anónimos, precisos ni representativos, y un modelo entrenado con datos que difieren silenciosamente de la realidad puede fallar de formas difíciles de detectar. El valor es real, pero depende de comprender qué reproduce fielmente el conjunto sintético y qué no.
Cómo funciona
El proceso comienza con un propósito. Antes de generar un solo registro sintético, la organización debe decidir para qué sirve el conjunto de datos. ¿El objetivo es permitir que los ingenieros prueben una aplicación sin exponer datos reales de clientes? ¿Entrenar un modelo de detección de fraude donde los casos genuinos son escasos? ¿Compartir datos con un proveedor? ¿Evaluar un sistema de IA? El nivel de realismo requerido varía según la tarea. Un conjunto de datos suficientemente bueno para pruebas de software puede estar muy lejos de ser adecuado para entrenamiento o análisis de políticas. La guía de NIST sobre utilidad lo señala con claridad: no existe una medida única de calidad para los datos sintéticos.
Una vez definido el propósito, los equipos eligen un método de generación. Para datos tabulares, esto puede implicar síntesis estadística, modelado probabilístico o un generador de datos sintéticos especializado que intente reproducir las relaciones entre variables. Para imágenes o datos de sensores, puede ser simulación, renderizado o un modelo generativo. Para texto, puede significar el uso de reglas, plantillas o modelos de lenguaje para crear registros realistas pero inventados. Algunas organizaciones combinan datos reales de origen con reglas de dominio. Otras crean ejemplos sintéticos casi en su totalidad mediante simulación. El método debe adaptarse al dominio. Una transcripción realista de un centro de atención al cliente, una tabla de reclamaciones médicas y un flujo de sensores de almacén no fallan de la misma manera.
Si se utilizan datos reales como base para la generación, esos datos fuente siguen necesitando una gobernanza adecuada. La ICO señala que, por lo general, será necesario procesar algunos datos reales para estimar parámetros realistas, y que ese procesamiento previo debe cumplir con la ley de protección de datos si esos registros se refieren a personas identificables. Esto importa porque muchos equipos se centran únicamente en el conjunto sintético publicado y olvidan los controles legales y operativos en torno al conjunto fuente y al proceso de generación.
Tras la generación llega la parte más difícil: la evaluación. Hay al menos tres aspectos que valorar. Primero, la fidelidad: ¿preserva el conjunto sintético las propiedades estadísticas, las correlaciones y la estructura que importan para la tarea? Segundo, la utilidad: ¿permite el análisis, las pruebas o el rendimiento del modelo que realmente se necesita? Tercero, la privacidad: ¿con qué facilidad podría inferirse información sobre personas reales a partir del conjunto publicado? NIST ha desarrollado herramientas y trabajos de referencia específicamente en torno a esta disyuntiva entre privacidad y utilidad, lo que refleja la centralidad de esa pregunta.
Las comprobaciones de utilidad deben ser tanto específicas para la tarea como estadísticas. Una tabla sintética de clientes que coincida con las distribuciones medias de edad e ingresos puede seguir siendo inútil si rompe las relaciones que importan para modelar la tasa de abandono. Un conjunto sintético de imágenes puede parecer convincente a una persona, pero enseñar a un modelo de visión las señales equivocadas. Por eso, los equipos sólidos prueban los datos sintéticos frente a la tarea real, no solo frente a gráficos de resumen. Esto suele implicar mantener un conjunto de datos reales de reserva con acceso estrictamente controlado y comprobar si los modelos entrenados o desarrollados con datos sintéticos siguen funcionando de forma aceptable con casos reales.
Las comprobaciones de privacidad son igual de importantes. NIST describe los conjuntos de datos sintéticos como aquellos que tienen el mismo esquema e intentan mantener las propiedades de los datos originales, y en los datos sintéticos con privacidad diferencial esto va acompañado de una garantía formal de privacidad. Pero fuera de esas garantías más sólidas, el riesgo residual puede ser difícil de evaluar. La ICO advierte que las personas inusuales en los datos fuente pueden seguir siendo inferidas si registros inusuales similares sobreviven en la publicación sintética. Esto significa que el riesgo de privacidad aceptable depende del contexto, la capacidad del atacante y el nivel de realismo que requiere el proyecto.
Por eso los datos sintéticos suelen funcionar mejor cuando el objetivo es concreto y explícito. "Necesitamos datos seguros pero realistas para probar el flujo de trabajo completo en nuestro producto" es un caso de uso sólido. "Queremos un único conjunto sintético que pueda sustituir todo el acceso a los datos de producción para cualquier fin" generalmente no lo es. Cuanto más amplio es el caso de uso, más difícil resulta preservar la estructura correcta y al mismo tiempo reducir el riesgo de divulgación.
La privacidad diferencial merece una mención breve porque a menudo se asocia con los datos sintéticos en debates serios. Los datos sintéticos con privacidad diferencial intentan ofrecer una garantía de privacidad demostrable para las personas del conjunto fuente, preservando al mismo tiempo una estructura agregada útil. Esto puede ser muy valioso, pero conlleva sus propias compensaciones en precisión y complejidad. No es el modo predeterminado de generación de datos sintéticos, y quienes lideran proyectos no deben asumir que todo proveedor que use la expresión "datos sintéticos" ofrece ese nivel de protección.
Ejemplos
Un banco puede querer que sus ingenieros prueben un nuevo flujo de incorporación sin conceder acceso amplio a las cuentas reales de clientes. Un conjunto de datos sintéticos puede proporcionar combinaciones realistas de transacciones, direcciones, indicadores de riesgo y estados de cuenta, de modo que el software se comporte como lo haría en producción, reduciendo la necesidad de distribuir datos personales reales en múltiples entornos de desarrollo. Este es un caso de uso clásico de ingeniería.
Un fabricante que construye un modelo de detección de defectos puede tener miles de ejemplos de productos normales y muy pocos de fallos poco frecuentes. El aumento sintético puede ayudar a crear imágenes adicionales de defectos o trazas de sensores, de modo que el modelo vea más ejemplos de la clase minoritaria durante el entrenamiento y las pruebas. El objetivo no es inventar la realidad, sino dar al modelo mayor exposición a casos que el historial apenas contiene.
Una organización sanitaria o del sector público también puede usar datos sintéticos para que los analistas prototipicen flujos de trabajo, documentación o controles de acceso antes de que se complete el proceso de aprobación de los datos reales. En esos contextos, el conjunto sintético no sustituye a la validación final, sino que reduce el tiempo perdido mientras el proceso de gobernanza real continúa en paralelo.
Un equipo de atención al cliente podría generar conversaciones sintéticas para probar un asistente de clasificación o un flujo de trabajo de resumen antes de usar transcripciones reales a gran escala. La ventaja es la velocidad y una iteración más segura en las primeras etapas. El riesgo es que las conversaciones sintéticas pueden ser demasiado limpias y predecibles, lo que puede ocultar el lenguaje desordenado y la ambigüedad que traen los clientes reales. Por eso los datos sintéticos suelen ser más útiles en el desarrollo inicial y en el aumento dirigido, más que como única fuente de verdad.
Malentendidos frecuentes
Un malentendido habitual es que los datos sintéticos son simplemente "datos falsos". En la práctica, los datos sintéticos útiles se diseñan para preservar patrones específicos que importan para un uso determinado. Eso es muy diferente de simples valores de marcador de posición. Si no se preserva la estructura, el conjunto de datos puede ser fácil de compartir, pero no será útil.
Otro es que los datos sintéticos son automáticamente anónimos. No lo son. La ICO lo afirma directamente. Dependiendo de cómo se generaron los datos y de lo que aún pueda inferirse, los datos sintéticos pueden seguir implicando riesgos para la privacidad y requerir un tratamiento cuidadoso.
Un tercer malentendido es que los datos sintéticos pueden sustituir a los datos reales en todos los contextos. A veces pueden reemplazar los datos reales para una tarea específica de desarrollo o intercambio. Con frecuencia no pueden sustituir la necesidad de validación en el mundo real. La postura prudente es que los datos sintéticos deben ganarse la confianza caso por caso.
Un cuarto es que más realismo siempre es mejor. En realidad, la privacidad y la utilidad suelen estar en tensión. Demasiado realismo puede aumentar el riesgo de divulgación. Demasiado poco puede destruir la utilidad. El equilibrio adecuado depende de la tarea.
Riesgos y límites
Los datos sintéticos pueden reproducir las debilidades de los datos reales en los que se basaron. Si los datos fuente están sesgados, son incompletos o están históricamente distorsionados, la versión sintética puede preservar esas distorsiones o incluso hacerlas más difíciles de detectar. También puede suavizar casos poco frecuentes que importan comercial o éticamente. En resumen, los datos sintéticos pueden reducir el riesgo de acceso y al mismo tiempo preservar el riesgo de calidad.
También existe un límite práctico en torno a la evidencia. Un proveedor puede afirmar que un conjunto de datos sintéticos es "seguro para la privacidad" o "apto para producción", pero sin una descripción clara de cómo se evaluaron la utilidad y el riesgo de divulgación, esa afirmación debe considerarse incompleta. Una evidencia sólida suele incluir validación específica para la tarea, pruebas de divulgación, limitaciones conocidas y documentación sobre para qué no deben usarse los datos sintéticos.
Por último, los datos sintéticos no eliminan el juicio legal o profesional. Si se utilizaron datos personales reales para crearlos, el procesamiento fuente sigue siendo relevante. Si el conjunto sintético respalda una decisión regulada o de alto riesgo, el sistema final sigue necesitando pruebas en condiciones reales que reflejen el despliegue. Este artículo es una guía práctica, no asesoramiento legal, de privacidad ni estadístico.
Próximos pasos
Comience con un caso de uso concreto donde los datos sintéticos tengan una función clara. Buenos primeros candidatos son las pruebas de producto, los entornos de pruebas para socios, el aumento de modelos para eventos poco frecuentes o la creación de prototipos seguros para analistas. Evite mandatos amplios como "sustituir los datos de producción por datos sintéticos en todos los contextos".
Luego plantéese cuatro preguntas sencillas. Qué decisión respaldará este conjunto de datos. Qué propiedades deben preservarse. Qué riesgo de privacidad permanece tras la generación. Cómo se probará la utilidad en condiciones del mundo real. Si el equipo no puede responder con claridad a esas preguntas, el proyecto no está listo.
Mantenga los datos fuente reales bajo un control estricto, documente el método de generación y exija un paquete de evaluación que cubra fidelidad, utilidad y riesgo de divulgación. Si el caso de uso afecta a datos sensibles de personas o a procesos regulados, involucre desde el principio a los responsables de privacidad, seguridad y dominio. Los datos sintéticos suelen ser más valiosos cuando acortan un trabajo cuidadoso, no cuando intentan evitarlo.
¿Tiene alguna pregunta o sugerencia, o desea saber cómo investigamos y revisamos estas guías? Lea sobre nuestros estándares editoriales y cómo contactarnos.
Preguntas frecuentes
¿Son los datos sintéticos lo mismo que los datos anonimizados?
No. Los datos sintéticos pueden reducir la identificabilidad, pero la ICO es clara al señalar que pueden ser o no anónimos dependiendo de cómo se crearon y de lo que aún pueda inferirse de ellos.
¿Pueden usarse datos sintéticos para entrenar modelos de IA?
Sí. La guía de OECD señala que los datos sintéticos pueden usarse para entrenar IA cuando los datos reales son escasos o confidenciales, pero la calidad del modelo y el sesgo siguen debiendo comprobarse frente al uso real.
¿Son los datos sintéticos útiles solo para grandes empresas?
No. Las organizaciones más pequeñas pueden usarlos para un desarrollo más seguro, demostraciones, pruebas y casos de uso de aumento dirigido. La cuestión clave no es el tamaño de la empresa, sino si el conjunto sintético es suficientemente bueno para la tarea declarada.
¿Cómo se evalúa si un conjunto de datos sintéticos es bueno?
Probando su utilidad para la tarea, no solo su apariencia de realismo. Una buena práctica comprueba conjuntamente la fidelidad estadística, el rendimiento en la tarea y el riesgo de divulgación.
¿La privacidad diferencial viene incluida por defecto en los datos sintéticos?
No. La privacidad diferencial es un marco matemático específico de privacidad. Algunos conjuntos de datos sintéticos lo utilizan; muchos no.
¿Cuándo conviene evitar depender de datos sintéticos?
Conviene ser cauteloso cuando la decisión final es de alto riesgo, cuando los casos límite del mundo real son los más importantes, o cuando el conjunto sintético no puede validarse frente a datos reales controlados.
Fuentes
Glossary (Information Commissioner's Office). Primary. Definition of synthetic data and the point that it may or may not be anonymous.
How should we assess security and data minimisation in AI? (Information Commissioner's Office). Primary. Limits of synthetic data, source data processing duties, and inference or re identification risk.
Differentially Private Synthetic Data (NIST). Primary. Explanation that synthetic data aims to preserve structure and properties, and when differential privacy adds a formal privacy guarantee.
Guidelines for Evaluating Differential Privacy Guarantees (NIST). Primary. Privacy evaluation concepts, synthetic data characteristics, and the need to weigh privacy and utility.
SDNist v2 Deidentified Data Report Tool (NIST). Primary. Evidence that synthetic and deidentified data should be evaluated with explicit metrics rather than assumed to be safe or useful.
HLG-MOS Synthetic Data Test Drive Guide (NIST). Primary. Utility and privacy evaluation workflow for synthetic data.
