Qué son los datos sintéticos
Los datos sintéticos son conjuntos de datos generados artificialmente que reproducen las propiedades estadísticas y los patrones de datos reales, sin contener información de personas o entidades concretas. No son datos inventados al azar: se producen a partir de modelos entrenados sobre datos originales, con el objetivo de generar un conjunto estadísticamente representativo y funcional para un propósito específico.
Como señala la Agencia Española de Protección de Datos (AEPD) en su documento sobre el tema, para que un conjunto de datos pueda considerarse sintético tiene que preservar las características y propiedades de los datos reales para ese caso de uso concreto. Si no cumple ese umbral mínimo de utilidad, no puede clasificarse como datos sintéticos válidos.
En la práctica, esto significa que un modelo de datos sintéticos puede reproducir, por ejemplo, la distribución de edades de una cohorte de pacientes, los patrones de transacciones de una cartera de clientes o los registros de fallos de una línea de producción, sin que ninguno de esos datos corresponda a una persona o a un evento real. El valor está en que conservan la lógica interna del fenómeno original.
Tipos de datos sintéticos: no todos son iguales
Antes de evaluar si los datos sintéticos encajan en un proyecto, conviene distinguir entre los tres tipos principales, porque sus usos y garantías son distintos.
Datos sintéticos totales
Son conjuntos generados íntegramente de forma artificial, sin ningún registro del mundo real. Se construyen estimando las distribuciones estadísticas del conjunto original y generando nuevas muestras a partir de ellas.
Su principal ventaja es la máxima protección de privacidad; su limitación, que pueden perder variabilidad en fenómenos muy heterogéneos o poco frecuentes. Son el recurso habitual para entornos de desarrollo y pruebas de software donde el acceso a datos reales está completamente restringido.
Datos sintéticos parciales
Parten de datos reales pero sustituyen únicamente los atributos más sensibles (nombres, identificadores, datos de contacto, información clínica identificable) por valores artificiales. El resto del registro mantiene su estructura original.
Son especialmente útiles cuando se necesita preservar la coherencia de los datos de negocio pero no se pueden compartir los atributos personales, por ejemplo, al colaborar con un proveedor externo o al pasar datos a un entorno de analítica de terceros.
Datos sintéticos híbridos
Combinan registros reales con registros completamente sintéticos. Se utilizan cuando el volumen de datos reales es insuficiente y se necesita ampliar el conjunto de entrenamiento manteniendo parte de la variabilidad original. Es la modalidad más habitual en proyectos de machine learning donde los datos reales existen pero son escasos.
Cómo se generan los datos sintéticos
El método de generación determina en gran medida la calidad y la fiabilidad del resultado. No existe un único enfoque válido para todos los casos.
- Los modelos estadísticos clásicos analizan las distribuciones del conjunto original y generan muestras a partir de ellas. Son adecuados cuando las relaciones entre variables son conocidas y bien definidas, y cuando el conjunto de datos no es excesivamente complejo. Su principal ventaja es la interpretabilidad: es más fácil auditar por qué el modelo genera lo que genera.
- Las redes generativas adversariales (GAN) operan con dos redes neuronales en competición: una que genera datos y otra que intenta distinguirlos de los reales. Esta competición iterativa produce resultados de alta fidelidad, especialmente útiles para datos de imagen o conjuntos con relaciones muy complejas entre variables. Son el método más utilizado actualmente en proyectos de salud y visión por computador, aunque requieren grandes volúmenes de datos de partida y capacidad computacional significativa.
- Los autoencoders variacionales (VAE) aprenden una representación comprimida de los datos originales y generan nuevas muestras a partir de ella. Son más estables que las GAN durante el entrenamiento y producen resultados más controlables, aunque su fidelidad en datos muy heterogéneos puede ser inferior.
La elección del método no es una decisión técnica menor. Depende del tipo de datos, del volumen disponible, del nivel de privacidad requerido y del propósito final del conjunto sintético.
Cuándo tiene sentido usar datos sintéticos
Los datos sintéticos aportan valor real en tres situaciones concretas. Fuera de ellas, conviene evaluar otras alternativas antes de asumir que son la solución adecuada.
- Cuando el volumen de datos reales es estructuralmente bajo.
En enfermedades raras, en eventos industriales de muy baja frecuencia o en escenarios de fraude con pocos casos registrados, generar datos sintéticos permite ampliar el conjunto de entrenamiento y mejorar la robustez del modelo. No elimina la necesidad de datos reales, pero reduce la penalización por escasez. - Cuando la regulación o la privacidad bloquean el acceso a los datos.
El Reglamento General de Protección de Datos (RGPD) y la normativa sectorial en salud, finanzas o industria farmacéutica imponen restricciones significativas sobre qué datos pueden compartirse entre organizaciones, usarse en entornos de desarrollo o transferirse a terceros. Los datos sintéticos permiten colaborar y desarrollar sin exponer información personal o confidencial, actuando como una técnica de privacidad efectiva según reconoce la propia AEPD. - En entornos de desarrollo, pruebas y validación.
Antes de conectar un modelo de IA a datos reales en producción, tiene sentido probar la arquitectura, los pipelines y la lógica del modelo con datos sintéticos. Reduce el riesgo, acelera los ciclos de desarrollo y permite iterar sin gestionar información sensible en entornos no securizados.
Sectores como la logística, la industria manufacturera y los servicios financieros llevan años incorporando datos sintéticos en sus ciclos de desarrollo de modelos predictivos, de detección de anomalías y de planificación de demanda, precisamente por estas razones.
Cuándo los datos sintéticos NO son la solución
Este es el punto que menos se desarrolla en la mayoría de artículos sobre el tema, y es el que tiene mayor impacto en la toma de decisiones.
- Los datos sintéticos no corrigen problemas de calidad en origen. Si los datos reales de partida son incompletos, sesgados o están mal estructurados, el modelo generativo aprenderá exactamente esos mismos patrones y los reproducirá a escala. Un conjunto sintético construido sobre datos deficientes no amplía el problema: lo multiplica. Antes de plantearse generar datos sintéticos, es imprescindible resolver la calidad en el dato de origen.
- No sustituyen a los datos reales cuando la variabilidad individual importa. Hay proyectos donde el modelo necesita aprender de la heterogeneidad real de una población (variaciones clínicas no habituales, comportamientos atípicos de cliente, fallos de máquina poco frecuentes pero críticos) y los datos sintéticos, por muy bien generados que estén, introducen un grado de homogeneización que puede penalizar el rendimiento del modelo en producción.
- Su uso en procesos de validación regulatoria sigue siendo exploratorio. La Agencia Europea del Medicamento (EMA) ha comenzado a plantear si los datos sintéticos pueden sustituir a los reales en evaluación clínica, especialmente en enfermedades raras. Pero los marcos de validación no están plenamente definidos. Asumir que un conjunto sintético tiene el mismo peso regulatorio que uno real es un error que puede comprometer la aprobación de un producto o proceso.
Qué necesita tu arquitectura para integrarlos bien
Generar datos sintéticos válidos no es difícil con las herramientas actuales. Lo que resulta complejo es integrarlos en una arquitectura de datos real de forma que sean gestionables, trazables y auditables. Este es el paso que más organizaciones subestiman.
El proceso comienza antes de generar nada. Es necesario definir con precisión para qué se van a usar los datos sintéticos, qué propiedades estadísticas deben preservarse y qué nivel de fidelidad es necesario para ese caso de uso concreto. Sin esa definición previa, es habitual producir conjuntos que superan las validaciones técnicas pero no son útiles para el problema real.
Una vez generados, los datos sintéticos requieren un proceso de validación riguroso: confirmar que las distribuciones relevantes se han preservado, verificar que no contienen información que permita reidentificar individuos del conjunto original y comprobar que un modelo entrenado con ellos tiene un rendimiento comparable a uno entrenado con datos reales. Esa validación no es un paso final: es parte del ciclo de vida del dato.
Dentro de la arquitectura, los datos sintéticos necesitan un lugar definido: cómo se almacenan, cómo se versionan, cómo se documenta su procedencia y cómo se mantiene la trazabilidad entre el conjunto sintético y el dato real que lo originó. Sin esa capa de gobernanza, la organización termina con datos de origen incierto y validez desconocida, que es exactamente el problema que los datos sintéticos deberían haber resuelto.
Cómo aborda BertIA la integración de datos sintéticos
En BertIA trabajamos con organizaciones de sectores como la industria farmacéutica, la logística, el retail, entre otros, que se enfrentan a este problema de forma recurrente: tienen proyectos de IA que no avanzan porque los datos reales no están disponibles en volumen suficiente, porque la regulación bloquea su uso en entornos de desarrollo o porque compartirlos con equipos externos genera riesgos de privacidad que no son asumibles.
Nuestra forma de abordar este reto parte siempre del diagnóstico de calidad del dato en origen. Antes de diseñar cualquier estrategia de generación sintética, evaluamos si el problema real es de volumen, de acceso o de calidad, porque la respuesta técnica es diferente en cada caso.
Cuando los datos sintéticos son la respuesta adecuada, definimos el método de generación, los criterios de validación y la arquitectura de gobernanza necesaria para que esos datos sean un activo gestionable, no un conjunto de ficheros de origen incierto. Si tu organización está evaluando si los datos sintéticos pueden desbloquear proyectos que están parados por restricciones de datos, habla con nuestro equipo para analizar tu situación concreta.
Conclusión
Los datos sintéticos son una herramienta con utilidad real en situaciones muy específicas: escasez estructural de datos, restricciones regulatorias o de privacidad, y entornos de desarrollo y pruebas. Fuera de esas situaciones, su aplicación requiere una evaluación cuidadosa, porque no corrigen problemas de calidad en origen, no siempre sustituyen la variabilidad de los datos reales y su peso regulatorio en procesos de validación formal sigue siendo limitado.
Lo que diferencia a las organizaciones que extraen valor de esta tecnología de las que no lo consiguen no es la herramienta de generación que utilizan: es haber resuelto primero la calidad del dato de origen, haber definido el caso de uso con precisión y haber construido la gobernanza necesaria para que el dato sintético sea trazable y auditable.



