Ingeniería de privacidad y datos sintéticos

Diseñamos canalizaciones de privacidad diferencial, generadores de datos sintéticos con garantías formales y sistemas de presupuesto de privacidad que permiten a los equipos entrenar IA sin exponer registros reales.

La mayoría de las organizaciones creen que han resuelto su problema de privacidad en la IA porque ejecutaron un script de enmascaramiento o reemplazaron nombres con tokens. Nuestro enfoque consiste en diseñar sistemas de privacidad que produzcan garantías matemáticas, no afirmaciones de políticas — cada declaración de privacidad está diseñada para llevar un épsilon declarado, un modelo de amenazas definido y un riesgo residual cuantificado — la misma disciplina de integridad arquitectónica demostrable frente a la mera afirmación que detallamos en nuestra investigación sobre la integridad arquitectónica en los sistemas de IA.

Por qué «Lo anonimizamos» no es una garantía de privacidad

Ejecutar un script de enmascaramiento o reemplazar nombres con tokens no resuelve el problema de privacidad en la IA. El EDPB rechazó de plano este planteamiento en el Dictamen 28/2024: los modelos de IA no son intrínsecamente anónimos. Se requiere una evaluación caso por caso, y los reguladores ahora esperan privacidad diferencial, pruebas de ataques de extracción y auditorías internas de privacidad como medidas concretas de anonimización.

Mientras tanto, los ataques de reidentificación siguen avanzando. Los investigadores han demostrado que el 87 % de la población de EE. UU. es identificable de forma única a partir únicamente del código postal, la fecha de nacimiento y el sexo. Los datos sintéticos generados sin garantías formales de privacidad todavía pueden filtrar información mediante la inferencia de patrones, y la trazabilidad a través de canalizaciones sintéticas de múltiples etapas es, según la investigación actual, «actualmente imposible» de verificar por completo.

Nuestro criterio es que un conjunto de datos sintéticos se considera seguro para compartir únicamente cuando el método puede producir los resultados de las pruebas de inferencia de pertenencia, el análisis de distancia al vecino más cercano y el presupuesto formal de privacidad diferencial bajo el cual se generó.

Privacidad diferencial diseñada para llegar a producción

La teoría detrás de la privacidad diferencial se comprende bien; el reto de ingeniería consiste en hacer que funcione sin destruir la utilidad de los datos. DP-SGD añade ruido calibrado durante el entrenamiento del modelo de modo que ningún registro de entrenamiento individual pueda influir materialmente en la salida. El coste de privacidad se rastrea mediante un presupuesto formal: cada consulta, cada época de entrenamiento y cada análisis posterior consume épsilon. Cuando el presupuesto se agota, no hay más consultas.

Nuestro método implementa la PD usando Opacus (PyTorch) o TensorFlow Privacy según su pila tecnológica existente. El trabajo real no es la integración de bibliotecas, sino la calibración de épsilon. Como el valor correcto es específico de cada conjunto de datos, cada proyecto ejecuta experimentos de calibración sobre sus datos reales para encontrar el rango de épsilon en el que tanto la protección de la privacidad como el rendimiento del modelo cumplen sus requisitos. Puntos de referencia de despliegues reales:

  • El Censo de EE. UU. usó un épsilon de 19,61 para las estadísticas de redistribución de distritos.
  • LinkedIn opera con un épsilon de 14,4 en ventanas de tres meses.
  • MOSTLY AI: sus pruebas comparativas muestran que los datos sintéticos alcanzan un 96,2 % de precisión posterior con épsilon 2,51 frente al 98,1 % sin PD, una compensación de precisión de aproximadamente el 2 % que la mayoría de los casos de uso en producción puede absorber.

Asignación del presupuesto de privacidad entre equipos

Para las organizaciones que ejecutan varios equipos sobre conjuntos de datos sensibles compartidos, la asignación del presupuesto de privacidad se convierte en un problema de diseño organizativo. El contador PLD (distribución de pérdida de privacidad) de Google produce límites de composición 5 veces más ajustados que el contador PRV de Microsoft y 200 veces más ajustados que los enfoques más antiguos de Privacy Buckets. Una composición más ajustada significa que sus equipos pueden ejecutar más análisis dentro del mismo presupuesto de privacidad. Nuestro enfoque despliega una contabilidad basada en PLD con asignaciones de presupuesto por equipo, alertas automáticas de agotamiento y registros de auditoría diseñados para rastrear exactamente qué análisis consumieron qué porciones del presupuesto.

Generación de datos sintéticos con privacidad medida

Los datos sintéticos no son intrínsecamente privados. Una GAN entrenada con registros de pacientes sin restricciones de PD memorizará y reproducirá registros reales, especialmente en el caso de valores atípicos y condiciones raras. El reto SaTML MIDST de 2025 confirmó que los ataques de inferencia de pertenencia contra modelos de difusión tabulares siguen siendo eficaces, con una detección basada en modelos sombra que identifica de forma fiable a los miembros del conjunto de entrenamiento.

Nuestro enfoque genera datos sintéticos usando la técnica que se ajusta a la forma de sus datos y a sus requisitos de privacidad. TabDDPM (basado en difusión) supera de forma consistente a las GAN tanto en utilidad para ML como en fidelidad de distribución en las pruebas comparativas recientes. CTGAN del ecosistema SDV maneja bien los datos tabulares mixtos categóricos-continuos, pero tiene dificultades con las correlaciones complejas entre columnas y es propenso al colapso de modo en clases desbalanceadas. Para datos sanitarios y financieros, donde la fidelidad estadística importa más, solemos recurrir a TabDDPM o a generadores de redes bayesianas como PrivBayes, entrenados bajo restricciones de PD para que el propio generador no pueda memorizar registros individuales.

Evaluación de la calidad en tres dimensiones

  • Fidelidad: ¿reproducen los datos sintéticos las propiedades estadísticas de los datos reales: distribuciones, correlaciones, relaciones condicionales?
  • Utilidad: ¿rinden los modelos entrenados con datos sintéticos de forma comparable a los modelos entrenados con datos reales?
  • Privacidad: ¿puede un adversario determinar si el registro de un individuo específico estaba en el conjunto de entrenamiento?

Nuestra evaluación ejecuta DOMIAS (inferencia de pertenencia basada en densidad) y análisis de distancia al vecino más cercano como estándar. Los profesionales constatan de forma consistente que los modelos entrenados con datos sintéticos generados correctamente alcanzan el 85–95 % del rendimiento con datos reales, y la diferencia se reduce aún más cuando los datos sintéticos complementan un pequeño conjunto semilla real en lugar de reemplazar por completo a los datos reales.

Dónde fallan los datos sintéticos y qué usar en su lugar

Los datos sintéticos no son una solución universal. Si su caso de uso requiere preservar el comportamiento exacto de la cola de la distribución —fenotipos de enfermedades raras, patrones de transacciones inusuales para la detección de fraude—, los generadores sintéticos suavizarán precisamente la señal que necesita. Si su conjunto de datos real es pequeño (menos de unos pocos miles de registros), el generador no tiene suficiente señal para aprender una estructura significativa, y la salida sintética se convierte en ruido con un formato plausible.

Colaboración entre organizaciones: aprendizaje federado

Cuando los datos brutos no pueden salir de su origen, el aprendizaje federado es la alternativa, pero sus propiedades de privacidad son más débiles de lo que comúnmente se promociona. Los ataques de inversión de gradiente (Geminio, MMGIA) pueden reconstruir imágenes de entrenamiento a partir de gradientes compartidos. En un estudio de imágenes de retina, el 92 % de los participantes eran identificables a partir de reconstrucciones de gradiente incluso con una PD moderada aplicada. La agregación segura combinada con ruido de PD por actualización es la defensa mínima viable, no un complemento opcional.

Privacidad en el momento de la inferencia: computación confidencial

Para proteger las consultas de los usuarios frente al proveedor del modelo, la computación confidencial mediante TEE es actualmente la única vía viable en producción. Las GPU NVIDIA Hopper y Blackwell ahora admiten la ejecución confidencial, manteniendo cifrados tanto los pesos del modelo como los datos del usuario durante la inferencia. FHE está avanzando —las implementaciones aceleradas por GPU muestran aceleraciones de 200 veces frente a las referencias de CPU—, pero la latencia y la sobrecarga computacional aún la limitan a casos de uso estrechos.

El panorama regulatorio de la IA que preserva la privacidad está cambiando rápidamente, y las respuestas seguras de hace dos años ya no se sostienen. El Dictamen 28/2024 del EDPB exige que las organizaciones demuestren que los modelos de IA no pueden filtrar datos personales mediante ataques de extracción, y no que simplemente afirmen que los datos de entrenamiento se eliminaron —el mismo giro hacia la responsabilidad algorítmica demostrable que examinamos en nuestro whitepaper sobre la responsabilidad en la era post-RealPage. Los requisitos para sistemas de alto riesgo de la Ley de IA de la UE entran en vigor en agosto de 2026, añadiendo obligaciones de gobernanza de datos (Artículo 10) además de las restricciones existentes del RGPD.

El propuesto Digital Omnibus codificaría la identificabilidad específica por entidad, lo que significa que los datos que son personales para la organización que los posee podrían no serlo para un receptor posterior. Esto podría remodelar la forma en que se clasifican las transferencias de datos sintéticos, pero la orientación no es definitiva.

HIPAA: Puerto Seguro frente a Determinación por Experto

Para las organizaciones reguladas por la HIPAA, la elección entre la desidentificación por Puerto Seguro y por Determinación por Experto afecta directamente a la calidad de los datos de entrenamiento de IA. El Puerto Seguro elimina 18 tipos de identificadores y, a menudo, suprime demasiada señal para el ML. La Determinación por Experto preserva una estructura más útil, pero requiere que un experto cualificado certifique que el riesgo de reidentificación es «muy pequeño». Un proyecto se dimensiona para construir la canalización técnica y producir el análisis estadístico que exige la Determinación por Experto.

La AB 2013 de California y el mapeo regulatorio

La AB 2013 de California (vigente desde el 1 de enero de 2026) ahora exige la divulgación del uso de datos sintéticos en el entrenamiento de IA. Nuestro método mapea sus garantías técnicas de privacidad con los requisitos regulatorios aplicables y documenta las condiciones específicas bajo las cuales sus salidas con privacidad diferencial o sus conjuntos de datos sintéticos quedan fuera del ámbito de los datos personales, con advertencias honestas sobre dónde la orientación regulatoria sigue sin resolverse.

Puntos clave

  • Los scripts de anonimización y la tokenización no son garantías de privacidad: el Dictamen 28/2024 del EDPB considera que los modelos de IA no son intrínsecamente anónimos, y el 87 % de la población de EE. UU. es reidentificable a partir del código postal, la fecha de nacimiento y el sexo.
  • Diseñamos privacidad diferencial para producción con Opacus o TensorFlow Privacy, calibrando el épsilon sobre sus datos reales frente a puntos de referencia de despliegue (Censo de EE. UU. 19,61, LinkedIn 14,4, MOSTLY AI 2,51).
  • El contador PLD de Google ofrece una composición 5 veces más ajustada que el PRV de Microsoft y 200 veces más ajustada que Privacy Buckets, de modo que los presupuestos de varios equipos rinden más.
  • Los datos sintéticos se generan bajo restricciones de PD (TabDDPM, CTGAN, PrivBayes) y se califican por fidelidad, utilidad y privacidad —alcanzando el 85–95 % del rendimiento con datos reales—, pero fallan en el comportamiento de la cola y en conjuntos de datos pequeños.
  • El aprendizaje federado (vulnerable a la inversión de gradiente de Geminio/MMGIA) y la computación confidencial basada en TEE sobre NVIDIA Hopper/Blackwell son las alternativas cuando los datos sintéticos no encajan.
  • Mapeamos las garantías con la Ley de IA de la UE (agosto de 2026), el RGPD, el propuesto Digital Omnibus, la Determinación por Experto de la HIPAA y la AB 2013 de California (1 de enero de 2026).
FAQ

Preguntas Frecuentes

¿Cuánta precisión perdemos al añadir privacidad diferencial al entrenamiento del modelo?

La compensación de precisión depende del tamaño de su conjunto de datos, la complejidad del modelo y el valor de épsilon que elija. En el conjunto de datos US Census Income (48 842 filas, 15 atributos), las pruebas comparativas de MOSTLY AI muestran un 96,2 % de precisión con PD a épsilon 2,51 frente al 98,1 % sin PD, una diferencia de aproximadamente el 2 %. Para conjuntos de datos más grandes, la diferencia se reduce porque el ruido de PD tiene un impacto relativo menor. Por debajo de épsilon 3 en conjuntos de datos tabulares pequeños, la precisión puede degradarse entre un 15 y un 30 %, razón por la cual la calibración del épsilon sobre sus datos reales es crítica antes de comprometerse con un presupuesto de privacidad. Ejecutamos experimentos de calibración a lo largo de rangos de épsilon para encontrar el punto en el que tanto la protección de la privacidad como el rendimiento del modelo cumplen sus requisitos, en lugar de elegir un épsilon de un libro de texto.

¿Cuánto cuesta y qué entrega realmente un proyecto de ingeniería de privacidad?

Un proyecto dimensionado que cubra una única canalización de entrenamiento con PD, junto con generación de datos sintéticos y evaluación de calidad, suele durar de 8 a 12 semanas. Los entregables incluyen la canalización de entrenamiento que preserva la privacidad con presupuestos de épsilon documentados y garantías formales, el generador de datos sintéticos con informes de calidad en las dimensiones de fidelidad, utilidad y privacidad, una evaluación de riesgos de privacidad que documenta los riesgos residuales y sus mitigaciones, y las especificaciones de integración con su infraestructura de datos existente. Para las organizaciones que necesitan una gestión del presupuesto de privacidad a nivel de toda la empresa entre múltiples equipos, añada de 4 a 6 semanas para la infraestructura de contabilidad y el diseño organizativo. La inversión total depende de la complejidad de los datos, el alcance regulatorio y de si necesita la Determinación por Experto de la HIPAA o el análisis de datos anónimos del RGPD.

¿Los datos sintéticos cumplen automáticamente con el RGPD?

No. El Dictamen 28/2024 del EDPB rechazó explícitamente la idea de que las salidas de la IA sean intrínsecamente anónimas. Los datos sintéticos generados sin privacidad diferencial pueden filtrar información sobre individuos reales mediante la inferencia de patrones, y los reguladores ahora esperan pruebas de ataques de extracción y medidas formales de privacidad como evidencia de anonimización. El propuesto Digital Omnibus de la UE codificaría la identificabilidad específica por entidad, lo que podría cambiar la forma en que se clasifican las transferencias de datos sintéticos, pero la orientación no es definitiva. Gartner predice que los datos sintéticos superarán a los datos reales en el entrenamiento de IA para 2030, y se proyecta que el mercado de datos sintéticos alcance los 2300 millones de dólares para ese año. El marco regulatorio todavía está poniéndose al día. Mapeamos sus garantías técnicas de privacidad con disposiciones específicas del RGPD y documentamos dónde sus datos sintéticos quedan fuera del ámbito de los datos personales, con advertencias honestas sobre posturas regulatorias sin resolver.

¿Deberíamos construir nuestra propia canalización de datos sintéticos o comprarla a Gretel, MOSTLY AI o Tonic?

Las plataformas comerciales han madurado significativamente. Gretel ofrece épsilon configurable (1-20) con puntuación de privacidad adversaria y una asociación con NVIDIA para escalar. MOSTLY AI usa la biblioteca Opacus de Meta para DP-SGD y logra una precisión sólida a épsilon 2,51 con seguimiento automático del presupuesto. Tonic se centra en la adopción por equipos de ingeniería con soporte para datos estructurados, semiestructurados y de texto libre. Construir tiene sentido cuando necesita el máximo control sobre los parámetros de PD, sus datos tienen una estructura inusual que los generadores comerciales manejan mal, o no puede enviar datos a un entorno de un proveedor. Comprar tiene sentido cuando su equipo carece de experiencia en PD, necesita registros de auditoría y documentación de cumplimiento listos para usar, o partes interesadas no técnicas necesitan acceso. Evaluamos ambas vías para sus requisitos específicos. Muchas organizaciones terminan con un enfoque híbrido: una plataforma comercial para datos tabulares estándar y una canalización personalizada para datos específicos del dominio o de alta sensibilidad.

¿Cómo elegimos el valor de épsilon correcto para nuestro presupuesto de privacidad?

No existe un épsilon correcto universal. Los despliegues del mundo real abarcan un amplio rango: el Censo de EE. UU. usa un épsilon de 19,61 para la redistribución de distritos, LinkedIn opera con 14,4 a lo largo de tres meses, y los sistemas de analítica interactiva asignan de 0,1 a 1 por consulta con presupuestos trimestrales de 1 a 10. El épsilon correcto depende de su modelo de amenazas (qué capacidades de un adversario está defendiendo), la sensibilidad de sus datos (los registros médicos exigen presupuestos más ajustados que los datos de secuencia de clics) y sus requisitos de utilidad (cuánta pérdida de precisión puede tolerar su aplicación posterior). El contador PLD de Google ofrece límites de composición 5 veces más ajustados que el contador PRV de Microsoft, lo que significa que puede extraer más utilidad del mismo presupuesto total. Calibramos el épsilon empíricamente sobre sus datos midiendo el rendimiento de la tarea posterior a lo largo de rangos de épsilon y mapeando los resultados frente a sus obligaciones regulatorias y su tolerancia al riesgo.

¿Cuál es la diferencia entre la privacidad diferencial y la anonimización de datos tradicional?

La anonimización tradicional (enmascaramiento, tokenización, k-anonimato, l-diversidad) transforma los datos en sí y confía en que la transformación sea irreversible. No proporciona ninguna garantía matemática sobre lo que un adversario puede aprender. Los investigadores han demostrado que el 87 % de la población de EE. UU. es identificable de forma única a partir únicamente del código postal, la fecha de nacimiento y el sexo, lo que significa que el simple enmascaramiento de los identificadores directos no es suficiente. La privacidad diferencial adopta un enfoque fundamentalmente distinto: añade ruido calibrado al cálculo (entrenamiento del modelo, respuestas a consultas, generación de datos sintéticos) de modo que la salida esté matemáticamente garantizada de no revelar si algún individuo específico estaba en la entrada. La garantía se mantiene con independencia de la información auxiliar que tenga el adversario. La compensación es que la PD añade ruido, lo que reduce la precisión. La anonimización tradicional puede preservar los valores exactos, pero no ofrece protección demostrable.

¿Podemos usar LLM para generar datos de entrenamiento sintéticos y es eso privado?

Los datos sintéticos generados por LLM son cada vez más comunes, y casi todos los modelos importantes lanzados en el último año se entrenaron al menos en parte con datos generados sintéticamente. Pero el análisis de privacidad es fundamentalmente distinto al de la generación basada en GAN o difusión. Los LLM memorizan los datos de entrenamiento: Carlini et al. demostraron la extracción textual de datos personales, incluidos nombres, números de teléfono y direcciones de correo electrónico, de GPT-2. Si el LLM que genera sus datos sintéticos fue entrenado con datos que contenían información sobre los individuos que intenta proteger, la salida sintética puede contener sus datos personales reales. Los ataques de extracción compuestos que combinan información de múltiples consultas duplican el riesgo de extracción. La generación sintética basada en LLM es útil para aumentar conjuntos de entrenamiento cuando los datos de origen ya son públicos, pero no es una técnica que preserve la privacidad para datos sensibles sin mecanismos de PD adicionales aplicados al propio LLM.

¿Cómo se aplica la desidentificación de la HIPAA a los datos de entrenamiento de IA?

La HIPAA ofrece dos métodos de desidentificación con implicaciones muy distintas para el ML. El Puerto Seguro exige eliminar 18 tipos específicos de identificadores. Es claro y fácil de estandarizar, pero suprime demasiada señal para la mayoría de los casos de uso de ML, eliminando la granularidad geográfica, la precisión temporal y el detalle demográfico que los modelos necesitan. La Determinación por Experto permite que un experto cualificado certifique que el riesgo de reidentificación es muy pequeño, preservando una estructura más útil a la vez que proporciona cumplimiento de la HIPAA. La Determinación por Experto es preferible para los datos de entrenamiento de IA porque adapta la desidentificación al conjunto de datos específico y al uso previsto. Construimos el análisis estadístico y la canalización técnica que exige la Determinación por Experto, incluida la cuantificación del riesgo de reidentificación, y proporcionamos la documentación que satisface el proceso de certificación del experto cualificado.

Construya su IA con confianza.

Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.

Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.