Privacy Engineering en Synthetische Data

Wij bouwen differential-privacy-pijplijnen, generatoren voor synthetische data met formele garanties en privacybudgetsystemen waarmee teams AI kunnen trainen zonder echte records bloot te stellen.

De meeste organisaties denken dat ze hun AI-privacyprobleem hebben opgelost omdat ze een maskeringsscript hebben uitgevoerd of namen door tokens hebben vervangen. Onze aanpak is het ontwerpen van privacysystemen die wiskundige garanties opleveren, geen beleidsmatige beweringen — elke privacyclaim is ontworpen om een vastgestelde epsilon, een gedefinieerd dreigingsmodel en een gekwantificeerd restrisico te dragen — dezelfde discipline van aantoonbare architecturale integriteit boven bewering die we uitwerken in ons onderzoek naar architecturale integriteit in AI-systemen.

Waarom "We hebben het geanonimiseerd" geen privacygarantie is

Het uitvoeren van een maskeringsscript of het vervangen van namen door tokens lost het AI-privacyprobleem niet op. De EDPB heeft deze denkwijze regelrecht verworpen in Advies 28/2024: AI-modellen zijn niet inherent anoniem. Beoordeling per geval is vereist, en toezichthouders verwachten nu differential privacy, testen op extractieaanvallen en interne privacyaudits als concrete anonimiseringsmaatregelen.

Ondertussen blijven heridentificatieaanvallen zich ontwikkelen. Onderzoekers hebben aangetoond dat 87% van de Amerikaanse bevolking uniek identificeerbaar is op basis van alleen postcode, geboortedatum en geslacht. Synthetische data die zonder formele privacygaranties worden gegenereerd, kan nog steeds informatie lekken via patrooninferentie, en de traceerbaarheid door meerfasige synthetische pijplijnen is volgens huidig onderzoek "momenteel onmogelijk" om volledig te verifiëren.

Onze norm is dat een synthetische dataset pas veilig om te delen wordt genoemd wanneer de methode de resultaten van de membership-inference-tests, de analyse van de afstand tot de dichtstbijzijnde buur en het formele differential-privacy-budget waaronder deze is gegenereerd kan opleveren.

Differential privacy ontworpen om naar productie te gaan

De theorie achter differential privacy is goed begrepen; de technische uitdaging is om het te laten werken zonder de bruikbaarheid van de data te vernietigen. DP-SGD voegt tijdens de modeltraining gekalibreerde ruis toe zodat geen enkel afzonderlijk trainingsrecord de output wezenlijk kan beïnvloeden. De privacykosten worden bijgehouden via een formeel budget: elke query, elke trainingsepoch, elke downstream-analyse verbruikt epsilon. Wanneer het budget is uitgeput, geen queries meer.

Onze methode implementeert DP met Opacus (PyTorch) of TensorFlow Privacy afhankelijk van uw bestaande stack. Het echte werk is niet de integratie van bibliotheken — het is epsilon-kalibratie. Omdat de juiste waarde datasetspecifiek is, worden er tijdens een opdracht kalibratie-experimenten op uw werkelijke data uitgevoerd om het epsilon-bereik te vinden waarin zowel de privacybescherming als de modelprestaties aan uw eisen voldoen. Referentiepunten uit echte implementaties:

  • De US Census gebruikte epsilon 19,61 voor herindelingsstatistieken.
  • LinkedIn draait op epsilon 14,4 over vensters van drie maanden.
  • MOSTLY AI's benchmarks laten zien dat synthetische data 96,2% downstream-nauwkeurigheid bereikt bij epsilon 2,51 tegenover 98,1% zonder DP — een afweging van ongeveer 2% nauwkeurigheid die de meeste productietoepassingen kunnen opvangen.

Toewijzing van privacybudget over teams heen

Voor organisaties die meerdere teams op gedeelde gevoelige datasets laten werken, wordt de toewijzing van het privacybudget een organisatorisch ontwerpvraagstuk. Google's PLD-accountant (Privacy Loss Distribution) produceert compositiegrenzen die 5x strakker zijn dan Microsofts PRV-accountant en 200x strakker dan oudere Privacy-Buckets-benaderingen. Strakkere compositie betekent dat uw teams meer analyses kunnen uitvoeren binnen hetzelfde privacybudget. Onze aanpak implementeert PLD-gebaseerde accounting met budgettoewijzingen per team, automatische uitputtingswaarschuwingen en auditlogs die zijn ontworpen om precies bij te houden welke analyses welke delen van het budget hebben verbruikt.

Generatie van synthetische data met gemeten privacy

Synthetische data is niet inherent privé. Een GAN die zonder DP-beperkingen op patiëntdossiers is getraind, zal echte records memoriseren en reproduceren, vooral voor uitschieters en zeldzame aandoeningen. De SaTML MIDST-challenge van 2025 bevestigde dat membership-inference-aanvallen tegen tabulaire diffusiemodellen effectief blijven, waarbij op shadow-modellen gebaseerde detectie betrouwbaar leden van de trainingsset identificeert.

Onze aanpak genereert synthetische data met de techniek die past bij de vorm van uw data en uw privacyvereisten. TabDDPM (diffusiegebaseerd) presteert in recente benchmarks consequent beter dan GAN's op zowel ML-bruikbaarheid als distributiegetrouwheid. CTGAN uit het SDV-ecosysteem verwerkt gemengde categorisch-continue tabulaire data goed, maar heeft moeite met complexe kolomcorrelaties en is gevoelig voor mode collapse bij onevenwichtige klassen. Voor zorg- en financiële data waar statistische getrouwheid het belangrijkst is, grijpen we doorgaans naar TabDDPM of Bayesiaanse netwerkgeneratoren zoals PrivBayes, getraind onder DP-beperkingen zodat de generator zelf geen individuele records kan memoriseren.

Kwaliteitsbeoordeling langs drie dimensies

  • Getrouwheid: reproduceert de synthetische data de statistische eigenschappen van de echte data — distributies, correlaties, voorwaardelijke relaties?
  • Bruikbaarheid: presteren modellen die op synthetische data zijn getraind vergelijkbaar met modellen die op echte data zijn getraind?
  • Privacy: kan een tegenstander bepalen of het record van een specifiek individu in de trainingsset zat?

Onze beoordeling voert standaard DOMIAS (dichtheidsgebaseerde membership inference) en analyse van de afstand tot de dichtstbijzijnde buur uit. Praktijkbeoefenaars constateren consequent dat modellen die op correct gegenereerde synthetische data zijn getraind 85–95% van de prestaties op echte databereiken, waarbij het verschil verder afneemt wanneer synthetische data een kleine echte seed-set aanvult in plaats van echte data volledig te vervangen.

Waar synthetische data tekortschiet en wat u in plaats daarvan kunt gebruiken

Synthetische data is geen universele oplossing. Als uw use case het behoud van exact staartgedrag van de distributie vereist — zeldzame ziektefenotypen, ongebruikelijke transactiepatronen voor fraudedetectie — zullen synthetische generatoren juist het signaal dat u nodig heeft gladstrijken. Als uw echte dataset klein is (minder dan een paar duizend records), heeft de generator niet genoeg signaal om betekenisvolle structuur te leren, en wordt de synthetische output ruis met een plausibele opmaak.

Cross-organisatorische samenwerking: federated learning

Waar ruwe data de bron niet kan verlaten, is federated learning het alternatief — maar de privacy-eigenschappen ervan zijn zwakker dan gewoonlijk in de markt wordt gezet. Gradient-inversieaanvallen (Geminio, MMGIA) kunnen trainingsbeelden reconstrueren uit gedeelde gradiënten. In één onderzoek naar retinabeeldvorming was 92% van de deelnemers identificeerbaar op basis van gradiëntreconstructies, zelfs met matige DP toegepast. Veilige aggregatie gecombineerd met DP-ruis per update is de minimaal haalbare verdediging, geen optionele toevoeging.

Privacy tijdens inferentie: confidential computing

Voor het beschermen van gebruikersquery's tegen de modelaanbieder is confidential computing via TEE's momenteel het enige productierijpe pad. NVIDIA Hopper- en Blackwell-GPU's ondersteunen nu vertrouwelijke uitvoering, waarbij zowel modelgewichten als gebruikersdata tijdens de inferentie versleuteld blijven. FHE is in opmars — GPU-versnelde implementaties laten 200x versnellingen zien ten opzichte van CPU-baselines — maar latentie en rekenoverhead beperken het nog steeds tot smalle use cases.

Het regelgevingsbeeld voor privacybeschermende AI verschuift snel, en de veilige antwoorden van twee jaar geleden gaan niet meer op. Het EDPB-advies 28/2024 vereist dat organisaties aantonen dat AI-modellen geen persoonsgegevens kunnen lekken via extractieaanvallen, en niet slechts beweren dat trainingsdata is verwijderd — dezelfde verschuiving naar aantoonbare algoritmische verantwoording die we onderzoeken in onze whitepaper over verantwoording in het post-RealPage-tijdperk. De vereisten voor systemen met een hoog risico van de EU AI Act worden van kracht in augustus 2026, waarbij databeheerverplichtingen (artikel 10) boven op de bestaande AVG-beperkingen komen.

De voorgestelde Digital Omnibus zou entiteitsspecifieke identificeerbaarheid vastleggen — wat betekent dat data die persoonlijk is voor de organisatie die deze bezit, mogelijk niet persoonlijk is voor een downstream-ontvanger. Dit zou de manier waarop overdrachten van synthetische data worden geclassificeerd kunnen hervormen, maar de richtsnoeren zijn niet definitief.

HIPAA: Safe Harbor versus Expert Determination

Voor HIPAA-gereguleerde organisaties beïnvloedt de keuze tussen de-identificatie via Safe Harbor en Expert Determination direct de kwaliteit van de AI-trainingsdata. Safe Harbor verwijdert 18 typen identificatiegegevens en haalt vaak te veel signaal weg voor ML. Expert Determination behoudt meer bruikbare structuur, maar vereist dat een gekwalificeerde expert certificeert dat het risico op heridentificatie "zeer klein" is. Een opdracht wordt afgebakend om de technische pijplijn te bouwen en de statistische analyse op te leveren die Expert Determination vereist.

Californië AB 2013 en het in kaart brengen van regelgeving

Californië's AB 2013 (van kracht op 1 januari 2026) vereist nu openbaarmaking van het gebruik van synthetische data bij AI-training. Onze methode koppelt uw technische privacygaranties aan de toepasselijke wettelijke vereisten en documenteert de specifieke voorwaarden waaronder uw differentieel private outputs of synthetische datasets buiten het bereik van persoonsgegevens vallen, met eerlijke voorbehouden over waar de regelgevende richtsnoeren onzeker blijven.

Belangrijkste conclusies

  • Anonimiseringsscripts en tokenisatie zijn geen privacygaranties — EDPB-advies 28/2024 behandelt AI-modellen als niet inherent anoniem, en 87% van de Amerikaanse bevolking is heridentificeerbaar op basis van postcode, geboortedatum en geslacht.
  • We ontwerpen differential privacy voor productie met Opacus of TensorFlow Privacy, waarbij we epsilon kalibreren op uw echte data ten opzichte van referentiepunten uit implementaties (US Census 19,61, LinkedIn 14,4, MOSTLY AI 2,51).
  • Google's PLD-accountant geeft 5x strakkere compositie dan Microsofts PRV en 200x strakker dan Privacy Buckets, zodat budgetten voor meerdere teams verder reiken.
  • Synthetische data wordt gegenereerd onder DP-beperkingen (TabDDPM, CTGAN, PrivBayes) en beoordeeld op getrouwheid, bruikbaarheid en privacy — met een bereik van 85–95% van de prestaties op echte data — maar schiet tekort bij staartgedrag en kleine datasets.
  • Federated learning (kwetsbaar voor Geminio/MMGIA-gradiëntinversie) en TEE-gebaseerde confidential computing op NVIDIA Hopper/Blackwell zijn de alternatieven wanneer synthetische data niet past.
  • We koppelen garanties aan de EU AI Act (augustus 2026), de AVG, de voorgestelde Digital Omnibus, HIPAA Expert Determination en Californië AB 2013 (1 januari 2026).
FAQ

Veelgestelde vragen

Hoeveel nauwkeurigheid verliezen we door differential privacy toe te voegen aan de modeltraining?

De afweging in nauwkeurigheid hangt af van de omvang van uw dataset, de complexiteit van het model en de epsilon-waarde die u kiest. Op de US Census Income-dataset (48.842 rijen, 15 attributen) laten de benchmarks van MOSTLY AI 96,2% nauwkeurigheid zien met DP bij epsilon 2,51 tegenover 98,1% zonder DP, ongeveer een verschil van 2%. Voor grotere datasets wordt het verschil kleiner omdat DP-ruis relatief minder impact heeft. Onder epsilon 3 op kleine tabulaire datasets kan de nauwkeurigheid met 15-30% verslechteren, en daarom is epsilon-kalibratie op uw werkelijke data cruciaal voordat u zich vastlegt op een privacybudget. We voeren kalibratie-experimenten uit over verschillende epsilon-bereiken om het punt te vinden waar zowel de privacybescherming als de modelprestaties aan uw eisen voldoen, in plaats van een epsilon uit een leerboek te kiezen.

Wat kost en levert een opdracht voor privacy engineering daadwerkelijk op?

Een afgebakende opdracht die één DP-trainingspijplijn met generatie van synthetische data en kwaliteitsbeoordeling omvat, duurt doorgaans 8-12 weken. De op te leveren producten omvatten de privacybeschermende trainingspijplijn met gedocumenteerde epsilon-budgetten en formele garanties, de generator van synthetische data met kwaliteitsrapporten over de dimensies getrouwheid, bruikbaarheid en privacy, een privacyrisicobeoordeling die de restrisico's en de mitigaties ervan documenteert, en integratiespecificaties voor uw bestaande data-infrastructuur. Voor organisaties die enterprisebreed privacybudgetbeheer over meerdere teams nodig hebben, komt er 4-6 weken bij voor de accounting-infrastructuur en het organisatorische ontwerp. De totale investering hangt af van de complexiteit van de data, de reikwijdte van de regelgeving en of u HIPAA Expert Determination of AVG-analyse van anonieme data nodig heeft.

Is synthetische data automatisch AVG-conform?

Nee. Het EDPB-advies 28/2024 heeft expliciet het idee verworpen dat AI-outputs inherent anoniem zijn. Synthetische data die zonder differential privacy wordt gegenereerd, kan informatie over echte individuen lekken via patrooninferentie, en toezichthouders verwachten nu het testen op extractieaanvallen en formele privacymaatregelen als bewijs van anonimisering. De voorgestelde EU Digital Omnibus zou entiteitsspecifieke identificeerbaarheid vastleggen, wat mogelijk verandert hoe overdrachten van synthetische data worden geclassificeerd, maar de richtsnoeren zijn niet definitief. Gartner voorspelt dat synthetische data tegen 2030 de echte data in AI-training zal overtreffen, en de markt voor synthetische data zal naar verwachting tegen dat jaar $2,3 miljard bereiken. Het regelgevingskader loopt nog achter. We koppelen uw technische privacygaranties aan specifieke AVG-bepalingen en documenteren waar uw synthetische data buiten het bereik van persoonsgegevens valt, met eerlijke voorbehouden over onzekere regelgevende standpunten.

Moeten we onze eigen pijplijn voor synthetische data bouwen of kopen bij Gretel, MOSTLY AI of Tonic?

De commerciële platforms zijn aanzienlijk volwassener geworden. Gretel biedt configureerbare epsilon (1-20) met adversariële privacyscoring en een NVIDIA-partnerschap voor schaal. MOSTLY AI gebruikt Meta's Opacus-bibliotheek voor DP-SGD en bereikt sterke nauwkeurigheid bij epsilon 2,51 met automatische budgetregistratie. Tonic richt zich op adoptie door engineeringteams met ondersteuning voor gestructureerde, semigestructureerde en vrije tekst. Bouwen is zinvol wanneer u maximale controle over DP-parameters nodig heeft, uw data een ongebruikelijke structuur heeft die commerciële generatoren slecht verwerken, of u geen data naar een leveranciersomgeving kunt sturen. Kopen is zinvol wanneer uw team DP-expertise mist, u kant-en-klare audittrails en compliancedocumentatie nodig heeft, of niet-technische stakeholders toegang nodig hebben. We evalueren beide paden voor uw specifieke eisen. Veel organisaties komen uit op een hybride oplossing: een commercieel platform voor standaard tabulaire data, een op maat gemaakte pijplijn voor domeinspecifieke of zeer gevoelige data.

Hoe kiezen we de juiste epsilon-waarde voor ons privacybudget?

Er bestaat geen universeel correcte epsilon. Praktijkimplementaties beslaan een breed bereik: de US Census gebruikt epsilon 19,61 voor herindeling, LinkedIn draait op 14,4 over drie maanden, en interactieve analysesystemen wijzen 0,1-1 per query toe met kwartaalbudgetten van 1-10. De juiste epsilon hangt af van uw dreigingsmodel (tegen welke tegenstandersvaardigheden u zich verdedigt), de gevoeligheid van uw data (medische dossiers vereisen strakkere budgetten dan clickstream-data) en uw bruikbaarheidseisen (hoeveel nauwkeurigheidsverlies uw downstream-toepassing kan verdragen). Google's PLD-accountant geeft 5x strakkere compositiegrenzen dan Microsofts PRV-accountant, wat betekent dat u meer bruikbaarheid uit hetzelfde totale budget kunt halen. We kalibreren epsilon empirisch op uw data door de prestaties van downstream-taken over verschillende epsilon-bereiken te meten en de resultaten af te zetten tegen uw wettelijke verplichtingen en risicotolerantie.

Wat is het verschil tussen differential privacy en traditionele data-anonimisering?

Traditionele anonimisering (maskering, tokenisatie, k-anonimiteit, l-diversiteit) transformeert de data zelf en hoopt dat de transformatie onomkeerbaar is. Het biedt geen wiskundige garantie over wat een tegenstander kan leren. Onderzoekers hebben aangetoond dat 87% van de Amerikaanse bevolking uniek identificeerbaar is op basis van alleen postcode, geboortedatum en geslacht, wat betekent dat eenvoudige maskering van directe identificatiegegevens niet genoeg is. Differential privacy hanteert een fundamenteel andere aanpak: het voegt gekalibreerde ruis toe aan de berekening (modeltraining, query-antwoorden, generatie van synthetische data) zodat de output wiskundig gegarandeerd niet onthult of een specifiek individu in de invoer zat. De garantie geldt ongeacht welke aanvullende informatie de tegenstander heeft. De afweging is dat DP ruis toevoegt, wat de nauwkeurigheid verlaagt. Traditionele anonimisering kan exacte waarden behouden, maar biedt geen aantoonbare bescherming.

Kunnen we LLM's gebruiken om synthetische trainingsdata te genereren en is dat privé?

Door LLM's gegenereerde synthetische data komt steeds vaker voor; vrijwel elk groot model dat het afgelopen jaar is uitgebracht, is ten minste gedeeltelijk getraind op synthetisch gegenereerde data. Maar de privacyanalyse is fundamenteel anders dan bij op GAN of diffusie gebaseerde generatie. LLM's memoriseren trainingsdata: Carlini et al. toonden de woordelijke extractie aan van PII, waaronder namen, telefoonnummers en e-mailadressen, uit GPT-2. Als de LLM die uw synthetische data genereert is getraind op data met informatie over de individuen die u probeert te beschermen, kan de synthetische output hun echte persoonsgegevens bevatten. Samengestelde extractieaanvallen die informatie uit meerdere query's combineren, verdubbelen het extractierisico. Op LLM's gebaseerde synthetische generatie is nuttig voor het aanvullen van trainingssets waar de brondata al openbaar is, maar het is geen privacybeschermende techniek voor gevoelige data zonder aanvullende DP-mechanismen die op de LLM zelf worden toegepast.

Hoe is HIPAA-de-identificatie van toepassing op AI-trainingsdata?

HIPAA biedt twee de-identificatiemethoden met zeer verschillende implicaties voor ML. Safe Harbor vereist het verwijderen van 18 specifieke typen identificatiegegevens. Het is duidelijk en gemakkelijk te standaardiseren, maar haalt te veel signaal weg voor de meeste ML-use cases, waarbij geografische granulariteit, temporele precisie en demografisch detail die modellen nodig hebben worden geëlimineerd. Expert Determination laat een gekwalificeerde expert certificeren dat het risico op heridentificatie zeer klein is, waarbij meer bruikbare structuur behouden blijft en tegelijkertijd HIPAA-compliance wordt geboden. Expert Determination heeft de voorkeur voor AI-trainingsdata omdat het de de-identificatie afstemt op de specifieke dataset en het beoogde gebruik. We bouwen de statistische analyse en technische pijplijn die Expert Determination vereist, inclusief de kwantificering van het heridentificatierisico, en leveren de documentatie die voldoet aan het certificeringsproces door de gekwalificeerde expert.

Bouw uw AI met vertrouwen.

Werk samen met een team met diepgaande ervaring in het bouwen van de volgende generatie enterprise-AI. Laat ons u helpen bij het ontwerpen, bouwen en implementeren van een AI-strategie waarop u kunt vertrouwen.

Veriprajna Deep Tech-adviesbureau is gespecialiseerd in het bouwen van veiligheidskritische AI-systemen voor de gezondheidszorg, de financiële sector en gereguleerde domeinen. Onze architecturen worden gevalideerd aan de hand van gevestigde protocollen met uitgebreide compliancedocumentatie.