隐私工程与合成数据

我们构建差分隐私管道、带有形式化保证的合成数据生成器,以及隐私预算管理系统,让团队无需暴露真实记录即可训练 AI。

大多数组织认为自己已经解决了 AI 隐私问题,因为他们运行了脱敏脚本或用令牌替换了姓名。我们的做法是设计出能够提供 数学保证而非政策声明 的隐私系统——每一项隐私主张都被设计为附带明确的 epsilon 值、清晰界定的威胁模型和量化的残余风险——这与我们所倡导的、以可证明的架构完整性取代空泛声明的原则一脉相承,详见 我们关于 AI 系统架构完整性的研究

为什么“我们已做匿名化处理”不等于隐私保证

运行脱敏脚本或用令牌替换姓名并不能解决 AI 隐私问题。EDPB 在 第 28/2024 号意见中直接否定了这种思路:AI 模型并非天生匿名。必须进行逐案评估,监管机构如今期望将 差分隐私、提取攻击测试和内部隐私审计 作为具体的匿名化措施。

与此同时,重新识别攻击不断进步。研究人员已经证明,仅凭邮政编码、出生日期和性别,就能唯一识别出 87% 的美国人口 。在没有正式隐私保证的情况下生成的合成数据,仍可能通过模式推断泄露信息,而根据当前研究,对多阶段合成管道进行可追溯性验证“目前是不可能的”。

我们的标准是:只有当所用方法能够提供成员推断测试结果、最近邻距离分析,以及生成该数据时所依据的正式差分隐私预算时,某个合成数据集才被称为可安全共享。

面向生产部署而设计的差分隐私

差分隐私背后的理论已被充分理解;真正的工程挑战在于如何在不破坏数据可用性的前提下让它发挥作用。 DP-SGD 在模型训练过程中加入经过校准的噪声,使得任何单条训练记录都无法对输出产生实质性影响。隐私成本通过正式预算进行跟踪:每一次查询、每一个训练轮次、每一项下游分析都会消耗 epsilon。当预算耗尽时,便不再允许任何查询。

我们的方法根据你现有的技术栈,使用 Opacus (PyTorch)或 TensorFlow Privacy 来实现 DP。真正的工作不在于库的集成,而在于 epsilon 校准。由于合适的取值因数据集而异,一次合作会在你的真实数据上运行校准实验,以找到隐私保护和模型性能都能满足你需求的 epsilon 区间。来自真实部署的参考点:

  • 美国人口普查 在选区重新划分统计中使用了 epsilon 19.61。
  • LinkedIn 在三个月的窗口内以 epsilon 14.4 运行。
  • MOSTLY AI的基准测试显示,合成数据在 epsilon 2.51 下达到 96.2% 的下游精度,而不使用 DP 时为 98.1%——这约 2% 的精度权衡是大多数生产用例都能承受的。

跨团队的隐私预算分配

对于让多个团队针对共享敏感数据集开展工作的组织而言,隐私预算分配便成为一个组织设计问题。 谷歌的 PLD(隐私损失分布)核算器 所产生的组合上界比微软的 PRV 核算器紧 5 倍,比更早的 Privacy Buckets 方法紧 200 倍。更紧的组合意味着你的团队可以在同一隐私预算内运行更多分析。我们的做法是部署基于 PLD 的核算,配以按团队分配的预算、自动耗尽告警,以及旨在精确追踪哪些分析消耗了预算哪些部分的审计日志。

带有可度量隐私的合成数据生成

合成数据并非天生具有隐私性。在没有 DP 约束的情况下用患者记录训练的 GAN 会记住并复现真实记录,尤其是对于离群值和罕见病症。 2025 SaTML MIDST 挑战赛 证实,针对表格扩散模型的成员推断攻击依然有效,基于影子模型的检测能够可靠地识别出训练集成员。

我们的做法是采用与你的数据形态和隐私需求相契合的技术来生成合成数据。 TabDDPM (基于扩散)在近期基准测试中,无论是在机器学习效用还是分布保真度上都持续优于 GAN。 来自 SDV 生态系统的 CTGAN 能很好地处理混合了类别型和连续型的表格数据,但难以应对复杂的列间相关性,且在不平衡类别上容易出现模式崩溃。对于统计保真度最为重要的医疗和金融数据,我们通常选用 TabDDPM 或诸如 PrivBayes这样的贝叶斯网络生成器,并在 DP 约束下进行训练,使生成器本身无法记住单条记录。

从三个维度进行质量评估

  • 保真度: 合成数据是否再现了真实数据的统计特性——分布、相关性、条件关系?
  • 效用: 在合成数据上训练的模型,其表现是否可与在真实数据上训练的模型相媲美?
  • 隐私: 攻击者能否判定某个特定个体的记录是否在训练集中?

我们的评估将 DOMIAS (基于密度的成员推断)和最近邻距离分析作为标准做法。从业者一致发现,在正确生成的合成数据上训练的模型可达到 真实数据性能的 85–95%,而当合成数据是用来补充一个小规模真实种子集、而非完全取代真实数据时,这一差距会进一步缩小。

合成数据在哪些场景会失效,以及应改用什么

合成数据并非万能方案。如果你的用例要求精确保留分布尾部的行为——罕见疾病表型、用于欺诈检测的异常交易模式——那么合成生成器恰恰会抹平你所需要的信号。如果你的真实数据集规模很小(不足几千条记录),生成器便没有足够的信号来学习有意义的结构,合成输出会沦为带有貌似合理格式的噪声。

跨组织协作:联邦学习

在原始数据无法离开其源头的情况下,联邦学习是一种替代方案——但它的隐私特性比通常宣传的要弱。梯度反演攻击(Geminio、MMGIA)能够从共享的梯度中重建训练图像。在一项视网膜成像研究中,即便应用了中等强度的 DP,仍有 92% 的参与者 可以从梯度重建中被识别出来。安全聚合与逐次更新的 DP 噪声相结合,是最低限度的可行防御,而非可有可无的附加项。

推理时的隐私:机密计算

要保护用户查询免受模型提供方的窥探,通过 TEE 实现的机密计算是目前唯一可用于生产的路径。 NVIDIA Hopper 和 Blackwell GPU 现已支持机密执行,在推理过程中同时对模型权重和用户数据保持加密。 FHE 正在进步——GPU 加速的实现相较 CPU 基线可实现 200 倍的加速——但延迟和计算开销仍将其局限于狭窄的用例。

隐私保护型 AI 的监管图景正在快速变化,两年前的安全答案如今已不再成立。 EDPB 的第 28/2024 号意见 要求组织证明 AI 模型不会通过提取攻击泄露个人数据,而不仅仅是声称训练数据已被删除——这与我们所探讨的、朝着可证明的算法问责迈进的转变如出一辙, 我们关于后 RealPage 时代问责制的白皮书《欧盟 AI 法案》对高风险系统的要求将于 2026 年 8 月生效,在现有 GDPR 约束之上增加数据治理义务(第 10 条)。

拟议中的 《数字综合法案》(Digital Omnibus) 将把主体特定的可识别性写入法律——也就是说,对持有数据的组织而言属于个人数据的信息,对下游接收方而言可能并不属于个人数据。这可能重塑合成数据传输的分类方式,但相关指引尚未定稿。

HIPAA:安全港与专家判定

对于受 HIPAA 监管的组织而言,在安全港(Safe Harbor)与专家判定(Expert Determination)去标识化之间的选择,会直接影响 AI 训练数据的质量。 安全港 会剥离 18 类标识符,往往为机器学习去除了过多的信号。 专家判定 保留了更多有用的结构,但需要一位合格专家来证明重新识别风险“非常小”。一次合作的范围被界定为构建技术管道并产出专家判定所要求的统计分析。

加利福尼亚州 AB 2013 与监管映射

加利福尼亚州的 AB 2013 (自 2026 年 1 月 1 日起生效)现要求披露在 AI 训练中使用合成数据的情况。我们的方法将你的技术隐私保证映射到适用的监管要求,并记录你的差分隐私输出或合成数据集在何种具体条件下不属于个人数据范畴,同时对监管指引仍不确定之处如实标注注意事项。

核心要点

  • 匿名化脚本和令牌化并非隐私保证——EDPB 第 28/2024 号意见将 AI 模型视为并非天生匿名,而仅凭邮政编码、出生日期和性别即可重新识别出 87% 的美国人口。
  • 我们使用 Opacus 或 TensorFlow Privacy 为生产环境设计差分隐私,在你的真实数据上对照部署参考点(美国人口普查 19.61、LinkedIn 14.4、MOSTLY AI 2.51)校准 epsilon。
  • 谷歌的 PLD 核算器所提供的组合比微软的 PRV 紧 5 倍,比 Privacy Buckets 紧 200 倍,因此多团队预算能撑得更久。
  • 合成数据在 DP 约束下生成(TabDDPM、CTGAN、PrivBayes),并从保真度、效用和隐私三个维度进行评级——可达到真实数据性能的 85–95%——但在尾部行为和小数据集上会失效。
  • 联邦学习(易受 Geminio/MMGIA 梯度反演攻击)以及在 NVIDIA Hopper/Blackwell 上基于 TEE 的机密计算,是合成数据不适用时的替代方案。
  • 我们将各项保证映射到《欧盟 AI 法案》(2026 年 8 月)、GDPR、拟议中的《数字综合法案》、HIPAA 专家判定,以及加利福尼亚州 AB 2013(2026 年 1 月 1 日)。
常见问题

常见问题解答

在模型训练中加入差分隐私会让我们损失多少精度?

精度权衡取决于你的数据集规模、模型复杂度以及你所选择的 epsilon 值。在美国人口普查收入数据集(48,842 行、15 个属性)上,MOSTLY AI 的基准测试显示,在 epsilon 2.51 下使用 DP 可达 96.2% 的精度,而不使用 DP 时为 98.1%,差距约为 2%。对于更大的数据集,由于 DP 噪声的相对影响更小,差距会缩小。在小型表格数据集上,当 epsilon 低于 3 时,精度可能下降 15-30%,这正是在确定隐私预算之前于你的真实数据上进行 epsilon 校准至关重要的原因。我们会在各个 epsilon 区间内运行校准实验,以找到隐私保护和模型性能都能满足你需求的那一点,而不是从教科书里挑一个 epsilon。

一次隐私工程合作实际的成本和交付物是什么?

一次范围明确的合作,涵盖单个 DP 训练管道,并包含合成数据生成与质量评估,通常历时 8-12 周。交付物包括:带有明确 epsilon 预算和正式保证的隐私保护型训练管道;附带保真度、效用和隐私各维度质量报告的合成数据生成器;记录残余风险及其缓解措施的隐私风险评估;以及针对你现有数据基础设施的集成规范。对于需要跨多个团队进行企业级隐私预算管理的组织,需再增加 4-6 周用于核算基础设施和组织设计。总体投入取决于数据复杂度、监管范围,以及你是否需要 HIPAA 专家判定或 GDPR 匿名数据分析。

合成数据会自动符合 GDPR 合规要求吗?

不会。EDPB 的第 28/2024 号意见明确否定了“AI 输出天生匿名”这一观点。在没有差分隐私的情况下生成的合成数据,可能通过模式推断泄露关于真实个体的信息,监管机构如今期望将提取攻击测试和正式隐私措施作为匿名化的证据。拟议中的欧盟《数字综合法案》将把主体特定的可识别性写入法律,可能改变合成数据传输的分类方式,但相关指引尚未定稿。Gartner 预测,到 2030 年合成数据在 AI 训练中的使用量将超过真实数据,而合成数据市场预计到那一年将达到 23 亿美元。监管框架仍在追赶。我们会将你的技术隐私保证映射到具体的 GDPR 条款,并记录你的合成数据在何处不属于个人数据范畴,同时对尚未确定的监管立场如实标注注意事项。

我们应该自建合成数据管道,还是从 Gretel、MOSTLY AI 或 Tonic 采购?

商用平台已显著成熟。Gretel 提供可配置的 epsilon(1-20),配有对抗性隐私评分,并与 NVIDIA 建立了规模化合作。MOSTLY AI 使用 Meta 的 Opacus 库来实现 DP-SGD,在 epsilon 2.51 下达到很高的精度,并具备自动预算跟踪。Tonic 专注于工程团队的采用,支持结构化、半结构化和自由文本数据。在以下情况下自建更合理:你需要对 DP 参数拥有最大程度的控制、你的数据结构异常而商用生成器处理不佳,或你无法将数据发送到供应商环境。在以下情况下采购更合理:你的团队缺乏 DP 专业能力、你需要开箱即用的审计轨迹和合规文档,或非技术相关方需要访问。我们会针对你的具体需求评估这两条路径。许多组织最终采用混合方案:标准表格数据用商用平台,领域特定或高敏感度数据用自建管道。

我们如何为隐私预算选择合适的 epsilon 值?

不存在普遍正确的 epsilon。真实世界的部署跨越很宽的范围:美国人口普查在选区重新划分中使用 epsilon 19.61,LinkedIn 在三个月内以 14.4 运行,而交互式分析系统则为每次查询分配 0.1-1,季度预算为 1-10。合适的 epsilon 取决于你的威胁模型(你要防御的是何种攻击者能力)、你的数据敏感度(医疗记录要求比点击流数据更紧的预算),以及你的效用要求(你的下游应用能容忍多大的精度损失)。谷歌的 PLD 核算器所提供的组合上界比微软的 PRV 核算器紧 5 倍,意味着你能从同样的总预算中提取更多效用。我们会在你的数据上凭经验校准 epsilon,方法是测量各个 epsilon 区间内的下游任务性能,并将结果对照你的监管义务和风险承受能力进行映射。

差分隐私与传统数据匿名化之间有什么区别?

传统匿名化(脱敏、令牌化、k-匿名、l-多样性)对数据本身进行变换,并寄希望于这种变换不可逆。它对攻击者能够获知的内容不提供任何数学保证。研究人员已经证明,仅凭邮政编码、出生日期和性别就能唯一识别出 87% 的美国人口,这意味着仅对直接标识符进行简单脱敏是不够的。差分隐私采取了一种根本不同的方法:它向计算过程(模型训练、查询应答、合成数据生成)加入经过校准的噪声,从而在数学上保证输出不会揭示任何特定个体是否在输入之中。无论攻击者掌握何种辅助信息,该保证都成立。其代价是 DP 会加入噪声,从而降低精度。传统匿名化可以保留精确值,但不提供可证明的保护。

我们能用大语言模型来生成合成训练数据吗,这样做具有隐私性吗?

由大语言模型生成的合成数据日益普遍,过去一年发布的几乎每一个主流模型,都至少部分地使用了合成生成的数据进行训练。但其隐私分析与基于 GAN 或扩散的生成有着根本区别。大语言模型会记住训练数据:Carlini 等人证明了可从 GPT-2 中逐字提取包括姓名、电话号码和电子邮件地址在内的个人身份信息(PII)。如果生成你的合成数据的大语言模型,是用包含你试图保护的那些个体信息的数据训练的,那么合成输出可能就含有他们真实的个人数据。将多次查询的信息组合起来的复合提取攻击会使提取风险翻倍。基于大语言模型的合成生成,对于源数据已经公开的训练集扩充是有用的,但若不对大语言模型本身施加额外的 DP 机制,它对于敏感数据并不是一种隐私保护技术。

HIPAA 去标识化如何适用于 AI 训练数据?

HIPAA 提供两种去标识化方法,二者对机器学习有着截然不同的影响。安全港要求移除 18 类特定标识符。它清晰且易于标准化,但对大多数机器学习用例而言去除了过多信号,剔除了模型所需的地理粒度、时间精度和人口统计细节。专家判定允许一位合格专家证明重新识别风险非常小,在提供 HIPAA 合规性的同时保留更多有用的结构。专家判定更适合 AI 训练数据,因为它能针对具体的数据集和预期用途来量身定制去标识化。我们会构建专家判定所要求的统计分析和技术管道,包括重新识别风险量化,并提供满足合格专家认证流程的文档。

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。