本文提出了一种基于区块链的不可学习样本生成框架,将动态扰动与访问控制相结合。该框架通过确保未授权用户只能获取扰动后的数据,从而加强隐私保护,在保护敏感信息的同时,利用智能合约实现高效的数据管理和访问。
研究文章
本文提出了一种基于区块链的不可学习样本生成框架,将动态扰动与访问控制相结合。该框架通过确保未授权用户只能获取扰动后的数据,从而加强隐私保护,在保护敏感信息的同时,利用智能合约实现高效的数据管理和访问。
在大语言模型(LLMs)快速发展的背景下,对比学习因其能够利用海量网络数据进行模型训练,从而规避高昂的数据标注成本,已被广泛采用。然而,这种广泛应用引发了人们对数据隐私保护的严重关切。不可学习样本(Unlearnable Examples, UEs)是一种通过扰动数据来干扰模型学习的技术,可有效防止未经授权的模型滥用敏感数据。然而,现有的UE生成方法面临两个主要挑战:第一,扰动可能被逆转,例如通过反向净化或去噪技术(包括能够去除图像UE中保护性扰动的扩散模型);第二,数据一旦发布,数据可追溯性的确保和访问控制的管理将变得困难。为解决上述问题,本文提出了一种区块链集成的不可学习样本生成与管理框架(Blockchain-Integrated Unlearnable Example Generation and Management Framework, B-UEGMF),用于UE的生成与管理。该框架利用区块链的去中心化和不可篡改特性,将样本哈希值存储于区块链上,并通过智能合约动态管理数据访问权限。此外,采用一种多目标扰动技术——动态误差最小化噪声(Dynamic Error-Minimizing Noise, DEM)生成UE,以增强对逆转方法的鲁棒性。本文还对所生成样本的隐私保护能力进行了定量评估。实验结果表明,所提出的框架在确保高效数据隐私管理的同时,显著提升了UE对逆向攻击的防御能力。
近年来,随着深度学习和大语言模型的快速发展,对比学习因其不依赖昂贵的人工标注而成为一种高效的无监督学习方法1,2。然而,公共数据集的广泛使用引发了人们对隐私泄露和数据滥用的严重担忧。未经授权使用公开数据进行模型训练的情况日益普遍3。例如,2017年,未经授权的公开照片被用于训练人脸识别模型4。类似地,亚马逊在未获得所有用户明确同意的情况下,利用消费者的公开评论数据训练其推荐系统,暴露出隐私保护机制中的漏洞5。
为解决这些问题,不可学习样本(Unlearnable Examples, UEs)作为一种新型数据隐私保护技术应运而生。UEs 通过对数据样本添加难以察觉的扰动,引入一种捷径机制,使模型无法学习到敏感信息,同时保持人类对数据的可感知性6,7,8。目前生成 UEs 的主要方法包括误差最小化噪声(Error-Minimizing noise, EM)扰动9、基于生成对抗网络(generative adversarial networks, GANs)的扰动生成方法10、鲁棒误差最小化噪声(Robust Error-Minimizing noise, REM)以及通过对抗训练优化的稳定误差最小化噪声(Stable Error-Minimizing noise, SEM)11,12。此外,扩散模型最近也被用于生成错误标签噪声,进一步增强了隐私保护效果13。
尽管在生成不可学习样本(Unlearnable Examples, UEs)方面已取得显著进展,但在实际应用中仍存在若干挑战,尤其是在这些方法的隐私保护效果尚未得到充分验证的真实场景中。具体而言,主要挑战包括:
恢复性问题:扩散模型能够通过预测并移除数据中嵌入的扰动,部分恢复不可学习样本,从而重新获得可学习性,进而削弱隐私保护效果14,15。即使在训练过程中对数据进行了扰动处理,敏感信息仍可能在恢复后被泄露。
数据可追溯性与访问控制:一旦不可学习样本被发布,目前尚缺乏有效的技术手段来追踪其来源并实施访问限制16。
隐私保护与模型性能的平衡:现有方法虽致力于生成不可学习样本来保护隐私,但在隐私保护与模型训练性能之间实现平衡的问题仍未解决17,18,19。当前大多数研究优先考虑隐私保护,而对缓解模型训练过程中的性能下降问题关注有限20,21。因此,数据的访问与使用已成为隐私保护中的关键问题22。
尽管集中式解决方案和可信执行环境(TEEs)为数据访问控制提供了替代方法,但在医疗/法律场景中,它们存在固有的局限性:(1)集中式系统引入了单点故障,并依赖于审计机制23;(2)TEE 需要专用硬件,且缺乏去中心化的共识机制24。区块链因其不可篡改的账本特性,成为管理 UE 的最优解决方案,能够直接满足三项关键需求:可验证地遵守数据治理法规(例如 HIPAA 审计追踪)、在多机构环境中实现抗审查的访问控制,以及通过带时间戳的交易实现细粒度的来源追溯25,26,27。
我们的框架在中等规模数据集上结合GPU加速展现出最优性能,实现了实时扰动生成。尽管区块链操作引入了可测量的开销,但在需要不可篡改访问日志的场景中(例如多机构医学研究或受监管的数据市场),这一权衡是合理的。该系统随数据集规模呈线性扩展,但稳定运行需要至少16 GB内存和4核CPU,因此不太适用于资源受限的边缘设备。
为应对这些挑战,本文提出了一种区块链集成的不可学习样本生成与管理框架(Blockchain-Integrated Unlearnable Example Generation and Management Framework, B-UEGMF)。区块链作为一种去中心化且不可篡改的分布式账本技术,能够有效记录数据访问哈希,并通过智能合约动态管理访问权限,从而增强不可学习样本的隐私保护能力28,29。在该框架下,授权用户可访问原始干净数据,而未经授权的用户仅能访问动态生成的不可学习样本。为解决现有问题,本文引入了一种新型的动态误差最小化噪声(Dynamic Error-Minimizing Noise, DEM)生成方法。通过融合客户端特定信息和时间参数,DEM将扰动动态嵌入数据中,为每次数据请求生成唯一的扰动,确保数据隐私性与不可学习性。DEM的生成过程如图1所示。本文的主要贡献如下:
动态可追溯性与访问管理:本文通过提出B-UEGMF框架,解决了不可学习样本发布过程中的可追溯性与访问控制问题。区块链的去中心化特性解决了传统系统中对可信第三方的依赖问题,其透明性则可在不暴露原始数据的前提下实现可验证的访问日志。通过利用区块链的透明性与不可篡改性,结合智能合约实现的动态访问控制,该框架确保未经授权的用户无法恢复或传播原始干净数据,从而显著提升数据安全性。
动态扰动生成机制:提出了一种动态不可学习样本生成方案,其中智能合约负责管理来自不同客户端的请求。针对未授权客户端的请求,基于客户端特定信息和时间参数动态生成DEM扰动。该机制确保扰动效果在不同请求间有所变化,从而增强对基于扩散的噪声去除方法的抵抗能力,并限制未授权用户一次性访问大规模数据集。
在 CIFAR-10、CIFAR-100 和 ImageNet 数据集上进行的实验表明,DEM 在隐私保护和抵御逆向工程攻击方面优于现有方法(例如 EM、TAP 和 SEM),如图 2所示;同时,与 EM 相比,其对去噪攻击的抵抗能力提高了 57%,与 SEM 相比提高了 25%,如图 3所示,凸显了其在实际应用场景中的潜在适用性。
访问受限。请登录或开始试用以查看此内容。
设置
我们考虑一个监督分类任务,其数据集为
,其中
表示输入特征,
表示对应于 K 类问题的类别标签。数据集 D 被划分为一个干净的训练数据集和一个测试数据集。
目标是通过引入微小且难以察觉的扰动来修改干净的训练数据集 δ 创建一个无法学习的数据集
,其中
+ δ扰动 δ 由……限定
,确保其不会显著影响数据的正常使用价值。关键目标是通过强制模型学习过程受到干扰来破坏其学习能力 fθ,经训练于 Du,从而关注由噪声引起的无关模式,而非有意义的特征,导致在干净的测试数据集上泛化性能较差:
![figure-protocol-7 优化公式 argmin E[(xᵢ,yᵢ)~Dᵤ] L(fₑ(xᵢ),yᵢ),数学表达式。](/files/ftp_upload/68338/68338eq7.jpg)
模拟区块链环境
为了安装区块链工具,采用 Hardhat 框架在本地环境中模拟以太坊网络,用于部署智能合约并测试不可学习样本的生成。为启动本地网络,需初始化一个包含多个节点和账户的模拟区块链网络。每个节点将分配以太币等资源,以支持交易模拟。在智能合约开发过程中,实现合约以动态管理用户权限:授权用户可访问干净数据,未授权用户则仅能访问不可学习样本。首先,基于 Node.js v16.x 和 Hardhat 2.8.4 配置开发环境,并使用 Solidity 0.8.17 编译器完成智能合约的编译与优化。通过命令行执行 npx hardhat compile 命令进行编译,生成包含 ABI 和字节码的构建产物。随后,运行部署脚本 npx hardhat run scripts/deploy.js --network sepolia,将合约部署至 Sepolia 测试网络,并记录输出的合约地址及部署交易哈希。在性能测试阶段,依次执行三项核心测试:交易成本测试通过循环调用合约的 grantAccess 方法记录燃气消耗;吞吐量测试使用 Artillery 工具模拟用户请求,逐步增加负载;测试与验证交易包括数据存储与检索操作,以验证智能合约的功能正确性。
构建链上用户与权限机制
使用区块链钱包(例如 MetaMask)生成唯一的用户账户,每个账户包含一个私钥和一个公钥。原型实现采用模拟的区块链环境,其中合成的用户实体将公开可用的数据集上传至去中心化系统,仅在分布式账本上存储加密哈希值。这确保了数据完整性,同时避免将实际数据存储在链上,从而避免低效和高昂成本。实际数据存储在链下,通常使用 IPFS 等去中心化存储系统,以在保障安全性和隐私性的同时实现高效的数据管理。对于非同质化代币(NFT)和访问控制,本研究实现了基于符合 ERC-721 标准的 NFT 的细粒度访问控制机制。每个不可学习样本的数据集都关联一个唯一的 tokenId,该 tokenId 作为访问数据的密钥。用户通过提交 Merkle 证明来请求访问权限。这些证明以安全且去中心化的方式验证用户身份。在成功验证证明后,智能合约会铸造一个唯一的 NFT 并将其转移至用户的钱包。该 NFT 表示用户访问特定不可学习样本相关数据的权利。通过使用 NFT,可确保仅授权用户能够基于去中心化且不可篡改的记录访问数据。这与传统的基于角色的访问控制(RBAC)不同,后者通常在组级别运行,可能无法为高安全性应用提供所需的细粒度控制30。
智能合约通过 ownerOf 函数持续验证访问权限,检查 NFT 的所有权,以确保仅有授权用户可访问干净数据。管理员可通过 revokeAccess 函数销毁 NFT 以撤销访问权限,从而确保在时间推移中灵活管理用户访问。操作工作流程包含四个关键步骤:(1)用户提交包含 Merkle 证明的访问请求;(2)合约验证这些证明的有效性;(3)验证成功后,合约铸造相应的 NFT;(4)用户通过 NFT 元数据中嵌入的 IPFS 内容标识符(CID)检索加密数据。通过利用 NFT,我们相较于传统访问控制机制实现了多项优势,例如细粒度的权限控制(数据级而非组级)、更强的审计能力(链上不可篡改记录)以及权限可转让性(通过 NFT 市场交易)。
多重签名合约用于更新 Merkle 根哈希,防止数据被未经授权的篡改。系统通过将每个数据集绑定到唯一的 tokenId 来实现抗女巫攻击机制,确保恶意行为者无法生成伪造的代币以访问未授权的数据。用户数据(UEs)在上传至星际文件系统(IPFS)网络之前,使用 AES-256 进行加密。加密后的数据哈希值存储在链上,而完整数据集则保留在 IPFS 上,从而降低区块链的存储开销。这种链上与链下存储相结合的混合方法,在确保数据可用性的同时降低了存储成本,这是基于区块链应用中的常见问题。
智能合约被用于动态管理用户权限。只有当用户持有相应的NFT(作为其授权令牌)时,才被授予访问清洁数据的权限。智能合约将所有数据访问记录在事件日志中,实现完整的可追溯性。这些日志不可篡改,可进行审计,从而提供透明度与问责性。智能合约通过grantAccess函数来验证访问请求。合约会检查用户是否持有相应的NFT,若验证通过,则授予其对所请求数据的访问权限。每次访问事件均被记录在区块链上,确保所有数据检索活动均可验证。每个数据访问事件均由智能合约实时记录,并触发AccessGranted事件。该事件包含重要信息,例如用户的钱包地址、访问时间戳以及对应的NFT tokenId。智能合约的动态特性支持权限的实时管理。这在去中心化应用中尤为有用,因为访问控制需要具备高度的灵活性,并能适应不断变化的条件。
为解决公共区块链环境中的隐私问题,系统将低分辨率缩略图(例如 64 × 64 像素)存储在区块链上,而原始高分辨率图像则经过加密后存储在链下的 IPFS 中。只有持有相应 NFT 的授权用户才能获取解密密钥,以访问高分辨率数据。未经授权的用户只能获得带有实时 DEM 扰动的数据版本,从而确保其无法访问原始数据。
生成图像扰动
加载 CIFAR10、CIFAR100 和 ImageNet 数据集。将数据集中的图像统一调整大小并转换为 PyTorch 张量,然后使用均值和标准差对图像张量进行归一化。使用高斯分布初始化随机噪声 δ1,以生成初始扰动。将随机噪声应用于每张图像 x,并根据交叉熵损失计算目标标签与模型预测之间的损失。在包含 C 个类别的数据集中,对于样本 i,yi 为目标标签值,pi 为模型预测概率,用于量化模型预测的概率分布与真实标签之间的差异,通过最大化该损失使模型产生错误预测。交叉熵损失函数为:

根据损失函数计算图像扰动对预测的影响,反向传播更新扰动,通过多次迭代不断更新扰动范围和扰动值。对于学习率 η,扰动的更新公式为:

生成文本扰动
加载预训练的 BERT 模型以生成文本嵌入。使用一个自定义的 TextFeatureExtractor 网络,该网络由两个 Transformer 模块和一个全连接层组成,用于从 BERT 模型生成的文本嵌入中提取特征。将访问用户的信息和时间戳输入预训练的 BERT 模型,并通过自定义的 TextFeatureExtractor 网络动态生成文本噪声。
输入图像 我 输入至Qwen2.5-VL-7B-Instruct多模态模型中。在结构化提示的引导下,该模型生成一段简洁的文本描述 Tq. 此生成的文本 Tq 输入至预训练的 BERT-base-uncased 语言模型中。通过任务特定的重写提示,系统生成扰动文本
在保持语义的同时改变表达方式。文本特征提取器网络(TextFeatureExtractor)对扰动后的文本进行映射
转化为高维语义嵌入向量 Eg.
生成多目标扰动
为确保文本嵌入与图像扰动之间的兼容性,我们调整文本嵌入的形状,使其维度与图像扰动相匹配。设ET和Eq表示文本嵌入,PL表示图像扰动。重塑过程确保ET和Eq被转换为与PL相同的维度:
,其中C, H, W为PL的维度。定义一个注意力机制融合模块,用于融合文本嵌入扰动与图像扰动,并根据文本的注意力权重动态调整扰动。融合方式如下:

其中,α 为注意力机制参数的动态调整系数。δT 是由 Eq 和 ET 生成的文本扰动。在训练过程中添加正则化项以防止过拟合,该正则化项为文本嵌入的 L2 范数,用于惩罚扰动。多目标损失函数结合了交叉熵损失与融合扰动,其形式如下:

损失函数的目标是:

其中,λ 是用于控制扰动惩罚力度的正则化系数,旨在抑制过度扰动或过拟合。在对抗攻击研究中发现,
是人眼可感知的扰动上限。训练与评估过程包括扰动生成、损失计算、模型训练等步骤。
对比实验
我们对所提出的动态误差最小化噪声(Dynamic Error-Minimizing Noise, DEM)方法与三种现有方法进行了全面评估:误差最小化噪声(Error-Minimizing Noise, EM)、可迁移对抗扰动(Transferable Adversarial Perturbations, TAP)以及稳定误差最小化噪声(Stable Error-Minimizing Noise, SEM)。这些方法在三个基准数据集上进行了测试:CIFAR-10、CIFAR-100 和 ImageNet 的一个子集,并结合四种广泛使用的神经网络架构:VGG-16、ResNet-18、ResNet-50 和 DenseNet-121,以确保实验条件的多样性。
此外,我们通过应用基于扩散的去噪模型来去除防御性噪声,并测量去噪样本在测试数据集上的准确率,以检验这些方法的鲁棒性。该步骤旨在评估每种方法在对抗条件下抵抗恢复攻击并保持数据隐私完整性的能力。结果表明,我们的DEM在所有数据集和架构上的鲁棒性和准确率均优于其他方法,证明了其作为一种隐私保护框架的有效性。
访问受限。请登录或开始试用以查看此内容。
区块链与智能合约框架
实验结果表明,所提出的区块链集成不可学习样本生成与管理框架(B-UEGMF)结合智能合约,能够有效实现对特定客户端数据访问的动态管理。对于授权用户,从系统中检索到的干净数据在基于CIFAR-10数据集评估的ResNet-18代理模型上达到了90.2%的测试准确率。相比之下,未授权用户访问由DEM生成的不可学习样本(UEs)时,其测试准确率显著降低至13.0%。这些结果验证了B-UEGMF在通过强健的不可学习样本来保护数据隐私的同时,有效实施访问控制的能力,如图2所示。更多实验结果见表1。
对恢复攻击的抵抗能力
所提出的动态误差最小化噪声(Dynamic Error-Minimizing Noise, DEM)在抵抗基于恢复的对抗性攻击方面,表现出优于现有方法的鲁棒性。不同方法之间的训练损失比较如图4所示。在涉及扩散模型及其他去...
访问受限。请登录或开始试用以查看此内容。
区块链与UEs的结合通过提供一种透明且去中心化的数据访问管理方案,推动了数据隐私保护领域的发展。与传统隐私保护方法通常仅依赖扰动技术31不同,本研究弥合了数据保护与责任追溯之间的鸿沟。在联邦学习场景中,所提出的框架确保在去中心化数据集上进行安全且私密的模型训练,降低了未经授权恢复数据的风险。此外,DEM中嵌入的注意力机制提升了模型的适应性和鲁棒性,为其在复杂现实场景中的应用奠定了基础。
尽管本研究具有诸多贡献,但仍存在若干局限性。首先,当前框架主要针对图像分类任务中的隐私保护,其在其他下游任务中的表现尚未得到探索。其次,区块链集成的计算开销,包括存储和交易成本,可能限制其在大规模应用中的可扩展性。第三,动态扰动生成方法依赖于客户端元数据和时间戳,可能无法充分捕捉生成最优噪声所需的所有相关上下文因素。解决这些局限性需要对区块链框架和扰动生成策略进一步优化。
该框架在需要严格隐私保护和可追溯数据访问的场景中具有重要意义。例如,在医疗领域,患者数据必须在保密的同时支持协作研究
访问受限。请登录或开始试用以查看此内容。
作者无任何与本出版物相关的内容需要披露。
本工作得到了郑州大学网络空间安全学院的支持,该学院提供了优良的研究环境和学术资源。我们衷心感谢导师张子蛟教授在本研究过程中给予的宝贵指导、深刻建议和持续不断的鼓励。同时,我们诚挚感谢郑州大学网络管理中心提供了实验服务器、高性能计算资源以及区块链测试平台基础设施,这些条件对本研究的顺利实施至关重要。
作者贡献:
Ruijia Li 构思了本研究,开发了研究方法,开展了实验,进行了数据分析,并撰写了初稿。Zijiao Zhang 提供了研究监督、方法学验证以及对稿件的关键性审阅。Shouli Fu 为区块链的实现提供了指导。Lin Zhu 协助完成了数据整理与验证。Qunpeng Lei 参与了理论框架的构建。Buwei Wang 提供了技术支持。所有作者均审阅并批准了最终稿件。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CUDA 12.1 | NVIDIA | 用于提升深度学习应用的性能 | |
| NVIDIA A800 80GB PCIe A800 80GB PCIe | NVIDIA | 用于深度学习模型训练 | |
| Python 3.10 | Python Software Foundation | 用于数据预处理与分析 | |
| PyTorch 2.5.1 | 用于模型训练的深度学习框架 | ||
| Ubuntu 22.04 | Canonical | 用于环境搭建的操作系统 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可