ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

对抗攻击也“看菜下碟“:用零梯度百分比揪出最容易被攻破的样本

对抗攻击也“看菜下碟“:用零梯度百分比揪出最容易被攻破的样本 论文标题:Quantifying and Exploiting Adversarial Vulnerability: Gradient-Based Input Pre-Filtering for Enhanced Performance in Black-Box Attacks作者:Naveen Karunanayake、Bhanuka Silva、Yasod Ginige、Suranga Seneviratne(悉尼大学计算机科学学院)、Sanjay Chawla(卡塔尔计算研究院)发布:ACM Transactions on Privacy and Security,第28卷第2期,Article 24,2025年3月人脸识别、自动驾驶、内容审核……深度学习模型正被用在越来越多关键场景,但它们都有一个共同的软肋:对抗样本。只要在输入上加一点人眼几乎察觉不到的扰动,就可能让模型给出完全错误的判断。这篇论文提出了一个很实际的问题:同一个模型面对不同输入时,是不是有些输入天生就比别人更好骗?论文原文:https://doi.org/10.1145/3716384核心发现:零梯度百分比(ZGP)答案是肯定的。作者提出了一个简单却有效的指标——零梯度百分比(Zero Gradient Percentage,ZGP):把损失函数关于输入的梯度做裁剪(把绝对值很小、接近数值噪声的分量归零)后,统计还剩多少比例的分量恰好为零。核心结论是:ZGP越低的样本,越容易被对抗攻击攻破。这个结论并非拍脑袋得来。作者从FGSM(快速梯度符号法)的线性模型推导入手:对线性模型而言,扰动带来的输出变化正比于权重向量中非零分量的平均幅度。零分量比例越高,扰动越难改变输出,攻击也就越难成功;零分量越少,同样大小的扰动引起的变化就越大,攻击越容易得手。这一推导在l∞和l2两种扰动约束下都成立,并可自然推广到PGD、MI-FGSM等更强的迭代攻击。四个核心贡献理论推导:基于FGSM的线性解释,证明ZGP可作为衡量输入对抗脆弱性的理论依据。大规模实证验证:在图像(MNIST、CIFAR-10、SVHN、Tiny ImageNet)和表格(Spambase、Dry Bean、Wine Quality)共7个数据集上,ZGP最低的样本平均比随机选择的样本更容易被攻击成功34.5%。跨模型可迁移性:用一个模型架构算出的低ZGP样本,拿去攻击另一个完全不同架构的模型时依然表现出高脆弱性——这意味着攻击者甚至不需要知道目标模型的具体结构。改进的黑盒攻击流程:先用攻击者自己训练的影子模型计算ZGP,筛选出最脆弱的样本,再对这些样本发起查询式黑盒攻击,平均比传统影子模型攻击提升44.9%,比传统查询式攻击提升30.4%。方法是怎么做的具体流程并不复杂:计算损失相对输入的梯度,把绝对值小于阈值δ的分量裁剪为零(消除数值噪声),再统计零分量占比即得ZGP;按ZGP从0%到100%把样本分区间,分别用FGSM、PGD、MI-FGSM及集成攻击AutoAttack测试,以准确率下降幅度衡量攻击成功率。白盒场景直接用目标模型自身梯度;更贴近现实的黑盒场景中,攻击者用同分布数据训练一个本地影子模型计算ZGP,再对筛选出的样本发起无需梯度的Square Attack或基于查询估计梯度的有限差分攻击——这正是论文提出的新攻击流程的核心。实验结果一览平均而言,0% ZGP区域的样本比随机样本的攻击成功率高34.5%;在FGSM攻击下,图像数据集平均提升60.8%,表格数据集因输入维度较低,提升幅度较小(10.8%)。跨架构迁移测试中,例如在MNIST上用MLP筛选出的低ZGP样本去攻击一个完全独立训练的CNN,准确率下降78.5%,而随机样本只有13.4%。在查询受限的黑盒场景下,传统影子模型攻击平均成功率仅16.1%,传统查询式攻击为30.7%,而加入ZGP预筛选后,平均成功率跃升至61.0%,且低扰动强度下的提升尤为明显。现实意义与局限许多机器学习云服务(MLaaS)按查询次数计费,例如Clarifai的NSFW内容审核接口超出免费额度后每千次查询就要付费。攻击者若能用更少查询达到更高成功率,绕过内容审核或人脸识别系统的成本就会大幅降低——这正是论文强调查询效率的现实背景。方法也有边界:当攻击目标是预先指定的单一输入(比如必须让某个特定人脸通过验证)时,ZGP无从选择样本;对文本这类离散数据也不够友好,因为词向量梯度与原始文本语义并不完全对应。作者也提到,ZGP同样可反过来用于防御——对抗训练中优先挑选低ZGP样本作为难例强化,或有助于提升模型整体鲁棒性。延伸阅读论文原文(ACM DOI):https://doi.org/10.1145/3716384
返回列表