TAEFuzz:用“可迁移对抗样本”自动攻击深度学习模型
“ 随着深度学习模型在图像识别等任务中的广泛应用,其安全性问题日益受到关注。研究表明:深度学习模型容易受到对抗样本攻击;微小扰动即可导致模型输出错误结果;攻击往往具有跨模型迁移能力。然而,仍存在关键挑战:如何自动生成高质量攻击样本?如何系统性测试模型的鲁棒性?如何提升测试效率与覆盖能力?
传统 fuzzing 方法难以直接应用于深度学习系统,因为其输入空间是高维连续空间(如图像)。为此,论文提出:TAEFuzz,一种基于可迁移对抗样本的自动化深度学习模糊测试框架。 ”
📄论文标题:TAEFuzz: Automatic Fuzzing for Image-based Deep Learning Systems via Transferable Adversarial Examples
📅发表时间:ACM Transactions on Soware Engineering and Methodology,2025
🏫作者单位:河海大学、皇家墨尔本理工大学、中山大学、柏林洪堡大学
💡 开源代码:https://anonymous.4open.science/r/TAEFuzz-4575
01—方法介绍
图1是可转移的对抗示例生成。攻击者在代理模型上生成具有迁移性的对抗样本,并将其输入到目标模型中进行攻击。测试人员则模拟恶意攻击者的攻击方式,在代理模型上生成测试用例。这些测试用例被输入到目标模型中,用于发现具有迁移性的错误。
图 1. 可转移对抗示例生成
TAEFuzz 的核心思想是:利用对抗样本的“迁移性”,生成能够跨模型触发错误的测试输入,从而实现高效 fuzzing。
整体流程可以概括为三步:
① 对抗样本生成
基于源模型生成具有攻击性的输入样本;
② 可迁移性增强
优化样本,使其在不同模型间保持攻击效果;
③ 模型测试
将样本输入目标模型,检测错误行为。
图 2. TAEFuzz概述图
小结:将“对抗攻击”转化为“模糊测试输入生成策略”。
02—关键机制
- 对抗样本驱动 Fuzzing
将 adversarial attack 融入模糊测试框架。
- 迁移性增强机制
提升样本在不同模型之间的攻击能力。
- 连续空间测试策略
突破传统 fuzzing 在离散输入上的限制。
- 高效测试流程
减少无效样本,提高漏洞发现效率。
模块 | 设计思路 | 作用 |
|---|---|---|
对抗样本生成 | 利用梯度信息生成扰动图像 | 构造初始攻击输入 |
迁移性优化 | 增强样本跨模型攻击能力 | 提升 fuzzing 泛化性 |
种子选择策略 | 选择高潜力样本进行扩展 | 提高测试效率 |
反馈机制 | 基于模型输出变化进行引导 | 优化样本生成过程 |
错误检测 | 检测分类错误或异常输出 | 发现模型缺陷 |
小结:TAEFuzz 将“攻击生成 + 模型反馈”结合,实现闭环测试。
03—实验结果
实验是在ImageNet和Tiny-ImageNet数据集上进行的。对于非目标攻击,我们从ImageNet验证集中随机选择了1000张图像,从Tiny ImageNet验证集随机选择了2000张图像作为原始良性示例。主要实验结果如下。
TAEFuzz采用RMI用于提高发现的可转移错误的数量,实验结果见表1-4。实验分为两部分,分别针对基于传输的目标攻击和基于传输的非目标攻击。对于非目标攻击,从以下设置中验证RMI:
S1:在单个代理模型上没有与其他方法的耦合。
S2:在单个替代模型上与CT存在耦合。
S3:在集合替代模型上与CT存在耦合。
结果表明,RMI在所有模型上都显示了最佳结果,特别是在鲁棒模型上。与现有的最佳方法DT-PI++相比,CT-RP在鲁棒模型上将ASR提高了56.2%-71.2%。
表1. 不同方法与其他方法(顶表)不耦合,与CT(底表)耦合,在ImageNet数据集上使用单个模型查找可传递错误的能力
表2. 与CT不耦合的不同方法在微小ImageNet数据集上使用单个模型查找可传递错误的能力
表3. 不同方法与CT结合在ImageNet数据集上使用集成模型查找可传递错误的能力
表4. 使用集成模型查找目标误差的不同方法的能力
小结:TAEFuzz是一种通过可转移对抗示例进行基于图像分类的DNN的新模糊方法。TAEFuzz可以在目标模型中发现更多可转移的误差,并提高生成示例的图像质量。此外,TAEFuzz为噪声模块提供了一种成本较低的训练方法,显著提高了目标模型的稳健性。
📌 总结
TAEFuzz的核心贡献在于:将对抗样本生成与模糊测试融合,提出一种面向深度学习系统的自动化测试框架。该方法证明:对抗攻击不仅是威胁,也可以作为高效测试工具。
未来研究可能进一步探索:多模态深度学习系统的 fuzzing、更强泛化能力的对抗样本生成方法。
📣 欢迎留言讨论
你认为对抗样本是否会成为 AI 系统测试的核心工具?
Fuzzing 与对抗攻击的结合是否会成为主流方向?
📌 点赞 + 收藏 + 分享,你的支持,是我们持续解析高水平软件安全论文的最大动力!