TAEFuzz:用“可迁移对抗样本”自动攻击深度学习模型

“ 随着深度学习模型在图像识别等任务中的广泛应用,其安全性问题日益受到关注。研究表明:深度学习模型容易受到对抗样本攻击;微小扰动即可导致模型输出错误结果;攻击往往具有跨模型迁移能力。然而,仍存在关键挑战:如何自动生成高质量攻击样本?如何系统性测试模型的鲁棒性?如何提升测试效率与覆盖能力?

传统 fuzzing 方法难以直接应用于深度学习系统,因为其输入空间是高维连续空间(如图像)。为此,论文提出:TAEFuzz,一种基于可迁移对抗样本的自动化深度学习模糊测试框架。 ”

  • 📄论文标题:TAEFuzz: Automatic Fuzzing for Image-based Deep Learning Systems via Transferable Adversarial Examples

  • 📅发表时间:ACM Transactions on Soware Engineering and Methodology,2025

  • 🏫作者单位:河海大学、皇家墨尔本理工大学、中山大学、柏林洪堡大学

  • 💡 开源代码:https://anonymous.4open.science/r/TAEFuzz-4575

01—方法介绍

图1是可转移的对抗示例生成。攻击者在代理模型上生成具有迁移性的对抗样本,并将其输入到目标模型中进行攻击。测试人员则模拟恶意攻击者的攻击方式,在代理模型上生成测试用例。这些测试用例被输入到目标模型中,用于发现具有迁移性的错误。

图 1. 可转移对抗示例生成

TAEFuzz 的核心思想是:利用对抗样本的“迁移性”,生成能够跨模型触发错误的测试输入,从而实现高效 fuzzing。

整体流程可以概括为三步:

① 对抗样本生成

基于源模型生成具有攻击性的输入样本;

② 可迁移性增强

优化样本,使其在不同模型间保持攻击效果;

③ 模型测试

将样本输入目标模型,检测错误行为。

图 2. TAEFuzz概述图

小结:将“对抗攻击”转化为“模糊测试输入生成策略”。

02—关键机制

  1. 对抗样本驱动 Fuzzing

    将 adversarial attack 融入模糊测试框架。

  2. 迁移性增强机制

    提升样本在不同模型之间的攻击能力。

  3. 连续空间测试策略

    突破传统 fuzzing 在离散输入上的限制。

  4. 高效测试流程

    减少无效样本,提高漏洞发现效率。

模块

设计思路

作用

对抗样本生成

利用梯度信息生成扰动图像

构造初始攻击输入

迁移性优化

增强样本跨模型攻击能力

提升 fuzzing 泛化性

种子选择策略

选择高潜力样本进行扩展

提高测试效率

反馈机制

基于模型输出变化进行引导

优化样本生成过程

错误检测

检测分类错误或异常输出

发现模型缺陷

小结:TAEFuzz 将“攻击生成 + 模型反馈”结合,实现闭环测试。

03—实验结果

实验是在ImageNet和Tiny-ImageNet数据集上进行的。对于非目标攻击,我们从ImageNet验证集中随机选择了1000张图像,从Tiny ImageNet验证集随机选择了2000张图像作为原始良性示例。主要实验结果如下。


TAEFuzz采用RMI用于提高发现的可转移错误的数量,实验结果见表1-4。实验分为两部分,分别针对基于传输的目标攻击和基于传输的非目标攻击。对于非目标攻击,从以下设置中验证RMI:

S1:在单个代理模型上没有与其他方法的耦合。

S2:在单个替代模型上与CT存在耦合。

S3:在集合替代模型上与CT存在耦合。

结果表明,RMI在所有模型上都显示了最佳结果,特别是在鲁棒模型上。与现有的最佳方法DT-PI++相比,CT-RP在鲁棒模型上将ASR提高了56.2%-71.2%。

表1. 不同方法与其他方法(顶表)不耦合,与CT(底表)耦合,在ImageNet数据集上使用单个模型查找可传递错误的能力

表2. 与CT不耦合的不同方法在微小ImageNet数据集上使用单个模型查找可传递错误的能力

表3. 不同方法与CT结合在ImageNet数据集上使用集成模型查找可传递错误的能力

表4. 使用集成模型查找目标误差的不同方法的能力

小结:TAEFuzz是一种通过可转移对抗示例进行基于图像分类的DNN的新模糊方法。TAEFuzz可以在目标模型中发现更多可转移的误差,并提高生成示例的图像质量。此外,TAEFuzz为噪声模块提供了一种成本较低的训练方法,显著提高了目标模型的稳健性。

📌 总结

TAEFuzz的核心贡献在于:将对抗样本生成与模糊测试融合,提出一种面向深度学习系统的自动化测试框架。该方法证明:对抗攻击不仅是威胁,也可以作为高效测试工具。

未来研究可能进一步探索:多模态深度学习系统的 fuzzing、更强泛化能力的对抗样本生成方法。

📣 欢迎留言讨论

  • 你认为对抗样本是否会成为 AI 系统测试的核心工具?

  • Fuzzing 与对抗攻击的结合是否会成为主流方向?

📌 点赞 + 收藏 + 分享,你的支持,是我们持续解析高水平软件安全论文的最大动力!