Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks
文章核心总结与创新点
一、主要内容
该研究针对大型语言模型(LLM)安全护栏模型的对抗性攻击鲁棒性展开全面评估,选取了来自Meta、谷歌、IBM、英伟达、阿里巴巴、艾伦人工智能研究院等7家机构的10个公开护栏模型,基于涵盖21个攻击类别的1445条测试提示词(含公开基准提示词与新型攻击提示词)进行测试。
核心发现包括:
- 整体性能:阿里巴巴Qwen3Guard-8B整体准确率最高(85.3%),其次是艾伦AI的WildGuard-7B(82.8%)和IBM的Granite-Guardian-3.3-8B(81.0%);而LlamaGuard系列部分模型表现较差,社区微调版LlamaGuard-7B准确率仅38.0%。
- 泛化能力缺陷:所有模型在新型攻击提示词上性能大幅下降,Qwen3Guard-8B从公开基准的91.0%跌至33.8%(差距57.2个百分点),而Granite-Guardian-3.2-5B泛化差距最小(仅6.5个百分点)。
- 安全与可用性权衡:LlamaGuard系列模型过于宽松(良性提示词准确率97%-99%,但有害提示词检测率仅4.5%-21.8%),Qwen3Guard-8B等模型则实现较好平衡。
- 新型失效模式:发现“帮助模式”越狱现象,Nemotron-Safety-8B(13.6%)和Granite-Guardian-3.2-5B(11.1%)会生成有害内容而非拦截,将防御工具转化为攻击向量。
- 模型规模反例:同系列中小规模模型表现更优(如ShieldGemma-2B优于ShieldGemma-9B),颠覆“规模越大性能越好”