大模型安全评测:延迟和成本不能挤掉安全判定
大模型安全评测:延迟和成本不能挤掉安全判定
Prompt 注入防护会增加分类、检索和工具授权步骤,但不能为了缩短耗时直接删掉。先拆清每道防线的输入和决策,再讨论优化。
记录判定链
一次请求关联输入分类、检索来源、策略版本、工具授权和最终动作。日志只保存脱敏摘要与原因码,不记录完整提示词或凭据。模型拒答、策略拒绝和下游超时使用不同状态,避免把安全拦截统计成服务故障。
成本从实际调用算
固定评测集,分别记录安全分类、主模型和工具调用的耗时与 Token。缓存策略结果时,键必须包含租户、策略与模型版本,不能跨权限复用。
优化后重放直接注入、间接注入、编码变体和正常业务样本,同时看绕过、误拒、尾延迟和成本。安全判定没有通过,再快也不能作为发布依据。