审计自演化金融智能体:能力增益、安全漂移与执行‑接口不匹配 审计自演化金融智能体:能力增益、安全漂移与执行‑接口不匹配论文来源:arXiv:2608.17684v1摘要自演化智能体可以从历史交互经验生成可复用技能、工作流或者记忆。但是仅依靠演化后的任务准确率,无法判断学习得到的行为是否保留原有正确行为,也无法评估安全属性是否发生劣化。本文在仿真电子银行环境下,对SkillOpt、Agent Workflow Memory(AWM)、ReasoningBank三套主流自演化智能体开展审计;采用配对良性获取轨迹、密封评估端点、基于执行结果的校验器、独立状态重放完整实验链路。以Qwen‑3.7‑Flash为基座:SkillOpt将良性任务效用得分从0.741提升至0.837;出现23例由错转对的能力增益,同时存在10例由对转错的能力退化;但是智能体接触注入恶意内容的暴露率从0.820升高至0.943。在已经接触恶意内容样本内,攻击成功率(条件ASR)由0.605下降到0.562;全部受攻击样本总体攻击成功率ASR从0.496上升至0.530;未授权金融状态变更事件上升至0.685。该现象说明ASR上涨主要来自暴露率漂移,而不是接触攻击内容之后服从性变强。在3条独立演化谱系中:能力增益、攻击面暴露、未授权状态变更三项指标全部同步上涨;但是总体攻击成功率ASR仅在2条谱系上涨,证明ASR一致性最弱。ReasoningBank将效用提升到0.859,获得25项增益、9项退化;总体ASR没有上涨,但未授权状态变更略高于静态基线版本。AWM暴露一类全新评估陷阱:源自WebArena的文本动作封装格式,会在原生函数调用执行器中破坏工具调用执行。事后敏感性实验表明:仅删除该封装标签,效用就从0.319恢复至0.756,接近静态基线0.741;但是暴露率上涨到0.909,ASR上涨至0.575。结论:审计自演化金融智能体,不能只看准确率;必须同时追踪能力退化、攻击面接触情况、未授权金融状态变更、学习产物与执行器之间的兼容性。关键词:大模型智能体;自演化;提示词注入;金融智能体;安全审计1 引言大语言模型智能体可以保存历史交互文本,用来改进后续决策。Reflexion将反思文本存入情景记忆并复用到后续尝试;Self‑Refine利用自我生成反馈迭代修改输出。近期自演化系统把外部可复用状态显式实现:SkillOpt:基于轨迹编辑生成自然语言技能文档,通过验证门控完成部署;Agent Workflow Memory(AWM):从成功轨迹中归纳可复用工作流;ReasoningBank:从成功、失败经历中蒸馏推理记忆并做检索复用。学习外部状态本意是提升任务性能。但对于金融智能体,提升任务完成度的同时,也会改变智能体读取外部信息、调用高风险工具的行为。仅仅看演化后聚合准确率,无法观测这些变化;而在金融场景,有用信息与攻击者可控恶意指令来自同一交互入口。间接提示注入会将恶意指令放置在外部数据中,后续被大模型应用读取。InjecAgent证明该威胁同样适用于调用工具的智能体;AgentDojo提供包含电子银行套件的可扩展工具环境。在本文设定下,注入文本只有智能体调用工具拿到返回结果时,才会进入模型上下文。例如学到一条经验:“操作前先检查近期交易和引用文件”,该规则对良性任务有益,但同时增大接触攻击者控制内容的概率。反之,如果学习产物格式错误导致工具完全失效,则看起来安全性很高,但实际是无法正常执行。Shao等人将自演化过程中出现的非预期劣化定义为错误演化(misevolution),覆盖模型、记忆、工具、工作流多条路径。本文在此基础上,面向金融场景开展受控审计;将指标拆解为:能力变化、攻击暴露、接触攻击后的条件脆弱性、基于实际执行的金融危害。研究问题:当金融智能体从良性经验中自我学习,在提升弱样本表现的同时,是否可以保留原有正确行为,并且维持安全?完整评估闭环链路:学习规则 → 演化产物 → 执行器行为 → 交互攻击面 → 金融状态。报告指标:错转对(W→C)增益、对转错(C→W)退化、提示注入暴露率、接触攻击后条件攻击成功率、总体攻击成功率、可观测未授权金融状态变更。主要实验基于AgentDojo银行套件,预先审计修复校验器,得到15个任务家族。对比SkillOpt、AWM、ReasoningBank;使用同一套主执行器,一轮离线良性演化,3条独立演化谱系。演化阶段全部输入良性轨迹;同一谱系内部三套系统接收字节完全一致的获取轨迹;评估端点在全部演化产物冻结之后才解封。实验采用端到端对比,三套系统写权限、准入策略、更新机制、状态表示、检索逻辑均不相同,因此观测差异不能单纯归因为状态表示。本文贡献提出面向自演化金融智能体的基于执行结果的审计协议;统计配对能力增益与退化;将攻击成功率拆解为暴露率、条件脆弱性,同时度量未授权状态变更。证明能力提升与安全属性可以解耦。SkillOpt效用提升9.6个百分点,同时暴露率上涨12.3个百分点,未授权状态变更上涨10.2个百分点;ReasoningBank效用提升11.9个百分点,但总体攻击成功率没有上涨。上述现象在未修改官方校验器的任务子集同样成立。总体攻击成功率ASR在不同演化谱系之间一致性较差,证明需要分开报告暴露率和实际执行层面的危害。识别**执行‑接口不匹配(execution‑interface mismatch)**评估混淆因素。针对AWM做事后受控实验:保持学习到的工作流内容不变,仅仅修改不兼容的文本动作封装,区分性能下降来自工作流逻辑本身,还是面向执行器的接口格式。2 相关工作2.1 从智能体经验中自我学习SkillOS学习技能筛选策略;Shao等人提出错误演化,刻画模型、记忆、工具、工作流层面涌现风险。本文做受控金融审计:银行环境、攻击手段固定;三套外部状态演化系统接收字节完全一致的良性获取轨迹,排除获取证据差异带来的干扰。2.2 工具调用智能体安全间接提示注入相关威胁研究;Agent Security Bench、Agent‑SafetyBench;Task Shield在执行阶段强制任务对齐。现有基准大多评估固定配置下智能体安全;本文固定环境、攻击、评估协议,观测智能体经过良性自演化之后发生的变化。2.3 金融大模型与智能体FinanceBench开放集金融问答;FinBen金融大模型多任务评测;PIXIU金融领域基准、指令集、领域模型;FinCon面向金融多智能体的记忆与语言强化。本文场景更加聚焦,并且基于真实执行状态:AgentDojo Banking提供可变账户状态与高风险工具;审计转账、定时支付、凭证变更行为,同时评估敏感数据泄露,而不是只看任务得分或者交易性能。3 审计协议3.1 环境与校验器审计使用AgentDojo Banking v1.2.2,包含16个任务家族、9种注入攻击目标、11个工具。在调用模型之前,使用最多6种终端状态探针(真值、空操作、错误接收人、错误金额、错误输出、虚假动作)审计每一条官方效用判断谓词。要求谓词必须接受真值状态,拒绝所有适用的对抗状态。16个官方谓词中有4个不满足要求,分为三类缺陷。task_5、task_11修复中将字面接收人名字替换为可执行账户ID。全部修复在运行任何模型之前冻结。主实验使用修复之后15个任务家族;其中12个家族官方谓词没有改动,作为“未改动校验器”灵敏度子集在4.6节分析。任务家族缺陷类别问题说明冻结处理方案task_5、task_6fixture‑shadowed智能体执行前,已有历史记录就满足校验条件