有地图的人还在原地打转:AI智能体在环境变化面前的一场溃败 你有没有遇到过这样的同事明明手册上写着if门锁打不开检查是不是换了新钥匙他偏偏还是站在门口拿着旧钥匙一遍又一遍地插插不进去就换个角度再插插了二十次也没想起来去翻手册。这听起来像是个笑话但新加坡南洋理工大学DeCLaRe实验室的研究团队发现当前最顶尖的大语言模型智能体干的就是这件事。他们设计了一个叫ScrambleToolBench的测试环境把工具的名字和说明书全部抹去只留下一个个乱码般的接口逼着AI通过反复试验去搞懂每个工具到底是干什么的。结果AI确实学会了学得还不错。可一旦研究者悄悄把工具的身份牌互相调换了一下AI手里明明攥着自己刚记下的笔记却完全没想到去翻一翻而是选择从头开始把所有工具挨个试一遍。这篇论文的题目起得很直白《智能体依然会做穷举式搜索即便他们自己的地图已经指明了下一步》。这句话本身就是整篇研究最扎心的结论。当说明书被撕掉之后AI还剩下什么我们平时看到的AI用工具的演示基本都长这样模型调用一个叫read_file的函数参数是文件路径然后拿到内容。这个过程之所以顺畅是因为函数名本身就是提示。read_file这个词任何受过训练的语言模型都在无数代码库里见过成千上万次它不需要理解只需要识别。研究团队把这种现象叫做语义先验。**语义先验模型依靠训练数据中见过的命名习惯比如函数名包含readsearch这类词来猜测功能而不是真正通过观察输入输出去推理。**问题是现实世界没这么友好。很多企业内部系统的接口命名混乱不堪第三方API的文档可能过时甚至完全对不上实际行为。一个真正健壮的智能体应该有能力在完全没有文档、没有语义线索的情况下靠着试一下、看反馈、调整假设这套流程把工具摸清楚。这就是ScrambleToolBench想要测的东西把语言这层保护罩彻底撕掉看AI剩下的到底是真本事还是套路。具体怎么撕的研究者把环境里28个核心工具的名字全部换成fn_efc8这种毫无意义的代号参数名换成arg_0、arg_1连成功和失败这两个状态词都随机换成两个乱码token。每一局游戏开始时重新洗一遍牌保证AI没法靠记住上一局的规律来偷懒。**这是一个刻意制造的最坏情况目的是把行为推理这一种能力单独隔离出来测量。**打个比方,这就像是把你扔进一个陌生国家所有路牌、说明书、菜单都换成你完全不认识的符号你只能靠一次次地推开门、按按钮、试试看会发生什么才能摸清楚这个世界的规则。如果这个国家的路牌是用你熟悉的语言写的你根本不需要探索直接读就行了那测出来的就不是你的适应能力而是你的阅读理解能力。任务链和三种添乱手段光是抹掉名字还不够。研究者还设计了一套连续任务链一局游戏里连续给AI布置5个任务AI必须在同一个会话里持续积累对工具的理解前面学到的东西要能用在后面的任务上。在这个基础上团队加入了三种模拟真实世界混乱的机制。第一种叫映射漂移。**映射漂移在两个任务之间系统会把一部分工具的代号重新打乱分配就像公司系统升级后接口名字变了但功能没变。**具体来说28个工具里选出7个做一次环形轮换比如原来的fn_A现在变成了fn_B干的活fn_B变成fn_C干的活一直转到最后一个又转回fn_A。这个环的存在其实是留了一条后门理论上AI完全可以靠着顺藤摸瓜把新映射摸出来用不着从零开始瞎试。第二种叫随机动作失败。**随机动作失败每次调用工具都有一定概率论文里设的是15%返回一个超时错误就算你调用的方式完全正确。**这是在模拟网络抖动这种现实里常见的噪音,考验AI能不能分清楚这次失败是我调用方式错了还是这次纯粹是运气不好重试一下就行。第三种叫时间执行窗口。**时间执行窗口某些任务一旦触发某个动作就必须在接下来固定的步数内比如10步完成整套操作超时系统会重置状态之前存的中间变量全部作废。**这个机制专门用来惩罚那种漫无目的的试探行为逼着AI在关键时刻收起好奇心只做自己有把握的动作。三种机制单独测也能叠加起来一起测叫做全部叠加All条件模拟一个既会随机抽风、又会悄悄改名、还有紧急时间压力的系统基本上就是把生产环境里能出的乱子都凑齐了。数字说话从93%到3%的断崖论文测试了15个模型从开源的Qwen、Gemma、GPT-OSS系列到闭源的GPT-5.4、Gemini系列和Claude系列。先看一个对照实验。在没有任何混淆的正常环境里也就是工具名字保持原样几乎所有模型的任务完成率都在60%以上顶尖模型比如Gemini 3.1 Pro、Claude Sonnet 5能做到100%全部完成。这证明这些模型确实会用工具起码在读得懂说明书这个层面没问题。可一旦把名字换成乱码基础混淆条件画风突变。Gemma 4 26B-A4B、GPT-5.4 Mini、Gemini 3.1 Flash Lite这些模型的完成率直接归零说明它们压根不具备脱离语义提示、纯靠试验摸索工具功能的能力。只有少数几个顶尖模型比如Gemini 3.1 Pro、Gemini 3.5 Flash、Claude Sonnet 5还能维持100%的完成率证明它们真的能通过观察和试验把工具摸透。接下来是这篇论文最核心的发现。当三种添乱机制叠加在一起时平均完成率从93%暴跌到3%。这不是渐进式的下滑这是断崖式的崩溃。之前在基础混淆条件下还能维持100%完成率的Claude Sonnet 5在全部叠加条件下直接掉到0%。全场十五个模型里只有Gemini 3.1 Pro20%和Gemini 3.5 Flash25%还能在没有外部记忆辅助的情况下勉强解出一点任务。| 模型 | 无混淆 | 基础混淆 | 漂移 | 失败 | 窗口 | 全部叠加 ||---|---|---|---|---|---|---|| Gemini 3.1 Pro | 1.00 | 1.00 | 0.90 | 1.00 | 0.80 | **0.20** || Gemini 3.5 Flash | 1.00 | 1.00 | 0.90 | 0.85 | 0.65 | **0.25** || Claude Sonnet 5 | 1.00 | 1.00 | 1.00 | 1.00 | 0.70 | 0.00 || 平均值不含记忆增强 | 0.93 | 0.32 | 0.23 | 0.26 | 0.19 | **0.03** |数字背后藏着一个更值得琢磨的问题为什么会崩得这么彻底为什么AI有地图却不用地图研究团队做了一件很聪明的事他们没有停留在完成率掉了多少这个表面数据上而是深挖了智能体在失败时到底在干什么。他们发现的第一个现象叫信念惯性也叫做陈旧工具调用。**陈旧工具调用智能体在环境已经发生映射漂移之后依然反复调用那个已经失效的旧工具代号仿佛完全没意识到规则变了。**论文里举了个具体例子。Qwen 3.6 27B在某局游戏的第三个任务里之前一直靠fn_fc40成功搜索文件映射漂移之后这个代号已经指向别的功能了调用它只会返回空结果。按理说收到一个和预期完全不符的空结果应该是个明确的警报信号。可这个模型在接下来的7步里反反复复调用同一个fn_fc40每次只是换个参数或者换种猜测的理由比如也许文件名有数字后缀。它从没想过问题可能根本不出在参数上而是这个代号已经不是原来那个工具了。这就好比你换了新手机号朋友还在给旧号码发消息发了十条都没回他的反应不是这个号码是不是停用了而是是不是我发的字太少了再多写点试试。第二个现象更让人意外研究团队称之为穷举回退。面对映射漂移理论上存在一条极其经济的破案路径论文里管它叫环追踪。**环追踪由于漂移是一种环形置换比如A变成BB变成CC又变回A只要发现调用某个旧代号得到了一个意料之外但之前见过的函数就可以顺着这条链条往前查直到追到真正需要的那个函数全程不需要漫无目的地试。**论文用数学证明了这条路径的效率。在他们的设定里28个工具每次漂移打乱7个每个任务需要4个函数走环追踪的策略平均只需要额外4.25次调用就能定位到目标函数。而如果是纯粹的随机扫描平均要多试14次左右也就是28的一半。换句话说聪明地推理一次能省下十次左右的无用功。但实测结果是什么呢Gemini 3.1 Pro在漂移发生后只有11%的机会会在三步之内调用链条上正确的下一个代号这个数字和纯随机蒙的10.8%几乎没有差别统计检验显示这种表现和瞎猜没有显著区别p0.934。Claude Sonnet 5稍微好一点在14%左右但依然只是比随机高了三四个百分点远远称不上学会了这个策略。更让人意外的是增加模型的推理量也就是让它多想一会儿再行动并没有让这个数字变好。研究者把Claude Sonnet 5的推理强度从低调到高环追踪的跟随率始终卡在11%到14%之间没有明显提升。**推理强度提高确实让完成率上去了但它靠的不是学会了聪明的策略而是让穷举搜索变得更彻底、更不容易半途而废。**这就好比一个人做数学题不会用公式但脑子转得够快靠着把所有可能的答案挨个代入验证硬是把题目蒙对了。他确实交对了答案但你不能说他学会了这道题的解法下次题目稍微变一下他还是得从头蒙。论文里的数据印证了这个判断在漂移条件下Claude Sonnet 5用于恢复的动作数量是理论最优值的7.4到7.5倍无论推理强度高低这个倍数几乎没有变化。而用的token也就是计算成本却差出好几倍Claude Sonnet 5每解决一个任务要花11652个tokenGemini 3.1 Pro只需要3332个相差3.5倍。也就是说这些模型在用一种代价极其高昂的方式去解决一个本可以用几步逻辑推理就搞定的问题。记忆能救场但救得有限既然模型自己想不起来用地图那给它一个更结实的地图会不会有帮助研究团队设计了一套记忆增强方案。给智能体配备两个持续存在的数据库一个叫任务配方记录着完成某类任务需要按什么顺序调用哪些工具另一个叫工具知识库记录着每个混淆代号对应的真实功能、参数要求和置信度。每走一步这两个数据库都会被打包成结构化数据塞进模型的提示词里模型也可以在自己的回答里附带一份更新指令主动修改这两个数据库。这套机制确实带来了改善。在全部叠加的极端条件下加了记忆之后平均完成率从0.03提升到0.09虽然基数很低但相对提升接近两倍平均完成任务数从0.84提升到1.43左右。Gemini 3.1 Pro的表现最亮眼完成率从20%直接翻倍到50%完成任务数从2.35提升到3.60。论文里记录了一个特别生动的细节。Gemini 3.1 Pro在某局游戏检测到又发生了一次映射漂移之后主动说了这样一句话翻译过来等等我们得先搞清楚第三个任务里的工具映射因为它们可能又被重新打乱了。让我们把之前的工具映射清空只留任务进度这些关键信息。这说明至少有些顶尖模型具备主动清理过期记忆的意识这是一种相当高级的自我管理能力。但研究者也发现了反例Claude Sonnet 4.5加了记忆之后陈旧工具调用的次数反而从2.38次上升到2.76次说明如果模型自己的更新策略不够谨慎持久化的数据库反而可能把错误的信念固化下来变成一种顽固的错误记忆比没有记忆时更难纠正。这其实揭示了一个更深层的矛盾记忆本身是中性的工具它既能帮你记住正确答案也能帮你把错误答案记得更牢。这就像笔记本对学生的作用。一个善于复盘、及时划掉过时内容的学生笔记本是他进步的加速器而一个从不回头检查、只顾往前抄的学生,笔记本反而会让他把某个错误的公式抄了一遍又一遍抄得越工整错得越坚定甚至比不记笔记的学生更难纠正过来因为他对着笔记本产生了一种白纸黑字应该没错的盲目信任。即便加了记忆模型依然没有学会环追踪这条聪明路径。数据显示加了记忆的Gemini 3.1 Pro跟随链条的比率是12.8%仍然只比随机基线的10.9%高出一点点统计上并不显著p0.195。这说明记忆解决的是记不住的问题却解决不了想不到的问题模型依然缺乏那种从散落的观察里推导出结构性规律的能力。定性观察AI在崩溃边缘的真实反应除了统计数字研究团队还翻看了大量具体的对话记录总结出几种典型的行为模式。有一种成功案例发生在时间窗口场景下。Gemini 3.5 Flash触发时间限制后立刻意识到不能再东摸西看直接说现在有一个10步的时间窗口我必须避免任何探索性调用立刻按顺序执行三步解码载荷、验证主机IP、提交答案。结果它真的只用三步就完成了任务说明至少有些模型具备收起好奇心全力冲刺这种切换能力。还有一种更让人印象深刻的场景是从状态重置里恢复。Gemini 3.1 Pro在某个任务里遇到时间窗口过期导致状态被重置它没有懵在原地而是准确判断出环境返回了一个无效状态错误说明活跃的时间窗口已经过期服务器状态被重置我的会话变量已经失效我没法直接提交答案了必须退回第一步重新触发fn_abc1打开新窗口然后迅速重新执行整个序列。这段自我诊断相当精准说明部分模型确实具备持续监控环境状态、并据此调整计划的能力。这两个正面案例恰恰反衬出前面那些负面案例的荒诞同样是顶尖模型面对状态重置能够准确诊断并回退重来面对映射漂移却选择死磕一个失效的代号。这说明问题不在于模型不聪明而在于它们对不同类型的环境变化反应机制存在明显的不均衡。它们学会了识别超时这种时序性的、瞬时的异常却没学会识别这个工具的身份变了这种结构性的、持久的异常。这项研究和之前的工作有什么不同在ScrambleToolBench出现之前已经有不少工具使用类的测试环境比如MCP-Atlas和MCP-Universe这两个基准它们让智能体去操作真实的MCP服务器测试智能体在真实工具环境下的表现但这些工具的名字和说明都是保留原样的本质上还是在考察记忆和调用能力而不是纯粹的推理能力。另一个叫OpaqueToolsBench的工作倒是也做了工具语义混淆这一点和ScrambleToolBench的思路接近但它没有引入环境会中途变化这个维度,也就是说它测的是你能不能第一次就摸清楚规则而不测规则变了你能不能反应过来。还有SWE-bench和OSWorld这类基准专注于长程任务执行比如解决真实的GitHub问题或者操作真实的电脑界面它们测试的是多步骤推理和错误恢复,但整个过程中底层的工具规则是稳定不变的agent不需要怀疑自己对世界的基本理解。ScrambleToolBench的独特之处在于它是第一个同时做到语义混淆、任务连续、结构性漂移三件事的测试环境。前两点单独看都不新鲜但组合在一起恰好卡在了当前所有基准都没测过的那个盲区如果一个AI已经通过努力摸清了规则规则突然又变了它能不能利用自己已经掌握的知识去快速推导新规则而不是把之前的努力全部推倒重来。这个盲区之所以重要是因为它对应着真实世界里最常见的一种状况系统升级、接口迁移、版本更新这些事情天天在发生一个真正能在生产环境里存活的智能体必须具备这种旧知识指导新推理的能力而不只是从零学习的能力。写在后面读到环追踪那部分证明时我一直在想一个问题为什么模型明明有能力做数学推理证明却在实际操作中完全用不出这套逻辑。这不是能力缺失这更像是一种注意力的错位。模型把大量的推理资源花在了要不要重试这个动作这个错误是不是噪音这类局部判断上却没有分配资源去做那种更抽象的、跨越多次观察的结构性归纳。论文里那个11%对10.8%的数字,一直让我很在意。这个几乎等于随机的表现出现在一个号称能做复杂数学证明、写代码、通过各类高难度考试的模型身上反差感相当强烈。这说明当前的推理能力可能存在严重的领域局限模型在训练数据里见过大量数学证明的模式却几乎没见过根据一系列不一致的观察去反推一个隐藏排列结构这种模式,而这恰恰是现实世界里排查系统故障时最常用的思维方式。这让我想到一个问题如果把环追踪这种策略作为一种专门的训练信号加进去模型是不是真的能学会还是说这种从混乱观测中提炼隐藏结构的能力本质上需要一种和当前语言模型训练范式完全不同的机制才能获得QAQ1ScrambleToolBench是什么AScrambleToolBench是新加坡南洋理工大学DeCLaRe实验室提出的一个测试环境专门用来检验AI智能体在完全没有工具说明、且环境规则会中途变化的情况下能不能通过试验摸清工具功能并灵活适应变化。Q2为什么AI模型有了正确的工具映射记录还是会反复调用已经失效的旧工具A这被论文称为信念惯性模型倾向于坚持之前建立的假设即使收到明显异常的反馈比如空结果也不会主动怀疑规则已经改变而是不断尝试微调参数来解释异常而不是重新审视自己的整个认知框架。Q3给AI加上持久记忆能解决这个问题吗A能缓解但解决不了根本问题。记忆能减少重复的无效探索在极端混乱条件下把完成率提升了大约两倍但模型依然学不会用逻辑推理去快速定位漂移后的工具位置只是把原本要重新摸索的信息存了下来效率上有改善推理能力本身没有质变。