AI根因分析大变局:别再卷模型,真正瓶颈是上下文工程
文章目录
- 1. 别再卷模型了,根因分析的瓶颈早就换地方了
- 1.1 以前大家的执念:模型越强,排障越猛
- 1.2 现在业内共识:喂什么数据,比用什么模型重要
- 2. 两种主流玩法,现在风向明显变了
- 2.1 第一种:代理式,让模型自己满世界找线索
- 2.2 第二种:确定性,提前把线索摆上桌再让模型判
- 3. 有人专门做了实验,把这事给扒明白了
- 3.1 为了测准,专门造了带干扰的故障
- 3.2 测试结果挺反直觉的
- 4. 代理式不是不行,是不适合做主战场
- 4.1 它的优势,在未知故障上
- 4.2 生产环境,大家都选了稳的
- 5. 算完账更明白,未来卷的是上下文工程
- 5.1 推理本身真花不了多少钱
- 5.2 下一个赛场,是怎么给模型“喂饭”
P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者,这个教程里内容讲解通俗易懂且风趣幽默,对我帮助很大。我想与大家分享这个宝藏教程,请点击下方链接查看, 传送门https://blog.csdn.net/qq_74013365
1. 别再卷模型了,根因分析的瓶颈早就换地方了
1.1 以前大家的执念:模型越强,排障越猛
做可观测性的同行应该都有印象,前两年聊AI根因分析,开口先问你用的什么模型。
参数够不够大,版本够不够新,好像只要模型拉满,线上故障都能自动给你摆平。
这就跟打排位输了怪手机帧率不够似的,从来不想想自己是不是连技能都没点对。
结果真用到生产环境才发现,很多时候模型判错根因,根本不是它推理不行,是你喂给它的东西全是无效信息。
1.2 现在业内共识:喂什么数据,比用什么模型重要
现在越来越多工程师反应过来了:把精力花在整理上下文上,回报率比换个更贵的模型高多了。
就像做饭,食材选得好、处理得干净,普通厨师也能做出好菜;你给一堆烂菜叶子,米其林大厨来了也没辙。
对于做事件响应的团队来说,这话尤其戳人——之前砸钱升级模型没解决的问题,把上下文理清楚之后,准确率直接上去了。
2. 两种主流玩法,现在风向明显变了
2.1 第一种:代理式,让模型自己满世界找线索
早期很多AI根因方案走的是代理路线:给模型配一堆工具,让它自己查日志、看指标,想查什么查什么。
听着很智能对吧?就像雇了个全权负责的侦探,你只需要说“案子交给你了”,剩下的他自己跑。
但问题也出在这:侦探跑嗨了很容易跑偏,你根本不知道他中间去了哪、见了谁。
生产环境里用多代理排障,出了错连调用堆栈都没有,全是模型之间乱七八糟的对话,想复盘都无从下手。
2.2 第二种:确定性,提前把线索摆上桌再让模型判
现在行业慢慢往第二种走:先靠确定性规则把信号关联好,把因果链捋得差不多了,再把整理好的上下文丢给模型。
说白了就是先有人把嫌疑人、物证、时间线都整理好,再让模型做最终判断。
像Coroot、Dynatrace这些厂商的AI,都是这个路子——靠拓扑结构遍历依赖关系找根因,不是让模型在那瞎逛。
好处太明显了:结果可复现,出错了能定位是哪层的问题,不会出现“模型突然就错了”的玄学场面。
3. 有人专门做了实验,把这事给扒明白了
3.1 为了测准,专门造了带干扰的故障
之前总有人吵:排障不准到底是模型笨,还是给的证据不对?
Coroot的工程师干脆做了个对照实验,直接把这两个变量拆开看。
他们用Chaos Mesh注入网络延迟,搞出前端502的故障,还故意放了误导性信号——比如被网络耗时放大的查询时长,专门用来迷惑模型。
就像破案现场故意放个假凶器,就看侦探会不会被带偏。
最后给11款模型一模一样的提示词,差不多一万个token,让它们找根因、说因果链、给修复方案。
3.2 测试结果挺反直觉的
Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro这几个顶流专有模型全过了,不仅找对根因,连怎么删实验、删定时任务都说得明明白白。
大参数的开源模型大多也表现不错。
有意思的是小模型赛道:Gemma 4 31B反而成了唯一找对根因的自托管模型,参数更大的Qwen3.6 35B和Qwen3 Coder Next反倒栽了。
你看,只要上下文给得准,模型差距其实没那么夸张;反过来上下文乱,参数再大也白搭。
4. 代理式不是不行,是不适合做主战场
4.1 它的优势,在未知故障上
当然也不是说代理式就一无是处。
能自己找数据的模型,能抓到固定管道根本想不到的信号,遇上从来没出现过的新型故障,这能力就很关键。
就像常规警情走流程最快,但遇上悬案,还是得给侦探自由调查的权限。
4.2 生产环境,大家都选了稳的
但真到线上救火的时候,没人敢赌自由发挥。
现在很多工程师都放弃了纯代理设计,改成“大部分流程确定性,只在小环节用LLM”的方案。
理由很实在:可靠性更高,还省token钱。
毕竟凌晨三点出故障,你要的是五分钟出结论,不是等代理循环跑半小时,最后还不知道它跑到哪去了。
5. 算完账更明白,未来卷的是上下文工程
5.1 推理本身真花不了多少钱
很多人担心用大模型排障烧钱,其实真不是。
相关性分析都在调用模型之前做完了,真正传给模型的都是精简过的内容,单次调用也就几美分。
费钱的从来不是推理,是你瞎塞一堆没用的日志指标,平白无故给算力厂商冲KPI。
5.2 下一个赛场,是怎么给模型“喂饭”
现在业内基本达成共识:AI根因分析的推理部分,差不多已经解决了。
接下来真正的硬骨头,是怎么在调用模型之前,准备好又准又紧凑的上下文。
Anthropic、LangChain还有一堆可观测性厂商,现在都在往这个方向使劲,核心就一件事:筛选出信号最强的最小信息集,给模型最干净的输入。
说直白点,以后做这个方向的工程师,不用死记硬背各个模型的参数表了。
能把上下文治理明白,能给模型喂得又准又少,才是真正的核心竞争力。
P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者,这个教程里内容讲解通俗易懂且风趣幽默,对我帮助很大。我想与大家分享这个宝藏教程,请点击下方链接查看,传送门https://blog.csdn.net/qq_74013365