服务网格巡检要看什么:配置下发、代理状态与请求错误

服务网格巡检要看什么:配置下发、代理状态与请求错误

服务网格多了一层代理,也多了一层需要验证的配置传播。巡检不能只看控制面组件存活,还要确认工作负载拿到的配置能处理实际请求。

三类检查分开做

控制面检查配置是否被接受并下发;数据面检查代理是否就绪、证书是否有效、监听器和集群是否符合预期;请求侧检查路由命中、重试、超时和响应错误。每类结果带上命名空间、工作负载和配置版本。

脚本默认只读。发现代理配置异常时,先导出当前状态和相关资源,再决定滚动工作负载还是回退配置。自动重启可能暂时掩盖问题,也会丢掉现场。

避免重试放大

巡检要把原始失败与重试请求分开统计。网格、客户端和业务代码若同时重试,依赖恢复前可能积累更多请求。每层只保留明确负责的策略,并用故障注入验证超时预算是否逐层收敛。

最终产物是一份可定位的待办:哪个对象、哪项检查失败、依据是什么、由谁处理,而不是一张全绿但无法解释的总览。