模型首先需要稳定的基线
异常意味着偏离正常,但正常表现会随时段、地区和任务改变。若把全天数据混成一个基线,晚高峰可能被反复误报。
更合理的做法是按区域、设备、网络类型和观察窗口建立可比较样本。
时间序列揭示变化方式
延迟缓慢上升、突然跳变和周期波动可能对应不同原因。模型可以从连续样本识别模式,而单点阈值只能看到是否超过界线。
采样间隔必须与问题匹配。过于稀疏会错过短暂中断,过于频繁又可能制造额外负担。
拓扑变化提供结构线索
路由跃点变化、中心节点负载和模块间连接减少,都可能说明路径发生调整。图模型能把结构和指标放在一起观察。
看见结构变化仍不能直接知道原因,维护、策略调整和测量缺失可能产生相似现象。
标签错误会训练出错误判断
历史工单和人工备注常被当成故障标签,但描述可能不完整,甚至把设备问题归到网络。
训练前应抽查标签,并区分已确认原因、用户感受和自动告警。
概念漂移让旧模型逐渐失效
网络增加节点、改变上游或调整策略后,过去的正常范围可能不再适用。模型如果不更新,会把新结构当成异常。
监测模型自身的误报率和资料分布,和监测线路同样重要。
缺失数据不等于正常
探针离线、日志中断或采集延迟时,空白不应自动填成零异常。
系统应单独显示资料缺口,并避免在覆盖不足时给出强结论。
解释比单一异常分数重要
一个高分如果不能指出哪些指标、节点和时间贡献最大,很难指导后续行动。
解释结果至少应包含影响范围、开始时间、对照基线和最可能需要复查的路径。
隐私决定可使用的资料范围
网络日志可能包含地址、设备和访问时间。训练与分析前应最小化收集,并控制保存周期和访问权限。
能计算不等于应该收集。只保留完成诊断所需的字段更容易建立信任。
人工复核负责连接现场
模型发现异常后,仍要查看真实任务、设备反馈和公共状态。现场资料能排除模型看不到的账户、应用或目标服务问题。
把 AI 作为筛选器而不是裁判,能让团队先核实线索,再决定是否切换路径。
结果最终要转成可验证行动
好的异常提示会建议比较哪个区域、复测哪项指标或检查哪段时间,而不是只显示红色警告。
每个行动都应能产生新的证据,帮助确认或推翻最初判断。