一、场景:单次抖动被当成故障
某次拨测显示延迟 500ms,运维立刻开始排查,查了半天啥也没发现。回头看历史基线,这个节点平时 p95 就是 480ms,那次只是正常波动。
二、原理:基线才有参照物
拨测的本质是把某一次好不好变成长期稳不稳。连续采集后,异常才有参照物。基线看 p50、p95、p99,不看平均值。
三、告警阈值怎么定
普通展示站每 5 到 15 分钟一次足够。交易和支付接口 1 到 2 分钟,关键域名做到 30 秒。
告警阈值别拍脑袋,基于基线算。RTT 大于基线 p95 乘 1.5,或者丢包大于 1 百分比,触发预警。TTFB 大于 300ms 且持续 3 个周期,触发告警。某运营商节点连续超时说明调度异常,比全局平均更早发现问题。
四、总结
单次抖动不等于故障,告警设计必须带持续周期和同区域多节点交叉,避免误报疲劳。全局平均正常但某省移动 MISS 率突增这种局部问题,只有分运营商看基线的系统才抓得到。
附:7 乘 24 自动拨测和告警推送,用带批量检测和监控功能的平台可以实现,我用的快快测 kkce.com,支持 Telegram 推送,免费版够小站日常监控。