news 2026/9/18 14:57:12

Higress 监控实战:从指标采集到告警调优,把网关状态摸透

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Higress 监控实战:从指标采集到告警调优,把网关状态摸透

Higress 监控实战:从指标采集到告警调优,把网关状态摸透

【免费下载链接】higress🤖 AI Gateway | AI Native API Gateway项目地址: https://gitcode.com/GitHub_Trending/hi/higress

Higress 是 AI 原生的云原生网关,流量一上来,最先要回答的问题往往不是"它能不能跑",而是"它现在跑得怎么样"。这篇文章讲 Higress 监控怎么从 0 搭起来:Prometheus 指标采集怎么接、Grafana 面板看什么、告警阈值怎么定、大规模集群怎么给指标减负。读完你能在自己的环境里配出一套能落地的网关可观测性方案。

找到数据源:网关自带的 15020 指标端口

先说结论:Higress 网关底层是 Envoy,指标直接从它的 admin 端口拿,不用额外装采集组件。

整条数据流是这样的:Envoy 在 15020 端口暴露/stats/prometheus,Prometheus 侧的采集器按固定间隔拉取,数据再进 Grafana 展示、进 Alertmanager 触发告警。搞清楚这一点,后面所有排障思路都是顺着这条链路倒推。

部署完之后,先手动确认端点是通的:

kubectl exec -it <higress-gateway-pod> -n higress-system -- \ curl -s localhost:15020/stats/prometheus | head

只要能看到一堆envoy_前缀的指标行,数据源就是好的,后面采集不到别的地方都可以先排除 Envoy 这一层。

接入 Prometheus:一个开关加一个 selector 🎯

helm/core/values.yaml 里gateway.metrics.enabled默认是 false,把它翻成 true 之后,Helm 模板才会渲染出采集资源:

gateway: metrics: enabled: true podMonitorSelector: release: kube-prome provider: monitoring.coreos.com

关键是podMonitorSelector:它不是采集开关,而是标签过滤器。如果你用的不是 kube-prometheus-stack,或者 release 名不叫kube-prome,Prometheus 根本不会去采这个 Pod,后面所有面板都会是空的。provider决定渲染哪种 CRD:monitoring.coreos.com对应社区的 PodMonitor,operator.victoriametrics.com对应 VictoriaMetrics 的 VMPodScrape,两套监控栈都支持。

渲染出来的资源核心就这几行(见 helm/core/templates/podmonitor.yaml 模板):

spec: selector: matchLabels: app.kubernetes.io/name: higress-gateway podMetricsEndpoints: - port: istio-prom path: /stats/prometheus

intervalscrapeTimeout不填就走 Prometheus 的全局默认值,一般不用特意设。改完helm upgrade一下,用kubectl get podmonitor -n higress-system确认资源存在,再去 Prometheus 的 Targets 页面看有没有出现 higress-gateway 这个 target。

Grafana 面板配置:盯住四组指标

仓库里带了一版监控面板效果,流量、成功率、延迟、资源占用都有覆盖,导入官方仪表盘模板后基本不用从零画:

自建面板的话,Higress Grafana 面板配置聚焦到四组指标就够用了:

  • 请求流量http_requests_total,按cluster_nameroute_name拆开看,哪个后端在吃流量一目了然;
  • 成功率1 - sum(5xx) / sum(total),比裸看 QPS 更有诊断意义;
  • 延迟分布http_request_duration_seconds_bucket,P95/P99 分位才是网关真正该背的指标;
  • 资源使用率container_cpu_usage_seconds_total{pod=~"higress-gateway.*"},和延迟放同一个 row 里,方便定位是不是资源瓶颈。

排查"指标缺失"按这个顺序走:PodMonitor 资源在不在 → selector 标签和网关 Pod 是否一致 → 15020 端点 curl 通不通。九成问题卡在前两步。

调告警阈值:别让"狼来了"吵醒你 ⚠️

原则一句话:盯比例,不盯绝对值。QPS 绝对值报警在高峰和低谷之间必然狼来了,错误率才是稳定信号。一组可以直接用的规则:

groups: - name: higress.rules rules: - alert: HighErrorRate expr: sum(rate(http_requests_total{status_code=~"5.."}[5m])) / sum(rate(http_requests_total[5m])) > 0.01 for: 3m labels: severity: critical

重点在for: 3m这行:瞬时毛刺(比如某个上游抖一下自己恢复了)不值得拉人,持续 3 分钟还在的 1% 5xx 才需要处理。延迟告警同理,用 P99 持续超阈值的写法,别用瞬时值。

大规模场景:给指标减负

集群里服务一多,Envoy 默认吐出的细粒度指标会让 cardinality 膨胀,Prometheus 的抓取耗时和内存都会跟着失控。两个配置值得打开:

global: liteMetrics: true proxyStatsMatcher: inclusionRegexps: - "http.*"

liteMetrics会让网关只暴露精简后的指标集,在网关 Pod 里通过LITE_METRICS环境变量生效;proxyStatsMatcher在 Envoy 侧过滤统计项,默认.*全保留,只留http.*能砍掉一大截你用不上的连接级细节。再配合适当放宽采集间隔、给网关容器配好 requests/limits,监控开销能压到可以忽略的程度。

再往上的量级——上百服务、多集群——单机 Prometheus 扛不住就换 Thanos 或 VictoriaMetrics 集群做长期存储,把 retention 和聚合规则配好,别指望靠单机扩容硬扛。

监控搭得快不如用得对:先把四组核心指标和一条错误率告警跑起来,剩下的优化按需加。

【免费下载链接】higress🤖 AI Gateway | AI Native API Gateway项目地址: https://gitcode.com/GitHub_Trending/hi/higress

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/18 14:56:15

iperf3网络性能测试实战:带宽、丢包率与故障排查全解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 14:55:30

AI赋能企业数字化转型:从数据基础到Agent落地的工程实践

简介&#xff1a;这份PPT课件面向企业管理者、数字化转型项目负责人及对AI赋能感兴趣的学习者&#xff0c;系统梳理AI驱动企业转型的核心概念、发展现状与典型应用场景&#xff0c;重点涵盖IT现代化、客户服务、供应链、人力资源、智能制造、数据分析与金融服务等落地路径&…

作者头像 李华
网站建设 2026/9/18 14:52:51

MathType公式显示不全?固定行距与下标深度调整全攻略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 14:46:15

YOLOv11实现人脸识别与异常行为检测的端到端部署实践

简介&#xff1a;基于YOLOv11的《人脸识别异常行为检测端到端部署指南》是一份面向安防行业与计算机视觉开发者的技术手册&#xff0c;旨在解决传统目标检测效率低、成本高及复杂场景下识别精度不足的问题。资源为单个PDF文档&#xff0c;共34页&#xff0c;大小仅2.02MB&#…

作者头像 李华
网站建设 2026/9/18 14:45:58

5G NR小区搜索与SIB1探测全流程解析

简介&#xff1a;面向5G网络优化工程师及通信技术人员&#xff0c;这份文档系统讲解5G(NR)终端开机后的小区搜索与SIB1探测完整流程&#xff0c;属于5G网络优化方向的实用技术资料。压缩包仅包含1个docx文档&#xff0c;大小15KB&#xff0c;内容精炼且直击要点。文档依据3GPP …

作者头像 李华