网站宕机、接口变慢、磁盘将满……问题第一时间知道,才能第一时间解决。本讲从监控指标、日志、告警到可观测性,讲透一套完整的监控体系,让团队"先于用户发现问题"。
凌晨宕机,第二天上班才看到用户刷屏,损失已经发生且无法挽回。
没有预警,磁盘日志把空间吃满,网站突然打不开,重启也没用。
只知道"慢",但不知道是前端、后端还是数据库,排查全靠猜。
CPU、内存、QPS、延迟等量化指标,Prometheus 采集 + Grafana 可视化。
集中采集与全文检索(ELK/Loki),排错定位的"第一现场"。
跨服务请求全链路追踪(SkyWalking/Jaeger),定位慢在哪个环节。
分层监控,每层看什么、用什么,一目了然。
| 层级 | 核心指标 | 常用工具 |
|---|---|---|
| 基础设施 | CPU / 内存 / 磁盘 / 网络 | node_exporter + Grafana |
| 应用服务 | QPS / 延迟 / 错误率 / 饱和度 | Prometheus + 应用埋点 |
| 数据库 | 连接数 / 慢查询 / 主从延迟 | mysqld_exporter + 性能洞察 |
| 业务 | 订单 / 转化 / 活跃 / 营收 | 埋点 + 看板 |
| 用户端 | LCP / CLS / INP / 崩溃率 | RUM 真实用户监控 |
| 可用性 | 拨测 / 证书到期 / 首页状态 | 全球拨测 + 告警 |
P1 严重(宕机)/ P2 警告(延迟高)/ P3 提示(容量趋势),不同级别不同响应。
同类告警合并、抑制与静默,防止"狼来了"让团队麻木。
IM/短信/电话分级通知,关键故障必须有电话兜底。
On-call 轮值 + 事后复盘,把每次故障变成体系改进。
全球拨测 + 服务器指标监控,宕机分钟级告警。
下单量、转化率、接口成功率,异常波动即时发现。
服务器、数据库、容器集群的资源与健康监控。
跨服务调用追踪与依赖分析,分布式排错不再抓瞎。