
SRE 四大黄金信号详解
Google SRE 提出的四大黄金信号——延迟、流量、错误、饱和度,是服务监控的最小完备集。逐项讲清定义、度量方法、Prometheus 实现与告警策略。
从概念、接入到生产治理,提供可执行、可验证的工程方法。

Google SRE 提出的四大黄金信号——延迟、流量、错误、饱和度,是服务监控的最小完备集。逐项讲清定义、度量方法、Prometheus 实现与告警策略。

指数退避是分布式系统重试的标准姿势:每次重试间隔指数增长,配合随机抖动避免惊群效应。原理、JavaScript/Go 实现、适用场景与禁忌一篇讲清。

合成监控用自动化脚本模拟用户行为,7×24 主动探测服务的可用性、性能与关键业务流程。三大类型、与 RUM 的区别、适用场景一次讲清。

可用性监控是最基础的监控形式:定期请求你的 URL,校验状态码与关键字,宕机时立即告警。工作原理、宕机事件处理流程、关键字监控的优势与最佳实践。

Ping 监控用 ICMP 回显请求定期探测主机与网络设备的可达性,是最底层的可用性检查。工作原理、丢包与延迟指标、与 HTTP 监控的分工、适用场景。

定时任务监控(心跳监控)原理:任务成功后向监控端点发一次请求,没收到就告警。备份漏跑、报表失败第一时间知道,附脚本改造示例与实现方案。

API 监控定期调用你的 API 端点,校验状态码、响应内容与耗时,异常即告警。工作原理、该监控什么、事件处理流程、对第三方 API 的依赖监控一篇讲清。

SSL 证书监控在证书到期前提前告警,避免"网站突然被浏览器拦截"的尴尬事故。工作原理、证书为什么会过期、自动续期为什么还要监控、最佳实践。

域名过期监控定期查询 WHOIS 里的到期日期,在到期前 60/30/14 天分级告警。域名忘续费的后果(抢注、停摆、品牌损失)与防护实践。

DNS 监控定期查询你的域名解析记录,校验 A/AAAA/CNAME/MX 等记录是否正确,发现劫持、篡改、配置错误即时告警。原理、记录类型与监控实践。

健康检查是服务自我汇报状态的接口。本文讲清 liveness 与 readiness 的区别、健康检查该查什么(资源/进程/依赖)、失败处理策略与七条最佳实践。

K8s 三种探针详解:liveness(要不要重启)、readiness(能不能接流量)、startup(启动完没有);HTTP/TCP/exec/gRPC 四种实现方式、参数调优与避坑指南。