什么是 Ping 监控(Ping Monitoring)?
Ping 监控用 ICMP 回显请求定期探测主机与网络设备的可达性,是最底层的可用性检查。工作原理、丢包与延迟指标、与 HTTP 监控的分工、适用场景。
Ping 监控是最底层的可用性检查:定期向目标主机发送 ICMP 回显请求(echo request),等待回显应答(echo reply)。不应答 = 主机或网络链路出问题了,立即告警。它不关心应用层在跑什么,只回答一个问题——这台机器在网络上还活着吗?
工作原理
ICMP 是互联网控制消息协议,ping 命令用的就是它:源头发送 echo-request 包,目标收到后回一个 echo-reply。Ping 监控把这个过程自动化:
- 按预设频率(30 秒到 10 分钟)向目标发送 ICMP 请求;
- 校验应答:无应答、丢包率升高、往返时间(RTT)异常都算劣化;
- 连续失败后创建宕机事件,按告警策略通知值班人。
终端里手动验证的效果:
$ ping 1.1.1.1
PING 1.1.1.1 (1.1.1.1) 56(84) bytes of data.
64 bytes from 1.1.1.1: icmp_seq=1 ttl=57 time=8.2 ms # 正常
From 169.154.0.0 icmp_seq=1 Destination Host Unreachable # 目标不可达
Ping 监控能告诉你什么
- 可达性:设备是否在线——服务器、路由器、交换机、防火墙、IoT 设备;
- 丢包率:链路质量的直接指标,持续丢包意味着网络劣化;
- 往返延迟(RTT):网络路径的时间成本,RTT 突增往往先于彻底断连出现。
和 HTTP 监控的分工
两者是互补而非替代:
| Ping 监控 | HTTP/Uptime 监控 | |
|---|---|---|
| 检查层面 | 网络层(机器活着吗) | 应用层(服务正常吗) |
| 能发现 | 宕机、断网、网卡故障 | 应用崩溃、500、内容错误 |
| 发现不了 | 机器活着但应用挂了 | 应用正常但网络丢包 |
| 适用对象 | 服务器、网络设备、无 HTTP 的设备 | 网站、API、Web 服务 |
经典场景:HTTP 监控报宕机时,Ping 监控的结果帮你分层定界——Ping 也不通 → 机器/网络层问题;Ping 正常但 HTTP 不通 → 应用层问题。一个排查分叉直接收敛一半。
注意事项
- 有些环境禁 ICMP:不少云主机和防火墙默认丢弃 ICMP。监控前先确认目标会回应 ping,否则全是误报。
- Ping 通不代表服务正常:它只管网络可达,应用死活要用 HTTP/TCP 监控补位。
观测云对照
观测云可用性监测支持 ICMP(Ping)探测协议,与 HTTP/TCP/SSL/DNS 探测统一管理:同一份可用率报表里既有网络层也有应用层数据;多地域节点帮你区分"局部网络问题"和"真宕机";RTT 与丢包率趋势进仪表盘,链路劣化在断连之前就能被监控器捕捉并告警。
常见问题(FAQ)
Q:云服务器 ping 不通就是宕机吗?
A:不一定。先检查安全组/防火墙是否禁了 ICMP——很多云环境默认禁 ping。建议同时配 TCP 端口探测(如 22/80/443)交叉验证。
Q:Ping 监控适合监控网站吗?
A:不适合单独用。网站可用性要用 HTTP 监控(状态码+关键字);Ping 作为网络层的补充信号,帮助故障定界。
Q:RTT 多少算异常?
A:没有绝对值,看基线。同机房 <1ms,同城几 ms,跨国 150-300ms 都正常。监控"相对基线的突增"比盯绝对值有效得多。