MTTR 到底是什么?一文讲清 MTTR 的 4 种含义与 MTTA
MTTR 有四种含义:平均恢复时间、平均响应时间、平均修复时间、平均解决时间,加上 MTTA(平均确认时间)共五个核心事件指标。本文逐个给出定义、计算公式、适用场景和选用速查表。
MTTR 是事件管理里最容易被误用的缩写——它有 4 种不同含义:Mean Time to Recovery(恢复)、Respond(响应)、Repair(修复)、Resolve(解决)。四种都是"平均时间",但计时起点完全不同。在团队里使用 MTTR 时,务必写全称或先对齐定义,否则报表里的同一个数字可能在说不同的事。下面逐个拆开讲。
一、平均恢复时间(Mean Time to Recovery)
定义:从系统发生故障到完全恢复正常所经历的平均时长。它是衡量"宕机处置速度"的核心指标。
计算:
MTTR = 所有事件恢复时长之和 ÷ 事件次数
例:一周内发生 2 次宕机,合计中断 20 分钟,则本周 MTTR = 10 分钟。
它的问题:MTTR(恢复)常被当作北极星指标,但它太宏观了。它把检测、告警、确认、诊断、修复全揉在一起,看不出时间到底耗在哪一环。恢复时间长,可能是告警规则配置不当导致通知慢,也可能是修复能力不行——单看这一个数无从分辨。所以要引入下面几个分段指标。
二、平均响应时间(Mean Time to Respond)
定义:从收到第一条告警到事件恢复的平均时长。它与"平均恢复时间"的差值,正好就是"故障发生到告警送达"这段检测时间。
计算:所有事件(告警触发 → 恢复)时长之和 ÷ 事件次数。
什么时候看:想评估"告警链路 + 修复能力"的组合效率时用它。改进路径有两条:
- 提升修复速度:完善应急预案(Playbook)、上更好的日志与错误分析工具;
- 压缩告警到开工的间隔:这段时间就是 MTTA,靠更准的告警路由(直接通知最能解决该类问题的人)和主备值班兜底来改善。
📖 什么是应急预案(Playbook):一套规定事件期间与事后该做什么的流程文档,通常包含角色分工、处置流程清单、复盘指引。
三、平均修复时间(Mean Time to Repair)
定义:从修复工作实际开始到系统恢复正常的平均时长。与"响应时间"不同,它排除了告警、确认、调度等前置环节。
计算:所有事件(开始修复 → 修复完成)时长之和 ÷ 事件次数。
什么时候看:想单独考核团队"动手能力"时用。注意一个口径问题:诊断时间算不算在内?实践中诊断和修复往往交织(原因不明时要反复试修),很多团队干脆把诊断并入修复时长,只要团队内部口径一致即可。
四、平均解决时间(Mean Time to Resolve)
定义:从故障发生到根因被定位并彻底修复的平均时长。"解决"比"恢复"走得更远——恢复可能只是重启服务临时止血,解决意味着同类事件以后不会再发生。
计算:所有事件(故障开始 → 根因修复上线)时长之和 ÷ 事件次数。
什么时候看:把它和"平均恢复时间"对比着看。两者差值反映的是复盘与根治环节的效率——差值越大,说明团队止血很快但治根很慢,复盘后的改进项没有真正落地。
五、平均确认时间(MTTA)
定义:从告警触发到值班人确认收到的平均时长。
什么时候看:MTTA 衡量的是告警链路和值班纪律本身。它还有一个重要用途——发现告警疲劳:如果团队被过多告警淹没,确认速度就会变慢,MTTA 持续走高就是"狼来了"的早期信号。治理手段包括告警分级、降噪、升级策略优化(见本系列《升级策略设计指南》)。
选用速查表
| 指标 | 计时区间 | 回答的问题 |
|---|---|---|
| MTTR(恢复) | 故障发生 → 完全恢复 | 整体事件管理流程表现如何(宏观总览) |
| MTTA | 告警触发 → 确认收到 | 告警链路和值班响应是否灵敏 |
| MTTR(响应) | 收到告警 → 恢复 | 告警+修复的综合效率 |
| MTTR(修复) | 开始修复 → 修复完成 | 纯修复环节的手速 |
| MTTR(解决) | 故障发生 → 根因消除 | 含复盘根治的完整闭环效率 |
这些指标从哪来
要算准这五个数,前提是每条告警和事件都有完整时间线:触发、通知、确认、恢复、关闭各节点的精确时间戳。观测云的监控器与事件管理天然记录这些节点,配合日志查看器与 APM 做根因定位,MTTA、MTTR 各口径都能直接从平台数据算出来,无需人工补表。 1 2
常见问题(FAQ)
Q:五个指标都要考核吗?
不必。小团队先盯 MTTR(恢复)+ MTTA 两个,一个管结果一个管过程入口;团队成熟后再细分响应/修复/解决。
Q:MTTR 多少算合格?
没有通用标准,取决于业务容忍度和 SLA 承诺。正确姿势是建立自己的基线,然后看趋势——本月比上月好,就是好。
Q:MTTA 走高一定是值班人偷懒吗?
多数情况不是,而是告警太多导致脱敏(告警疲劳)。先看告警量和误报率,再谈人的问题。
Q:"恢复"和"解决"分不清,能不能合并?
小团队可以合并,但要意识到合并后你就看不见"止血快、治根慢"这个模式了。等复盘文化建立起来后再拆开。