
MTTR 到底是什么?一文讲清 MTTR 的 4 种含义与 MTTA
MTTR 有四种含义:平均恢复时间、平均响应时间、平均修复时间、平均解决时间,加上 MTTA(平均确认时间)共五个核心事件指标。本文逐个给出定义、计算公式、适用场景和选用速查表。
从概念、接入到生产治理,提供可执行、可验证的工程方法。

MTTR 有四种含义:平均恢复时间、平均响应时间、平均修复时间、平均解决时间,加上 MTTA(平均确认时间)共五个核心事件指标。本文逐个给出定义、计算公式、适用场景和选用速查表。

事件严重级别(Severity Level)衡量事故对业务的影响程度:SEV1 是致命事故、SEV3 是轻微问题。本文讲清 SEV 分级标准、Severity 与 Priority 的区别、为什么"说人话"的分级更好用,并附分级定义模板。

99.9% 可用性到底允许宕机多久?本文给出 90% 到 99.999% 各级可用性对应的年/月/周/日最大宕机时间对照表,并解释"几个 9"对 SLA 承诺和系统架构的实际意义。

SLA 是服务商与客户的协议,SLO 是协议里的具体目标,SLI 是衡量目标达成情况的实际数值。本文讲清三者关系、各自的常见坑、企业到底要不要 SLA,以及服务商写好 SLA 的 5 条实操建议。

一文讲清监控系统的三大支柱——指标(Metrics)、监控(Monitoring)、告警(Alerting):该采集哪几层指标、告警怎么设才不吵、现代系统的监控边界,附观测云落地路径。

内容安全策略(CSP)是防御 XSS 的最有效手段之一。从 default-src 入门,到 nonce/hash 处理内联脚本、strict-dynamic、report-only 灰度上线,一篇讲透 CSP 的配置与落地策略。

RED(速率/错误/耗时)面向服务与用户体验,USE(利用率/饱和度/错误)面向资源与基础设施。两套方法论如何互补、各自的 Prometheus 实现与仪表盘组织方式,一篇讲清。

Google SRE 提出的四大黄金信号——延迟、流量、错误、饱和度,是服务监控的最小完备集。逐项讲清定义、度量方法、Prometheus 实现与告警策略。

指数退避是分布式系统重试的标准姿势:每次重试间隔指数增长,配合随机抖动避免惊群效应。原理、JavaScript/Go 实现、适用场景与禁忌一篇讲清。

合成监控用自动化脚本模拟用户行为,7×24 主动探测服务的可用性、性能与关键业务流程。三大类型、与 RUM 的区别、适用场景一次讲清。

可用性监控是最基础的监控形式:定期请求你的 URL,校验状态码与关键字,宕机时立即告警。工作原理、宕机事件处理流程、关键字监控的优势与最佳实践。

Ping 监控用 ICMP 回显请求定期探测主机与网络设备的可达性,是最底层的可用性检查。工作原理、丢包与延迟指标、与 HTTP 监控的分工、适用场景。