可观测学堂

可观测技术指南

从概念、接入到生产治理,提供可执行、可验证的工程方法。

MTTR 到底是什么?一文讲清 MTTR 的 4 种含义与 MTTA cover
技术指南

MTTR 到底是什么?一文讲清 MTTR 的 4 种含义与 MTTA

MTTR 有四种含义:平均恢复时间、平均响应时间、平均修复时间、平均解决时间,加上 MTTA(平均确认时间)共五个核心事件指标。本文逐个给出定义、计算公式、适用场景和选用速查表。

事件严重级别是什么?SEV1 到 SEV3 一次讲清 cover
技术指南

事件严重级别是什么?SEV1 到 SEV3 一次讲清

事件严重级别(Severity Level)衡量事故对业务的影响程度:SEV1 是致命事故、SEV3 是轻微问题。本文讲清 SEV 分级标准、Severity 与 Priority 的区别、为什么"说人话"的分级更好用,并附分级定义模板。

可用性对照表:90% 到 99.999% 各允许多少宕机时间 cover
技术指南

可用性对照表:90% 到 99.999% 各允许多少宕机时间

99.9% 可用性到底允许宕机多久?本文给出 90% 到 99.999% 各级可用性对应的年/月/周/日最大宕机时间对照表,并解释"几个 9"对 SLA 承诺和系统架构的实际意义。

SLA、SLO、SLI 有什么区别?(附写好 SLA 的 5 个建议) cover
技术指南

SLA、SLO、SLI 有什么区别?(附写好 SLA 的 5 个建议)

SLA 是服务商与客户的协议,SLO 是协议里的具体目标,SLI 是衡量目标达成情况的实际数值。本文讲清三者关系、各自的常见坑、企业到底要不要 SLA,以及服务商写好 SLA 的 5 条实操建议。

指标、监控与告警:SRE 基础指南 cover
技术指南

指标、监控与告警:SRE 基础指南

一文讲清监控系统的三大支柱——指标(Metrics)、监控(Monitoring)、告警(Alerting):该采集哪几层指标、告警怎么设才不吵、现代系统的监控边界,附观测云落地路径。

用内容安全策略(CSP)防御 XSS 攻击:完整指南 cover
技术指南

用内容安全策略(CSP)防御 XSS 攻击:完整指南

内容安全策略(CSP)是防御 XSS 的最有效手段之一。从 default-src 入门,到 nonce/hash 处理内联脚本、strict-dynamic、report-only 灰度上线,一篇讲透 CSP 的配置与落地策略。

RED 与 USE 指标:监控与可观测性的两大方法论 cover
技术指南

RED 与 USE 指标:监控与可观测性的两大方法论

RED(速率/错误/耗时)面向服务与用户体验,USE(利用率/饱和度/错误)面向资源与基础设施。两套方法论如何互补、各自的 Prometheus 实现与仪表盘组织方式,一篇讲清。

SRE 四大黄金信号详解 cover
技术指南

SRE 四大黄金信号详解

Google SRE 提出的四大黄金信号——延迟、流量、错误、饱和度,是服务监控的最小完备集。逐项讲清定义、度量方法、Prometheus 实现与告警策略。

掌握分布式系统中的指数退避(Exponential Backoff) cover
技术指南

掌握分布式系统中的指数退避(Exponential Backoff)

指数退避是分布式系统重试的标准姿势:每次重试间隔指数增长,配合随机抖动避免惊群效应。原理、JavaScript/Go 实现、适用场景与禁忌一篇讲清。

什么是合成监控(Synthetic Monitoring)?新手指南 cover
技术指南

什么是合成监控(Synthetic Monitoring)?新手指南

合成监控用自动化脚本模拟用户行为,7×24 主动探测服务的可用性、性能与关键业务流程。三大类型、与 RUM 的区别、适用场景一次讲清。

什么是可用性监控(Uptime Monitoring)? cover
技术指南

什么是可用性监控(Uptime Monitoring)?

可用性监控是最基础的监控形式:定期请求你的 URL,校验状态码与关键字,宕机时立即告警。工作原理、宕机事件处理流程、关键字监控的优势与最佳实践。

什么是 Ping 监控(Ping Monitoring)? cover
技术指南

什么是 Ping 监控(Ping Monitoring)?

Ping 监控用 ICMP 回显请求定期探测主机与网络设备的可达性,是最底层的可用性检查。工作原理、丢包与延迟指标、与 HTTP 监控的分工、适用场景。