
用“录制回放“现场还原“删库跑路”的高风险行为
数据库是公司重要资产,在此类重要资产平台上,尤其是重要操作,应该保持敬畏心。
持续分享真实生产环境中的工程经验、产品判断与行业观察。

数据库是公司重要资产,在此类重要资产平台上,尤其是重要操作,应该保持敬畏心。

如何提升告警的有效性,准确识别问题,同时又不至于淹没在大量的无效告警中,正是本文所探讨的内容。

通过 Kubernetes Pod 的智能巡检可以根据事件报告加快事件调查、减轻工程师的压力、减少平均修复时间并改善最终用户体验。

可观测性的本质是度量基础设施、平台和应用程序,以了解它是如何运行的。与传统监控运维相比,目前主流的监控更加注重发现与预警问题,而可观测性的终极目标是为一个复杂分布式系统所发生的一切给出合理解释。监控更注重软件的交付过程中以及交付后的服务状态,而可观测性则要为全研发与运维的生命周期负责。

系统一定会有故障,相信作为用户都能理解,但用户需要在故障发生后,能尽快知晓造成故障的根本原因和修复计划,以便有效调整受影响的业务来降低损失;也需要在一次故障解决后,开发运维团队可以总结出经验教训,来提升自己管理运营能力,和提出之后的预防措施。

Velero 是一款云原生时代的灾难恢复和迁移工具, 利用 velero 用户可以安全的备份、恢复和迁移 Kubernetes 集群资源和持久卷。

上次我们使得Pod和Host网络互通,现在我们实现一个CNI插件,通过链式执行自动完成上面的事情。

最近在研究KubeVirt和Virtink两个项目,计划做一个Operator管理虚拟机。Kubernetes API有望成为云计算基础设施管理的事实标准,IaaS关注计算、存储和网络,相比OpenStack,Kubernetes是一个可塑性更强的项目。

日志采集系统的执行过程,从 “定位日志” 开始,然后是 “数据采集和处理”,最后则是 “同步采集状态”。本文主要介绍第二项,即数据的采集和解析.

日志采集(logging)是观测云 Datakit 重要的一项,它将主动采集或被动接收的日志数据加以处理,最终上传到观测云中心。日志采集的执行过程可大致分为三段,分别是“定位日志”、“数据处理” 和 “状态同步” 。本文将介绍第一段 “定位日志”。

什么是全链路追踪? 如何使用工具来分析链路中性能瓶颈?

通过 Nginx 代理的方式,如何高效解决跨域问题。