Infrastructure Monitoring

基础设施监控

观测云基础设施监控统一观测主机、容器、进程、网络和云资源,关联指标监控、日志、链路、事件和告警,并通过仪表板呈现资源状态、容量风险和故障影响范围。

基础设施监控
预约演示

基础设施监控解决什么问题

把分散资源变成可观测、可关联、可响应的基础设施视图

当主机、容器、网络和云资源分散在不同平台时,排障往往先卡在“资源在哪里、谁受影响、该看哪个指标”。观测云基础设施监控通过 DataKit 采集、统一标签、指标监控和资源关系视图,把资源运行状态与日志、链路、告警和事件关联起来,帮助团队更快判断问题边界。

真实排障路径

从资源异常到影响范围,把基础设施证据串成一条线

不是再看一张资源大盘,而是从异常对象出发,逐步确认容量、关系和跨信号证据,直到团队知道问题在哪里、影响了谁。

先确认问题发生在哪一组资源

查看证据在线状态、资源标签、主机与容器分布

得到结论圈定异常对象、环境与时间窗口

数据接入路径

DataKit / 云账号集成 → 主机、容器、进程与网络对象 → 指标、日志、事件统一关联

适用场景

适合混合云、Kubernetes 和多团队共用基础设施的运维、SRE 与平台团队。

使用边界

需要先完成资源采集和统一标签;若根因进入应用代码,还可继续关联 APM Trace 与 Profiling。

不要只看资源,把指标、日志、链路和告警关联起来
从基础设施对象可以继续查看相关指标、日志、应用链路、网络数据、事件和告警。遇到 CPU 飙高、磁盘空间不足、容器重启或主机离线时,团队可以沿着上下文继续排查,减少重复查询和信息拼接。
不要只看资源,把指标、日志、链路和告警关联起来

常见问题

什么是基础设施监控?

基础设施监控用于持续观测主机、容器、进程、网络和云资源的运行状态。观测云会把指标监控、仪表板、日志、链路、事件和告警关联起来,方便排障时快速定位影响范围。

基础设施监控应该关注哪些指标?

常见指标包括 CPU、内存、磁盘、文件系统、网络流量、进程状态、主机负载、容器资源、重启次数和资源在线状态。不同业务还可以通过标签、分组和自定义视图关注关键环境或核心服务。

基础设施监控如何帮助故障排查?

当资源异常时,观测云可以从指标趋势跳转到相关日志、应用 Trace、网络拓扑、事件和告警,帮助团队判断问题来自资源瓶颈、网络连接、容器调度还是应用依赖。

观测云基础设施监控适合哪些团队?

它适合运维、SRE、平台工程、云基础设施和研发团队使用,尤其适合多云、混合云、容器化和微服务环境,需要统一观察资源健康与业务影响的场景。

继续探索

资源与延伸阅读

从产品文档、相关方案到技术实践,按当前问题选择下一步。

相关阅读

来自产品实践、故障排查与技术方案的精选内容

想看基础设施监控如何落到你的业务系统?

预约演示