Prometheus 监控 Ceph 全栈实战从 OSD 心跳到 RGW 请求的分布式存储可观测性Ceph 作为软件定义存储的王者支撑着无数云平台的块、文件、对象存储。然而其复杂的组件OSD、MON、MDS、RGW和分布式一致性要求使得集群健康状态、OSD 降级/慢请求、PG 状态异常、容量水位等问题若未被及时发现可能导致数据丢失或业务中断。自 Mimic 版本起Ceph 在 Manager 中原生内置了 Prometheus 导出模块能够将集群的详细指标以标准格式暴露。本文将带你从启用模块、配置抓取到关键告警构建一套覆盖全组件的 Ceph 可观测性体系。1. 为什么选择内置 Prometheus 模块方案说明ceph-mgr prometheus 模块推荐自 Ceph Mimic (13.x) 起内置无需额外进程指标丰富持续更新支持集群健康、OSD、MON、PG、RGW、NFS 等独立 ceph-exporter第三方实现适用于老版本 Ceph0.80指标有限且维护滞后强烈建议使用内置模块本文将以 Ceph Pacific (16.x) / Quincy (17.x) / Reef (18.x) 为准覆盖常见组件。2. 启用并配置 Ceph Prometheus 模块在任一 Ceph 管理节点上执行ceph mgr moduleenableprometheus ceph mgr modulels|grepprometheus# 确认已加载默认情况下模块会在 Manager 的9283端口上暴露/metrics端点。验证curlhttp://mgr-ip:9283/metrics|head-20输出应包含ceph_health_status、ceph_osd_up等指标。可选配置如果你需要调整监听地址或端口可在 Manager 配置中修改ceph configsetmgr mgr/prometheus/server_addr0.0.0.0 ceph configsetmgr mgr/prometheus/server_port9283如需收集 RGW 指标需在 RGW 实例配置中添加rgw enable usage log true并启用rgw租户统计然后重启 RGW。自 Pacific 版本起prometheus 模块会自动抓取 RGW 指标需 mgr 有访问 RGW admin 的权限。3. 配置 Prometheus 抓取在prometheus.yml中添加scrape_configs:-job_name:cephscrape_interval:30sstatic_configs:-targets:-ceph-mgr1:9283-ceph-mgr2:9283# 高可用 Manager两个节点都暴露相同数据labels:cluster:ceph-prod注意无论几个 mgr 实例一次只需抓取一个或两个但instance标签相同因为它们报告相同的集群状态。可配置成多 target 但保留一个活跃以实现高可用抓取。4. 核心监控指标与 PromQLCeph Prometheus 模块导出的指标命名以ceph_为前缀标签包括cluster、osd、pool、instance等。4.1 集群健康状态指标含义ceph_health_status0HEALTH_OK, 1HEALTH_WARN, 2HEALTH_ERRceph_health_detail健康警告/错误的描述性标签字符串不易直接查询PromQL 告警ceph_health_status 0表示非健康。4.2 OSD 状态指标含义ceph_osd_up每个 OSD 是否在线1up, 0downceph_osd_in是否在集群中1in, 0outceph_osd_nearfull接近满的 OSD 数量从 Pacific 起可用ceph_osd_full满的 OSD 数量ceph_osd_stat_bytes_used/ceph_osd_stat_bytes_totalOSD 已用/总容量PromQL离线 OSDceph_osd_up 0全满 OSDceph_osd_full 0OSD 使用率ceph_osd_stat_bytes_used / ceph_osd_stat_bytes_total * 1004.3 Placement Group (PG) 状态指标含义ceph_pg_active活跃 PG 总数ceph_pg_clean清洁 PG 总数ceph_pg_degraded降级 PG 总数ceph_pg_stuck_degraded卡在降级状态的 PG 数ceph_pg_stuck_unclean卡在不洁状态的 PG 数关键告警ceph_pg_degraded 0或ceph_pg_stuck_unclean 0。4.4 MON 状态指标含义ceph_mon_quorum_status当前 MON 节点是否在法定数中1是ceph_mon_num_elections选举次数频繁选举表明不稳定告警ceph_mon_quorum_status 0表示某 MON 节点已出法定数。4.5 集群容量与池使用指标含义ceph_cluster_total_bytes集群总物理容量ceph_cluster_total_used_bytes已用物理容量ceph_cluster_total_avail_bytes可用空间ceph_pool_bytes_used/ceph_pool_max_avail池级别的使用和可用PromQL集群使用率ceph_cluster_total_used_bytes / ceph_cluster_total_bytes * 100池使用率ceph_pool_bytes_used / (ceph_pool_bytes_used ceph_pool_max_avail) * 1004.6 性能指标I/O 与延迟指标含义ceph_osd_op_w_latency_sum/_countOSD 写操作延迟ceph_osd_op_r_latency_sum/_countOSD 读操作延迟ceph_osd_perf_apply_latency_seconds事务应用延迟ceph_osd_perf_commit_latency_seconds提交延迟ceph_pool_rd_bytes/ceph_pool_wr_bytes池级读写速率PromQL平均写延迟rate(ceph_osd_op_w_latency_sum[5m]) / rate(ceph_osd_op_w_latency_count[5m])池吞吐MB/srate(ceph_pool_wr_bytes[1m]) / 1024 / 10244.7 RGW 对象网关若启用指标含义ceph_rgw_http_requests_totalRGW 请求总数ceph_rgw_http_errors_totalRGW 错误数ceph_rgw_qlen请求队列长度ceph_rgw_cache_hit_total/_miss_total缓存命中/未命中告警rate(ceph_rgw_http_errors_total[5m]) 05. Grafana 仪表盘推荐Ceph 社区提供了非常成熟的官方仪表盘Ceph Cluster DashboardID2842最经典涵盖集群健康、OSD、PG、容量、MON、I/O 延迟、池统计等完美适配 Prometheus 内置模块。Ceph RGWID13286若使用 RGW可独立导入。Ceph Pacific/Quincy EnhancementsID15328包含新版本增加的 nearfull、recovery 速率等面板。导入后选择 Prometheus 数据源将变量cluster绑定至你的 Ceph 集群标签。6. 告警规则实战groups:-name:ceph_alertsrules:-alert:CephClusterHealthWarnexpr:ceph_health_status 1for:5mlabels:severity:warningannotations:summary:Ceph 集群状态为 HEALTH_WARN-alert:CephClusterHealthErrexpr:ceph_health_status 2for:1mlabels:severity:criticalannotations:summary:Ceph 集群状态为 HEALTH_ERR立即处理-alert:CephOSDDownexpr:ceph_osd_up 0for:5mlabels:severity:criticalannotations:summary:OSD {{ $labels.osd }} 已离线-alert:CephOSDHostDownexpr:ceph_osd_in 0 and ceph_osd_up 0for:1mlabels:severity:criticalannotations:summary:OSD {{ $labels.osd }} 不在集群中且离线-alert:CephOSDNearFullexpr:ceph_osd_nearfull0for:10mlabels:severity:warningannotations:summary:存在接近满的 OSD立即添加容量或调整权重-alert:CephPGsDegradedexpr:ceph_pg_degraded0for:10mlabels:severity:warningannotations:summary:PG 出现降级数量{{ $value }}-alert:CephPGsStuckUncleanexpr:ceph_pg_stuck_unclean0for:15mlabels:severity:criticalannotations:summary:有 PG 长时间卡在不洁状态数据可能不可访问-alert:CephMonQuorumLostexpr:ceph_mon_quorum_status 0for:1mlabels:severity:criticalannotations:summary:MON 节点 {{ $labels.instance }} 失去法定数-alert:CephClusterCapacityFullexpr:ceph_cluster_total_used_bytes / ceph_cluster_total_bytes * 10085for:10mlabels:severity:warningannotations:summary:Ceph 集群容量使用率超过 85%-alert:CephPoolFullexpr:ceph_pool_bytes_used / (ceph_pool_bytes_used ceph_pool_max_avail) * 10085for:10mlabels:severity:warningannotations:summary:池 {{ $labels.pool }} 使用率超过 85%7. 进阶多集群、安全与性能7.1 多 Ceph 集群监控为每个集群的 mgr 配置不同的cluster标签在 Prometheus 中通过labels区分。Grafana 仪表盘通过变量cluster切换轻松实现多集群统一监控。7.2 安全加固Ceph Prometheus 端点默认无认证建议通过防火墙限制仅 Prometheus 服务器可访问 9283 端口。也可将 mgr 的 9283 绑定到127.0.0.1再用反向代理如 Caddy/Nginx添加 TLS 和 Basic Auth。确保 mgr 具备读取 RGW 统计的权限如ceph dashboard set-rgw-api-access-key等否则 RGW 指标会缺失。7.3 性能影响Prometheus 模块采集频率由 Prometheus scrape_interval 控制mgr 本身每次抓取时会查询集群状态对 mgr CPU 开销极小。通常 30s 抓取足够。8. 总结通过 Ceph 内置的 Prometheus 模块你的分布式存储集群不再是一块模糊的黑洞。从集群健康灯、OSD 在线状态、PG 降级到 RGW 请求延迟所有信息都转化为可查询、可告警的时序指标。结合 Grafana 丰富的仪表盘和 Alertmanager 的即时通知你能在数据丢失风险萌芽时就采取行动让 Ceph 真正成为软件定义存储的可观测基石。部署它让存储层也能像应用一样被“看见”。