Ceph Aiops

通过Ceph Dashboard API诊断和操作Ceph集群的智能助手

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Ceph Aiops。
它的用途是:通过Ceph Dashboard API诊断和操作Ceph集群的智能助手
完整的 Skill 内容见:https://321skill.com/skills/ceph-aiops-x/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“我的Ceph集群状态显示为HEALTH_WARN,提示‘1 pool(s) have many more objects per pg than average’,请帮我诊断一下。” 它会连接到您配置的Ceph Dashboard API,分析该警告的具体含义,评估相关池的PG分布情况,并给出是调整PG数量还是进行数据重平衡的操作建议。

介绍

本Skill专为解决Ceph集群运维中的诊断难题而设计。当Ceph集群出现HEALTH_WARN或HEALTH_ERR等健康状态告警时,传统的排查方式往往需要运维人员手动查阅大量日志和API文档,过程繁琐且易出错。

该Skill通过调用ceph-mgr Dashboard的REST API,能够自动解析集群的健康状态,将抽象的告警信息(如“pgs inconsistent”)解码为具体、可操作的故障原因和修复建议。用户只需提供集群的访问端点(URL)和认证信息,即可快速获取诊断结果。

它主要面向负责Ceph存储集群日常维护和故障处理的运维工程师、SRE以及需要进行存储层问题排查的后端开发人员。对于管理大规模Ceph部署的团队来说,它能显著提升故障定位效率。

使用前请确保您拥有目标Ceph集群ceph-mgr Dashboard的API访问权限(通常需要管理员凭证)。由于直接操作集群,建议在非生产环境或充分备份后先行测试。该Skill不替代深度性能调优或底层数据修复等复杂操作。

核心特点

与通用的API调用或监控工具不同,它深度集成了Ceph集群健康状态的语义解析能力,能将HEALTH_WARN/ERR等状态码直接翻译为具体的根因分析和操作指引,而非仅仅展示原始API数据。

注意事项

不适合用于Ceph集群的深度性能调优、数据恢复或非ceph-mgr Dashboard管理的其他Ceph组件(如RADOSGW)的运维操作。

常见问题

这个Skill需要什么权限?

需要目标Ceph集群ceph-mgr Dashboard的REST API访问权限,通常是具有读取集群健康状态和管理功能的管理员令牌或用户名密码。

它能修复Ceph集群的问题吗?

它主要提供诊断和原因分析,并可能给出操作建议。具体的修复操作(如执行ceph命令)仍需由运维人员根据建议手动或在其他终端完成。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/ceph-aiops-x/raw/index.md 读取 Ceph Aiops 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。