Ceph Aiops

通过Ceph Dashboard API诊断集群健康状态

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Ceph Aiops。
它的用途是:通过Ceph Dashboard API诊断集群健康状态
完整的 Skill 内容见:https://321skill.com/skills/ceph-aiops-x-4/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请检查Ceph集群的健康状态,并解码当前HEALTH_WARN告警的具体原因。' 它会调用ceph-mgr Dashboard API获取集群状态JSON,然后自动解析出告警代码(如OSD_DOWN、PG_AVAILABILITY等),并给出每个告警的影响范围、可能原因以及推荐修复步骤。

介绍

Ceph Aiops 是一个专门用于操作和诊断 Ceph 集群的 AI Agent Skill,它通过调用 ceph-mgr Dashboard REST API 直接获取集群状态,并自动解码 HEALTH_WARN 或 HEALTH_ERR 告警为具体原因。本 Skill 解决了运维人员需要手动登录节点、查看复杂日志来定位集群问题的痛点,将告警解读过程自动化、结构化的输出。

使用方式非常简单:您只需向 AI 描述当前遇到的集群异常或健康状态查询需求,例如“检查 Ceph 集群健康状态”或“分析 HEALTH_WARN 告警原因”,Skill 会自动连接 ceph-mgr Dashboard API,获取集群的详细状态信息,然后将告警代码、影响范围、可能原因以及修复建议以清晰的结构化文本呈现,帮助您快速定位问题。

本 Skill 最适合运维工程师、后端开发人员以及需要管理 Ceph 存储集群的团队。无论您是日常巡检、故障排查,还是集群扩容前后检查,它都能有效减少手动操作和误判,提升运维效率。对于不熟悉 Ceph 内部告警机制的新手,本 Skill 也能提供即时的解释和指导。

使用前请确保 ceph-mgr Dashboard 已启用且 REST API 可达,并配置好访问凭据(如 API Key 或 Token)。建议在测试环境先验证连接,再应用到生产集群。注意,本 Skill 仅执行诊断操作,不执行修改集群配置的写操作,确保安全。

核心特点

直接通过 ceph-mgr Dashboard 官方 REST API 解码健康告警,无需手动解析日志或依赖第三方工具,输出结构化的原因与修复建议。

注意事项

不适用于没有开启 ceph-mgr Dashboard 或 REST API 不可达的 Ceph 集群环境。

常见问题

需要提前配置什么才能使用?

需要确保 Ceph 集群已启用 ceph-mgr Dashboard 模块,并获取到有效的 API 访问地址和认证凭据(如管理员 Token)。

支持哪些 Ceph 版本?

支持 ceph-mgr Dashboard 模块可用的版本,建议使用 Octopus 及以上版本以获得完整的 REST API 功能。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/ceph-aiops-x-4/raw/index.md 读取 Ceph Aiops 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。