Ceph Aiops

通过REST API操作和诊断Ceph集群,解析健康告警状态。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Ceph Aiops。
它的用途是:通过REST API操作和诊断Ceph集群,解析健康告警状态。
完整的 Skill 内容见:https://321skill.com/skills/ceph-aiops-x-2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“我的Ceph集群状态显示为HEALTH_WARN,告警信息是‘OSD_DOWN’,请帮我分析一下。”,它会通过Dashboard API获取详细的OSD状态,告诉你具体是哪些OSD下线、可能的原因(如网络、硬件故障)以及如何安全地将其标记为out或尝试重启。或者,你可以说:“检查集群存储池‘rbd’的利用率。”,它会返回该存储池的已用容量、对象数量以及是否接近配额限制。

介绍

Ceph Aiops Skill 专为需要通过Ceph Dashboard REST API管理和诊断Ceph集群的用户设计。它解决了在集群出现HEALTH_WARN或HEALTH_ERR状态时,运维人员需要快速定位根本原因的难题。该技能能够解析复杂的集群健康状态信息,将告警代码转换为易于理解的原因描述和可能的操作建议,从而加速故障排查过程。

使用时,用户只需向AI Agent描述Ceph集群的健康状态或希望执行的操作,该技能便会调用相应的REST API,获取集群数据并进行智能分析。例如,它可以解读具体的OSD状态、PG分布异常或存储池容量告警,并提供针对性的诊断步骤。

该技能非常适合负责Ceph存储集群日常运维和故障处理的运维工程师、运维开发人员以及需要了解集群健康状况的后端开发人员。它能够显著降低理解Ceph复杂监控指标的门槛,提升运维效率。

需要注意的是,使用前请确保AI Agent已配置好访问Ceph-mgr Dashboard的API地址和认证凭据。该技能主要依赖于Dashboard提供的API接口,因此其功能深度受限于Dashboard API本身的能力。对于底层Ceph命令行的精细操作,可能仍需结合其他工具。

核心特点

与通用的API调用技能不同,它深度集成了对Ceph集群健康状态语义的理解,能够将原始的HEALTH_WARN/ERR编码直接解码为具体的故障原因和运维建议,而非仅仅执行API调用。

注意事项

不适合用于执行Ceph命令行(ceph-*)的精细操作或管理非Dashboard API暴露的集群功能。

常见问题

这个技能能修复Ceph集群问题吗?

不能直接修复,它主要用于诊断和提供操作建议,具体的修复操作需要运维人员根据建议手动执行。

需要提前配置什么?

需要提前在AI Agent中配置好Ceph-mgr Dashboard的REST API端点URL和有效的认证信息(如令牌)。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/ceph-aiops-x-2/raw/index.md 读取 Ceph Aiops 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。