Ceph Aiops

通过Ceph Dashboard API诊断和操作Ceph集群

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Ceph Aiops。
它的用途是:通过Ceph Dashboard API诊断和操作Ceph集群
完整的 Skill 内容见:https://321skill.com/skills/ceph-aiops-x-7/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'我的Ceph集群状态显示HEALTH_WARN,提示“too few PGs per OSD”,这是什么意思?',它会调用Ceph Dashboard API获取集群的PG分布和OSD详细信息,然后解释该警告意味着每个OSD上的PG数量低于推荐值,可能导致数据分布不均和性能问题,并建议如何计算和调整合适的PG数量。或者,

对AI说:'帮我检查集群中所有OSD的状态。',它会列出所有OSD的ID、状态(up/down)、权重和使用率,并高亮显示任何异常或离线的OSD。

介绍

该技能旨在解决Ceph集群运维人员在面对集群健康告警(HEALTH_WARN/ERR)时,难以快速定位和诊断根本原因的问题。它通过调用Ceph管理器的Dashboard REST API,将复杂的集群健康状态信息解码为具体、可理解的原因分析,帮助用户理解是OSD故障、PG不一致还是容量不足等问题。

使用时,用户只需向AI提供集群状态信息或描述遇到的问题,该技能便会自动解析API返回的数据,生成结构化的诊断报告,指出潜在的风险点、影响范围和可能的修复建议,从而将原始日志转化为可操作的运维指令。

该技能非常适合负责Ceph分布式存储系统日常运维和故障排查的运维工程师、SRE以及后端开发人员。他们通常需要快速响应线上集群的异常状态,确保存储服务的稳定性和数据可靠性。

使用建议:确保AI已获得访问Ceph Dashboard API的权限(如API端点、认证密钥)。注意事项:该技能依赖于Ceph Dashboard API的可用性和数据完整性,对于API未暴露的底层问题或需要深入内核调试的场景,仍需结合其他监控工具和命令行工具进行综合判断。

核心特点

与通用的系统监控或日志分析技能不同,它深度集成Ceph Dashboard API,专门针对Ceph集群特有的健康状态码(如HEALTH_WARN/ERR)进行语义化解码,能直接关联到Ceph的PG、OSD、Pool等核心概念,提供领域专用的诊断建议。

注意事项

不适合用于非Ceph存储系统(如MinIO、GlusterFS)的监控诊断,也不适用于需要直接操作底层文件系统或进行性能深度调优的场景。

常见问题

这个技能能修复Ceph集群问题吗?

不能直接修复。它主要用于诊断和提供操作建议,具体的修复操作(如重启OSD、调整PG数)需要由运维人员根据建议手动或在其他工具中执行。

需要提前配置Ceph API访问权限吗?

是的。使用前需要在AI的上下文中配置好Ceph Dashboard的REST API端点地址和有效的认证令牌(Token)。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/ceph-aiops-x-7/raw/index.md 读取 Ceph Aiops 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。