Ceph Aiops
通过Ceph Dashboard API诊断与操作Ceph集群,解析健康状态告警。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Ceph Aiops。 它的用途是:通过Ceph Dashboard API诊断与操作Ceph集群,解析健康状态告警。 完整的 Skill 内容见:https://321skill.com/skills/ceph-aiops-x-3/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
‘我的Ceph集群状态显示HEALTH_WARN,告警信息是“1 nearfull osd(s)”,请帮我分析一下具体情况和风险。’ 它会通过Dashboard API获取集群OSD的详细使用率数据,定位到具体是哪个OSD接近满载,并解释这可能导致的写入失败风险,同时建议你检查数据均衡或考虑扩容。
介绍
这个Skill旨在解决Ceph集群运维人员在面对集群健康状态告警(HEALTH_WARN/ERR)时,难以快速定位和诊断根本原因的问题。它通过调用ceph-mgr Dashboard的REST API,将复杂的集群状态信息转化为可读性强、指向明确的诊断结果,帮助用户理解告警背后的具体原因,如OSD故障、PG不一致或存储空间不足等。
使用时,用户只需向AI描述遇到的Ceph集群问题或提供具体的健康状态信息,该Skill便会自动调用相关API获取集群的详细状态数据,并进行分析解读。它不仅能解释告警的含义,还能提供相关的操作建议或查询更深入的指标,从而辅助用户进行下一步的故障排除或日常运维操作。
该Skill非常适合负责Ceph存储集群日常维护和故障处理的运维工程师、SRE以及云原生基础设施开发人员。对于需要快速响应线上存储服务告警、确保数据持久性和服务可用性的团队来说,它是一个高效的辅助工具。
使用建议:确保AI Agent具有访问目标Ceph集群Dashboard API的权限和网络连通性。由于涉及生产环境操作,建议在非核心业务时段先行测试,并理解Skill给出的建议后再执行关键操作。注意,该Skill主要提供诊断和查询能力,具体的修复操作仍需由经验丰富的管理员根据实际情况执行。
核心特点
与通用的API调用或命令行工具Skill不同,它深度集成了对Ceph集群特定健康状态编码(如HEALTH_WARN/ERR)的语义解析能力,能够将原始的API响应直接翻译成运维人员可理解的故障原因和 actionable 建议,而非仅仅返回原始数据。
注意事项
不适合用于非Ceph存储系统(如MinIO、GlusterFS)的运维诊断,也不具备直接执行修复操作(如重启服务、数据恢复)的能力。
常见问题
这个Skill需要什么前置条件?
需要目标Ceph集群的ceph-mgr Dashboard服务已启用,并且AI Agent拥有访问其REST API的网络权限和认证凭据(如Token)。
它能修复Ceph集群的问题吗?
不能直接修复。它的核心功能是诊断和解释问题原因,修复操作需要管理员根据其提供的分析手动或在其他工具中完成。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/ceph-aiops-x-3/raw/index.md 读取 Ceph Aiops 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/ceph-aiops-x-3/raw/index.md(查看排版版本)