portfolio_sre_agent

一个智能SRE告警分析与事件报告生成工具。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:portfolio_sre_agent。
它的用途是:一个智能SRE告警分析与事件报告生成工具。
完整的 Skill 内容见:https://321skill.com/skills/portfolio-sre-agent/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我分析一下刚刚 Prometheus 发来的这组告警,看看是不是真出事了,并给我一个简要的事件报告。” 它会调用 aiTriage 技能,将告警数据归一化,关联分析延迟、错误和饱和度信号,然后生成一份包含当前状况、影响评估和初步处理建议的简洁报告。

介绍

aiTriage 是一个专为站点可靠性工程(SRE)设计的智能告警处理工具。它能自动接收来自 Prometheus、Datadog 等监控系统的告警,并基于经典的“黄金信号”(延迟、错误、饱和度)进行关联分析,从而判断事件的真实影响。其核心逻辑是:仅资源使用率(饱和度)高,而延迟和错误率正常时,不一定会被判定为严重事故,这有助于减少误报。

使用上,它提供了多种交互方式。你可以通过 FastAPI 后端提供的 RESTful API 直接集成,也可以通过一个类似 k9s 的命令行 TUI 来实时查看和管理事件,或者使用基于 Astro 构建的现代化 Web 前端进行操作。项目内置了演示场景,可以快速体验其分析逻辑。

这个工具非常适合需要处理大量监控告警、希望提升事件响应效率的运维工程师、SRE 和全栈开发者。它通过自动化分析和报告生成,将工程师从繁琐的告警噪音中解放出来,聚焦于真正有影响的问题。

需要注意的是,其报告生成功能依赖 OpenAI 或 Anthropic 的 LLM API,并内置了缓存和速率限制机制(默认每小时每IP 3次调用)。如果 SQLite 不可用,系统会降级为无缓存、无限额模式,但核心的告警关联分析功能仍可工作。

核心特点

与简单转发或聚合告警的工具不同,aiTriage 的核心在于应用 SRE 的“黄金信号”理论进行智能关联分析,能区分容量预警和真实事故,显著减少因单一指标(如高CPU)导致的误报。同时,它提供了从 API、TUI 到 Web UI 的完整工具链,并内置了可复用的“SRE Skill”模块,便于集成到其他 AI 智能体中。

注意事项

不适合需要复杂、自定义告警关联规则,或完全离线、无法连接外部 LLM 服务的环境。

常见问题

高CPU报警就一定是事故吗?

不一定。aiTriage 会同时检查延迟和错误率,如果它们正常,则可能只标记为“容量预警”,而非事故。

报告生成收费吗?有限制吗?

使用 OpenAI/Anthropic API 会消耗 token。后端默认启用了速率限制(每小时每IP 3次LLM调用),但缓存命中不计入。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/portfolio-sre-agent/raw/index.md 读取 portfolio_sre_agent 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。