1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | alerting-irm-grafana-skills |
| 作者/维护者 | Grafana Labs(官方) |
| 来源链接 | https://github.com/grafana/skills/tree/main/skills/grafana-core/alerting-irm |
| 许可证 | Apache-2.0(数据来自 GitHub API) |
| GitHub Stars | 合集仓库整体 203(数据来自 GitHub API;该数字属整个 grafana/skills 合集,不代表本技能自身热度) |
| Forks | 合集仓库整体 17(数据来自 GitHub API) |
| 最新版本 | 无正式 Release,随 main 分支滚动更新(仓库最近一次提交为 2026-07-24) |
| 安装方式 | npx skills add grafana/skills 或 Claude Code 插件市场 |
2. 功能介绍与亮点
alerting-irm 是 Grafana 官方 skills 合集中专注“告警与事件响应”的技能,一份 SKILL.md 加三份参考文档(alerting.md / irm.md / slo.md)覆盖三件互相衔接的事:
- 告警配置:Grafana 托管告警、Prometheus/Mimir Ruler、Loki LogQL 告警规则的 YAML 编写,联系点(Slack/PagerDuty/Email/Webhook)与带层级匹配器的通知策略路由树、静默、免打扰时段。
- 事件响应联动:把告警接入 IRM(On-call 排班、升级链),并给出“触发测试告警 → 30 秒内应出现在 IRM”的验证步骤。
- SLO 与多窗口燃尽率告警:生成 SLO 记录规则与仪表盘,并明确解释为什么该用多窗口燃尽率告警而非单窗口。
主要亮点:官方 Grafana Labs 出品且完全开源;仓库配有 CI 校验与 Lint 流水线(Validate Marketplace / Lint Skills 两条 GitHub Actions),近期(2026-07-24)仍有其他子技能收到实质性 bug 修复,显示持续维护;每个工作流都附带可直接执行的 curl/YAML 示例与验证步骤,而非停留在原理说明。
3. 适用场景
固定分类:DevOps 与基础设施。
适合已经在用(或准备用)Grafana 做监控的团队:需要给告警接一个新的通知渠道、排查“为什么这条告警没触发/触发了却没人收到”、从零搭建 on-call 排班与升级策略、或者要为一个服务定义 SLO 并配上合理的燃尽率告警的 DevOps / SRE 工程师,都可以直接让 agent 按此技能生成可用的 YAML 与 API 调用。
4. 跨 Agent 兼容性
- Claude Code:✅ 原生支持,仓库 README 提供
claude plugin marketplace add grafana/skills+claude plugin install grafana-core@grafana-skills的官方安装步骤。 - Codex:✅ README 明确列出 Codex 为兼容工具之一。
- OpenClaw:❓ 未验证——SKILL.md 遵循通用 Agent Skills 开放规范,理论上可安装,但未见官方或第三方对 OpenClaw 的直接说明。
- Hermes Agent:❓ 未验证,理由同上。
5. 推荐理由
告警路由配错、on-call 排班没接对、SLO 只做了单窗口燃尽率告警导致噪音报警,是使用 Grafana 的团队里非常高频的返工点。这份技能把三者的正确做法(YAML 结构、验证步骤、常见坑)整理成 agent 可直接照做的操作手册,比让 agent 现查文档现拼配置更省事也更不容易出错,且官方持续维护、无需为使用它额外付费。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7.0 | 官方 Grafana Labs 出品;所属合集仓库整体 203 stars,不代表本技能自身热度——该子目录自身目前只有随仓库批量质量提升的提交记录,暂无独立于仓库整体的第三方讨论 |
| 可用性 | 9.0 | 一条命令安装;SKILL.md 加三份参考文档结构完整、示例可直接执行;仓库有自动化 Lint/Validate 保障质量;核心功能(Grafana 告警、开源 IRM 概念)可在自托管 Grafana OSS 免费使用,Grafana Cloud 也提供每月 3 个活跃 IRM 用户的免费额度 |
| 安全性 | 9.0 | 纯配置指南,无脚本执行、无自动联网行为;示例中的 API Token/Webhook 密钥均由用户自行在自己的环境中管理,文档未要求以不透明方式存储凭据;未发现可疑指令或混淆内容;License 明确;官方作者信誉良好 |
安全检查清单:①无 shell 命令执行,仅给出用户自行运行的 curl 示例,作用范围限于用户自己的 Grafana 实例 ②无自动联网外发,所有网络调用均由用户主动发起 ③需要用户自备 Grafana API Token 及第三方 Webhook 密钥,存储方式由用户自行决定,文档未提出不当存储要求 ④未发现提示注入或隐蔽指令迹象 ⑤作者为 Grafana Labs,官方信誉良好 ⑥License 为 Apache-2.0,明确 ⑦仓库近期(2026-07-24)仍有实质提交,非弃置项目
综合评分:8.3(三项均值)
7. 跟同类 Skills 相比的优势
| Skill | 定位 | 与本技能的差异 |
|---|---|---|
| incident-response-harness-harness-skills | Harness CI/CD 平台官方技能,把事故与近期部署自动关联、评估影响范围、生成复盘文档 | 聚焦“事故发生后如何调查与复盘”,前提是团队用 Harness 做 CI/CD;alerting-irm 聚焦“告警怎么配、怎么路由到人”,是更上游的告警与排班基础设施配置,两者可在同一套 DevOps 工作流里前后衔接而非互相替代 |
| grafana-dashboards(wshobson/agents 插件) | 通用 Grafana 仪表盘搭建技能,收录于一个 38k+ star 的多领域 agent 技能大合集中 | 只覆盖可视化仪表盘搭建,不涉及告警路由、on-call 或 SLO;alerting-irm 是 Grafana 官方出品,专精告警/事件响应/SLO 这一条线,文档针对 Grafana 告警引擎的实际接口(Provisioning API、Alertmanager)给出可直接执行的示例 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
9. 其他补充
同一 grafana/skills 仓库下还包含 grafana-oss(Grafana OSS 基础配置)、promql、k6、loki-label-analyzer、prometheus-label-strategy、prometheus-cardinality-troubleshooter 等技能,均聚焦查询与指标层面;alerting-irm 是该系列中首个覆盖告警/事件响应/SLO 的技能。
10. 安装使用方式
- 通用方式(推荐):
npx skills add grafana/skills,随后按 agent 提示选择安装 alerting-irm 所在的 grafana-core 插件。 - Claude Code:
claude plugin marketplace add grafana/skills claude plugin install grafana-core@grafana-skills - 安装后无需重启,agent 在识别到“配置告警”“设置 on-call”“定义 SLO”等相关意图时会自动触发该技能;实际执行 YAML Provisioning 或 API 调用前需要用户提供自己 Grafana 实例的访问地址与 API Token。
11. 注意事项
- 技能本身覆盖 Grafana 托管告警、Prometheus/Loki 告警与 SLO,均可在自托管 Grafana OSS 免费使用;若要用到 IRM 的 on-call 排班与升级链功能,需要 Grafana Cloud(提供每月 3 个活跃用户的免费额度,超出后为付费功能)。
- SKILL.md 中提到 Grafana OnCall OSS 版本已于 2026 年 3 月进入维护模式(不再是推荐路径),云端用户应改用 IRM,自托管用户需留意此变化。
- 技能覆盖面较专,前提是团队已经在使用或准备使用 Grafana 生态做监控与告警;不涉及 Grafana 之外的通用监控平台。