1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | gke-alert-configuration-google-skills |
| 作者/维护者 | Google(google/skills 官方仓库) |
| 来源链接 | https://github.com/google/skills/tree/main/skills/cloud/gke-alert-configuration |
| 许可证 | Apache License 2.0(数据来自 GitHub API,仓库级) |
| GitHub Stars | 18,802(合集仓库整体,非本技能独立热度,数据来自 GitHub API) |
| Forks | 1,508(合集仓库整体,数据来自 GitHub API) |
| 最新版本 | 无独立版本号,随仓库主干持续更新;本技能于 2026-08-25 首次提交入库 |
| 安装方式 | npx skills add google/skills(选择本技能)或手动复制该子目录到 agent 的 skills 目录 |
2. 功能介绍与亮点
本技能为 GKE(Google Kubernetes Engine)集群、工作负载与服务生成 Terraform 格式的 Prometheus 告警策略,围绕“4 个黄金信号”(延迟、错误、流量、饱和度)与集群健康状态(Pod 频繁重启、节点 NotReady)系统化组织告警覆盖面,而不是零散地按用户临时想到什么就写什么。
亮点:
- 成本护栏强制介入:识别出告警依赖
kube-state-metrics(Tier 2,按量计费)时,会先停下来向用户说明费用影响并征求同意,同时给出用指标白名单控制采集成本的具体做法,而不是默默生成一份会产生意外账单的配置。 - 工程实践细节到位:内置一批容易踩坑的规则,例如错误率告警必须用多窗口多燃烧率(Multi-Window Multi-Burn-Rate)SLO 算法而非简单比值以避免误报、饱和度告警只用内存指标不用 CPU(CPU 可压缩会被 CFS 限流、内存不可压缩才会触发 OOM)、以及流量归零时 PromQL 空向量导致告警失效的应对写法(
default 0/absent())。 - 本地校验闭环:附带
validate_config.py脚本,可在编辑前校验变更计划、编辑后扫描 Terraform 目录检测重复告警与语法错误——纯本地静态文本校验,不联网、不执行系统命令。 - 三份专项参考文档(配置前置条件、指标与告警目录、PromQL 查询范例)合计逾 4.7 万字节,覆盖具体到每个黄金信号对应的可直接使用的 PromQL 表达式。
3. 适用场景
所属分类:DevOps 与基础设施
适用于负责 GKE 集群可观测性建设的 SRE、平台工程师与后端开发者:需要为新上线的 GKE 工作负载补齐一套符合 SRE 最佳实践的告警覆盖、希望避免因误配 kube-state-metrics 指标而产生意外的 Prometheus 采集费用、或需要把现有告警规则迁移到 Terraform 做基础设施即代码管理的团队。
4. 跨 Agent 兼容性
- Claude Code:原生支持——标准 SKILL.md 格式,可直接放入
.claude/skills/或经npx skills add安装。 - Codex:原生支持——
npx skills(skills.sh)官方公开的受支持工具清单中列出 Codex。 - OpenClaw:原生支持——同一清单列出 OpenClaw。
- Hermes Agent:原生支持——同一清单列出 Hermes Agent,与本技能采用同一套 agentskills.io SKILL.md 标准,无需转换。
(核验依据:skills.sh 项目对外公开的受支持工具清单,覆盖 Claude Code、OpenAI Codex、OpenClaw、Hermes Agent 等 13 款工具。)
5. 推荐理由
GKE 告警配置这件事最容易出的问题不是“没告警”,而是“告警又多又吵、还悄悄产生了一笔计费”——这份技能把 SRE 圈子里公认但容易被跳过的细节(燃烧率算法、内存而非 CPU 做饱和度信号、流量归零的空向量陷阱)直接写成强制规则,并且对最容易失控的成本项(kube-state-metrics)设了一道“先说清楚费用再动手”的硬门槛。三份参考文档加一个本地校验脚本,让它不止是一份说明文档,而是一套可执行、可复核的告警配置流水线。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 由 Google 官方发布;所属仓库为多技能合集,18,802 星是仓库整体数字,不代表本技能自身热度;技能仅上线 3 天,暂无独立第三方讨论 |
| 可用性 | 9 | SKILL.md 正文逾 2 万字节,另附 3 份专项参考文档(合计约 4.7 万字节)与 1 个本地校验脚本;工作流、成本护栏、常见坑点均给出具体可执行的规则与代码示例;最近一次提交 2026-08-25,维护活跃 |
| 安全性 | 9 | 见下方检查清单 |
安全检查清单:① 唯一可执行代码是 validate_config.py,逐行核对未发现 subprocess/os.system/网络请求等调用,仅做本地 Terraform 文本的花括号平衡与重复项静态校验,范围可解释 ② 无外部网络外发,仅在文档中引用 Google Cloud 官方文档链接 ③ 不要求提供或存储任何 API key/凭据,复用用户已有的 gcloud 登录状态与既有 GKE/Prometheus 权限 ④ 通读 SKILL.md 全文与校验脚本,未发现可疑指令、混淆代码或隐蔽外发 ⑤ 作者为 Google 官方仓库,信誉最高档 ⑥ 许可证明确(Apache-2.0) ⑦ 最近一次提交 2026-08-25,维护活跃
7. 跟同类 Skills 相比的优势
| 技能 | 平台/范围 | 与本技能的差异 |
|---|---|---|
| google-cloud-slo-alert-configuration-google-skills | 通用 Google Cloud(App Hub 注册资源)SLO 告警 | 面向通用云资源的 SLO 配置向导,不针对 GKE 场景做专门优化,也不覆盖 kube-state-metrics 成本护栏、CrashLoopBackOff/NotReady 等 GKE 特有的集群健康信号 |
| agent-platform-alert-configuration-google-skills | AI Agent(基于 OpenTelemetry 指标)告警 | 监控对象是 AI Agent 本身的延迟、错误率、Token 用量等指标,与 Kubernetes 基础设施运维完全是两个领域,不产出 GKE 集群或工作负载告警 |
| cloud-monitoring-promql-query-google-skills | 通用 Cloud Monitoring PromQL 查询生成 | 只负责把指标描述符翻译成单条 PromQL 查询语句,不组织成 Terraform 告警策略,也没有黄金信号覆盖框架或成本治理规则 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
9. 安装使用方式
- 命令行安装:
npx skills add google/skills,安装时勾选gke-alert-configuration - 手动安装:将
skills/cloud/gke-alert-configuration整个目录(含references/与scripts/)复制进所用 agent 的 skills 目录 - 使用前提:已有 GKE 集群并启用 Google Cloud Managed Service for Prometheus 采集;本地或 CI 环境需能读写目标 Terraform 配置目录
- 安装后无需重启,在对话中提出“帮我给这个 GKE 服务配置延迟/错误率告警”“检查一下我的告警配置有没有重复”等意图即会触发;生成的 Terraform 文件需人工 review 后再实际 apply
10. 注意事项
- 仅覆盖 GKE 场景,不适用于脱离 GKE 的独立 Compute Engine 虚拟机或独立 Cloud Run 服务监控(技能内明确写出会拒绝并引导至对应的通用监控方案)
- 只生成使用
condition_prometheus_query_language(PromQL)的告警策略,不生成基于 MQL 或标准阈值条件的告警 - 生成的是 Terraform 配置代码,不直接执行
terraform apply,落地部署仍需人工或既有 CI/CD 流程完成 - 技能刚上线 3 天,实际使用反馈与边界场景覆盖情况有待更多用户验证