SkillsScout
DEVOPS-INFRA / DevOps 与基础设施

gke-alert-configuration-google-skills

收录日期 2026-08-28·来源仓库 ↗
受欢迎程度
7
可用程度与相关性
9
安全性
9
8.3SCOUT SCORE

1. 基本信息

项目 内容
名称 gke-alert-configuration-google-skills
作者/维护者 Google(google/skills 官方仓库)
来源链接 https://github.com/google/skills/tree/main/skills/cloud/gke-alert-configuration
许可证 Apache License 2.0(数据来自 GitHub API,仓库级)
GitHub Stars 18,802(合集仓库整体,非本技能独立热度,数据来自 GitHub API)
Forks 1,508(合集仓库整体,数据来自 GitHub API)
最新版本 无独立版本号,随仓库主干持续更新;本技能于 2026-08-25 首次提交入库
安装方式 npx skills add google/skills(选择本技能)或手动复制该子目录到 agent 的 skills 目录

2. 功能介绍与亮点

本技能为 GKE(Google Kubernetes Engine)集群、工作负载与服务生成 Terraform 格式的 Prometheus 告警策略,围绕“4 个黄金信号”(延迟、错误、流量、饱和度)与集群健康状态(Pod 频繁重启、节点 NotReady)系统化组织告警覆盖面,而不是零散地按用户临时想到什么就写什么。

亮点:

3. 适用场景

所属分类:DevOps 与基础设施

适用于负责 GKE 集群可观测性建设的 SRE、平台工程师与后端开发者:需要为新上线的 GKE 工作负载补齐一套符合 SRE 最佳实践的告警覆盖、希望避免因误配 kube-state-metrics 指标而产生意外的 Prometheus 采集费用、或需要把现有告警规则迁移到 Terraform 做基础设施即代码管理的团队。

4. 跨 Agent 兼容性

(核验依据:skills.sh 项目对外公开的受支持工具清单,覆盖 Claude Code、OpenAI Codex、OpenClaw、Hermes Agent 等 13 款工具。)

5. 推荐理由

GKE 告警配置这件事最容易出的问题不是“没告警”,而是“告警又多又吵、还悄悄产生了一笔计费”——这份技能把 SRE 圈子里公认但容易被跳过的细节(燃烧率算法、内存而非 CPU 做饱和度信号、流量归零的空向量陷阱)直接写成强制规则,并且对最容易失控的成本项(kube-state-metrics)设了一道“先说清楚费用再动手”的硬门槛。三份参考文档加一个本地校验脚本,让它不止是一份说明文档,而是一套可执行、可复核的告警配置流水线。

6. 评分

维度 分数 说明
受欢迎程度 7 由 Google 官方发布;所属仓库为多技能合集,18,802 星是仓库整体数字,不代表本技能自身热度;技能仅上线 3 天,暂无独立第三方讨论
可用性 9 SKILL.md 正文逾 2 万字节,另附 3 份专项参考文档(合计约 4.7 万字节)与 1 个本地校验脚本;工作流、成本护栏、常见坑点均给出具体可执行的规则与代码示例;最近一次提交 2026-08-25,维护活跃
安全性 9 见下方检查清单

安全检查清单:① 唯一可执行代码是 validate_config.py,逐行核对未发现 subprocess/os.system/网络请求等调用,仅做本地 Terraform 文本的花括号平衡与重复项静态校验,范围可解释 ② 无外部网络外发,仅在文档中引用 Google Cloud 官方文档链接 ③ 不要求提供或存储任何 API key/凭据,复用用户已有的 gcloud 登录状态与既有 GKE/Prometheus 权限 ④ 通读 SKILL.md 全文与校验脚本,未发现可疑指令、混淆代码或隐蔽外发 ⑤ 作者为 Google 官方仓库,信誉最高档 ⑥ 许可证明确(Apache-2.0) ⑦ 最近一次提交 2026-08-25,维护活跃

7. 跟同类 Skills 相比的优势

技能 平台/范围 与本技能的差异
google-cloud-slo-alert-configuration-google-skills 通用 Google Cloud(App Hub 注册资源)SLO 告警 面向通用云资源的 SLO 配置向导,不针对 GKE 场景做专门优化,也不覆盖 kube-state-metrics 成本护栏、CrashLoopBackOff/NotReady 等 GKE 特有的集群健康信号
agent-platform-alert-configuration-google-skills AI Agent(基于 OpenTelemetry 指标)告警 监控对象是 AI Agent 本身的延迟、错误率、Token 用量等指标,与 Kubernetes 基础设施运维完全是两个领域,不产出 GKE 集群或工作负载告警
cloud-monitoring-promql-query-google-skills 通用 Cloud Monitoring PromQL 查询生成 只负责把指标描述符翻译成单条 PromQL 查询语句,不组织成 Terraform 告警策略,也没有黄金信号覆盖框架或成本治理规则

8. 用户评价

该技能目前在第三方平台尚无具名用户评价。

9. 安装使用方式

10. 注意事项