1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | Cloud_Run_Alert_Configuration_Google_Skills |
| 项目自述名称 | Cloud Run Alert Configuration |
| 作者/维护者 | Google(google/skills 官方仓库) |
| 来源链接 | https://github.com/google/skills/tree/main/skills/cloud/cloud-run-alert-configuration |
| 许可证 | Apache License 2.0(GitHub API 实测,仓库级) |
| GitHub Stars | 19,785(合集仓库整体数字,来自 GitHub API;不代表本技能自身热度,见下文说明) |
| Forks | 1,593(同上,合集仓库整体) |
| 最新版本 | 无独立版本号,随仓库主分支迭代;本技能最近一次提交为 2026-09-11 |
| 安装方式 | npx skills add google/skills(skills.sh 通用安装器,可勾选单个技能) |
2. 功能介绍与亮点
这是一份面向 Google Cloud Run(服务、任务、Worker Pool 三种工作负载)的告警策略配置指南,核心是把 SRE 领域公认的最佳实践直接固化成可执行的 Terraform 配置生成流程,而不是一篇泛泛的监控概念文档。
核心能力:
- 自动发现目标:优先扫描本地工作区的
.tf文件识别已有的 Cloud Run 资源;扫不到时降级为gcloud命令行发现,全程不需要用户手工报资源名。 - 按工作负载类型分流:HTTP 服务、批处理任务、Worker Pool 各自对应一份独立的参考文档(
services.md/jobs.md/worker_pools.md),分别覆盖可用性 SLO(4xx/5xx)、请求延迟(P95/P99)、容器实例饱和度、CPU/内存利用率、可计费实例时间、任务执行失败、队列积压等指标。 - PromQL 与 Terraform 双重规范:对告警窗口(
duration)给出了具体的取值规则(如长窗口 25 小时以上必须省略duration,否则 Cloud Monitoring 会报INVALID_ARGUMENT),并规定输出统一使用google_monitoring_alert_policy资源、参数化通知渠道,避免生成能跑但不规范的配置。 - 只生成配置、不代执行:流程止步于本地
.tf文件的生成与展示,不包含terraform apply或任何直接改动线上环境的步骤,用户仍需自行审阅并部署。
主要亮点:官方出品(Google Cloud 团队维护)、内容完全开源可审计、当前处于持续更新状态(最近一次提交为 2026-09-11),且明确把默认阈值、SLO 目标等“魔法数字”全部摊开说明依据,而不是黑盒给结论。
3. 适用场景
所属分类:DevOps 与基础设施
适合已经在用 Cloud Run 部署服务、任务或 Worker Pool,但还没有系统性告警覆盖的团队——常见于从“能跑就行”过渡到“要对生产事故负责”阶段的中小团队或个人开发者。典型场景:新服务上线前补齐告警清单、事故复盘后发现监控盲区、把散落在控制台里手工配置的告警统一迁移成可版本化的 Terraform 代码。受益人群是负责 Cloud Run 运维或 SRE 职能的工程师,尤其是不熟悉 PromQL 和 Cloud Monitoring 告警细节、需要一份“抄了不会错”的配置模板的初中级用户。
4. 跨 Agent 兼容性
| Agent | 结论 | 依据 |
|---|---|---|
| Claude Code | 原生支持 | 仓库 README 明确提供 claude plugin marketplace add google/skills 安装路径,且技能本身是标准 SKILL.md,无 Claude 专属语法 |
| Codex | 需适配 | 仓库同时提供 Codex 插件市场安装路径,但技能执行依赖 gcloud 网络调用;若运行在默认无网络的 Codex 沙箱中,需要先手动打通网络与凭据配置才能实际发现资源 |
| OpenClaw | 原生支持 | SKILL.md 遵循通用 Agent Skills 开放标准(仅 name/description 必填字段),经检索确认该标准官方宣称可在 Hermes、OpenClaw、Claude 等多个 runtime 间直接复用同一技能文件 |
| Hermes Agent | 原生支持 | 同上,SKILL.md 标准字段无 harness 专属依赖;npx skills add 通用安装器本身即覆盖 Claude Code / Cursor / Codex 等多 runtime |
5. 推荐理由
它把“该给 Cloud Run 配什么告警”这个每个团队都要重新摸索一遍的问题,浓缩成了一套有明确依据、按工作负载类型分流、且直接落地为可审查 Terraform 代码的标准流程,省去了翻 SRE 手册再逐条对照 PromQL 语法的过程,同时因为只生成配置不代执行,风险可控,适合作为团队的告警配置起点模板。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 官方出品——Google Cloud 团队维护;合集仓库整体 19,785 星,该数字属整个合集,不代表本技能子目录自身的热度;未检索到该子技能自身的独立第三方讨论 |
| 可用性 | 9 | 安装为一条 npx skills add 命令;文档极为完整(配置优先/CLI 兜底的自动发现流程、按工作负载类型分拆的三份参考文档、明确的默认值与可覆盖说明);最近一次提交为 2026-09-11,属仓库内最新加入的技能之一;无付费依赖,仅需标准 GCP 项目权限 |
| 安全性 | 8 | 检查清单逐项:①仅执行只读发现类 gcloud 命令与本地写 .tf 文件,不含 terraform apply 等改动线上环境的操作,权限范围明确;②不联网外发数据到第三方,全部调用均为 Google Cloud 官方 API;③凭据走标准 gcloud auth,不涉及明文存储;④正文未发现任何可疑指令或夹带推广;⑤作者为 Google 官方团队;⑥License 为 Apache-2.0,明确;⑦维护活跃(近一日内有提交) |
综合评分:8.0
7. 跟同类 Skills 相比的优势
| 技能 | 定位 | 与本技能的差异 |
|---|---|---|
| GKE Alert Configuration(同仓库) | 面向 GKE(Kubernetes 容器集群)的告警配置 | 目标平台不同——GKE 需要理解 Pod/Node/集群层面的资源模型,本技能针对的是无需管理底层集群的 Serverless Cloud Run,配置复杂度和前置知识门槛更低 |
| Agent Platform Alert Configuration(同仓库) | 面向 Vertex AI Agent Platform 推理/评测服务的告警配置 | 服务对象是 AI Agent 运行时本身(如推理延迟、评测失败率),不覆盖通用 Web 服务/批处理/队列类的 Cloud Run 场景 |
| Datadog APM(dd-apm,第三方可观测性平台技能) | 跨云通用 APM 告警与追踪 | 依赖额外接入 Datadog 账号与 Agent,配置体系是 Datadog 自有的 Monitor/SLO 语法而非原生 Cloud Monitoring PromQL,迁移成本更高;本技能直接产出可被 Google Cloud 控制台识别的原生告警策略,无需引入第三方平台 |
8. 用户评价
该技能于 2026-09-11 刚加入仓库,目前在第三方平台尚无具名用户评价。
9. 安装使用方式
-
通用安装(推荐):
npx skills add google/skills安装过程中从列表勾选 “Cloud Run Alert Configuration” 即可,仅安装该单个技能,不会拉入整个仓库其余内容。
-
Claude Code 插件市场安装:
claude plugin marketplace add google/skills claude plugin install <plugin>@google-plugins -
手动安装:直接从仓库复制
skills/cloud/cloud-run-alert-configuration/整个目录(含SKILL.md与references/下的三份工作负载指南)到本地 agent 的 skills 目录。
安装后无需重启,技能会在对话中提到“配置 Cloud Run 告警”“Cloud Run 监控策略”等意图时自动触发;执行前需确保本地已安装并登录 gcloud CLI(gcloud auth login + gcloud config set project <project_id>),如涉及 Terraform 工作流还需本地已安装 terraform。
10. 注意事项
- 该技能只负责生成本地 Terraform 配置文件,不会自动执行
terraform apply,上线前仍需人工审阅并自行完成部署流程。 - 长窗口(25 小时以上)的 PromQL 告警规则有特殊语法要求(须省略
duration字段),文档已给出说明,但若脱离本技能手工编写同类规则容易踩坑。 - 依赖用户本地已正确配置
gcloud与项目权限;在没有网络访问或 GCP 凭据的沙箱环境(如部分 Codex 默认配置)中无法完成“自动发现”步骤,需要先手动补齐环境。 - 作为仓库中较新加入的技能(2026-09-11),尚未经过长期社区验证,建议先在测试项目中试跑生成结果再用于生产。