1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | GKE Reliability |
| 作者/维护者 | Google(google/skills 仓库) |
| 来源链接 | https://github.com/google/skills/tree/main/skills/cloud/gke-reliability |
| 许可证 | Apache-2.0(数据来源:GitHub API) |
| GitHub Stars | 18,283(数据来源:GitHub API;该数字属整个 google/skills 合集仓库,不代表本技能自身热度) |
| Forks | 1,443(同上,合集整体数据) |
| 最新版本 | 仓库不发布正式 release,持续滚动更新;本技能目录最近一次提交为 2026-06-24(数据来源:GitHub API) |
| 安装方式 | npx skills add google/skills 交互式勾选安装,或手动复制 skills/cloud/gke-reliability/ 目录到 agent 的 skills 目录 |
2. 功能介绍与亮点
GKE Reliability 聚焦运行在 Google Kubernetes Engine 上的工作负载如何扛住节点升级、扩缩容、单区故障等常规扰动,提供一份 Golden Path 可靠性基线(区域型集群跨 4 个可用区、SURGE 滚动升级策略、节点自动修复/自动升级、REGULAR 发布通道、有状态工作负载启用主从选举)和六段配置工作流:
- 集群高可用性核验:判断集群控制面是区域型还是单区型、节点是否跨多可用区分布。
- Pod 中断预算(PDB):检查现有 PDB、给出“每个 2 副本以上的生产 Deployment 都应配 PDB”的模板。
- 健康探针:liveness/readiness/startup 三类探针的推荐参数(含超时、失败阈值),并说明三者各自的判定用途。
- 优雅停机:
terminationGracePeriodSeconds与preStop钩子配置,确保 Pod 收到SIGTERM后能先排空在途请求再退出。 - 拓扑分布约束:按可用区(硬性)与节点(尽力而为)两级分布 Pod,避免单点故障波及整个服务。
- 副本数基线:按无状态服务/关键服务/有状态服务/批处理任务四类工作负载给出最低副本数建议及理由。
亮点:
- 每段工作流都给出 MCP 工具调用(标注为 preferred)与
kubectl/gcloud命令行两条等效路径,未接入 MCP 服务器的用户可完全靠命令行走完整套流程。 - PDB、健康探针、优雅停机、拓扑分布四类配置均附可直接复制的 YAML 模板,不需要用户自己现查字段名。
- 正文末尾的六条生产准则把容易被忽略的细节(如“不要依赖 1 秒的默认探针超时”“每个 2 副本以上服务都要配 PDB”)直接摆在配置流程里。
3. 适用场景
固定分类:DevOps 与基础设施。
适用于在 GKE 上运行生产工作负载、需要把可靠性基线(PDB、健康探针、优雅停机、拓扑分布、副本数)落到具体 YAML 配置的平台工程师与 SRE。这些配置项是几乎所有多副本生产服务都要具备的基础项,而非某个细分角色的专项需求,受益面覆盖同仓库内负责 GKE 运维的大多数团队。
4. 跨 Agent 兼容性
- Claude Code:原生支持——SKILL.md 遵循标准 Agent Skills 格式,仓库同时提供
npx skills add通用安装与claude plugin marketplace add google/skills插件市场两种途径。 - Codex:原生支持——仓库 README 明确列出
codex plugin marketplace add google/skills安装路径。 - OpenClaw:未验证——未见到针对该 agent 的专门说明。
- Hermes Agent:未验证——未见到针对该 agent 的专门说明。
5. 推荐理由
它把 PDB、健康探针、优雅停机、拓扑分布这些几乎每个 GKE 生产工作负载都躲不开的可靠性基线,整理成可直接复制的 YAML 模板与一份 Golden Path 默认值表,省去用户自己现查字段名和推荐值的过程。每段工作流都同时给出 MCP 与 kubectl/gcloud 两条路径,不强制用户接入特定工具链就能使用。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 发布方 Google 为一线云厂商,属官方出品,受欢迎程度不低于 7 分的保底档;google/skills 合集仓库 18,283 星不计入单个子技能,本技能自身暂无独立第三方讨论证据 |
| 可用性 | 8 | SKILL.md 单文件即为完整安装单元,四类核心配置均附可直接使用的 YAML 示例,技能目录最近一次提交在近 3 个月内;但工作流以 MCP 工具调用为 preferred 路径(kubectl/gcloud 为 fallback),比同仓库内不依赖任何外部工具的同类技能多一层可选依赖 |
| 安全性 | 8 | 全部内容开源可审计(Apache-2.0);MCP 工具中 apply_k8s_manifest 具备对用户集群写入资源的能力,但用途(仅限 PDB/探针/拓扑等可靠性配置)在正文中明确说明、范围可审计,未见外发或权限越界迹象 |
安全检查清单:
| 检查项 | 结果 |
|---|---|
| ① Shell 命令执行范围 | 无独立脚本;MCP 工具(get_cluster/get_k8s_resource/describe_k8s_resource/apply_k8s_manifest/list_k8s_events)与 kubectl/gcloud 命令均限定在可靠性相关的读取与配置应用,与技能声明功能一致 |
| ② 运行时联网外发 | 无独立外发;配置应用后的流量走用户自己的 GCP 项目与集群 |
| ③ API key/凭据 | 复用用户本机已有的 gcloud/kubectl 认证态或已配置的 MCP 服务器连接,技能本身不额外索取或存储凭据 |
| ④ 可疑指令/注入迹象 | 未发现 |
| ⑤ 作者/组织信誉 | Google 官方仓库,无造假迹象 |
| ⑥ License | Apache-2.0,明确 |
| ⑦ 最近维护时间 | 技能目录最近提交 2026-06-24,所属仓库整体最近提交 2026-08-14,持续维护中 |
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 与本技能的差异 |
|---|---|---|
| K8s_Manifest_Generator_Wshobson_Agents | 面向通用 Kubernetes(非 GKE 专属)从零生成生产级 manifest,覆盖资源限制、健康检查等基础最佳实践 | 面向“从零开始写 YAML”的初学场景,覆盖面更泛化;本技能面向已在 GKE 上运行的工作负载,聚焦 PDB/探针/拓扑/优雅停机这几项更细的可靠性专项配置,并给出 GKE 专属的 Golden Path 默认值 |
| Google_Cloud_Waf_Reliability_Google_Skills | Google Cloud Well-Architected Framework 可靠性支柱评审清单,覆盖高可用与容灾设计原则 | 定位是架构层面的系统性评审(原则与设计决策),面向云架构师;本技能是工作负载层面的具体配置落地(PDB YAML 怎么写、探针参数怎么设),面向直接动手配置的 SRE |
| Azure_Reliability_Microsoft_Azure_Skills | 一次对话评估并修复 Azure Functions/App Service 的多可用区容错缺口 | 服务对象是 Azure 的 PaaS 计算服务(Functions/App Service),配置模型与 Kubernetes 完全不同;本技能针对 GKE/Kubernetes 工作负载,两者面向不同云平台的不同计算形态 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价;google/skills 仓库整体在 Google Cloud 官方博客与多家技术媒体有发布报道,但报道内容面向仓库整体而非本技能。
9. 其他补充
正文六条生产准则中特别强调“探针超时不要依赖 Kubernetes 默认的 1 秒”,需要用户按自身应用的实际响应时间显式设置 initialDelaySeconds/periodSeconds/timeoutSeconds,属于容易被忽略但影响线上稳定性的细节。
10. 安装使用方式
- 一键安装:
npx skills add google/skills,安装过程中勾选 “GKE Reliability”。 - 插件市场安装(Claude Code):
claude plugin marketplace add google/skills,再执行claude plugin install <plugin>@google-plugins。 - 手动安装:将仓库
skills/cloud/gke-reliability/SKILL.md复制到本地 agent 的 skills 目录。 - 使用前需已完成
gcloud container clusters get-credentials认证,本机具备kubectl、gcloud两个命令行工具;如需走 MCP 路径,需另行配置对应的 GKE/Kubernetes MCP 服务器连接。
11. 注意事项
- 内容聚焦工作负载层面的可靠性配置(PDB、探针、拓扑分布、优雅停机、副本数),不涉及灾难恢复或整集群备份(该部分由同仓库
gke-backup-dr覆盖)。 - MCP 工具路径需要额外配置 MCP 服务器连接,未配置时可完全退回
kubectl/gcloud命令行路径,不影响核心功能可用性。 - 拓扑分布约束示例中的“可用区硬性分布”策略(
DoNotSchedule)在小规模集群(可用区数量少于所需副本数时)可能导致 Pod 无法调度,使用前需确认集群可用区数量与副本数匹配。