1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | GKE Workload Scaling |
| 作者/维护者 | Google(google/skills 仓库) |
| 来源链接 | https://github.com/google/skills/tree/main/skills/cloud/gke-workload-scaling |
| 许可证 | Apache-2.0(数据来源:GitHub API) |
| GitHub Stars | 18,273(数据来源:GitHub API;该数字属整个 google/skills 合集仓库,不代表本技能自身热度) |
| Forks | 1,442(同上,合集整体数据) |
| 最新版本 | 仓库不发布正式 release,持续滚动更新;本技能目录最近一次提交为 2026-07-17(数据来源:GitHub API) |
| 安装方式 | npx skills add google/skills 交互式勾选安装,或手动复制 skills/cloud/gke-workload-scaling/ 目录到 agent 的 skills 目录 |
2. 功能介绍与亮点
GKE Workload Scaling 聚焦 Google Kubernetes Engine 上应用/工作负载层的扩缩容配置,覆盖三种手段:
- 手动扩缩容:
kubectl scale一键调整副本数,适合临时干预或测试。 - 水平自动扩缩容(HPA):基于 CPU/内存或自定义指标自动增减 Pod 数量,正文区分了“控制台快速命令”与“YAML 清单化配置”两条路径,并说明 GKE 上基于 Cloud Monitoring 指标(如 Pub/Sub 队列长度)扩缩容的推荐做法(External 指标类型,无需额外部署 Custom Metrics Adapter)。
- 垂直自动扩缩容(VPA):自动调整容器的 CPU/内存预留,正文列出
Off/Initial/Auto/InPlaceOrRecreate四种更新模式的行为差异与适用场景,并给出 Autopilot 与 Standard 集群启用方式的区别。
亮点:
- 配套可运行模板:
assets/hpa-example.yaml、assets/vpa-example.yaml两份可直接kubectl apply的清单模板,覆盖手册与模板两个层次。 - 一手运维经验:明确指出 HPA 与 VPA 同时作用于同一指标(如都用 CPU)会导致抖动,建议“HPA 管 CPU、VPA 管内存”的搭配模式;并说明 VPA “Auto” 模式默认要求至少 2 个副本才会执行驱逐,避免单副本应用被误伤。
- 完整的“再调整”工作流:正文最后给出一套从 VPA
Off模式观察 24 小时、比较target与实际requests、按 20% 缓冲量应用新配置的量化再调整(rightsizing)流程,并配一张按 CPU/内存超配倍数分级给出处置建议与风险等级的对照表。
3. 适用场景
固定分类:DevOps 与基础设施。
适用于负责 GKE 集群应用层容量规划与调优的团队:当应用需要根据负载自动增减副本、或需要按实际用量校正容器资源预留时,可用它快速配置 HPA/VPA 并按内置工作流完成再调整。受益人群为 GKE 平台的 SRE、DevOps 工程师与后端应用负责人。
4. 跨 Agent 兼容性
- Claude Code:原生支持——SKILL.md 遵循标准 Agent Skills 格式,仓库同时提供
npx skills add通用安装与claude plugin marketplace add google/skills插件市场两种途径。 - Codex:原生支持——仓库 README 明确列出
codex plugin marketplace add google/skills安装路径。 - OpenClaw:未验证——未见到针对该 agent 的专门说明。
- Hermes Agent:未验证——未见到针对该 agent 的专门说明。
5. 推荐理由
它把 GKE 应用层扩缩容这个几乎每个生产集群都要面对的问题,从“HPA/VPA 怎么配”提升到“配完之后怎么再校正”:内置的再调整工作流把 CPU/内存超配倍数直接映射到具体处置建议与风险等级,省去工程师自己摸索阈值的过程;对 HPA/VPA 指标冲突、VPA 驱逐副本数下限等容易踩的坑也提前点出。两份可直接 apply 的 YAML 模板让配置过程一步到位,对日常做容量规划的 GKE 使用者是可以直接照做的操作手册。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 发布方 Google 为一线云厂商,属官方出品,受欢迎程度不低于 7 分的保底档;google/skills 合集仓库 18,273 星不计入单个子技能,本技能自身暂无独立第三方讨论证据 |
| 可用性 | 9 | SKILL.md 正文 + 2 份可直接 apply 的 YAML 模板,安装为一条命令;技能目录最近一次提交在近 3 个月内;不依赖任何外部 MCP 服务器或付费组件,kubectl/gcloud 命令行工具即可完整使用 |
| 安全性 | 9 | 全部内容开源可审计(Apache-2.0);正文只给出配置指导与命令示例,不含随附可执行脚本;未见外发或权限越界迹象 |
安全检查清单:
| 检查项 | 结果 |
|---|---|
| ① Shell 命令执行范围 | 有——kubectl scale/kubectl autoscale/kubectl apply、gcloud container clusters update 等命令均作用于用户当前的 kube 上下文与 GCP 项目,权限范围与技能声明的扩缩容配置功能一致 |
| ② 运行时联网外发 | 无独立外发;命令均指向用户自己配置的 GCP 项目与集群 |
| ③ API key/凭据 | 复用用户本机已有的 gcloud/kubectl 认证态,技能本身不额外索取或存储凭据 |
| ④ 可疑指令/注入迹象 | 未发现 |
| ⑤ 作者/组织信誉 | Google 官方仓库,无造假迹象 |
| ⑥ License | Apache-2.0,明确 |
| ⑦ 最近维护时间 | 2026-07-17,近期活跃 |
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 与本技能的差异 |
|---|---|---|
| Gke_Cluster_Autoscaler_Google_Skills | GKE 节点池/集群层的自动扩缩容配置与故障排查 | 关注点在节点池是否能按需创建、扩缩容是否卡住,本技能关注的是应用 Pod 层的副本数与资源预留调整,两者分属不同层级、互补而非重叠 |
| Gke_Compute_Classes_Google_Skills | 通过 ComputeClass 定义节点的机型优先级与调度回退策略 | 解决“新节点该用什么机型”,本技能解决“应用该有几个副本、每个副本该占多少资源”,两者服务于扩容链路的不同阶段 |
| Kubernetes_Skill | 面向通用 Kubernetes(非 GKE 专属)manifest 生成与安全默认值诊断 | 覆盖任意 K8s 发行版的清单生成与安全巡检,不专门处理扩缩容参数调优;本技能是 GKE 专属,且聚焦扩缩容这一单一场景的配置与再调整 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
9. 其他补充
技能正文提示 VPA 在 GKE 1.34+ 版本才支持 InPlaceOrRecreate 更新模式(不重启 Pod 即可生效资源变更),使用较旧版本集群时需退回 Auto 模式并接受 Pod 重启开销。
10. 安装使用方式
- 一键安装:
npx skills add google/skills,安装过程中勾选 “GKE Workload Scaling”。 - 插件市场安装(Claude Code):
claude plugin marketplace add google/skills,再执行claude plugin install <plugin>@google-plugins。 - 手动安装:将仓库
skills/cloud/gke-workload-scaling/整个目录(含SKILL.md、assets/)复制到本地 agent 的 skills 目录。 - 使用前需已完成
gcloud container clusters get-credentials认证,本机具备kubectl、gcloud两个命令行工具;若集群为 Standard 模式,VPA 需先手动开启。
11. 注意事项
- 内容聚焦应用/工作负载层的扩缩容,不涉及节点池层面的集群自动扩缩容(该部分由同仓库
gke-cluster-autoscaler覆盖)。 - 再调整工作流建议先以 VPA
Off模式观察 24 小时以上再应用建议值,直接照搬瞬时数据可能得出不准确的资源预留。 - VPA “Auto” 模式会重启 Pod 以应用新资源配置,应用需能正确处理
SIGTERM优雅终止,否则可能引发短暂服务中断。