1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | gke-ai-troubleshooting-handle-disruption-gpu-tpu-google-skills |
| 作者/维护者 | Google(google/skills 官方仓库) |
| 来源链接 | https://github.com/google/skills/tree/main/skills/cloud/gke-ai-troubleshooting-handle-disruption-gpu-tpu |
| 许可证 | Apache License 2.0(数据来自 GitHub API) |
| GitHub Stars / Forks | 仓库整体 19,204 / 1,546(数据来自 GitHub API;google/skills 是包含近百个独立技能的合集仓库,此数字属整个合集,不代表本技能自身热度) |
| 最新版本 | 无独立版本号,最近一次改动 2026-07-24(数据来自 GitHub API) |
| 安装方式 | 将该子目录下的 SKILL.md 复制进目标 Agent 的 skills 目录,或克隆整个 google/skills 仓库后按需启用单个技能 |
2. 功能介绍与亮点
该技能面向部署在 GKE 上的 GPU/TPU 工作负载,诊断由 Compute Engine 主机维护(硬件/软件维护事件)引发的节点中断,并给出处置建议。
- 分级诊断:依次核对节点标签(
scheduled-maintenance-time)、PromQL 指标(kubernetes_io:node_interruption_count)、Cloud Logging 维护事件与节点污点,全部为只读查询。 - 排除规则:三类信号均为空时,明确引导转向应用层原因(OOMKill、CUDA 错误等),避免误判。
- 三项防护组合:确认存在维护风险时,统一建议同时配置优雅终止(
terminationGracePeriodSeconds)、机会性维护与 PodDisruptionBudget,分别覆盖保存状态、主动避让、维持可用副本数三个环节。 - 官方出品,随 google/skills 仓库持续维护,命令示例可直接复制执行。
3. 适用场景
固定分类:DevOps 与基础设施。
面向在 GKE 上运行 GPU/TPU 训练或推理任务的 SRE、MLOps 与平台工程团队:训练任务出现节点意外重启、Pod 被驱逐时,用它判断是否由主机维护引起;也可在上线前按三项防护组合提前加固,减少未来维护窗口造成的任务失败。
4. 跨 Agent 兼容性
- Claude Code:原生支持——标准 SKILL.md 格式(YAML front matter + 指令正文),可直接放入
.claude/skills/目录使用。 - Codex CLI:需适配——技能诊断步骤依赖
kubectl、gcloud及 Cloud Monitoring/Logging 的联网查询,而 Codex CLI 默认沙箱不包含网络访问,需要显式放开沙箱网络权限或改用可联网的执行环境后才能跑通诊断命令。 - OpenClaw:未验证。
- Hermes Agent:未验证。
5. 推荐理由
GPU/TPU 集群的主机维护中断是训练与推理任务失败的常见诱因,人工排查往往需要在 Cloud Monitoring、Cloud Logging 与 kubectl 之间来回切换。该技能把诊断流程固化为可复制的步骤与查询语句,并附带三项防护配置组合,能降低排查遗漏与防护缺项的概率,适合作为 GKE GPU/TPU 团队的标准排障手册。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | Google 官方发布,发布方即 GKE/Compute Engine 产品所有者;该子技能自身在第三方渠道暂无独立热度证据,GitHub issue 检索与公开搜索均未发现相关讨论 |
| 可用性 | 8 | 诊断步骤含可直接复制的 kubectl/PromQL/日志过滤语句,结构清晰;需用户自备 GKE 集群与 Cloud Monitoring 访问权限,近期(2026-07-24)仍有维护 |
| 安全性 | 9 | 全部诊断动作均为只读查询,无破坏性操作,无凭据索取或存储,License 明确开源 |
安全检查清单:① shell/kubectl 权限仅限 get/describe 等只读操作,无写入或删除;② 联网查询限于用户自有 GCP 项目内的 Cloud Monitoring/Logging,不外发第三方;③ 不索取也不存储任何 API key 或凭据,复用用户既有的 gcloud/kubectl 登录态;④ 全文未发现可疑指令或隐蔽外发;⑤ 官方仓库,无造假迹象;⑥ License 为 Apache-2.0,明确;⑦ 最近一次改动 2026-07-24,在活跃维护窗口内。
7. 跟同类 Skills 相比的优势
| 技能 | 定位 | 与本技能的差异 |
|---|---|---|
| gke-workload-troubleshooting(google/skills 同仓库) | 诊断 GKE 应用层工作负载故障(CrashLoopBackOff、OOMKilled、ImagePullBackOff、Pending 等) | 关注 Pod/容器层面的启动与运行错误,不覆盖底层主机维护这一基础设施层诱因 |
| gke-reliability(google/skills 同仓库) | 通过 PDB、健康探针、拓扑分布约束提升工作负载可靠性 | 是“事前加固”配置指南,不提供针对一次具体中断事件的诊断排查流程 |
| azure-diagnostics(MicrosoftDocs/Agent-Skills) | 用 AppLens、Azure Monitor 与资源健康状况,跨 App Service/AKS/Functions/VM 排查 Azure 生产事故 | 面向 Azure 全服务的通用事故分诊工具,使用 KQL 而非 PromQL,不针对 GKE 或 GPU/TPU 硬件维护场景 |
8. 用户评价
该技能目前在第三方平台(GitHub issue、Reddit、Hacker News 等)尚无具名用户评价;仅有个别第三方 Skill 索引站点收录了该仓库内的同类技能条目,属聚合展示而非用户评价。
9. 其他补充
仓库整体近期仍持续新增与重命名子技能,本技能所在的 gke-ai-troubleshooting-* 系列即为近期新增分组。
10. 安装使用方式
- 手动安装:从来源链接下载
SKILL.md,放入.claude/skills/gke-ai-troubleshooting-handle-disruption-gpu-tpu/目录。 - 克隆仓库:
git clone https://github.com/google/skills,再从对应子目录复制所需文件。 - 使用前提:需已配置
gcloud/kubectl对目标 GKE 集群的访问权限,并启用 Cloud Monitoring 的 GKE 系统指标;加载后即可在对话中触发使用,无需重启 Agent。
11. 注意事项
- 该技能只覆盖“主机维护导致的中断”这一类根因;若诊断结果显示三类信号均为空,需自行转向应用层排查(OOMKill、CUDA 错误等),技能本身不提供这部分诊断。
- 使用 PromQL 相关步骤依赖目标集群已开启 GKE 系统指标采集,未配置时相关查询会无数据返回。
- 在 Codex CLI 等默认无网络访问的沙箱环境中,需要先放开网络权限才能实际执行诊断命令。