1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | gke-node-notready-google-skills |
| 作者/维护者 | Google(google/skills 仓库) |
| 来源链接 | https://github.com/google/skills/tree/main/skills/cloud/gke-node-notready |
| 许可证 | Apache License 2.0(GitHub API 获取) |
| GitHub Stars | 19,458(仓库整体,GitHub API 获取;该数字属整个 google/skills 合集,不代表本技能自身热度) |
| Forks | 1,561(仓库整体,GitHub API 获取) |
| 最新版本 | 无独立版本号;技能目录首次提交为 2026-09-03(GitHub API 获取) |
| 安装方式 | npx skills add google/skills 后勾选 “GKE Node NotReady”,或手动复制 skills/cloud/gke-node-notready 目录 |
2. 功能介绍与亮点
指导 agent 系统化诊断 GKE 节点报告 NotReady(或 Ready: Unknown)状态的根因,并提出安全的修复建议。技能按固定流程推进:①上下文发现——提取项目、集群、节点参数与故障时间窗口;②采集节点 Conditions/事件与 kubelet/容器运行时日志(同时给出 kubectl 命令与等价的 Cloud Logging 深链两条取证路径);③按内置决策表把日志/事件特征(容器运行时无响应、系统 OOM、PLEG 异常、kube-node-lease 终止、CNI 故障、准入 Webhook 拦截等 7 类信号)映射到根因;④分支排查每类根因并给出对应指标查询与修复思路;⑤证据不足或信号超出决策表覆盖范围时,明确要求如实说明局限并升级人工,禁止编造诊断结论。
核心亮点是强制只读诊断边界——SKILL.md 正文明确写明“仅采集证据、提出修复命令供人工执行,绝不自动排空/删除/重建节点”,且开篇就提示要先排除节点正在扩缩容、升级、修复等“预期内”NotReady,避免误诊断。全部排障路径均标注来自 Google Cloud 官方故障排查文档(节点 NotReady、节点注册排查、日志查看指南),无自造判断。
3. 适用场景
所属分类:DevOps 与基础设施(诊断对象是 Kubernetes 集群节点基础设施本身,而非应用代码或部署流程)。
适用于运维 GKE 集群、需要快速定位节点 NotReady 故障根因的云平台工程师与 SRE:节点批量或个别报 NotReady 导致 Pod 被驱逐或调度停滞时,用于替代人工逐条翻阅 kubelet 日志的排查工作;也适合作为值班手册,把“先判断是否预期内、再按信号查表定位根因、最后给出人工确认的修复命令”这套流程固化下来。
4. 跨 Agent 兼容性
- Claude Code:✅ 原生支持——技能为标准 SKILL.md + Markdown 格式,
kubectl/gcloud命令均在对话中呈现供人工判断,无特殊运行时依赖。 - Codex:⚠️ 需适配——技能建议的 Cloud Logging 深链与
kubectl/gcloud交互需要网络与已认证的集群访问,Codex CLI 默认沙箱不开放出站网络,需手动放开权限(本池 google/skills 系列技能的一致结论)。 - OpenClaw:❓ 未验证。
- Hermes Agent:❓ 未验证。
5. 推荐理由
节点 NotReady 是 GKE 运维中排查耗时最长的故障类型之一,需要交叉核对节点 Conditions、多个组件日志与指标。本技能把这套排查经验固化成“先排除预期内状态→查看证据→按信号表定位根因→分支处理→给出人工确认命令”的标准流程,并显式设置只读诊断边界防止误操作,让初中级运维人员也能按图索骥完成一次专业排障,而不必凭直觉逐条摸索。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 发布方 Google 是 GKE 服务的所有者,属第一方官方出品;仓库整体 19,458 stars(属整个合集,不代表本技能自身热度),技能刚于 2026-09-03 首次提交,暂无独立第三方讨论 |
| 可用性 | 9 | 单文件、复制即用;流程分步清晰、附完整决策表与命令示例;不依赖外部 MCP 服务或付费组件;作为新提交技能维护时效性最佳 |
| 安全性 | 9 | 明确划定只读诊断边界(正文强调“绝不自动排空/删除/重建节点”),执行的 kubectl/gcloud 命令均为只读查询,外联仅指向 Google Cloud 官方 Logging/Monitoring 控制台;不索取凭据;License 明确;官方账号维护 |
综合评分:8.33
安全检查清单:①仅执行只读诊断命令(kubectl get/describe、日志查询),无写入/删除类操作 ②仅联网访问 Google Cloud 官方 Logging/Monitoring 深链,外联目标透明 ③不索取任何 API Key 或凭据 ④SKILL.md 正文未发现可疑指令或隐蔽外发 ⑤作者为 Google 官方账号,信誉明确 ⑥License 明确(Apache-2.0) ⑦2026-09-03 首次提交,维护及时
7. 跟同类 Skills 相比的优势
| 技能 | 定位 | 与本技能的差异 |
|---|---|---|
| gke-workload-troubleshooting | GKE 工作负载/Pod 层面故障排查 | 定位应用层(Pod 调度失败、容器崩溃等),本技能明确定位节点层(kubelet/容器运行时/内核),两者互补、SKILL.md 正文互相标注边界 |
| gke-cluster-autoscaler | 集群自动扩缩容决策排查 | 关注扩缩容策略与节点池弹性行为本身;本技能关注单个节点“为何变得不健康”,二者可能相关(如扩缩容中的节点短暂 NotReady)但排查对象不同 |
| terrashark | 基础设施代码(Terraform)安全与合规扫描 | 面向 IaC 静态分析,不涉及运行时集群诊断;本技能面向已运行集群的实时故障排查 |
8. 用户评价
该技能于 2026-09-03 刚提交至仓库,目前在第三方平台尚无具名用户评价;其排障依据均直接引用 Google Cloud 官方故障排查文档,但那属于对底层技术方案的官方说明,不构成对该技能条目本身的独立评价。
9. 安装使用方式
- 通过
npx skills add google/skills交互式选择 “GKE Node NotReady”,或直接从来源链接下载SKILL.md。 - 复制到所用 agent 的 skills 目录(如 Claude Code 的
.claude/skills/)。 - 需具备目标 GKE 集群的
kubectl/gcloud只读访问权限(gcloud container clusters get-credentials);若无法连接集群,技能会退化为给出诊断命令供人工执行并从症状描述继续分析。 - 无需重启 agent,加载后在对话中描述节点 NotReady 症状即可触发。
10. 注意事项
- 技能不会自动修复集群,所有修复动作(排空、重建节点、调整 Webhook 范围等)均需人工确认后手动执行。
- 依赖 Cloud Logging
_Default日志桶默认仅保留 30 天,超出窗口的历史故障需依赖_Required桶(400 天)或直接说明证据缺失。 - 决策表覆盖 7 类常见信号,遇到表外信号会明确要求升级人工排查,不会强行给出诊断结论。