SkillsScout
DEVOPS-INFRA / DevOps 与基础设施

gke-node-notready-google-skills

收录日期 2026-09-04·来源仓库 ↗
受欢迎程度
7
可用程度与相关性
9
安全性
9
8.3SCOUT SCORE

1. 基本信息

项目 内容
名称 gke-node-notready-google-skills
作者/维护者 Google(google/skills 仓库)
来源链接 https://github.com/google/skills/tree/main/skills/cloud/gke-node-notready
许可证 Apache License 2.0(GitHub API 获取)
GitHub Stars 19,458(仓库整体,GitHub API 获取;该数字属整个 google/skills 合集,不代表本技能自身热度)
Forks 1,561(仓库整体,GitHub API 获取)
最新版本 无独立版本号;技能目录首次提交为 2026-09-03(GitHub API 获取)
安装方式 npx skills add google/skills 后勾选 “GKE Node NotReady”,或手动复制 skills/cloud/gke-node-notready 目录

2. 功能介绍与亮点

指导 agent 系统化诊断 GKE 节点报告 NotReady(或 Ready: Unknown)状态的根因,并提出安全的修复建议。技能按固定流程推进:①上下文发现——提取项目、集群、节点参数与故障时间窗口;②采集节点 Conditions/事件与 kubelet/容器运行时日志(同时给出 kubectl 命令与等价的 Cloud Logging 深链两条取证路径);③按内置决策表把日志/事件特征(容器运行时无响应、系统 OOM、PLEG 异常、kube-node-lease 终止、CNI 故障、准入 Webhook 拦截等 7 类信号)映射到根因;④分支排查每类根因并给出对应指标查询与修复思路;⑤证据不足或信号超出决策表覆盖范围时,明确要求如实说明局限并升级人工,禁止编造诊断结论。

核心亮点是强制只读诊断边界——SKILL.md 正文明确写明“仅采集证据、提出修复命令供人工执行,绝不自动排空/删除/重建节点”,且开篇就提示要先排除节点正在扩缩容、升级、修复等“预期内”NotReady,避免误诊断。全部排障路径均标注来自 Google Cloud 官方故障排查文档(节点 NotReady、节点注册排查、日志查看指南),无自造判断。

3. 适用场景

所属分类:DevOps 与基础设施(诊断对象是 Kubernetes 集群节点基础设施本身,而非应用代码或部署流程)。

适用于运维 GKE 集群、需要快速定位节点 NotReady 故障根因的云平台工程师与 SRE:节点批量或个别报 NotReady 导致 Pod 被驱逐或调度停滞时,用于替代人工逐条翻阅 kubelet 日志的排查工作;也适合作为值班手册,把“先判断是否预期内、再按信号查表定位根因、最后给出人工确认的修复命令”这套流程固化下来。

4. 跨 Agent 兼容性

5. 推荐理由

节点 NotReady 是 GKE 运维中排查耗时最长的故障类型之一,需要交叉核对节点 Conditions、多个组件日志与指标。本技能把这套排查经验固化成“先排除预期内状态→查看证据→按信号表定位根因→分支处理→给出人工确认命令”的标准流程,并显式设置只读诊断边界防止误操作,让初中级运维人员也能按图索骥完成一次专业排障,而不必凭直觉逐条摸索。

6. 评分

维度 分数 说明
受欢迎程度 7 发布方 Google 是 GKE 服务的所有者,属第一方官方出品;仓库整体 19,458 stars(属整个合集,不代表本技能自身热度),技能刚于 2026-09-03 首次提交,暂无独立第三方讨论
可用性 9 单文件、复制即用;流程分步清晰、附完整决策表与命令示例;不依赖外部 MCP 服务或付费组件;作为新提交技能维护时效性最佳
安全性 9 明确划定只读诊断边界(正文强调“绝不自动排空/删除/重建节点”),执行的 kubectl/gcloud 命令均为只读查询,外联仅指向 Google Cloud 官方 Logging/Monitoring 控制台;不索取凭据;License 明确;官方账号维护

综合评分:8.33

安全检查清单:①仅执行只读诊断命令(kubectl get/describe、日志查询),无写入/删除类操作 ②仅联网访问 Google Cloud 官方 Logging/Monitoring 深链,外联目标透明 ③不索取任何 API Key 或凭据 ④SKILL.md 正文未发现可疑指令或隐蔽外发 ⑤作者为 Google 官方账号,信誉明确 ⑥License 明确(Apache-2.0) ⑦2026-09-03 首次提交,维护及时

7. 跟同类 Skills 相比的优势

技能 定位 与本技能的差异
gke-workload-troubleshooting GKE 工作负载/Pod 层面故障排查 定位应用层(Pod 调度失败、容器崩溃等),本技能明确定位节点层(kubelet/容器运行时/内核),两者互补、SKILL.md 正文互相标注边界
gke-cluster-autoscaler 集群自动扩缩容决策排查 关注扩缩容策略与节点池弹性行为本身;本技能关注单个节点“为何变得不健康”,二者可能相关(如扩缩容中的节点短暂 NotReady)但排查对象不同
terrashark 基础设施代码(Terraform)安全与合规扫描 面向 IaC 静态分析,不涉及运行时集群诊断;本技能面向已运行集群的实时故障排查

8. 用户评价

该技能于 2026-09-03 刚提交至仓库,目前在第三方平台尚无具名用户评价;其排障依据均直接引用 Google Cloud 官方故障排查文档,但那属于对底层技术方案的官方说明,不构成对该技能条目本身的独立评价。

9. 安装使用方式

  1. 通过 npx skills add google/skills 交互式选择 “GKE Node NotReady”,或直接从来源链接下载 SKILL.md
  2. 复制到所用 agent 的 skills 目录(如 Claude Code 的 .claude/skills/)。
  3. 需具备目标 GKE 集群的 kubectl/gcloud 只读访问权限(gcloud container clusters get-credentials);若无法连接集群,技能会退化为给出诊断命令供人工执行并从症状描述继续分析。
  4. 无需重启 agent,加载后在对话中描述节点 NotReady 症状即可触发。

10. 注意事项