1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | k8s-investigation(SKILL.md 内部标识符为 observability-k8s-investigation) |
仓库文件 |
| 作者/维护者 | Elastic(elastic/agent-skills 官方仓库) |
GitHub API |
| 来源链接 | https://github.com/elastic/agent-skills/tree/main/skills/observability/k8s-investigation | — |
| 许可证 | Apache License 2.0(仓库整体) | GitHub API |
| GitHub Stars / Forks | 所属仓库 545★ / 44 forks(注:该数字属整个技能合集,不代表本技能个体热度,仅供了解所属仓库规模) | GitHub API |
| 最新版本 | SKILL.md 标注 v0.2.0 | 仓库文件 |
| 安装方式 | npx skills add elastic/agent-skills --skill observability-k8s-investigation,或 Claude Code / GitHub Copilot 插件市场安装 observability 技能组 |
仓库文档 |
2. 功能介绍与亮点
k8s-investigation 是 Elastic 官方出品的 Kubernetes 故障诊断技能,把资深 SRE 排查 K8s 问题的推理经验固化成结构化流程:
- 故障模式分类表:覆盖工作负载层(OOMKilled、CPU 节流、探针配置错误、镜像拉取失败)、节点层(NotReady 级联、资源驱逐)、控制平面层(etcd I/O 级联、准入 webhook 阻塞)等 16+ 种失败模式,每种标注“关键信号”与“需交叉验证的证据”
- 反臆测准则:强调“证据缺失不等于某个具体结论”——日志查询返回 0 行不代表“依赖不可用”,只代表“未采集到日志”,要求 agent 报告
no_logs_available而非编造解释 - ES|QL 查询范式与坑点:内置重启排查、CPU 节流检测、内存压力定位等可复用诊断查询,并列出 ES|QL 处理 OTel 直方图、
VALUES()标量/数组歧义等已知陷阱 - 标准化调查流程:定向→特征刻画→分类→交叉验证→综合结论五步法,明确“证据足够即停止,不追求无谓的彻底”
- 置信度分级输出:结论必须标注 high/medium/low 置信度,缺日志或 APM 数据时强制降级,禁止在应用层证据缺失时仍给出高置信度结论
亮点:单个 Markdown 文件,无配套脚本、无需额外安装依赖或申请 API Key;2026-04-22 Elastic Observability Labs 官方技术博客专文介绍了其设计动机与故障分类方法论。
3. 适用场景
固定分类:DevOps 与基础设施
- 已用 EDOT 采集 Kubernetes 遥测数据、需要 agent 辅助做首轮故障定位的 SRE / on-call 工程师
- 半夜被告警叫醒、希望 agent 直接给出“高置信度假设 + 证据 + 下一步建议”而非从零排查的运维人员
- 需要在 Pod 崩溃、节点异常、控制平面故障之间快速判断根因层级的团队
- 已具备 Elastic Observability 环境、但缺乏系统化 K8s 故障诊断方法论沉淀的中小型 SRE 团队
4. 跨 Agent 兼容性
- Claude Code:原生支持——官方插件市场安装
claude plugin install observability@elastic-agent-skills - Codex:支持——仓库
npx skills安装工具的“受支持 agent”列表明确列出 codex,对应安装目录.agents/skills - OpenClaw:未验证——官方材料与安装工具支持列表均未提及
- Hermes Agent:未验证——同上,官方材料未提及
5. 推荐理由
Kubernetes 排障最耗时的往往不是查数据,而是把碎片信号拼成正确假设——OOMKilled 不一定是内存泄漏,平均 CPU 正常不代表没有节流。这个技能把容易踩坑的推理规则和 16+ 种故障模式的判别信号写进了指令,还强制区分“没证据”和“证据证明没问题”,避免 agent 编造结论。单文件纯指令,无脚本安装负担、不索取凭据,对已用 Elastic Observability 监控 Kubernetes 的团队,是把 agent 变成合格首轮排查员的低成本路径。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 8 | Elastic 为可观测性领域一线上市公司(NYSE: ESTC)官方出品;Elastic Observability Labs 官方技术博客(2026-04-22,作者 Jesse Miller)专文点名介绍该技能的设计与故障分类方法;2026 年 6 月 Elastic 官方新闻稿介绍配套的 Kubernetes 调查能力,被多家科技/财经媒体转载报道 |
| 可用性 | 9 | 单个 SKILL.md 文件、无配套脚本,复制即用;文档详尽含大量可直接复用的 ES |
| 安全性 | 8 | 见下方安全检查清单 |
| 综合评分 | 8.3 | 三项均值 |
安全检查清单:
| 检查项 | 结果 |
|---|---|
| ① Shell 命令执行 | 无——纯 Markdown 指令,不含任何脚本或可执行代码 |
| ② 运行时联网外发 | 技能本身不发起网络请求;文档建议的 ES |
| ③ API key/凭据 | 本技能文件不索取、不存储任何凭据,假定调用环境已具备对用户自有 Elastic 部署的访问能力 |
| ④ 可疑指令 | 全文通读未见 prompt injection 或越权指令;文档反复要求“证据不足时报告不确定,不得编造结论” |
| ⑤ 作者/组织信誉 | Elastic 官方(elastic.co,纽交所上市公司 ESTC) |
| ⑥ License | 仓库整体 Apache License 2.0,GitHub API 确认,口径清晰 |
| ⑦ 维护时间 | 仓库最近一次提交 2026-07-22,整体活跃维护 |
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 差异点 |
|---|---|---|
| k8s-investigation(本推荐) | Elastic 官方:基于真实 OTel 遥测数据做生产环境实时故障诊断,覆盖工作负载/节点/控制平面三层 | 唯一面向“事后实时诊断”场景,内置反臆测准则与置信度分级输出 |
| kubernetes-operator(alirezarezvani/claude-skills) | 静态分析 Kubernetes Operator 代码:CRD 校验、Go reconcile 循环 linting、OperatorHub 能力分级 | 处理的是开发阶段的 Operator 代码质量,不涉及运行时故障排查,与本推荐互补而非竞争 |
| k8s-manifest-generator(wshobson/agents) | 生成/审查生产级 K8s YAML manifest,补全资源限制、健康检查等最佳实践 | 处理的是部署前的配置生成,本推荐处理的是部署后的运行时故障诊断 |
| kubernetes-skill(LukasNiessen) | 生成、审查 K8s manifest 与 Helm/Kustomize 配置,侧重安全默认值查漏 | 同样是部署前静态配置审查工具,不具备读取实时遥测数据、诊断线上故障的能力 |
| yb-k8s-operator(yugabyte/yugabytedb-skills) | 专为 YugabyteDB Operator 编写 CRD、排查该数据库 Operator 自身故障 | 范围局限于单一数据库厂商的 Operator,不是通用 Kubernetes 故障诊断工具 |
差异化总结:市面上同类 K8s 技能多集中在“部署前”(manifest 生成/审查、Operator 代码静态分析)或单一厂商 Operator 排障,本推荐覆盖的是“生产环境实时故障诊断”这一环节,且直接对接真实遥测数据而非停留在建议层面。
8. 用户评价
Elastic Observability Labs 官方技术博客(2026-04-22,作者 Jesse Miller)专文介绍了该技能,称其“编码了完整的诊断协议”。2026 年 6 月 Elastic 官方新闻稿中,可观测性事业部总经理 Bahaaldine Azarmi 就配套的 Kubernetes 调查能力表示:“凌晨三点被叫醒排障的工程师不想从零调查,他们想要答案”。以上均为 Elastic 官方发言,该技能目前在第三方平台尚无经证实的独立用户评价。
9. 其他补充
elastic/agent-skills 合集还包含云管理、Elasticsearch、Kibana、安全等 30 余个其他技能,官方建议按需安装以避免上下文膨胀。文档提到配套的“K8s CrashLoopBackOff Investigation”自动化 workflow 可在告警触发时自动运行确定性查询,本技能提供其缺少的解读层。
10. 安装使用方式
- 方式一(推荐,精确安装单个技能):
npx skills add elastic/agent-skills --skill observability-k8s-investigation - 方式二(Claude Code 插件市场,安装整组可观测性技能):先执行
claude plugin marketplace add https://github.com/elastic/agent-skills,再执行claude plugin install observability@elastic-agent-skills - 方式三(GitHub Copilot CLI):
copilot plugin marketplace add elastic/agent-skills,再copilot plugin install observability@elastic-agent-skills - 方式四(手动):clone 仓库后把
skills/observability/k8s-investigation子目录复制到自己项目的技能目录 - 无需额外安装依赖或配置 API Key;前提是目标 Kubernetes 集群已部署 EDOT/kube-stack collector 并接入 Elastic Observability
- 安装后建议重启 Claude Code 会话(官方 README 提示
/reload-plugins可能不会立即生效)
11. 注意事项
- 仅覆盖 OTel 采集路径,明确将传统 ECS Kubernetes 集成(
metrics-kubernetes.*等字段)列为范围外且不再维护 - APM 层分析(服务 SLO、事务错误率、上游依赖健康度)不在本技能范围内,需配合同仓库 service-health 技能使用
- 与 OpenClaw、Hermes Agent 的兼容性未经官方验证,建议自行测试
- 需要用户自行配置好接入 Kubernetes 遥测数据的 Elastic Observability 环境,技能本身不提供环境搭建指引