1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | incident-response-harness-harness-skills |
| 作者/维护者 | Harness(harness 官方组织) |
| 来源链接 | https://github.com/harness/harness-skills/tree/main/skills/incident-response |
| 许可证 | Apache-2.0(GitHub API 获取,仓库级) |
| GitHub Stars / Forks | 合集仓库整体 74 / 14(GitHub API 获取;该数字属整个 harness-skills 合集,不代表本技能自身热度,取证方式见第 7 章) |
| 最新版本 | SKILL.md 声明 version 1.0.0 |
| 安装方式 | 克隆仓库 + 配置 Harness MCP v2 Server(详见第 10 章) |
2. 功能介绍与亮点
incident-response 通过 Harness MCP,把一次生产事故从“刚发生”到“复盘归档”串成三个可独立触发的工作流。
- 部署-事故关联:拉取近期部署执行记录,按时间窗口(默认 2 小时,找不到再放宽到 4–6 小时)与服务匹配度比对,给出 HIGH / MEDIUM / LOW 置信度结论,判断这次故障是不是某次上线引发的
- 影响范围评估:查询服务实时状态,梳理直接影响、上游调用方、下游依赖与数据一致性风险,按 Critical / Major / Minor 分级,并据此给出回滚、扩容或熔断等处置建议
- 复盘文档生成:从流水线执行记录与告警时间戳自动拼出事件时间线,结构化输出执行摘要、时间线、根因分析、影响评估、行动项(分“立即修复/流程改进/监控改进”三类)与经验总结六个部分
- 三个工作流全部通过只读 MCP 工具(
harness_list、harness_status)完成查询,不修改任何流水线或资源;文档附有故障排查段落(如“关联窗口内找不到部署”“影响范围评估遗漏服务”)与四条可直接使用的触发示例短语
3. 适用场景
所属分类:DevOps 与基础设施
适合已经在用 Harness CI/CD 的工程师与 SRE:生产出问题时,第一反应往往是“是不是刚才那次发布搞的”,但翻部署记录、拉服务依赖图、事后补写复盘文档这几件事既耗时又容易漏项。这个技能把这套流程标准化成结构化查询与模板化输出,尤其适合值班轮换频繁、缺乏统一复盘规范的团队——不用等资深工程师主导,也能产出一份结构完整的事故记录。
4. 跨 Agent 兼容性
- Claude Code:原生支持——仓库根目录 CLAUDE.md 导入 AGENTS.md,skills 自动发现,README 给出具体安装步骤
- Codex:官方支持——README 明确列出 Codex 的 MCP 配置步骤(
AGENTS.md自动作为系统指令加载,并可在 prompt 中直接引用具体技能文件) - OpenClaw:未验证——抓取材料未点名,仅笼统声明支持任何兼容系统指令/MCP/文件上下文的 AI 工具
- Hermes Agent:未验证——抓取材料未点名,理由同上
5. 推荐理由
把“这次故障是不是刚才的发布引起的”“影响范围有多大”“复盘文档该怎么写”这三件事故响应中最容易靠个人经验、也最容易在忙乱中漏项的工作,变成基于平台实时数据的结构化查询与模板化输出,让团队的事故响应质量不再取决于当班工程师是否资深。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | Harness 官方出品,但本子技能自身仅 1 次提交,仓库整体规模有限,未见独立于官方渠道的第三方专门讨论 |
| 可用性 | 7 | 三个工作流的步骤、判断标准与响应模板写得清楚,官方文档站也将其列为正式(非 Alpha)技能;但自 2026-05-22 批量添加后未见后续迭代提交,且需要已配置好的 Harness 账号、MCP v2 Server 与 API Key,非零配置开箱即用 |
| 安全性 | 9 | 见下方检查清单 |
| 综合 | 7.7 | 三项均值 |
安全检查清单:
| 检查项 | 结果 |
|---|---|
| ① Shell 命令与权限范围 | 不执行任意 shell 命令,全部通过 harness_list/harness_status 只读 MCP 工具完成查询,不修改任何流水线、环境或资源 |
| ② 联网外发 | 仅通过用户自行配置的 Harness MCP v2 Server 与用户自己的 Harness 账号通信,未见其他外发目标 |
| ③ 凭据存储 | 依赖 Harness MCP Server 自身的 API Key 配置(环境变量),技能正文不要求粘贴或落盘明文凭据 |
| ④ 可疑指令 | 全文未发现提示注入或隐蔽指令,均为查询步骤说明与响应格式模板 |
| ⑤ 作者信誉 | Harness 为知名商业 CI/CD 平台厂商,harness 为其官方 GitHub 组织 |
| ⑥ License | Apache-2.0,明确(仓库级) |
| ⑦ 维护时间 | 子目录自身仅 1 次提交(2026-05-22),仓库整体最近一次提交为 2026-07-07,非弃置项目 |
7. 跟同类 Skills 相比的优势
| 方案 | 定位 | 差异 |
|---|---|---|
| incident-response(本技能) | 面向已用 Harness 平台的团队,事故发生后自动关联部署记录、评估影响范围、生成复盘文档 | 判断依据是 Harness 平台实时数据(部署执行记录、服务状态),而非人工回忆或手动翻日志 |
| incident-response(Anthropic 官方,knowledge-work-plugins 仓库) | 通用型事故响应工作流:严重级别分类(SEV1-4)、内外部沟通稿起草、战情室协调、盲责复盘文档 | 不绑定任何数据源或 CI/CD 平台,靠结构化 Markdown 模板与人工输入驱动,覆盖沟通协调环节更全,但无法自动判断“是不是某次部署引发的” |
| debug-pipeline(同仓库姊妹技能) | 流水线执行失败后定位阶段/步骤级根因 | 关注单次流水线执行本身为什么失败,不做事故影响范围评估或跨服务复盘 |
| deployment-readiness(同仓库姊妹技能) | 部署前的就绪检查、环境漂移分析、金丝雀发布决策 | 是“上线前”的预防性门禁,incident-response 是“出事之后”的诊断与复盘,二者覆盖 CI/CD 生命周期的不同阶段 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价;仓库层面公开的 issue 与合并记录以 Harness 内部工程师为主,唯一一条外部 issue 与本技能无关。
9. 其他补充
除 Claude Code、Codex 外,README 同时给出 Cursor 与 GitHub Copilot 的接入步骤(分别通过 mcp.json 配置与 copilot-instructions.md)。同仓库还有 debug-pipeline(流水线失败根因诊断)、deployment-readiness(部署前就绪检查)、dora-metrics(团队交付效能报告)、create-sbom / sign-artifact / verify-sign / enforce-sbom(供应链安全组)等技能,incident-response 补上的是此前均未覆盖的“事故发生后”这一环节,与已有技能一起覆盖“生成合规制品 → 部署前拦截不合规 → 上线前综合判断 → 出事后关联诊断与复盘”的完整流程。
10. 安装使用方式
git clone https://github.com/harness/harness-skills.git
cd harness-skills
claude
在 ~/.claude/settings.json 中加入 Harness MCP v2 Server 配置:
{
"mcpServers": {
"harness-mcp-v2": {
"command": "npx",
"args": ["-y", "harness-mcp-v2"],
"env": { "HARNESS_API_KEY": "<your-api-key>" }
}
}
}
安装后无需重启;在对话中输入 /incident-response 或直接描述“我们的支付服务挂了,是不是哪次发布导致的”“这次故障的影响范围有多大”“帮我生成昨天认证服务事故的复盘文档”即可触发对应工作流。
11. 注意事项
- 必须已有 Harness 账号并配置好 Harness MCP v2 Server(含 API Key),无法离线或脱离 Harness 平台使用
- 部署-事故关联的默认判断窗口为 2 小时,超出该窗口的延迟性故障可能需要手动放宽到 4–6 小时重新排查
- 影响范围评估依赖服务依赖图的完整性,未登记的隐藏依赖(如共享数据库、消息队列)可能被遗漏
- OpenClaw / Hermes Agent 的兼容性未见官方声明,跨 agent 使用前建议自行验证