SkillsScout
DEVOPS-INFRA / DevOps 与基础设施

node-starrocks-starrocks-debug-skills

收录日期 2026-08-04·来源仓库 ↗
受欢迎程度
7
可用程度与相关性
8
安全性
9
8.0SCOUT SCORE

1. 基本信息

项目 内容
名称 node-starrocks-starrocks-debug-skills
作者/维护者 StarRocks(Linux Foundation 旗下开源 OLAP 数据库项目官方团队)
来源链接 https://github.com/StarRocks/starrocks-debug-skills/tree/main/node
许可证 Apache License 2.0(GitHub API 确认)
GitHub Stars 仓库整体 72(GitHub API;本技能为合集仓库中的独立子技能,此数字为仓库整体热度参考,非本模块单独热度,详见“评分”一节说明)
Forks 12(GitHub API)
最新版本 SKILL.md 内声明 version 2.0.0;仓库最近一次提交 2026-05-26(GitHub API)
安装方式 官方 install.sh 一键安装(全部模块),或手动复制 node/ 目录

2. 功能介绍与亮点

node 是一份专注于 StarRocks 集群节点级故障的调查手册,覆盖 BE(计算节点)内存溢出(OOM)与崩溃、FE(元数据节点)死锁、FE Full GC 长时间停顿、FE 堆内存增长泄漏五类根因(文档内称 Cause A–E)。内容分三阶段组织:Phase 1 用一套判定表在 30 秒内区分问题类型(BE 还是 FE、OOM 还是崩溃、死锁还是 GC);Phase 2 给出每种根因的具体定位方法,包括读取 BE 的 mem_tracker/memz 端点、解析 large memory alloc 日志找出问题查询、用 jstack 配合 DeadLockChecker 结构化 JSON 输出确认死锁链、读取 GC 日志与内存分配火焰图;Phase 3 给出对应的缓解与修复命令(如 KILL QUERY、设置 query_mem_limit、开启查询溢写、调整 BE 内存上限等)。文档内引用了 13 个可追溯编号的真实生产案例(如 case-021 FE 因元数据操作 OOM、case-030 FE 主机内存因 malloc arena 碎片增长),并明确标注部分诊断方法(如 DeadLockChecker、内存分配火焰图)的可用版本区间。

主要亮点:官方 StarRocks 团队出品并配发工程博客文章介绍项目诞生背景(把分散在 Slack 讨论、复盘文档、个人笔记中的运维经验系统化为结构化调查流程);仓库设有 CI lint 工作流,自动校验内容中不含违禁关键词、非英文文本与 frontmatter 格式,保证内容一致性;开源、Apache-2.0 协议、无付费依赖。

3. 适用场景

所属分类:DevOps 与基础设施

面向负责运维 StarRocks 生产集群的 SRE / DBA / 平台工程师,在 BE 进程被 OOM Killer 杀死或崩溃、FE 因死锁导致全部查询挂起、FE 出现长时间 Full GC 停顿或堆内存持续增长等生产故障发生时,按本技能给出的判定树定位根因并采取缓解措施。

4. 跨 Agent 兼容性

(官方脚本另支持 Cursor 与 JetBrains IDE,但两者不在本报告追踪的四个生态范围内。)

5. 推荐理由

官方 StarRocks 团队把分散的生产运维经验系统化为结构化的 AI 故障排查手册,node 模块专精覆盖数据库服务进程级故障(OOM、崩溃、死锁、GC 停顿),是同类数据库诊断技能中较少见的、聚焦“服务本身挂了”而非“查询慢”的场景。

6. 评分

维度 分数 说明
受欢迎程度 7 官方 StarRocks(Linux Foundation 旗下项目)团队出品,配发专门的工程博客文章介绍;但技能仓库本身创建于 2026 年 4 月,尚属年轻项目,子技能级别的独立热度证据(如安装量、专属讨论)有限,未达到大范围独立讨论的量级
可用性 8 SKILL.md 提供清晰的三阶段判定树、精确到具体命令的诊断步骤,并附 13 个可追溯的真实案例编号;官方脚本支持多 IDE 一键安装;但实际操作需要用户对目标 StarRocks 集群具备访问权限与一定运维背景,非纯粹复制即用
安全性 9 检查清单见下

安全检查清单

① 是否执行 shell 命令及权限范围:涉及的命令均为只读诊断(dmesgjstack、访问 BE 本地监控端口、grep/tail 读日志、gdb 读取 core dump 堆栈),未见任何写入或破坏性操作指令 ② 运行时是否联网外发数据:无,全部诊断在用户自有集群本地执行,不涉及外部网络请求 ③ 是否要求 API key/凭据及其存储方式:不涉及 ④ SKILL.md 与脚本中有无可疑指令:未发现提示词注入或隐蔽指令迹象;仓库设有 CI 关键词过滤工作流 ⑤ 作者/组织信誉:StarRocks 官方项目团队,与主数据库仓库同属一个 GitHub 组织 ⑥ License 是否明确:明确,Apache License 2.0 ⑦ 最近维护时间:最近一次提交 2026-05-26,距今约两个月,未见 archived 标记

7. 跟同类 Skills 相比的优势

技能 定位 与本技能的差异
node-starrocks-starrocks-debug-skills StarRocks 服务进程级故障(OOM/崩溃/死锁/GC)排查
mongodb-query-optimizer(MongoDB 官方) 诊断慢查询并给出复合索引建议 聚焦查询语句本身的性能优化,不覆盖数据库进程崩溃、内存溢出等服务端故障场景
database-skills(PlanetScale 官方) MySQL/PostgreSQL/Vitess 的 schema 设计与查询调优参考 是通用性数据库设计知识库,不含针对具体故障(崩溃、死锁)的实操排查判定树
clickhouse-js-node-troubleshooting(ClickHouse 官方) 排查 ClickHouse Node.js 客户端库连接/解析报错 名称同含“node”但对象是客户端库连接问题,与本技能排查数据库服务端 BE/FE 进程故障是完全不同的问题域,容易望文生义混淆

同类数据库技能普遍聚焦查询语句层面的性能优化或 schema 设计,node 模块则专门覆盖“数据库服务本身宕机/内存耗尽/死锁”这一生产事故场景,两者互补但不重叠。

8. 用户评价

该技能目前在第三方平台尚无具名用户评价。StarRocks 官方工程博客(Towards Data Engineering,2026 年 5 月)介绍了项目诞生背景,并以导入超时、版本错误(合并压缩问题)等场景为例说明调查流程的使用方式,但未给出量化的使用效果或用户反馈数据。仓库 Issue 区可见一条用户提问“有没有性能分析 skill”,显示有真实用户在关注该项目后续覆盖范围。

9. 其他补充

同仓库还有 12 个姊妹模块(query/import/compaction/balance/data-lake/tablet/deployment/high-concurrency/resource-isolation/materialized-view/shared-data/cpu-saturation),分别覆盖不同症状域,构成一套完整的 StarRocks 故障排查体系;仓库 guides/ 目录下还有跨模块级联案例(如集群性能整体退化的排查路径),把多个模块的判定树串联起来处理复合型故障。

10. 安装使用方式

方式一(官方脚本,一次安装全部 13 个模块)

git clone https://github.com/StarRocks/starrocks-debug-skills
cd starrocks-debug-skills
./scripts/install.sh --tool claude-code --target ~/.claude/skills/

方式二(仅安装本模块):手动将仓库内 node/ 目录(含 SKILL.mdreferences/)复制到 ~/.claude/skills/node/

安装后注意事项:Claude Code 重启会话后自动加载新技能;技能按 SKILL.md 的 description 字段中的症状关键词(如“BE OOM”“FE deadlock”)由 Claude 自动匹配触发,无需手动调用;实际执行文档中的诊断命令需要用户对目标 StarRocks 集群具备 SSH 或监控端口访问权限。

11. 注意事项