1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | skill-conductor |
| 作者/维护者 | Serge Shima(GitHub: smixs) |
| 来源链接 | https://github.com/smixs/skill-conductor |
| 许可证 | MIT(GitHub API) |
| GitHub Stars | 116(GitHub API) |
| Forks | 15(GitHub API) |
| 最新版本 | v3.1.0(2026-07-21 发布,GitHub Releases) |
| 安装方式 | npx skills add smixs/skill-conductor 或 Claude Code 插件市场(见第 10 章) |
2. 功能介绍与亮点
Skill Conductor 是一个“用来创建、评估、改进其他技能的技能”——面向技能作者的全生命周期工具,覆盖 CREATE(架构选型→TDD 基线→搭建骨架→编写→验证)、IMPROVE(诊断→评测循环→受控自更新)、VALIDATE(结构检查+触发测试+二元评分)、REVIEW(第三方技能质量门)、OPTIMIZE(描述文案自动调优)、PACKAGE(打包为可分发的 .skill 文件) 六种模式。
三个核心亮点:
- 架构先行:动笔写 SKILL.md 之前,先从 5 种模式(顺序流程、迭代精炼、按上下文选择、领域知识、多 MCP 协同)中选定架构,并显式决定脚本/伪代码/自然语言三档“自由度”,避免先写错模式再返工。
- TDD-RED 基线:写技能前先验证 Agent 在没有这个技能时确实会做错,若已经能做对就不需要新增技能——把“这个技能是否必要”变成一个可验证的问题而非直觉判断。
- BinEval 二元评分与受控自更新:把传统的 1-10 模糊打分改成 Discovery/Clarity/Structure/Robustness/Completeness 五维度的逐条是非题(每条附证据,方法采自论文 Ask, Don’t Judge,arXiv 2606.27226);v3.1.0 新增“留存集门禁”(借鉴微软 SkillOpt 方法论):自动编辑只能从训练集学习,候选版本必须在留存集上不退步才会被采纳,防止自我优化过程“刷分”。
方法论明确注明出处:在 Anthropic 官方 skill-creator 的 grader/comparator/analyzer 三代理评测架构、Superpowers 作者 Jesse Vincent 关于“描述陷阱”的实践经验、以及 Toyota TWI 与标准作业程序写作指南之上做综合,而非另起炉灶。
3. 适用场景
固定分类:元技能与 Agent 增强。适用于经常为 Claude Code / Codex 等 Agent 编写和维护多个技能的作者或团队——尤其是遇到“技能写了但不触发”“触发了但表现不稳定”这类问题时;也适合在引入第三方技能前,先用 REVIEW 模式跑一次质量门检查。
4. 跨 Agent 兼容性
- Claude Code:✅ 原生支持。六种模式均可用;VALIDATE/IMPROVE/OPTIMIZE 三种模式内部通过命令行调用
claude -p做真实触发测试。 - Codex / OpenClaw / Hermes Agent:⚠️ 需适配。安装通道
npx skills add对应的vercel-labs/skillsCLI 官方文档列出了对这三者的路径支持(Codex:.agents/skills/;OpenClaw:skills/或~/.openclaw/skills/;Hermes Agent:.hermes/skills/或~/.hermes/skills/),CREATE/REVIEW/PACKAGE 三种模式为纯提示词+本地 Python 脚本可正常使用;但 VALIDATE/IMPROVE/OPTIMIZE 因脚本硬依赖claude命令行二进制,在这三个生态下若本机未同时装有 Claude Code CLI 则无法运行。
5. 推荐理由
它不是一个简单的模板脚手架,而是把“这个技能到底该怎么设计、怎么测、怎么迭代”变成一套可执行、可验证的流程:用 TDD-RED 先确认真的需要这个技能,用逐条带证据的二元判据代替模糊打分,用训练/留存集拆分防止自我优化跑偏。对于已经在维护多个技能、又不想每次都凭手感判断“这一版改得到底好不好”的用户,这是目前同类工具里方法论出处最扎实、迭代记录最完整的一个。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 116 stars/15 forks;来自 Okahu(一家 AI 可观测性公司)的工程师 hocokahu 提交并合并了一项将评测评分接入其 Monocle 追踪框架的功能改动,另有独立用户提出功能扩展提案,具备可查证身份的外部工程参与 |
| 可用性 | 8 | README、6 份参考文档与逐版本更新记录齐全,最近一次发布(v3.1.0)为 2026-07-21;一条命令即可安装,但 VALIDATE/IMPROVE/OPTIMIZE 三种模式需要本机另装 uv 与 Claude Code 命令行工具 |
| 安全性 | 9 | 全部脚本仅做本地文件操作与调用本机已安装的 claude CLI,subprocess 均为固定参数列表、无 shell 拼接注入风险;唯一的网络请求是生成的 HTML 报告里静态加载 Google Fonts;License 明确;作者身份可查证,名下另有多个风格一致的技能项目 |
综合评分(三项均值):8.0
7. 跟同类 Skills 相比的优势
| 竞品 | 定位 | 与本技能的差异 |
|---|---|---|
| Anthropic 官方 skill-creator | 官方脚手架+评测基础设施(grader/comparator/analyzer 三代理、A/B 盲测、benchmark 追踪) | 本技能正是在其评测架构之上做的延伸,额外加入了架构先行选型、TDD-RED 必要性验证、二元 BinEval 判据与受控自更新门禁,覆盖到“设计”与“打包分发”两端 |
| idea-refine(addyosmani/agent-skills) | 把一个模糊想法收敛成结构化的需求变体,通用于任意类型的任务 | 面向“想法阶段”的通用收敛工具,不特定针对技能本身的架构、测试或打包 |
| skill-scanner(getsentry/skills) | 静态扫描 SKILL.md 与配套脚本,检测提示注入等恶意迹象 | 关注的是安全审计这一个维度;本技能关注的是触发准确性与产出质量这一维度,两者可互补而非替代 |
8. 用户评价
Okahu(一家 AI 可观测性公司)的工程师 hocokahu 向该仓库提交并合并了一项功能改动(将评测评分接入其开源追踪框架 Monocle),另一位用户 MainFrame100 提出了扩展“Skill vs MCP 决策矩阵”等功能建议。目前尚未检索到独立媒体或博客对该技能的具名评价。
9. 其他补充
作者 smixs(Serge Shima)名下还有 mentor、autograph、creative-director-skill 等多个 Agent Skill 项目,风格上均强调方法论出处可查、参考文档完整。
10. 安装使用方式
# 方式一:skills.sh 通用安装器,装入 ~/.claude/skills
npx skills add smixs/skill-conductor
# 方式二:Claude Code 插件市场
/plugin marketplace add smixs/skill-conductor
/plugin install skill-conductor@smixs
安装后无需重启,Agent 检测到“构建/测试/评审技能”相关任务时会自动触发;若要使用 VALIDATE/IMPROVE/OPTIMIZE 三种模式,需要本机已安装 uv(技能会在这些模式的预检步骤中检查并提示)。
11. 注意事项
- VALIDATE/IMPROVE/OPTIMIZE 三种模式的触发测试功能通过命令行直接调用
claude,依赖本机预先安装并配置好 Claude Code CLI;在其他 Agent 环境下若缺少该 CLI,这三种模式将无法运行,CREATE/REVIEW/PACKAGE 三种模式不受此限制。 - 完整工作流还依赖
uv作为 Python 运行环境管理工具。 - 目前未发现独立第三方媒体评价,仅有 GitHub 仓库自身的外部贡献者与 issue 记录可查。