1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | spec-driven-eval-tech-leads-club-agent-skills |
| 作者/维护者 | Waldemar Neto(github.com/waldemarnt),发布于 Tech Leads Club 维护的 tech-leads-club/agent-skills 技能目录仓库 |
| 来源链接 | https://github.com/tech-leads-club/agent-skills/tree/main/packages/skills-catalog/skills/(development)/spec-driven-eval |
| 许可证 | 该技能 CC-BY-4.0;所属仓库整体 MIT(均来自 SKILL.md 与仓库 LICENSE 文件确认) |
| GitHub Stars / Forks | 5,019 / 459(数据来自 GitHub API,2026-08-13;该数字属整个合集仓库,不代表本技能自身热度) |
| 最新版本 | 1.0.0(SKILL.md 内 metadata 字段) |
| 安装方式 | npx @tech-leads-club/agent-skills 交互式安装向导;或命令行直接指定 agent-skills install -s spec-driven-eval |
2. 功能介绍与亮点
对“规格驱动开发”(SDD)产出的实现做逐条验收标准(AC)打分,把每条 AC 拆成若干原子级二元检查(MET/UNMET,须附 file:line 证据),最终汇总成一个可跨框架、可跨次运行比较的综合分数,专用于给“这个功能到底做完了没有”一个可复现的答案。
- 双维独立打分:实现完成度
I与测试完成度T(是否有对应层级测试真正断言结果,而非只跑过路径)分开评分,AC_score = 0.6×I + 0.4×T,按 P0/P1/P2 优先级加权汇总为Final - 反 LLM 评分偏差:判分模型与写代码模型须不同;同一检查表连续独立评三次取多数;分数不因代码量或测试数量增加而虚高
- 旁路指标不污染主分:鲁棒性
R、范围合规S(有没有做 PRD 明确排除的事)、工程门禁G(build/lint/unit/e2e 是否真跑过)、需求提炼质量E均单独展示、不并入Final - 配套 4 会话操作流程:
references/quickstart.md给出“冻结基线→规划→实现→评分”四个独立会话的可复制提示词,并提醒清理 git 忽略的构建产物,避免上一轮结果泄漏进新一轮评分 - 显式声明
disable-model-invocation: true,只在用户明确点名时启动,不会自动触发
3. 适用场景
所属分类:工程效率与代码质量
适合使用 Claude Code、Codex 等编码 Agent 做规格驱动开发、且需要一个可复现数字(而非“感觉做完了”)来验收功能完整度的团队与个人:横向比较多个 SDD 框架或多次实现的效果、给 PRD 验收标准逐条打分、审计“实现 + 测试”是否真的覆盖了需求,都是其设计目标场景。
4. 跨 Agent 兼容性
- Claude Code:✅ 原生支持——所属仓库 README「Supported Agents」Tier 1 明确列出
- Codex:✅ 原生支持——同表 Tier 2 列出 OpenAI Codex
- OpenClaw:❓ 未验证——支持列表未提及
- Hermes Agent:❓ 未验证——支持列表未提及
5. 推荐理由
把“这个功能做完了吗”从主观判断变成可复现的数字:二元检查表 + 证据引用 + 三次独立评分取多数 + 判分模型与作者模型隔离,专门针对 LLM 评分常见的虚高与偏袒问题做了工程化约束,适合需要横向比较多个 SDD 框架或反复验收同一 PRD 的团队。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 5 | 所属合集仓库整体 5,019 stars/npm 包近 30 天下载 3,295 次,但均属整个合集,不代表本技能个体热度;检索该子目录专属的第三方目录收录、社区讨论或具名评价均未获得独立证据 |
| 可用性 | 9 | 一条 npx 命令即可安装到目标 Agent;SKILL.md 正文 35KB,另附 quickstart.md(4 会话操作指南)与 reference.md(校准锚点范例),文档详尽且可直接复制使用;最近一次提交 2026-06-19,维护活跃;纯提示词方法论,无付费依赖 |
| 安全性 | 9 | 纯 Markdown 提示词与方法论文档,不含任何脚本、不执行 shell 命令、不联网外发;License(技能自身 CC-BY-4.0、仓库整体 MIT)清晰;作者 GitHub 账号自 2013 年活跃、1,617 关注者,无造假迹象 |
综合评分 = 三项均值 = 7.7
安全检查清单:①无任何代码执行,纯提示词/文档 ②无外联 ③无需 API Key/凭据 ④逐段通读全文未见可疑指令或混淆内容 ⑤作者 GitHub 账号长期活跃、身份具名,无刷星或造假迹象 ⑥License 清晰(CC-BY-4.0 + 仓库 MIT) ⑦最近提交 2026-06-19
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
tlc-spec-driven(同合集 tech-leads-club/agent-skills) |
Specify→Design→Tasks→Execute 四阶段规格驱动开发流程,负责把 PRD 变成代码 | 服务于实现之前与实现过程中;本技能服务于实现之后,专门给已完成的实现打分,二者按其自身文档明确互补而非重叠 |
| GitHub Spec Kit(github/spec-kit) | 官方开源 CLI 工具包,Specify→Plan→Tasks→Implement 全流程,核心是贯穿始终的项目“宪法”文档 | 同样聚焦“如何做出实现”,未见内置对已完成实现的逐条验收标准打分、多次评分一致性控制或跨框架横向对比方法论 |
ln-42-acceptance-test-builder(levnikolaevich/claude-code-skills) |
根据需求描述生成验收测试用例 | 产出的是测试代码本身;本技能产出的是对既有实现+测试的量化完整度评分,且带判分偏差控制与可复现协议,两者面向验收流程的不同阶段 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价,源仓库之外也未见独立的第三方目录收录信息。
9. 安装使用方式
- 交互式安装:
npx @tech-leads-club/agent-skills,选目标 Agent 与安装方式 - 直接安装:
agent-skills install -s spec-driven-eval - 安装后:不会自动触发,需在对话中明确要求“运行 spec-driven-eval”或“按此规则打分”;建议按 quickstart.md 分四个独立会话执行(冻结基线→规划→实现→评分),避免上下文串味影响评分客观性
10. 注意事项
- 设计为评分工具而非修复工具:评分过程中发现问题不会自动修改被评代码,红灯门禁需人工按报告修复
- 每次评分需要一份结构清晰的 PRD(明确的 P0/P1/P2 优先级与编号验收标准)作为基线,PRD 质量直接决定评分的公正性与可复现性
- OpenClaw、Hermes Agent 兼容性尚未验证,使用前建议先小范围测试