SkillsScout
ENG-QUALITY / 工程效率与代码质量

spec-driven-eval-tech-leads-club-agent-skills

收录日期 2026-08-13·来源仓库 ↗
受欢迎程度
5
可用程度与相关性
9
安全性
9
7.7SCOUT SCORE

1. 基本信息

项目 内容
名称 spec-driven-eval-tech-leads-club-agent-skills
作者/维护者 Waldemar Neto(github.com/waldemarnt),发布于 Tech Leads Club 维护的 tech-leads-club/agent-skills 技能目录仓库
来源链接 https://github.com/tech-leads-club/agent-skills/tree/main/packages/skills-catalog/skills/(development)/spec-driven-eval
许可证 该技能 CC-BY-4.0;所属仓库整体 MIT(均来自 SKILL.md 与仓库 LICENSE 文件确认)
GitHub Stars / Forks 5,019 / 459(数据来自 GitHub API,2026-08-13;该数字属整个合集仓库,不代表本技能自身热度)
最新版本 1.0.0(SKILL.md 内 metadata 字段)
安装方式 npx @tech-leads-club/agent-skills 交互式安装向导;或命令行直接指定 agent-skills install -s spec-driven-eval

2. 功能介绍与亮点

对“规格驱动开发”(SDD)产出的实现做逐条验收标准(AC)打分,把每条 AC 拆成若干原子级二元检查(MET/UNMET,须附 file:line 证据),最终汇总成一个可跨框架、可跨次运行比较的综合分数,专用于给“这个功能到底做完了没有”一个可复现的答案。

3. 适用场景

所属分类:工程效率与代码质量

适合使用 Claude Code、Codex 等编码 Agent 做规格驱动开发、且需要一个可复现数字(而非“感觉做完了”)来验收功能完整度的团队与个人:横向比较多个 SDD 框架或多次实现的效果、给 PRD 验收标准逐条打分、审计“实现 + 测试”是否真的覆盖了需求,都是其设计目标场景。

4. 跨 Agent 兼容性

5. 推荐理由

把“这个功能做完了吗”从主观判断变成可复现的数字:二元检查表 + 证据引用 + 三次独立评分取多数 + 判分模型与作者模型隔离,专门针对 LLM 评分常见的虚高与偏袒问题做了工程化约束,适合需要横向比较多个 SDD 框架或反复验收同一 PRD 的团队。

6. 评分

维度 分数 说明
受欢迎程度 5 所属合集仓库整体 5,019 stars/npm 包近 30 天下载 3,295 次,但均属整个合集,不代表本技能个体热度;检索该子目录专属的第三方目录收录、社区讨论或具名评价均未获得独立证据
可用性 9 一条 npx 命令即可安装到目标 Agent;SKILL.md 正文 35KB,另附 quickstart.md(4 会话操作指南)与 reference.md(校准锚点范例),文档详尽且可直接复制使用;最近一次提交 2026-06-19,维护活跃;纯提示词方法论,无付费依赖
安全性 9 纯 Markdown 提示词与方法论文档,不含任何脚本、不执行 shell 命令、不联网外发;License(技能自身 CC-BY-4.0、仓库整体 MIT)清晰;作者 GitHub 账号自 2013 年活跃、1,617 关注者,无造假迹象

综合评分 = 三项均值 = 7.7

安全检查清单:①无任何代码执行,纯提示词/文档 ②无外联 ③无需 API Key/凭据 ④逐段通读全文未见可疑指令或混淆内容 ⑤作者 GitHub 账号长期活跃、身份具名,无刷星或造假迹象 ⑥License 清晰(CC-BY-4.0 + 仓库 MIT) ⑦最近提交 2026-06-19

7. 跟同类 Skills 相比的优势

对比对象 定位 与本技能的差异
tlc-spec-driven(同合集 tech-leads-club/agent-skills) Specify→Design→Tasks→Execute 四阶段规格驱动开发流程,负责把 PRD 变成代码 服务于实现之前与实现过程中;本技能服务于实现之后,专门给已完成的实现打分,二者按其自身文档明确互补而非重叠
GitHub Spec Kit(github/spec-kit) 官方开源 CLI 工具包,Specify→Plan→Tasks→Implement 全流程,核心是贯穿始终的项目“宪法”文档 同样聚焦“如何做出实现”,未见内置对已完成实现的逐条验收标准打分、多次评分一致性控制或跨框架横向对比方法论
ln-42-acceptance-test-builder(levnikolaevich/claude-code-skills) 根据需求描述生成验收测试用例 产出的是测试代码本身;本技能产出的是对既有实现+测试的量化完整度评分,且带判分偏差控制与可复现协议,两者面向验收流程的不同阶段

8. 用户评价

该技能目前在第三方平台尚无具名用户评价,源仓库之外也未见独立的第三方目录收录信息。

9. 安装使用方式

10. 注意事项