1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | Promptfoo Evals(promptfoo 仓库内置的 Claude Code 技能) |
| 作者/维护者 | Promptfoo 团队(2026 年 3 月起并入 OpenAI) |
| 来源链接 | https://github.com/promptfoo/promptfoo/tree/main/.claude/skills/promptfoo-evals |
| 许可证 | MIT(GitHub API 确认) |
| GitHub Stars | 23,388(GitHub API) |
| Forks | 2,091(GitHub API) |
| 最新版本 | v0.121.19,2026-07-14(GitHub Releases,累计 419 个版本) |
| 安装方式 | 主工具:npm / brew / pip / npx 四种渠道;技能本身随仓库分发(见第 10 章) |
2. 功能介绍与亮点
该技能教会 Claude Code 编写、调优、运行并 QA 校验 promptfoo 的评测套件:
- 按 schema 生成
promptfooconfig.yaml - 编写断言:确定性检查(正则、JSON 校验、成本/延迟)与模型评分式(model-graded)评测
- 组织基于文件与基于数据集的测试用例
- 对接多种模型 provider(OpenAI、Anthropic、自建 HTTP 端点、本地代码、echo provider)
- 内置输出转换(transform),在断言前清洗模型响应
亮点:由 promptfoo 官方团队自用维护(dogfooding),2026 年 3 月被 OpenAI 收购后仍保持 MIT 开源;主项目发布节奏极快(419 个历史版本),最近一次发布距今仅数天。
3. 适用场景
固定分类:工程效率与代码质量
面向正在用 Claude Code 等编码 agent 开发或维护 LLM 应用(prompt、agent、RAG 流水线)的初中级开发者——需要为这些组件搭建回归测试与评测套件时,可直接让 Claude 按此技能生成合规的 promptfoo 配置与断言,省去反复查文档的过程。
4. 跨 Agent 兼容性
| Agent | 结论 | 依据 |
|---|---|---|
| Claude Code | ✅ 原生支持 | 技能文件位于仓库 .claude/skills/promptfoo-evals/SKILL.md,是 Claude Code 官方技能发现的标准路径 |
| Codex | ❓ 未验证 | 抓取到的材料未提及该技能与 Codex 技能发现机制的兼容情况 |
| OpenClaw | ❓ 未验证 | 同上 |
| Hermes Agent | ❓ 未验证 | 同上 |
5. 推荐理由
promptfoo 是 LLM 评测/红队测试领域的代表性开源工具,2026 年 3 月被 OpenAI 收购后仍保持开源与 MIT 协议,官方公开数据显示已有 35 万+开发者使用、13 万月活、超 25% 的财富 500 强企业采用。其官方团队亲自维护的 Claude Code 技能把“如何写 promptfoo 评测配置”直接嵌入编码 agent 工作流,对正在给 AI 应用补测试防线的初中级开发者尤其省心。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 9 | GitHub 23.4k stars / 2,091 forks;2026 年 3 月被 OpenAI 收购;Hacker News 上跨越多个月份、多个独立讨论串持续被提及 |
| 可用性 | 8 | 主工具 npm/brew/pip/npx 四渠道一键安装、文档完整;但技能本身需从仓库子目录复制到自己项目的 .claude/skills/ 下,且 model-graded 断言需配置 API Key,略增上手步骤;仓库近日仍在发新版本 |
| 安全性 | 9 | 见下方检查清单 |
安全检查清单:
① Shell 命令:仅涉及 npx promptfoo@latest validate/eval 等官方 CLI 命令,权限范围明确,无越界系统操作
② 联网外发:运行评测时按用户配置调用模型 provider API,行为透明、用户可控
③ API Key:通过环境变量注入(如 {{env.OPENAI_API_KEY}}),未见硬编码明文凭据
④ 可疑指令:抓取到的 SKILL.md 内容中未发现流程外操作指令或数据外发迹象
⑤ 作者信誉:2026 年 3 月被 OpenAI 正式收购,收购前已是逾 25% 财富 500 强企业采用的商业化开源项目
⑥ License:MIT,仓库徽章与 LICENSE 文件均明确标注
⑦ 最近维护:最新发布于 2026-07-14,仓库最后一次 push 在 2026-07-18,维护活跃度高
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 与 Promptfoo Evals 的差异 |
|---|---|---|
| langchain-skills(langchain-ai) | 官方 LangChain/LangGraph/Deep Agents 技能合集,含 13 个子技能 | 覆盖面更广(agent 框架搭建全流程),但仓库 2026 年 1 月才创建,自述“早期开发阶段,API 与内容可能变化”,且未见明确开源许可证 |
| skills(mastra-ai) | Mastra 框架的官方技能包,覆盖安装、文档查询、故障排查、迁移 | 同为官方出品,但聚焦单一小众 TypeScript 框架,GitHub 关注度(69 stars)远低于 promptfoo 所在生态 |
| dspy-agent-skills(intertwine) | 第三方维护的 DSPy 3.2.x 技能包,覆盖 GEPA、BetterTogether、RLM 等优化方法 | 面向 DSPy 这一相对小众的提示词编程框架,非 DSPy 官方团队出品,社区关注度有限 |
| dspy-skills(OmidZamani) | 另一独立开发者维护的 DSPy 技能集合 | 与上一项功能重叠、规模更小,由个人而非团队维护 |
8. 用户评价
- alexhans(Hacker News,讨论串):在“为什么评测类创业公司会失败”的讨论中,将 promptfoo 与 Arize、deepeval 并列为“跑通了商业模式的评测框架/SaaS 厂商”。
- b00gn1sh(Hacker News,讨论串):2026 年 7 月的“谁想被雇用”帖子中,将“Promptfoo evals”列为个人技术技能项,用于 AI 系统的评测测试。
- rhdunn(Hacker News,讨论串):分享了用 promptfoo 配置对本地小模型(Qwen 3:0.6B)做分类效果评测的实际配置示例。
9. 安装使用方式
- 底层 CLI(四选一):
npm install -g promptfoo/brew install promptfoo/pip install promptfoo/ 免安装的npx promptfoo@latest - Claude Code 技能本身:从 promptfoo 仓库的
.claude/skills/promptfoo-evals/目录复制到自己项目的.claude/skills/下(或 clone 整个仓库后摘取该子目录),Claude Code 会自动发现该目录中的 SKILL.md - 常用命令:
npx promptfoo@latest validate -c promptfooconfig.yaml(校验配置)、npx promptfoo@latest eval -c promptfooconfig.yaml(运行评测) - 安装后注意事项:若使用 model-graded 断言,需在环境变量中配置
OPENAI_API_KEY/ANTHROPIC_API_KEY;仅用确定性断言(正则/JSON 校验)则无需额外凭据;新增技能目录后无需重启 Claude Code,下一次对话即可触发
10. 注意事项
- 该技能随 promptfoo 主仓库分发,并非独立发布的技能包,需要手动复制子目录或 clone 整个仓库后自行摘取
- Codex / OpenClaw / Hermes Agent 的兼容性未经验证,如需跨平台使用建议先行测试
- 2026 年 3 月被 OpenAI 收购,OpenAI 官方声明将保持 MIT 开源并继续服务现有客户,但长期路线图仍存在不确定性