1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | plugin-eval-openai-plugins | — |
| 作者/维护者 | OpenAI Codex 团队(openai/plugins 官方合集仓库) |
GitHub API + 插件清单 |
| 来源链接 | https://github.com/openai/plugins/tree/main/plugins/plugin-eval | — |
| 许可证 | MIT(.codex-plugin/plugin.json 清单声明;仓库根未见独立 LICENSE 文件) |
GitHub API + 插件清单 |
| GitHub Stars / Forks | 所属仓库 5,072★ / 694 forks(该数字属整个插件合集,不代表本子技能个体热度;子技能自身证据见第 6 章) | GitHub API |
| 最新版本 | 插件清单声明 0.1.2;该子目录最近一次实质提交在 2026-06-08 | GitHub API(commits)+ 插件清单 |
| 安装方式 | 本地 checkout 该 monorepo 后 npm link,或通过 Codex 插件市场清单注册为聊天式插件 |
仓库 README |
2. 功能介绍与亮点
plugin-eval 是 OpenAI 官方为 Codex 生态打造的技能/插件质量体检工具,同时以本地 CLI 与 Codex 聊天式插件两种形态存在,内含 5 个协同的子技能:
- 静态分析与解释:
analyze对本地一个 skill 目录或 plugin 根目录做静态检查,并能用自然语言解释“为什么打了这个分、先改哪里”,而不只是甩一份分数表。 - 真实 token 成本测算:
explain-budget先估算预期开销,benchmark通过实际调用本地codex可执行文件跑真实会话,测出这个技能在实战中到底吃掉多少 token,compare可对比改动前后的测算结果。 - 改进闭环:
improve-skill把评估发现的问题转成具体的重写建议;metric-pack-designer支持团队自定义评分规则,把自己在意的质量维度也纳入检查。 - 聊天优先的入口:
start命令识别“帮我评估这个技能”“为什么打这个分”“先改哪里”等自然语言请求,自动路由到对应子命令,新手不需要先记命令。
3. 适用场景
固定分类:元技能与 Agent 增强。
面向正在给 Codex(或其他遵循 SKILL.md 规范的 Agent)编写自定义技能或插件、想知道它写得好不好、该先改哪里、实际会烧多少 token 的开发者,尤其适合在发布或分享一个技能前做一次本地质量体检。
4. 跨 Agent 兼容性
- Codex:✅ 原生支持——本身即 Codex 官方插件,通过
.codex-plugin/plugin.json清单在 Codex 插件市场注册,聊天中用$plugin-eval触发。 - Claude Code:⚠️ 需适配——
analyze/explain-budget等静态分析命令是纯本地 Node CLI,理论上可指向任意路径下的 SKILL.md 使用,但benchmark硬依赖调用本地codex可执行文件测真实用量,在 Claude Code 环境下这部分功能不可用;且聊天式触发依赖 Codex 专属的插件市场机制。 - OpenClaw:❓ 未验证——README 未提及,无官方声明。
- Hermes Agent:❓ 未验证——同上。
5. 推荐理由
OpenAI 官方出品,填补了“写完一个技能却不知道好不好用”的空白——不只给分,还解释扣分原因、指出先改哪里,并能跑真实 Codex 会话测出确切的 token 开销,是一款专门做“评估既有技能/插件”、与“创建新技能”或“发现/安装技能”类工具形成互补的实用工具。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 发布方 OpenAI 即 Codex 插件生态的所有者,属第一方官方出品;所属合集仓库 5,072★ 不计入子技能个体热度;GitHub 站内外均未检索到针对本子技能的独立第三方讨论或采用数据 |
| 可用性 | 7 | 5 个子技能文档结构清晰、含具体命令示例;但 npm 包标记为 "private": true,说明书要求本地 checkout 整个 monorepo 才能用(无法直接从 npm registry 安装);该子目录最近一次实质提交在 2026-06-08,距今两个多月 |
| 安全性 | 8 | 检查清单详见下表 |
安全检查清单:
- ① 是否执行 shell 命令及权限范围:
benchmark通过child_process.spawn调用本地codex可执行文件(路径可经环境变量覆盖),benchmark-workspace通过execFile调用git worktree系列命令创建/清理隔离工作区;均以数组参数形式调用而非拼接 shell 字符串,用途明确、范围可审计 - ② 运行时是否联网外发数据:核心分析命令(
analyze/explain-budget/measurement-plan)纯本地文件读取与报告生成,不联网;benchmark调用的是本地codex进程而非外部网络端点 - ③ 是否要求 API key/凭据及其存储方式:不涉及,全部走本地文件与本地可执行文件
- ④ SKILL.md 与附带脚本中有无可疑指令:逐份审阅 5 份 SKILL.md 及
src/core下的核心脚本,未见混淆代码或 prompt injection 迹象 - ⑤ 作者/组织信誉:OpenAI 官方团队,作为 Codex 生态的所有者出品配套质量工具,无造假迹象
- ⑥ License 是否明确:明确,插件清单声明 MIT
- ⑦ 最近维护时间:该子目录最近一次实质提交 2026-06-08,距今两个多月,非弃置项目
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
| skill-creator(Anthropic 官方) | 引导从零编写新技能,并通过带/不带 skill 的对照实验量化验证效果 | 解决“怎么写出一个新技能”;plugin-eval 解决“这个已经写好的技能/插件到底好不好、该先改哪、实际耗多少 token” |
| find-skills(Vercel 官方) | 技能发现与安装工具,帮用户在海量社区技能里找到并装上靠谱的那个 | 解决“该去哪找技能、装哪个”;plugin-eval 面向的是已经写好或正在开发的技能本身的质量评估,而非发现与安装 |
| skill-scanner | 装机前自动扫描技能里的提示注入与恶意代码风险,聚焦安全维度 | 只做安全体检这一件事;plugin-eval 覆盖面更广,包含功能质量、文档完整度、token 成本等多维评估,但不专门做恶意代码检测 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。第三方技能注册站 Tessl 收录了该插件内的 evaluate-plugin 子技能,标注最佳实践合规度 90%、经 Snyk 安全扫描无发现,与本报告第 6 章的安全检查结论互相印证,但该注册站页面本身不含用户评分或评论内容。
9. 其他补充
同一 openai/plugins 仓库内还有一款 codex-security 插件,专注安全扫描;plugin-eval 面向通用质量评估,二者服务目的不同。plugin-eval 提供的 metric-pack-designer 子技能允许团队自定义评分规则,理论上可扩展出面向特定场景(如安全维度)的定制评估包。
10. 安装使用方式
方式一:本地 CLI(推荐用于静态分析)
git clone https://github.com/openai/plugins.git
cd plugins/plugins/plugin-eval
npm link
plugin-eval analyze <你的技能或插件路径> --format markdown
方式二:不装全局命令,直接用 node 运行
node ./scripts/plugin-eval.js analyze <路径> --format markdown
方式三:作为 Codex 聊天式插件
在 ~/.agents/plugins/marketplace.json(或工作区级 .agents/plugins/marketplace.json)中登记本地插件路径后重启 Codex,即可在聊天中用 $plugin-eval 帮我评估这个技能 触发。
注意事项:benchmark 命令会调用本地 codex 可执行文件在隔离临时工作区跑真实会话,运行前建议检查生成的 .plugin-eval/ 基准配置,尤其是目标项目或 prompt 并非自己撰写时。
11. 注意事项
- npm 包标记为
"private": true,只能从本地 checkout 使用,无法直接npm install全局安装。 benchmark功能依赖本机已安装可用的codexCLI,纯analyze/explain-budget等静态命令不需要。- 目前仅在 Codex 生态内验证过聊天式触发;在 Claude Code / OpenClaw / Hermes Agent 中只能以本地 CLI 形式使用静态分析部分。