1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | eval-engineering-langchain-ai-langchain-skills | GitHub API |
| 作者/维护者 | LangChain(langchain-ai) | GitHub API |
| 来源链接 | https://github.com/langchain-ai/langchain-skills/tree/main/config/skills/eval-engineering | — |
| 许可证 | MIT(声明于仓库 .claude-plugin/plugin.json;仓库根目录未见独立 LICENSE 文件) |
GitHub API |
| GitHub Stars | 1,110(整个合集仓库共享,由约 22 个子技能共享,不代表本技能个体热度) | GitHub API |
| Forks | 86 | GitHub API |
| 最新版本 | 无独立版本号,随合集仓库滚动更新;该子目录最近一次提交为 2026-08-06 | GitHub API |
| 安装方式 | npx skills add langchain-ai/langchain-skills --skill eval-engineering --yes |
GitHub README |
2. 功能介绍与亮点
eval-engineering 引导 agent 开发者把“测一测”变成一条可重复、可审计的评测流水线:先绘制被测 agent 的 Harness(模型、提示词、循环、工具、记忆)与 Environment(文件、数据、服务、权限)地图,再提出 2-3 个值得验证的能力方向供用户选择,起草 harness.md/environment.md/task.md 三份规范并等待用户逐一批准,才动手搭建成一个可执行的 Harbor 评测任务,运行后逐项审计验证器的判定是否真的测中了目标能力。
亮点:技能明确区分 Harness / Environment / Verifier 三者边界,并写入“隐藏答案与判官凭据对被测对象不可见”“不做生产写入”“每轮重置可变状态”等不变式,防止评测本身被污染或作弊;配套 7 份参考文档(覆盖 Harness 识别、Environment 搭建、任务设计、trace 溯源、验证器设计、多轮模拟、Harbor 操作),内容深度在同仓库中居前列;仓库 README 为其单列安装小节并给出 Codex 专属安装范例,是该合集里被重点介绍的技能之一;最近一次提交发生在 2 天前,维护活跃。
3. 适用场景
固定分类:元技能与 Agent 增强。
适用于正在构建或维护 AI agent 的开发者与团队——无论 agent 基于 LangChain/LangGraph 还是 Claude Code、Codex CLI 等其他 harness 构建——尤其是已经积累了一些生产 trace、想把观察到的失败模式转化为可重复运行的回归评测集,或需要在改动 agent 前后用统一标准比较效果的场景。
4. 跨 Agent 兼容性
- Claude Code:原生支持。仓库自带
.claude-plugin清单,可直接/plugin install;Harbor 本身也能把 Claude Code 作为被评测的 harness 之一。 - Codex:支持。README 专门给出针对本技能的 Codex 安装范例(“Install the
eval-engineeringskill fromlangchain-ai/langchain-skills”);Harbor 同样可将 Codex CLI 作为被评测对象。 - OpenClaw / Hermes Agent:❓ 未验证。抓取到的材料(README、SKILL.md)未提及这两个 agent。
5. 推荐理由
多数 agent 开发者验证效果的方式还停留在“跑几个例子看看对不对”,缺少一套可重复、可审计的评测方法。这个技能把“如何为一个 agent 设计合适的评测任务”这件事本身系统化——从盘点 Harness/Environment、征求用户对方向和规范的确认,到落地成 Harbor 任务、复盘验证器是否真的测中了目标能力,并在流程里显式堵住“评测数据泄露给被测对象”这类常见坑。对正打算给自己的 agent 建立正式回归测试集的团队,能省下大量从零设计评测框架的试错成本。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 由 LangChain 官方仓库发布;LangChain 是 agent 构建与评测工具链领域被广泛引用的头部厂商(LangGraph、LangSmith 均为该领域常被独立引用的产品);所属合集仓库整体 1,110 stars 由约 22 个子技能共享,不代表本技能个体热度,暂未检索到针对该子技能自身的独立第三方引用数据 |
| 可用性 | 8 | 一条命令即可安装技能本体,README 为其单列安装小节;配套 7 份参考文档,内容详尽;但实际运行 evals 需另行安装开源 Harbor CLI 与 Docker(或配置支持的云沙箱),非零配置;该子目录最近一次提交为 2 天前,维护活跃 |
| 安全性 | 9 | 技能本体是纯 Markdown 指令与参考文档,不含可执行脚本;引导用户运行的 Harbor CLI 命令范围明确、开源可审计;显式写入安全不变式(判官/模拟器凭据对被测对象不可见、禁止生产写入、每轮重置可变状态);License(MIT)明确;由官方团队持续维护 |
综合评分:8.0
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 与本技能的差异 |
|---|---|---|
| langsmith-online-eval-engineering(同合集姊妹技能) | 面向 LangSmith 生产环境,从实时 trace 出发构建持续运行的在线评测器 | 定位互补而非重叠:本技能产出离线、可重复运行的 Harbor 评测任务;对方产出挂在生产流水线上持续打分的在线评测器 |
| langchain-ai/agentevals | 提供一批“开箱即用”的 agent 轨迹评测器(现成的 trajectory match、LLM-judge 等) | 对方给的是“评测器成品”,本技能给的是“如何设计评测任务”的方法论与流程,二者可搭配使用 |
| Hamel Husain 的独立 evals-skills 项目 | 面向编码类 agent 的自研评测技能,自成一套体系,不依赖 Harbor | 更轻量、不需要额外框架,但缺少本技能对 Harness/Environment/Verifier 边界的显式建模与用户逐步审批环节 |
8. 用户评价
eval-engineering 技能本身目前在第三方平台尚无独立具名评价。其编排调用的 Harbor 评测框架,独立技术作者 Robin Moffatt 在个人博客(2026-04-09)中评价:Harbor 对“针对固定基准比较不同模型或 agent 实现”非常有用,自带面板与预置任务注册表;但用于频繁调整提示词的迭代式开发时略显笨重——新建任务变体需要复制验证器,存在多份定义失步的风险,结论是“值得记在心里”的工具。
9. 其他补充
技能本身与编程语言无关;被评测的 agent(Harness)可以是 Python 或 TypeScript 编写,Harbor 均可将其容器化运行评测。
10. 安装使用方式
- 通用安装器:
npx skills add langchain-ai/langchain-skills --skill eval-engineering --yes(追加--global可全局安装) - Claude Code 插件:
/plugin marketplace add langchain-ai/langchain-skills后/plugin install langchain-skills@langchain-skills(会连带装入同仓库全部技能,非本技能独有的安装路径) - Codex:直接对话请求“Install the eval-engineering skill from langchain-ai/langchain-skills”
- 安装后需另行安装开源 Harbor CLI 并准备 Docker(或配置支持的云沙箱)才能实际运行评测;触发方式是直接向已安装该技能的 agent 提需求,例如“Use eval-engineering to inspect this agent and propose two or three Harbor evals”
11. 注意事项
- 仓库整体仍标注“early development,API 与技能内容可能变化”
- 安装技能本体是零成本的,但端到端跑通一次评测依赖额外安装的开源框架 Harbor 与 Docker 环境
- License 信息来自插件清单声明(MIT),仓库根目录未见独立 LICENSE 文件
- OpenClaw / Hermes Agent 的兼容性未经验证