1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | langsmith-online-eval-engineering-langchain-ai-langchain-skills | GitHub API |
| 作者/维护者 | LangChain(langchain-ai) | GitHub API |
| 来源链接 | https://github.com/langchain-ai/langchain-skills/tree/main/config/skills/langsmith-online-eval-engineering | — |
| 许可证 | MIT(声明于仓库 .claude-plugin/plugin.json;仓库根目录未见独立 LICENSE 文件) |
GitHub API |
| GitHub Stars | 1,110(整个合集仓库共享,由约 22 个子技能共享,不代表本技能个体热度) | GitHub API |
| Forks | 86 | GitHub API |
| 最新版本 | 无独立版本号,随合集仓库滚动更新;该子目录最近一次提交为 2026-07-30 | GitHub API |
| 安装方式 | npx skills add langchain-ai/langchain-skills --skill langsmith-online-eval-engineering --yes |
GitHub README |
2. 功能介绍与亮点
这个技能引导 agent 与用户协作,把一段 LangSmith 生产追踪数据逐步变成一个挂在线上、持续给新流量打分的评测器。流程分五步:先拉取指定项目的最近 trace 并总结输入/输出字段结构;再基于真实字段提出 2-3 个评测方向供用户挑选(LLM-as-judge 或纯代码两类,各自说明衡量维度与打分方式);获批后落地成具体评测器——LLM 评测器要求先给出 reasoning 字段再给分,代码评测器强制“只能用内置库和标准库、以 dict 形式读取 trace”;创建前对历史 trace 做试跑验证,确认没有把“基础设施报错”误判成“评测器判错”;最后把评测器接到项目的 run rule 上,让它开始对新 trace 持续打分。
亮点:每一步落地动作之前都要求先展示配置、拿到用户明确批准才调用 API,不会替用户静默做决定;采样率必须显式询问,不接受默默给默认值;配套三份参考文档(trace 结构解析、评测方向设计、LangSmith API 用法)把每一步的实现细节拆开写清楚;作为 LangChain 官方合集仓库的一员,与仓库内已有的 Harbor 离线评测技能形成“离线设计任务 vs 线上持续打分”的互补关系,SKILL.md 正文明确写了这层分工。
3. 适用场景
固定分类:元技能与 Agent 增强。
适用于已经把自己的 agent 或 LLM 应用接入 LangSmith 追踪、且积累了一批生产 trace 的团队——尤其是希望从“人工抽查几条对话”升级为“每条新流量自动打分、异常自动可见”的场景。既可以是刚发现某类质量问题(如答非所问、遗漏关键信息)想先做一个评测器盯住它,也可以是持续迭代 agent 时需要一套稳定的在线质量哨兵。
4. 跨 Agent 兼容性
- Claude Code:✅ 原生支持。仓库自带
.claude-plugin清单与install.sh安装脚本,可直接/plugin install或脚本安装。 - Codex:❓ 未验证。仓库整体声明兼容“任何遵循 Agent Skills 规范的 agent”(Claude Code、Cursor、Windsurf 等),但未见针对本技能或 Codex 的专门验证材料。
- OpenClaw / Hermes Agent:❓ 未验证。抓取到的材料(README、SKILL.md)未提及这两个 agent;技能本身不依赖任何平台专属运行时,理论上可随通用 Agent Skills 机制安装,但缺乏直接验证证据。
5. 推荐理由
多数团队对 agent 的评测还停留在“手动挑几条对话看一眼”,缺一套能自动、持续盯住生产质量的机制。这个技能把“从真实 trace 出发设计一个线上评测器”这件本来需要来回摸索字段结构、评测口径、采样策略的事情,收敛成一条有审批节点的标准流程——不猜字段名、不静默替用户做决定、代码评测器被强制关进“只用内置库”的安全笼子里。对已经在用 LangSmith 追踪 agent 的团队,能省下从零设计评测器和踩“评测器本身写错却当成 agent 出错”这类坑的时间。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 由 LangChain 官方仓库发布,LangChain 是 agent 构建与评测工具链领域被广泛引用的头部厂商(LangSmith 本身即是其旗舰可观测性产品);所属合集仓库整体 1,110 stars 由约 22 个子技能共享,不代表本技能个体热度,暂未检索到针对该子技能自身的独立第三方引用数据 |
| 可用性 | 8 | 一条命令即可安装技能本体,配套三份参考文档写清每步细节;但实际使用要求已有 LangSmith 账号与 API Key,非零配置、非免费依赖;该子目录最近一次提交为 2026-07-30,维护活跃 |
| 安全性 | 9 | 技能本体是纯 Markdown 指令与参考文档,不含可执行脚本;引导创建的代码评测器被显式限定“只能用内置库和标准库”,且每一步涉及实际 API 调用前都要求先展示配置、拿到用户批准;License(MIT)明确;由官方团队持续维护 |
综合评分:8.0
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 与本技能的差异 |
|---|---|---|
| eval-engineering(同合集姊妹技能) | 面向离线场景,引导把观察到的失败模式设计成可重复运行的 Harbor 评测任务 | 定位互补而非重叠:本技能产出挂在生产流水线上持续打分的在线评测器,对方产出的是离线、按需重跑的回归评测集 |
| langchain-ai/agentevals | 提供一批开箱即用的 agent 轨迹评测器(现成的 trajectory match、LLM-judge 等) | 对方给的是“评测器成品”直接调用,本技能给的是“如何从真实生产 trace 出发、一步步设计出一个贴合自己场景的评测器”的协作流程 |
| Arize 的评测/追踪类技能 | 面向通用 LLM 应用的可观测性平台,评测器与 Arize 自家追踪后端绑定 | 服务不同的可观测性平台生态(Arize vs LangSmith),选择取决于团队已经在用哪家追踪工具,不构成直接替代关系 |
8. 用户评价
该技能目前在第三方平台尚无独立具名用户评价。
9. 其他补充
技能与被评测 agent 使用的编程语言无关——只要该 agent 的执行记录被追踪进 LangSmith 项目,就可以用本技能为其设计线上评测器;代码评测器路径本身要求纯 Python 标准库实现,与被评测对象的技术栈解耦。
10. 安装使用方式
- 通用安装器:
npx skills add langchain-ai/langchain-skills --skill langsmith-online-eval-engineering --yes(追加--global可全局安装) - Claude Code 插件:
/plugin marketplace add langchain-ai/langchain-skills后/plugin install langchain-skills@langchain-skills(会连带装入同仓库全部技能,非本技能独有的安装路径) - 使用前需准备 LangSmith 账号并配置
LANGSMITH_API_KEY;触发方式是向已安装该技能的 agent 提需求并给出 LangSmith 项目名,例如“用 langsmith-online-eval-engineering 帮我给这个项目的追踪数据设计一个线上评测器”
11. 注意事项
- 仓库整体仍标注“early development,API 与技能内容可能变化”
- 使用依赖 LangSmith 账号与 API Key,非零成本零配置技能
- 代码评测器被限定为“只能使用内置库和标准库”,若评测逻辑需要外部依赖需改走 LLM-as-judge 路径或另行调整
- Codex / OpenClaw / Hermes Agent 的兼容性未经直接验证
- License 信息来自插件清单声明(MIT),仓库根目录未见独立 LICENSE 文件