1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | arize-experiment(合集仓库 Arize-ai/arize-skills 子技能) |
| 作者/维护者 | Arize AI(官方,LLM 可观测性平台厂商) |
| 来源链接 | https://github.com/Arize-ai/arize-skills/tree/main/skills/arize-experiment |
| 许可证 | MIT(GitHub API 核实) |
| GitHub Stars | 40(整仓库,GitHub API;合集仓库星数不代表本子技能个体热度) |
| Forks | 6(整仓库,GitHub API) |
| 最新版本 | v1.1.0(2026-07-01 发布,release-please 自动发版,整仓库统一版本号) |
| 安装方式 | npx skills add / git clone + install.sh / ax CLI(ax skills install)/ Claude Code 插件市场 |
2. 功能介绍与亮点
指导 agent 用 ax CLI 完成实验全流程:列出/创建/删除实验、导出运行记录、附加评分标签(annotate-runs)、跨实验对比(含回归检测与统计显著性提示)。亮点:① 明确禁止编造模型输出或评分(“CRITICAL — Never fabricate outputs”),强制真实调用模型 API;② 详尽的“静默失败”故障排查表——例如 create 阶段传入 evaluations 字段不会报错但也不会生效,这类隐蔽坑逐条列出;③ 内置 OpenAI/Anthropic/Gemini/自定义端点等多家模型供应商的调用模板;④ 官方博客披露该技能已被接入 Kiro CLI(Amazon 的智能体命令行工具)的“代码改动前后效果验证”工作流,说明其价值不止于 Claude Code/Codex 场景。
3. 适用场景
固定分类:工程效率与代码质量。典型场景:AI 编程 agent 修改了 prompt 或切换了模型后,需要用同一批测试样例跑新旧版本对比,判断准确率是否提升、有无回归;也适用于团队在多个候选模型间做 A/B 选型评估。
4. 跨 Agent 兼容性
- Claude Code:✅ 原生支持——README 明确列出,且提供专门的
/plugin marketplace add Arize-ai/arize-skills安装路径 - Codex:✅ 原生支持——README 明确列为受支持 agent 之一
- OpenClaw:❓ 未验证——README 未点名,仓库自述“兼容 40+ agents”为泛指列表,未逐一核实
- Hermes Agent:❓ 未验证——同上
5. 推荐理由
它把“改了 prompt 或模型之后到底有没有变好”这个几乎每个 LLM 应用团队都会反复面对的问题,收敛成一条 ax 命令行闭环,省去手写胶水脚本对接 API 的功夫;文档罕见地把“看起来跑成功了、实则某个字段被静默丢弃”这类坑逐一列出,能省下不少调试时间;背后是持续维护的官方可观测平台,且提供免费层(25k span/月)供个人与小团队直接试用。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 合集仓库星数不计入个体评分;子目录本身有真实第三方 bug 报告(与 Arize 无雇佣关系的用户在实际使用中发现兼容性问题并提交 issue)加上持续的功能性提交,但独立信源数量仍偏少 |
| 可用性 | 8 | 一条 ax skills install 或 npx skills add 即可安装;需配置 Arize API Key(有免费层);文档极详尽,故障排查表覆盖多个静默失败场景;近一个月仍有实质性维护提交 |
| 安全性 | 8 | 见下方检查清单 |
安全检查清单:
① shell 命令执行——调用 ax CLI 及生成小段 Python 推理脚本调用用户指定的模型 API,范围明确且与技能声明目的一致,无越权操作
② 联网外发——数据发往用户自己配置的 Arize 工作区与模型供应商 API,均为完成任务所必需且对用户透明
③ 凭据存储——通过 ax profiles 管理 Arize 密钥、环境变量传递模型供应商密钥,SKILL.md 明文写“绝不读取 .env 文件或在文件系统中搜索凭据”,存储方式清晰可查
④ 无可疑指令——通读全文未发现混淆代码或隐蔽外发,反而多处写有“绝不能编造输出”的防幻觉约束
⑤ 作者信誉——Arize AI 为知名 LLM 可观测性厂商,GitHub 贡献者可核实为公司团队成员
⑥ License——MIT,明确
⑦ 最近维护——子技能专属提交最近一次为 2026-07-08,整仓库最近提交 2026-07-27,维护活跃
7. 跟同类 Skills 相比的优势
| 竞品 | 定位 | 差异 |
|---|---|---|
| wandb-primary(Weights & Biases/CoreWeave 官方技能) | 覆盖 Runs/Artifacts/Weave 追踪/Reports/Launch 的综合性技能 | 范围更广但更通用,未针对“建实验→跑评估→对比结果”这一具体流程做 CLI 级封装与静默失败提示 |
| LangSmith(LangChain 官方评估平台) | 面向 LangChain/LangGraph 生态的实验对比与在线评估仪表盘 | 深度绑定 LangChain 技术栈,依赖其 Web UI/SDK 手动操作,无官方 agent skill 封装 |
| promptfoo(开源提示词评估 CLI) | YAML 配置驱动的本地化提示词/模型批量对比测试工具 | 无需连接第三方观测平台、可本地运行,但不提供集中式实验结果留存与跨时间版本追溯 |
8. 用户评价
该技能目前尚无独立第三方具名评价文章,但 GitHub 上有真实使用反馈:开发者 veronicaxge(与 Arize 无雇佣关系)在实际使用该技能触发数据集导出时,报告了一处 CLI 与 SDK 版本不兼容的具体故障(issue #42),问题描述具体、可复现,随后得到跟进。
9. 其他补充
Arize 同时提供开源、可自托管的 Phoenix 项目(不依赖本技能所需的云端 Arize AX 账号),适合完全离线/自托管场景的用户作为替代参考。
10. 安装使用方式
- 推荐:
npx skills add Arize-ai/arize-skills --skill arize-experiment(自动识别当前 agent) - Claude Code 插件市场:
/plugin marketplace add Arize-ai/arize-skills后/plugin install arize-skills@arize-skills - 已装
axCLI(v0.9.0+):ax skills install - git clone 后运行
./install.sh --project <项目目录>(Windows 对应install.ps1) - 使用前需
ax profiles create配置 Arize API Key(从 app.arize.com/admin 获取),并设置ARIZE_SPACE环境变量指定工作区
11. 注意事项
- 依赖 Arize 云端账号(有免费层,25k span/月、15 天留存),完全离线场景需改用开源 Phoenix
create阶段传入的evaluations字段会被静默忽略、不报错,必须用annotate-runs单独附加评分,是本技能最容易踩的坑- 统计显著性建议样本量 ≥ 30,过小样本的对比差异应视为方向性参考而非结论