1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | Agent Platform Eval Flywheel Skill |
| 项目自述名称 | README 中展示标题为 “Agent Platform Eval Flywheel Skill” |
| 作者/维护者 | Google(google/skills 官方仓库,云端团队具名工程师参与维护) |
| 来源链接 | https://github.com/google/skills/tree/main/skills/cloud/agent-platform-eval-flywheel |
| 许可证 | Apache License 2.0(GitHub API 确认) |
| GitHub Stars | 母仓库 google/skills 15,236★(GitHub API;该数字属整个技能合集,不代表本技能个体热度) |
| Forks | 母仓库 1,192(同上,合集层面数据) |
| 最新版本 | 仓库无发布版本标签;针对本技能内容的最近一次实质性提交为 2026-06-24(GitHub API commits) |
| 安装方式 | npx skills add google/skills --skill agent-platform-eval-flywheel,或克隆仓库后手动复制到对应 agent 的 skills 目录 |
2. 功能介绍与亮点
该技能把“评估并改进 AI Agent/模型质量”固化为一套可重复的五阶段方法论——准备数据、跑推理、打分、分析失败、优化迭代,循环直至质量达标:
- 多种数据来源:支持
EvalCase列表(单轮/多轮对话轨迹)、Pandas DataFrame(CSV/BigQuery/Sheets 等表格数据),或在没有现成数据时用generate_user_scenarios冷启动合成测试场景 - 丰富的评测指标:内置多轮任务成功率、轨迹质量、工具调用质量等 Agent 专用指标,以及幻觉检测、事实一致性、安全合规等静态规则指标,也支持自定义 LLM-as-judge 或代码执行型指标
- 失败聚类分析:10 个以上同类失败可调用 Error Analysis 服务自动归类为 L1/L2 主题标签,避免逐条人工翻阅
- 防止指标造假的工程纪律:明确要求“提出修复方案的一方不能同时给自己打分”,并配套
compare_results.py做修复前后回归对比,防止只优化单一指标却引入其他退化 - 配套脚本齐全:
validate_dataset.py、parse_adk_traces.py、inspect_results.py、render_html_report.py等本地辅助脚本覆盖从数据校验到 HTML 报告渲染的全流程
Google Developers 官方博客曾专文演示如何用该技能驱动编码 Agent 完成质量迭代闭环,并给出具体的安装命令与两个真实失败案例(Agent 内部认可修改但对外回复矛盾、Agent 完成任务但未披露所用工具)。
3. 适用场景
所属分类:元技能与 Agent 增强
适合在 Google Cloud 上构建或运维 AI Agent、需要用系统化方法而非“感觉调优”来评估质量的开发者:为 Agent 建立可持续跟踪的评测基线、定位具体失败模式(任务未完成、工具误用、幻觉、安全违规等)、在多轮修复迭代中确认没有此消彼长的指标退化。
4. 跨 Agent 兼容性
google/skills 仓库通过 npx skills 通用安装器(vercel-labs/skills)分发;该安装器 README 的 Supported Agents 表格逐一列出各 agent 的安装路径:
| Agent | 项目路径 | 全局路径 |
|---|---|---|
| Claude Code | .claude/skills/ |
~/.claude/skills/ |
| Codex | .agents/skills/ |
~/.codex/skills/ |
| OpenClaw | skills/ |
~/.openclaw/skills/ |
| Hermes Agent | .hermes/skills/ |
~/.hermes/skills/ |
四个生态均为原生支持——技能本身是标准 SKILL.md + Python 脚本 + references 文档结构,不依赖 Claude Code 专属机制,配合上表安装路径即可在任一生态中使用。
5. 推荐理由
Google官方Agent质量评测方法论,提供数据集构建打分失败分析到迭代的完整闭环。它把“这个 Agent 是不是真的变好了”这个开发者普遍靠直觉判断的问题,转成了有数据集、有指标、有回归对比的工程化流程,对认真做 Agent 产品化的团队价值明确。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 官方 Google Cloud 团队维护,隶属仓库整体 15,236 stars 的官方技能仓库;该数字属整个合集,不代表本技能自身热度——本子目录自身提交含具名工程师参与,并被 Google Developers 官方博客专文以该技能为案例演示 |
| 可用性 | 8 | 安装后需执行 pip install 添加 SDK 依赖,并完成 gcloud auth 与项目/区域环境变量配置;SKILL.md 文档详尽(含快速参考、方法论说明、配套脚本对照表、references 子文档),子目录最近一次实质提交为 2026-06-24;无强制付费依赖,仅需用户自有 Google Cloud 账号 |
| 安全性 | 9 | 见下方检查清单 |
| 综合 | 8.0 | 三项均值 |
安全检查清单:
① Shell 命令及权限范围:仅本地辅助脚本(数据校验、轨迹解析、结果查看、结果对比、HTML 渲染)读写评测数据文件,无系统级危险操作;远程调用限于用户自有 Google Cloud 项目下的评测 API。
② 联网外发:会将评测数据集(prompt/response/Agent 交互轨迹)发送至用户自己 Google Cloud 项目内的评测服务用于打分,SKILL.md 对此有明确说明,目标透明。
③ 凭据处理:标准 gcloud auth application-default login OAuth 流程,凭据由 gcloud 本地凭据存储管理,技能本身不硬编码或另行落盘密钥。
④ 可疑指令:未发现隐藏指令或异常数据外发;反而设有分级确认机制——涉及计费的操作(推理、打分等)需用户显式 Yes/No 确认后才执行,避免意外产生云端费用。
⑤ 作者信誉:Google 官方仓库,提交记录含具名工程师,无刷星或 SEO 操纵迹象。
⑥ License:Apache License 2.0,明确清晰。
⑦ 最近维护:最近一次实质性提交为 2026-06-24,母仓库当前仍在活跃更新。
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
| Promptfoo Evals(promptfoo 仓库内置技能) | 面向多云、多模型 provider 的开源 LLM 评测框架,通过 YAML 配置断言(正则/JSON 校验/成本延迟/model-graded)驱动测试 | Provider 无关、可脱离云平台独立运行,更贴近“配置驱动的确定性回归测试”;本技能则原生绑定 Google Cloud Agent Platform 的 SDK,强项在多轮 Agent 轨迹的自适应评分(LLM-as-judge rubric)与失败聚类分析,两者定位互补而非直接替代 |
| 通用 LLM 可观测性平台(如 Langfuse、Arize Phoenix 等) | 侧重线上生产流量的追踪、日志与仪表盘可视化 | 更偏“运行时监控”而非“离线评测迭代闭环”;本技能聚焦开发阶段的系统化质量改进方法论,两者可搭配而非互斥使用 |
8. 用户评价
该技能目前在第三方平台尚无独立于官方渠道之外的具名用户评价;Google Developers 官方博客曾专文演示其使用方法与两个真实失败案例的排查过程。
9. 其他补充
该技能是 google/skills 仓库 “Agent Platform” 系列的一员,同系列还包含 Prompt 管理、RAG 引擎管理、模型注册表管理等技能,均围绕 Google Cloud 上的 Agent 全生命周期管理展开。
10. 安装使用方式
- 通过安装器:
npx skills add google/skills --skill agent-platform-eval-flywheel,安装器会将技能放入当前 Agent 对应的 skills 目录(见第 4 章路径表) - 手动安装:克隆或下载
google/skills仓库后,将skills/cloud/agent-platform-eval-flywheel/整个目录复制到目标 agent 的 skills 目录下 - 安装后:需先执行
pip install google-cloud-aiplatform[evaluation]>=1.154.0 google-genai>=1.0.0安装 SDK 依赖,并完成gcloud auth application-default login与GOOGLE_CLOUD_PROJECT、GOOGLE_CLOUD_LOCATION环境变量配置,之后无需重启 Agent 即可在对话中触发本技能
11. 注意事项
- 需要一个可用的 Google Cloud 项目并开通 Agent Platform(原 Vertex AI)相关 API,个人开发者可用免费试用额度起步,但涉及 LLM 推理与评测调用会产生实际云端费用
- 部分操作(跑推理、评分等)会触发计费,技能已内置确认机制,但用户仍需自行关注实际用量
- 技能强绑定 Google 的 Agent Platform GenAI Evaluation SDK,若团队使用其他云厂商或完全自建的 Agent 框架,需要额外适配数据格式后才能复用其评测方法论