SkillsScout
META-AGENT / 元技能与 Agent 增强

agent-platform-eval-flywheel-google-skills

收录日期 2026-07-25·来源仓库 ↗
受欢迎程度
7
可用程度与相关性
8
安全性
9
8SCOUT SCORE

1. 基本信息

项目 内容
名称 Agent Platform Eval Flywheel Skill
项目自述名称 README 中展示标题为 “Agent Platform Eval Flywheel Skill”
作者/维护者 Google(google/skills 官方仓库,云端团队具名工程师参与维护)
来源链接 https://github.com/google/skills/tree/main/skills/cloud/agent-platform-eval-flywheel
许可证 Apache License 2.0(GitHub API 确认)
GitHub Stars 母仓库 google/skills 15,236★(GitHub API;该数字属整个技能合集,不代表本技能个体热度)
Forks 母仓库 1,192(同上,合集层面数据)
最新版本 仓库无发布版本标签;针对本技能内容的最近一次实质性提交为 2026-06-24(GitHub API commits)
安装方式 npx skills add google/skills --skill agent-platform-eval-flywheel,或克隆仓库后手动复制到对应 agent 的 skills 目录

2. 功能介绍与亮点

该技能把“评估并改进 AI Agent/模型质量”固化为一套可重复的五阶段方法论——准备数据、跑推理、打分、分析失败、优化迭代,循环直至质量达标:

Google Developers 官方博客曾专文演示如何用该技能驱动编码 Agent 完成质量迭代闭环,并给出具体的安装命令与两个真实失败案例(Agent 内部认可修改但对外回复矛盾、Agent 完成任务但未披露所用工具)。

3. 适用场景

所属分类:元技能与 Agent 增强

适合在 Google Cloud 上构建或运维 AI Agent、需要用系统化方法而非“感觉调优”来评估质量的开发者:为 Agent 建立可持续跟踪的评测基线、定位具体失败模式(任务未完成、工具误用、幻觉、安全违规等)、在多轮修复迭代中确认没有此消彼长的指标退化。

4. 跨 Agent 兼容性

google/skills 仓库通过 npx skills 通用安装器(vercel-labs/skills)分发;该安装器 README 的 Supported Agents 表格逐一列出各 agent 的安装路径:

Agent 项目路径 全局路径
Claude Code .claude/skills/ ~/.claude/skills/
Codex .agents/skills/ ~/.codex/skills/
OpenClaw skills/ ~/.openclaw/skills/
Hermes Agent .hermes/skills/ ~/.hermes/skills/

四个生态均为原生支持——技能本身是标准 SKILL.md + Python 脚本 + references 文档结构,不依赖 Claude Code 专属机制,配合上表安装路径即可在任一生态中使用。

5. 推荐理由

Google官方Agent质量评测方法论,提供数据集构建打分失败分析到迭代的完整闭环。它把“这个 Agent 是不是真的变好了”这个开发者普遍靠直觉判断的问题,转成了有数据集、有指标、有回归对比的工程化流程,对认真做 Agent 产品化的团队价值明确。

6. 评分

维度 分数 说明
受欢迎程度 7 官方 Google Cloud 团队维护,隶属仓库整体 15,236 stars 的官方技能仓库;该数字属整个合集,不代表本技能自身热度——本子目录自身提交含具名工程师参与,并被 Google Developers 官方博客专文以该技能为案例演示
可用性 8 安装后需执行 pip install 添加 SDK 依赖,并完成 gcloud auth 与项目/区域环境变量配置;SKILL.md 文档详尽(含快速参考、方法论说明、配套脚本对照表、references 子文档),子目录最近一次实质提交为 2026-06-24;无强制付费依赖,仅需用户自有 Google Cloud 账号
安全性 9 见下方检查清单
综合 8.0 三项均值

安全检查清单

① Shell 命令及权限范围:仅本地辅助脚本(数据校验、轨迹解析、结果查看、结果对比、HTML 渲染)读写评测数据文件,无系统级危险操作;远程调用限于用户自有 Google Cloud 项目下的评测 API。 ② 联网外发:会将评测数据集(prompt/response/Agent 交互轨迹)发送至用户自己 Google Cloud 项目内的评测服务用于打分,SKILL.md 对此有明确说明,目标透明。 ③ 凭据处理:标准 gcloud auth application-default login OAuth 流程,凭据由 gcloud 本地凭据存储管理,技能本身不硬编码或另行落盘密钥。 ④ 可疑指令:未发现隐藏指令或异常数据外发;反而设有分级确认机制——涉及计费的操作(推理、打分等)需用户显式 Yes/No 确认后才执行,避免意外产生云端费用。 ⑤ 作者信誉:Google 官方仓库,提交记录含具名工程师,无刷星或 SEO 操纵迹象。 ⑥ License:Apache License 2.0,明确清晰。 ⑦ 最近维护:最近一次实质性提交为 2026-06-24,母仓库当前仍在活跃更新。

7. 跟同类 Skills 相比的优势

对比对象 定位 与本技能的差异
Promptfoo Evals(promptfoo 仓库内置技能) 面向多云、多模型 provider 的开源 LLM 评测框架,通过 YAML 配置断言(正则/JSON 校验/成本延迟/model-graded)驱动测试 Provider 无关、可脱离云平台独立运行,更贴近“配置驱动的确定性回归测试”;本技能则原生绑定 Google Cloud Agent Platform 的 SDK,强项在多轮 Agent 轨迹的自适应评分(LLM-as-judge rubric)与失败聚类分析,两者定位互补而非直接替代
通用 LLM 可观测性平台(如 Langfuse、Arize Phoenix 等) 侧重线上生产流量的追踪、日志与仪表盘可视化 更偏“运行时监控”而非“离线评测迭代闭环”;本技能聚焦开发阶段的系统化质量改进方法论,两者可搭配而非互斥使用

8. 用户评价

该技能目前在第三方平台尚无独立于官方渠道之外的具名用户评价;Google Developers 官方博客曾专文演示其使用方法与两个真实失败案例的排查过程。

9. 其他补充

该技能是 google/skills 仓库 “Agent Platform” 系列的一员,同系列还包含 Prompt 管理、RAG 引擎管理、模型注册表管理等技能,均围绕 Google Cloud 上的 Agent 全生命周期管理展开。

10. 安装使用方式

11. 注意事项