SkillsScout
DATA-ANALYSIS / 数据分析与可视化

wandb-primary

收录日期 2026-08-02·来源仓库 ↗·2026-08-04 修订
受欢迎程度
7
可用程度与相关性
8
安全性
9
8.0SCOUT SCORE

1. 基本信息

项目 内容
名称 wandb-primary(来自 wandb/skills 仓库)
作者/维护者 Weights & Biases;仓库内 SPDX 版权头标注为 CoreWeave, Inc.(W&B 母公司)
来源链接 https://github.com/wandb/skills
许可证 Apache License 2.0(来自 GitHub API,仓库内每个文件均带 SPDX 头)
GitHub Stars 65(来自 GitHub API)
Forks 2(来自 GitHub API)
最新版本 未发布正式 Release/Tag,以持续提交迭代,最近一次提交 2026-06-29(来自 GitHub API)
安装方式 npx skills add wandb/skills,或手动复制 skills/wandb-primary/ 目录

2. 功能介绍与亮点

wandb-primary 教编码 agent 使用 Weights & Biases 平台完成两类工作:模型训练侧(记录指标、追踪实验、分析训练结果、调优超参数)与 Agent 构建侧(追踪 LLM 应用调用链、按失败模式分类、跑评测、做生产监控)。技能把 W&B 的两个核心表面——Runs(wandb.Api())与 Weave Traces(weave.init())——统一到同一套决策流程里,并提供一批“直接照抄可跑”的快速脚本(数运行数、找最佳 loss、对比两个 run 的配置、总结最新评测等)。

亮点:

3. 适用场景

固定分类:数据分析与可视化

面向已经在用 Weights & Biases 做模型训练实验跟踪或 LLM 应用可观测性(Weave)的团队。典型场景:ML 工程师想让 Claude Code 直接回答“最近 5 次训练的验证损失分别是多少”“这两次 sweep 的配置差异在哪”“这个 agent 项目里 Weave trace 显示了哪些失败模式”,而不必每次手写 wandb.Api()weave.init() 的样板代码;也适合需要定期从 W&B 项目生成 Reports、并将结果导出给合规/管理层查阅的场景。

4. 跨 Agent 兼容性

Agent 结论 依据
Claude Code 原生支持 ✅ 官方文档 docs.wandb.ai 明确列出;Skill Bench 给出综合约 98% 通过率(分类目 72%–97%)
Codex 原生支持 ✅ 官方文档明确列出;Skill Bench 给出综合约 78% 通过率(分类目 63%–86%)
OpenClaw 未验证 官方文档与仓库材料均未提及
Hermes Agent 未验证 官方文档与仓库材料均未提及

(官方文档另列出 Cursor、GitHub Copilot、Gemini CLI 的支持,不在本报告固定评估的四个生态范围内,仅供参考。)

5. 推荐理由

这是一份官方出品、有真实 benchmark 数据支撑的 W&B 分析技能:用可验证的通过率而非空泛描述证明了跨 agent 的实际效果,又针对大规模项目做了专门的性能与稳定性优化,能把 ML 工程师日常“打开 W&B 网页翻数据”的动作变成一句自然语言提问,同时保留了完整的参考文档供深入排查。

6. 评分

维度 分数 说明
受欢迎程度 7 官方产品文档站 + 博客公告,但 GitHub 仅 65 星,12 次子目录提交均来自 4 名 W&B/CoreWeave 内部员工;issue 区仅发现 1 条真实外部用户提问(询问 Opus 4.7 下的 benchmark 表现),尚处早期采用阶段
可用性 8 一条命令 npx skills add wandb/skills 即可安装,需额外配置 WANDB_API_KEY;SKILL.md(约 70KB)+ 7 篇参考文档 + 4 组针对大项目做过速度优化的 helper 脚本,覆盖详尽;最近一次提交距今约 5 周,维护活跃
安全性 9 见下方检查清单

安全检查清单: ① Shell 执行:helper 脚本均为 Python 函数,封装 wandb/weave SDK 调用,未见任意 shell 命令执行; ② 联网外发:仅与 W&B 自身服务通信,是技能功能本身要求,用途透明; ③ 凭据:使用标准环境变量 WANDB_API_KEY,由用户自行申请与保管; ④ 可疑指令:通读 SKILL.md 全文与核心 helper 脚本未发现提示词注入或混淆代码; ⑤ 作者信誉:官方厂商 Weights & Biases(CoreWeave 旗下); ⑥ License:Apache-2.0,全部源文件带 SPDX 头,明确; ⑦ 维护活跃度:近 5 周内有提交,历史记录中含专门的安全加固 PR(为 GitHub Actions 启用 SHA pinning)。

综合评分 = (7 + 8 + 9) / 3 = 7.33

7. 跟同类 Skills 相比的优势

竞品 定位 与 wandb-primary 的差异
Arize AI 系列技能 LLM 可观测性与评估平台,提供面向生产环境的评估、prompt 优化能力 聚焦已上线 LLM 应用的评估与漂移检测,不提供训练实验(runs/超参数 sweep)追踪能力
Together AI evaluations 技能 面向 Together AI 推理平台上部署的模型提供批量评测 服务对象局限于 Together 自身托管的模型,不覆盖通用实验追踪,也不支持跨平台 LLM trace 分析
MLflow 开源机器学习实验追踪标准,社区部署广泛 目前未提供官方 agent skill 或跨 agent benchmark 数据,用户需自行封装 API 调用逻辑才能接入编码 agent

wandb-primary 的差异化在于同时覆盖“训练实验追踪”与“LLM agent 可观测性”两个表面,并且是目前少数公开跨 agent 通过率数据的同类技能。

8. 用户评价

该技能作为官方新发布产品,目前在第三方平台尚无具名用户评价。GitHub issue 区可见一条真实外部用户提问——用户 Yvette-0508 询问该技能在 Claude Opus 4.7 上是否有对应 benchmark 数据,是目前唯一可考的外部用户互动记录,截至目前尚未获得官方回复。

9. 其他补充

仓库内可见后续规划迹象:一个名为 “aria-chat” 的新子技能已提交但尚未合并,另有“按客户工作流拆分 W&B 技能”的重构提案处于开发中——说明 wandb-primary 目前是一个覆盖面较广的综合入口,未来可能会拆分出更细分的专用技能。

10. 安装使用方式

11. 注意事项