1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | agent-watchdog-builderio-skills |
| 作者/维护者 | Builder.io(官方组织账号) |
| 来源链接 | https://github.com/BuilderIO/skills/tree/main/skills/agent-watchdog |
| 许可证 | MIT(数据来源:GitHub API) |
| GitHub Stars / Forks | 合集仓库整体 3,902 ★ / 196 forks(数据来源:GitHub API);该数字属整个 BuilderIO/skills 合集,不代表本技能自身热度,本技能自身暂无独立星标机制 |
| 最新版本 | 未设置 Release/Tag,以主分支最新提交为准 |
| 安装方式 | npx @agent-native/skills@latest add --skill agent-watchdog,或用 Vercel 的 npx skills@latest add BuilderIO/skills --skill agent-watchdog 做纯文件复制 |
2. 功能介绍与亮点
agent-watchdog 解决的是一个具体的多 agent 协作场景:当一个 agent 需要“接手核查”另一个 agent(或另一次会话)已完成的工作时,用它来把“agent 说它做完了”和“agent 真的做对了”这两件事分开验证。
核心能力:
- 多来源目标解析:可以从 Codex 会话 ID、Claude Code 会话/转录、PR、分支、CI 日志或直接粘贴的运行摘要中定位被审查的工作
- 四种工作模式:仅监视(等待任务完成并汇报,不改文件)、审计(读取需求、diff、测试、CI、截图后出具差距报告,不改文件)、审计并修复(在用户明确授权后对清晰的差距做小范围修复)、对比(多个 agent/会话针对同一需求的产出互相校对)
- 重建需求契约:不轻信被审查 agent 自己的总结,而是回到用户原始请求、后续范围变更、隐含验收标准(测试、CI、截图、评审意见)逐项核对
- 证据分级:把发现的问题分为“缺失(Gap)”“缺陷(Bug)”“验证不足(Verification miss)”“范围漂移(Scope drift)”“无问题”五类,输出结构固定的差距报告模板
主要亮点:技能本身是纯提示词/流程说明,不依赖任何托管服务或付费 API,读取的都是 agent 主机自带的会话记录、Git 状态与 GitHub 工具;来自 Builder.io 官方组织账号发布,隶属于其持续维护的 Agent Skills 合集(该合集近两个月内获得 3,902 星、196 次 fork,仓库整体近一周内仍有提交)。
3. 适用场景
所属分类:元技能与 Agent 增强(判定依据见第 7 步审计记录)
适合已经在用多个 agent 或多次会话协作完成任务、需要一道“验收关”的用户:例如把编码任务交给 Codex 后台跑完再回来核对是否真的做完;用 Claude Code 处理完一个 PR 后想确认有没有偷工减料、跳过测试或改动了不该动的文件;两个 agent 各自给出一版实现,需要快速看出差异在哪。目标群体是已经建立起“多 agent 分工”习惯、但还没有系统化验收流程的初中级用户。
4. 跨 Agent 兼容性
- Claude Code:原生支持——README 明确将其列为可通过
.claude原生 skills 路径安装的对象,也是 SKILL.md 描述里点名的核查目标之一 - Codex:原生支持——安装器写明通过
.agents共享路径安装,SKILL.md 描述明确把“Codex 会话 ID”列为可解析的目标类型之一 - OpenClaw:未验证——仓库未点名提及,其纯文本 SKILL.md 格式理论上可手动复制使用,但未见官方适配说明
- Hermes Agent:未验证——同上,仓库文档未提及
5. 推荐理由
多 agent 协作里最容易出问题的一环,不是“没人干活”,而是“干完的活没人核实”。agent-watchdog 把这道核查工序标准化成一个可复用的技能:不需要额外账号、不需要接入任何托管平台,直接用宿主 agent 自带的会话与仓库信息,就能把“我以为做完了”和“实际做到了什么”之间的差距讲清楚,并给出结构固定、可直接转发给人类审阅者的报告。对刚开始尝试多 agent 分工的用户,这是一个能立刻用起来、且不会引入新依赖的安全网。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 所属 BuilderIO/skills 合集近两月获 3,902 星、196 fork,仓库整体持续更新,但本技能自身除首次提交外未见后续修改,也未检索到专门针对它的 issue/PR 讨论——星数不可沿用,故按合集尚在成长但该子技能自身证据不足评为 5 |
| 可用性 | 9 | 一条命令安装;SKILL.md 与独立 README 均含完整流程说明和示例报告模板;仓库整体一周内仍有提交;无任何付费依赖或托管服务依赖,纯读取本地会话/仓库数据 |
| 安全性 | 8 | 见下方检查清单 |
安全检查清单: ① Shell 命令与权限:仅在用户明确授权“审计并修复”模式时才修改文件,范围限定于已核实的缺口,默认的“仅监视/审计”两种模式完全只读 —— 权限可解释,无过度索权 ② 联网外发:不涉及,读取的是宿主 agent 自带的会话记录、Git 状态与 GitHub 工具,无独立外发通道 ③ API Key/凭据:不需要任何凭据 ④ 可疑指令:通读 SKILL.md 与 README 未发现提示词注入或隐蔽指令 ⑤ 作者信誉:Builder.io 官方组织账号,非匿名个人 ⑥ License:MIT,明确 ⑦ 维护时间:仓库整体近一周内有提交,在合理维护窗口内 — 存在“审计并修复”模式下的实际代码执行能力,范围明确、需用户显式授权、可审计,无外联
7. 跟同类 Skills 相比的优势
| 技能 | 定位 | 与 agent-watchdog 的差异 |
|---|---|---|
| mentor | 聚合 Claude Code / Codex 多次历史会话,生成用后反思报告 | 面向“事后复盘学经验”,产出是给人看的反思笔记;agent-watchdog 面向“这次交付是否达标”,产出是可执行的差距清单,且支持监视中/审计后两种时机 |
| handoff(OpenClaw 官方) | 生成多 agent 交接用的标准化 prompt,交接前强制独立审查一次 | 解决的是“怎么把工作正确交出去”,审查动作嵌在交接流程里;agent-watchdog 解决的是“已经交出去的工作是否真的做对了”,可在交接之后的任意时间点单独触发,且支持多 agent 产出横向对比 |
8. 用户评价
该技能目前在第三方平台尚无独立于其所属合集之外的具名用户评价;已检索到的第三方技能榜单页面(如 claudeskills.info 的代码评审类技能榜)未收录该技能。
9. 安装使用方式
- 通过 Agent Skills 安装器:
npx @agent-native/skills@latest add --skill agent-watchdog,安装时可选择用户级或项目级路径,支持 Claude Code 原生 skills 路径与 Codex 等 agent 共用的.agents路径 - 通过 Vercel skills CLI 纯文件复制:
npx skills@latest add BuilderIO/skills --skill agent-watchdog - 安装后无需重启,直接在对话中说出“帮我审计一下这个 PR”“看看刚才那个 Codex 会话做完了没”等指令即可触发;默认进入只读的审计模式,需要修复时须用户明确授权
10. 注意事项
- 技能本身不带任何监控轮询的强制间隔设置,“仅监视”模式下需要宿主 agent 自身支持按合理间隔轮询会话/CI 状态的能力
- “审计并修复”模式的修复范围严格限定在已核实的缺口,遇到需要产品决策、凭据或大范围重写的情况会主动停止并汇报,不会擅自扩大改动面
- 该技能是所属合集内一篇独立文件,非独立仓库;OpenClaw、Hermes Agent 生态下的可用性未经验证,如需使用建议先手工确认 SKILL.md 格式兼容