1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | agent-vision-toolkit |
| 作者/维护者 | Anionex(独立开发者) |
| 来源链接 | https://github.com/Anionex/agent-vision-toolkit |
| 许可证 | MIT |
| GitHub Stars | 373(GitHub API) |
| Forks | 17(GitHub API) |
| 最新版本 | v0.1.0(GitHub API,2026-08-06 发布) |
| 安装方式 | npx skills add 一条命令,或让 agent 按仓库说明自动安装 |
2. 功能介绍与亮点
让纯文本模型(如 DeepSeek)驱动的编码 agent 具备处理图像的能力,核心是五个本地 CLI:glance(描述/提问/OCR)、ground(定位坐标)、detect(清点元素)、trace(拟合为 SVG)、crop(裁图),另附长截图分段 OCR 脚本。
亮点:看图时把当前任务真实意图一并传给视觉模型,描述更贴题;提供可选无缝集成层——本地代理(Codex/Claude Code 换 base URL 即用)与单文件插件(Pi/Oh My Pi、OpenCode),粘贴图片即生效;开源可审计,附真实案例,最近提交为 2026-08-09。
3. 适用场景
所属分类:元技能与 Agent 增强
面向用纯文本模型驱动编码 agent 却需处理图像的开发者:读图问答、草图还原界面代码、长截图 OCR、按截图定位操作 GUI、示意图数字化,适合常被“看不懂图片”卡住的文本模型用户。
4. 跨 Agent 兼容性
- Claude Code:原生支持 ✅——README 已验证,换
ANTHROPIC_BASE_URL即可接入。 - Codex:原生支持 ✅——作者主要开发验证环境。
- OpenClaw:未验证——仓库未提及,仅“可执行 shell 的 agent”基础用法理论可用。
- Hermes Agent:未验证——仓库未提及。
5. 推荐理由
许多人为省成本选纯文本模型,却因此失去看图能力。它用五个职责清晰的 CLI 加可选无缝代理把“看图”还给 agent,且传递真实任务意图、结果更贴题。开源可审计、文档齐全、迭代活跃,适合低成本补齐视觉能力的用户。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 6 | GitHub 373 stars,仓库创建于 2026-08-01、增长较快;暂未查到独立第三方讨论 |
| 可用性 | 8 | 一句话唤 agent 安装或一条命令安装;文档与案例齐全,最近提交 2026-08-09;需自备视觉 API Key |
| 安全性 | 8 | 见下方检查清单 |
安全检查清单:
- shell 权限:CLI 仅处理本地图像,不执行外部 shell 命令。
- 联网外发:图像仅转发到用户自配的视觉 API,去向透明。
- 凭据存储:API Key 写入本地文件并设 600 权限,不入库。
- 可疑指令:抽查 SKILL.md 与核心脚本均为常规逻辑,无隐蔽指令。
- 作者信誉:独立开发者,维护记录公开,附安全策略文档。
- License:MIT,清晰。
- 维护时间:最近提交 2026-08-09,已发布 v0.1.0。
综合评分 ≈ 7.33
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 差异 |
|---|---|---|
| farhanic017/vision-tool | 面向多种 agent 的 MCP 视觉服务器 | 需额外部署常驻 MCP Server;本技能是纯 CLI + Skill,无需独立服务进程 |
| Borda/vision-delivery | “问题到已部署 CV 模型”的工程技能集 | 服务训练/交付 CV 模型;本技能服务日常任务中临时“看懂”一张图 |
| thenamangoyal/codex-vision | 包一层 codex exec -i 转发给 Codex CLI 的 Claude Code 技能 |
强依赖本机 Codex CLI、仅适配 Claude Code;本技能只要求视觉后端“OpenAI 兼容”,验证过 5 种宿主 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
10. 安装使用方式
一句话安装:发给 agent「按仓库 README 说明安装视觉工具包和技能」。
命令行安装:
npx skills add Anionex/agent-vision-toolkit --skill vision-tools -a codex -g --copy -y
或手动复制 skills/vision-tools/ 到技能目录。
必需配置:本地 env 文件写入 VISION_API_KEY、VISION_BASE_URL、VISION_MODEL,指向支持 image_url 的多模态 API。
可选集成层:按 AGENT_INSTALL.md 装本地代理或原生插件,装完需重启 agent 生效。
11. 注意事项
- 是“图像转文本”桥接层,效果同时取决于文本模型与所选视觉模型。
- 代理的描述缓存仅存于进程内存,重启即清空。
- 仅发布过一个正式版本,配置方式后续可能调整。
- 需自担所选视觉 API 的调用成本。