1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | hf-mem-huggingface-skills |
| 作者/维护者 | Hugging Face(发布于官方 huggingface/skills 仓库;底层显存估算逻辑由 Hugging Face 内部 ML 工程师 Alvaro Bartolome 开发并独立开源,GitHub API 已确认) |
| 来源链接 | https://github.com/huggingface/skills/tree/main/skills/hf-mem |
| 许可证 | 仓库根 LICENSE 声明 Apache-2.0(GitHub API 已确认);SKILL.md frontmatter 未单独声明许可证字段;底层估算工具另有独立仓库,以 MIT 开源 |
| GitHub Stars / Forks | 合集仓库整体 10,909 stars / 724 forks(GitHub API);该数字属整个 huggingface/skills 合集,不代表本技能自身热度 |
| 最新版本 | SKILL.md frontmatter 未声明版本号;底层 CLI 工具走独立 PyPI 发布,当前最新版本 0.5.5 |
| 安装方式 | Claude Code:/plugin marketplace add huggingface/skills 后 hf skills add hf-mem;或直接复制 skills/hf-mem/ 目录进本地 agent 的 skills 目录 |
2. 功能介绍与亮点
hf-mem 教 agent 用一条命令估算某个 Hugging Face 模型的推理显存/内存需求,全程不下载、不加载任何模型权重:
- 零下载估算:只读取 Safetensors 或 GGUF 文件的头部字节获取权重元数据,即使面对 100GB+ 大模型也能秒级出结果。
- 格式覆盖广:同时支持 Safetensors(Transformers、Diffusers、Sentence Transformers 等生态)与 GGUF;GGUF 多量化精度文件可指定具体版本单独估算。
- KV Cache 精细估算:
--experimental额外计算 LLM/VLM 推理时的 KV Cache 显存增量,支持自定义上下文长度、批大小、缓存精度等参数。 - 结构化输出:
--json-output直接给出机器可读结果,便于 agent 直接解析并给出建议。
3. 适用场景
所属固定分类:DevOps 与基础设施。 该技能的产出是“某模型在给定精度/量化下需要多少显存”这一容量规划结论——既不涉及对既有数据的探索分析,也不是围绕某个框架编写业务代码的编码指南,而是 agent 在判断“这个模型能不能跑在这块 GPU/这台机器上”时的部署前置依据,归入基础设施容量规划范畴。
具体场景:
- 开发者在下载或部署一个新模型前,先确认本地 GPU 或云实例的显存是否够用,避免下载几十 GB 权重后才发现装不下;
- 在多个候选模型或量化版本之间选型时,批量比较各自的显存占用;
- 为 LLM/VLM 推理服务设定
--max-model-len、--batch-size等参数前,先估算 KV Cache 带来的额外显存开销。
4. 跨 Agent 兼容性
- Claude Code:原生支持。仓库自带 Claude Code 插件市场清单,
/plugin marketplace add huggingface/skills后即可用hf skills add hf-mem安装。 - Codex:支持,但非一键安装——官方文档说明需手动将
skills/目录下的技能复制到.agents/skills对应位置。 - OpenClaw:未验证。仓库 README 未提及该平台;本技能只依赖标准 SKILL.md 格式与本地
uv环境,不含平台专属清单文件,理论上可手动安装,但缺乏官方材料佐证。 - Hermes Agent:未验证,理由同上。
5. 推荐理由
把“这个模型能不能塞进我的显卡”这个每次本地部署或微调前都要回答的问题,压缩成一条命令、几秒钟出结果,且无需先下载任何模型权重——用 HTTP Range 请求只读文件头部元数据即可估算。相比手动翻 config.json 折算参数量,或下载下来试跑一遍才知道会不会 OOM,这条技能把决策提前到下载之前,省下时间与带宽成本;对刚接触本地部署 LLM/VLM 的用户,也是理解“显存怎么算”的直观入口。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | Hugging Face 官方发布;合集仓库 stars 不计入本技能个体热度;未检索到该子技能自身独立于官方渠道的第三方讨论,但其底层显存估算工具已有独立第三方博客文章介绍 |
| 可用性 | 9 | uvx hf-mem --model-id <id> --json-output 一条命令即可用;SKILL.md 含 Safetensors/GGUF/LLM/VLM 多场景示例;该技能于 2026-06-12 加入仓库,内容与工具当前版本一致;仅需 uv,无付费依赖 |
| 安全性 | 9 | 检查清单逐项见下 |
综合评分:8.3(三项均值)
安全检查清单逐项结果:
① Shell 命令:执行 uvx hf-mem,范围限定在读取模型元数据与本地计算,无越权操作 — 通过
② 联网外发:仅通过 HTTP Range 请求读取 Hugging Face Hub 上模型文件的头部字节,不下载完整权重,不外发用户数据 — 通过
③ 凭据存储:仅访问 gated/private 模型时才需要 HF_TOKEN,经环境变量或 --hf-token 参数传入,标准做法 — 通过
④ 可疑指令:SKILL.md 全文均为公开文档化行为,未发现隐蔽指令或混淆代码 — 通过
⑤ 作者信誉:收录于 Hugging Face 官方 skills 仓库;底层估算工具由 Hugging Face 内部 ML 工程师独立开源维护,无造假迹象 — 通过
⑥ License:仓库根 LICENSE 为 Apache-2.0,底层工具独立仓库另以 MIT 开源,均明确 — 通过
⑦ 最近维护:该技能 2026-06-12 加入仓库,距今约 2 个月 — 通过
7. 跟同类 Skills 相比的优势
| 竞品 | 定位 | 与 hf-mem 的差异 |
|---|---|---|
| Model Memory Utility(Hugging Face 官方 Space) | 网页版计算器,手动输入模型 ID 与训练配置(优化器、精度、batch size)估算训练显存 | 面向浏览器交互,需人工打开网页填表;hf-mem 是命令行工具,可被 agent 在对话中直接调用并解析 JSON 结果,更适合融入自动化流程,但估算场景偏推理而非训练全流程 |
| vramio(第三方开源工具) | 同样读取模型元数据估算显存,提供网页与 CLI 两种形态 | 功能定位高度相似,但未被 Hugging Face 官方仓库收录,不具备标准 SKILL.md 格式与官方插件市场分发渠道 |
| 手动折算(参数量 × 精度字节数) | 无需任何工具,自行查模型 config.json 估算 | 需人工查阅并计算,遗漏激活值与 KV Cache 部分容易算错;hf-mem 自动读取并给出结构化结果,精度与效率更高 |
8. 用户评价
Medium 作者 Jatin Prasad 在 Coding Nexus 专栏撰文介绍了该技能所依托的 hf-mem 显存估算工具本身,将其定位为解决“AI 硬件规划”痛点的方案,强调其无需下载或加载模型即可给出显存估算的特点。除此之外,该技能目前在第三方平台尚无其他具名用户评价。
9. 其他补充
无。
10. 安装使用方式
- Claude Code:
/plugin marketplace add huggingface/skillshf skills add hf-mem
- 通用方式(任意支持 Agent Skills 格式的平台):将仓库
skills/hf-mem/目录复制进本地 agent 的 skills 目录(如.claude/skills/hf-mem/)。 - 使用前置条件:本地已安装
uv(用于uvx执行);如需读取 gated/private 模型,需额外设置HF_TOKEN。 - 安装后注意事项:无需重启 agent;当用户询问模型显存/VRAM 占用或“能不能在某块 GPU 上跑”时会被触发调用。
11. 注意事项
- 目前只覆盖 Safetensors 与 GGUF 两种权重格式,不支持更老的 PyTorch
.bin权重格式估算。 - 默认命令只给出模型权重本身的显存占用;KV Cache 增量需额外加
--experimental标志才会计入,若忽略该标志容易把结果误读为“总显存需求”。 - 该技能子目录自加入仓库以来仅有一次提交,尚未经历后续修订迭代,长期可靠性有待观察。