1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | jetson-inference-mem-tune | GitHub API |
| 作者/维护者 | NVIDIA(Jetson Team),仓库归属 NVIDIA Corporation | SKILL.md / skill-card.md |
| 来源链接 | https://github.com/nvidia/skills/tree/main/skills/jetson-inference-mem-tune | — |
| 许可证 | Apache-2.0(SKILL.md 声明)+ CC-BY-4.0(配套 skill-card.md 声明,仓库整体采用双许可) | SKILL.md / skill-card.md |
| GitHub Stars | 2,875(合集仓库整体,非本技能个体热度,见第 6 章说明) | GitHub API |
| Forks | 335 | GitHub API |
| 最新版本 | 0.0.1(SKILL.md version 字段) |
SKILL.md |
| 安装方式 | npx skills add nvidia/skills --skill jetson-inference-mem-tune --agent <agent>,或手动复制目录 |
仓库 README |
2. 功能介绍与亮点
jetson-inference-mem-tune 把“Jetson 边缘设备上该用 vLLM、SGLang、llama.cpp 还是 TensorRT Edge-LLM 服务大模型、显存参数怎么设”这类容易靠试错踩坑的决策,变成一次基于设备实时内存快照的结构化建议。
- 数据驱动而非拍脑袋:读取
jetson-memory-audit生成的实时内存快照,结合具体 Jetson SKU(Orin Nano/NX/AGX、Thor)给出运行时选型与--gpu-memory-utilization、--max-model-len等具体启动参数。 - 覆盖芯片代际差异:内置量化策略对照表——Thor 优先 NVFP4、Orin 系列用 W4A16、llama.cpp 路径统一 GGUF Q4_K_M,并明确标注每种运行时在 Orin/Thor 上应使用的镜像版本,避免张冠李戴。
- 纯建议、零执行风险:脚本只读取快照并计算推荐,不启动/停止/重启任何模型服务,输出结构化 JSON(runtime、rationale、launch_flags、alternatives)。
- 发布前经实测:仓库随附
BENCHMARK.md,显示该技能经 NVIDIA 内部评测框架用 Claude Code 与 Codex 各跑过 8 项任务,安全维度两个 agent 均 100% 通过,整体判定 PASS,并附官方签名文件。
3. 适用场景
所属分类:DevOps 与基础设施(部署配置与运行时调优,见第 7 章判定说明)。
面向在 Jetson AGX Orin / Orin NX / Orin Nano / Thor 等边缘设备上部署 LLM 或 VLM 推理服务的开发者:模型加载报 OOM、或拿不准该选哪个推理引擎时,跳过反复试错,直接拿到一份贴合当前设备内存状况的运行时与启动参数建议。
4. 跨Agent兼容性
- Claude Code:原生支持。安装 CLI 提供
--agent claude-code;NVIDIA 内部评测明确用claude-codeagent 实测过该技能(8 项任务,安全维度 100% 通过)。 - Codex:原生支持。CLI 提供
--agent codex;同一评测中codexagent 同样实测通过(安全维度 100%)。 - OpenClaw:未验证。仓库 Roadmap 显示已完成向 “ClawHub” 市场的分发,但 SKILL.md 正文未单独说明 OpenClaw 沙箱下的适配细节,实际运行效果未逐条验证。
- Hermes Agent:未验证。仓库 Roadmap 显示已完成向 “Hermes Hub” 的分发,同样未在 SKILL.md 正文找到专门适配说明。
5. 推荐理由
它把边缘设备上“选引擎、设显存参数”这个容易反复 OOM 试错的环节,变成基于设备实时内存快照的一次结构化建议;技能本身只读不触碰运行中的服务,由 NVIDIA 官方维护,发布前用真实 Claude Code / Codex agent 实测过安全性与执行正确性,适合正在把 LLM/VLM 推理服务部署到 Jetson 的开发者。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | NVIDIA 是 Jetson 平台的所有者,属第一方出品;合集仓库整体 2,875 星为合集热度,不代表本技能个体数据;未检索到该子技能自身独立的第三方讨论或采用数据 |
| 可用性 | 9 | 单条 CLI 命令即可安装到目标 Agent;文档含用途、前置条件、错误码、输出契约、运行时/量化对照表;对应目录最近一次同步于 2026-06-22;纯读取本地快照计算,无付费依赖 |
| 安全性 | 9 | 明确只读、不启动/停止/重启服务、不联网外发数据、不经手凭据;License 清晰;作者为 NVIDIA 官方 Jetson Team,经官方签名与内部安全评测(两个 agent 安全维度均 100% 通过);未见可疑指令或混淆代码 |
| 综合 | 8.3 | 三项均值 |
安全检查清单:①无 shell 执行,脚本仅读取审计 JSON 并计算推荐,SKILL.md 中出现的 docker 命令为面向用户的部署参考文本,技能本身不调用;②不联网外发数据;③不需要 API key/凭据(文档示例命令中的 $HF_TOKEN 是用户自备环境变量,供后续实际部署使用,技能不采集);④未发现可疑指令或混淆代码;⑤作者为 NVIDIA 官方团队,经内部安全评测与签名;⑥License 明确(Apache-2.0 + CC-BY-4.0);⑦最近一次同步 2026-06-22。
7. 跟同类Skills相比的优势
| 工具 | 定位 | 与本技能的差异 |
|---|---|---|
jetson-memory-audit(同仓库) |
采集 Jetson 设备的实时内存快照 | 只产出原始数据,不给运行时或启动参数建议;本技能消费它的输出、专攻“选哪个引擎、怎么配”这一步 |
jetson-headless-mode(同仓库) |
通过关闭桌面环境与非必要守护进程回收系统内存 | 作用在操作系统层,不涉及推理引擎选型;与本技能面向不同的内存来源,可配合使用而非互斥 |
| vLLM / SGLang 等项目官方调参文档 | 通用平台的性能调优指南 | 面向所有硬件的通用建议,未覆盖 Jetson 各 SKU 的显存上限与芯片代际差异,仍需开发者自行试错换算 |
8. 用户评价
该技能目前在第三方平台尚无已验证的具名用户评价。其所属的 “Jetson Device” 技能家族随 NVIDIA JetPack 7.2 于近期发布,NVIDIA 官方技术博客与开发者论坛已介绍该系列技能的定位与设计动机,但尚未见到独立开发者对本技能的具体使用反馈。
9. 其他补充
jetson-inference-mem-tune 是 NVIDIA “Jetson Device” 技能家族(共 9 个技能,覆盖诊断、内存审计、无头模式、LLM 服务与基准测试等)之一,与专注主机端 BSP 定制的 “Jetson BSP” 家族是两条不同产线,仓库整体由多个 NVIDIA 产品团队每日自动同步。
10. 安装使用方式
推荐方式(需 Node.js/npm):
npx skills add nvidia/skills --skill jetson-inference-mem-tune --agent claude-code
将 --agent claude-code 替换为 --agent codex 等即可装到其他受支持 Agent;可重复传入 --agent 一次装多个。装完在 Claude Code 里运行 /reload-skills 生效。
手动方式(无 Node.js 环境时): 复制仓库 skills/jetson-inference-mem-tune/ 整个目录(含 SKILL.md 与 scripts/recommend.py),放入对应 Agent 的技能目录,如 Claude Code 的 ~/.claude/skills/。
使用前需先准备一份 jetson-memory-audit 生成的 audit.json 快照;向 Agent 描述“这台 Jetson 该用什么引擎跑推理/为什么 vLLM 一直 OOM”即可触发。
11. 注意事项
- 依赖
jetson-memory-audit提供的实时快照作为输入;无法采集快照时,建议不可靠。 - 技能纯只读、只给建议,不会自动重启或调整正在运行的推理服务,需要用户或上层编排 agent 手动应用推荐的参数。
- 当前版本号 0.0.1,属早期版本;NVIDIA 官方发布前校验曾标记 SKILL.md 缺少推荐的 “Examples” 章节,属已知文档小缺口,不影响核心推荐逻辑。
- 覆盖 Jetson Orin 系列与 Thor;不适用于非 Jetson 平台或数据中心 GPU 服务器的推理调优场景。