1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | nemo-mbridge-recipe-recommender | GitHub API |
| 作者/维护者 | NVIDIA Corporation(Megatron Bridge / NeMo 团队) | SKILL.md / 上游仓库 |
| 来源链接 | https://github.com/nvidia/skills/tree/main/skills/nemo-mbridge-recipe-recommender | — |
| 许可证 | Apache-2.0 | SKILL.md |
| GitHub Stars | 2,877(合集仓库 nvidia/skills 整体,非本技能个体热度);所服务的独立产品仓库 NVIDIA-NeMo/Megatron-Bridge 另有 859 星、451 Fork、394 个开放 Issue | GitHub API |
| 最新版本 | SKILL.md 未单独声明版本号;正文标注最后一次内容签名刷新于 2026-08-03 | SKILL.md |
| 安装方式 | npx skills add nvidia/skills --skill nemo-mbridge-recipe-recommender --agent <agent>,或手动复制目录 |
仓库 README |
2. 功能介绍与亮点
nemo-mbridge-recipe-recommender 是 NVIDIA 官方训练框架 Megatron Bridge 的配方推荐技能,帮用户在动辄几十种预置训练配方里,按自己的模型、硬件和目标快速定位到可直接跑的起点配置。
- 四问定位配方:只需模型名称/规模、GPU 数量与型号、训练目标(预训练/全量微调/PEFT)、序列长度,即可从内置索引匹配到具体配方函数名与启动命令。
- 明确区分两类配方:功能训练配方(
recipes/,用于实际产出可用模型)与性能基准配方(perf_recipes/,仅用于吞吐量测算),并提醒不要把基准配置误当生产训练配置使用。 - 并行度调整有硬规则背书:TP 必须整除 KV 头数、TP 不跨节点、EP 不能与 TP 简单相乘、SP 在 TP>1 时应开启等,均给出可直接套用的判定条件,而非笼统建议。
- 常见故障对照表:把“TP 超过 KV 头数导致崩溃”“CUDA Graph 与序列打包冲突”等十余种真实报错现象、症状与修复方式做成速查表。
- 收敛语义与性能配置分层管理:明确区分“改了会产生新实验”的收敛相关参数与“不影响收敛只影响执行效率”的性能参数,避免用户在调吞吐时无意间破坏了训练结果的可比性。
3. 适用场景
所属分类:工程效率与代码质量(技术栈/框架的编码与使用指南,见第 7 章判定说明)。
面向正在使用 NVIDIA Megatron Bridge 训练或微调大模型的机器学习工程师:无论是第一次跑通烟雾测试、按已有 GPU 资源选定预训练/SFT/PEFT 起点配置,还是需要把长上下文、CUDA Graph 等进阶特性叠加到现有配方上,都可以从这个技能获得有依据的配置建议而非从零试错。
4. 跨Agent兼容性
- Claude Code:原生支持。技能安装器提供官方
--agent claude-code目标。 - Codex:原生支持。技能安装器提供官方
--agent codex目标。 - OpenClaw:未验证。官方技能安装器
--agent目标列表未包含 OpenClaw,技能正文也未提及。 - Hermes Agent:未验证。同上,官方安装目标与正文均未提及 Hermes。
5. 推荐理由
Megatron Bridge 的配方数量以十计、可调参数以百计,新手最容易在“改了这个参数到底会不会影响训练结果”上踩坑。这个技能把配方索引、并行度调整的硬性判定条件、常见报错的对照修复方式整理成一份可直接查阅的决策依据,还额外做了“收敛配置 vs 执行性能配置”的分层说明——这一层区分在同类文档里并不常见,却直接决定了调参时能不能放心动某个字段。对已经在用 Megatron Bridge、但还没吃透其内部参数体系的工程师,这是能显著减少试错轮次的起步材料。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | NVIDIA 官方出品(Megatron Bridge 由 NVIDIA-NeMo 团队自研);所属 nvidia/skills 为合集仓库,2,877 星不代表本技能个体热度;上游独立产品仓库 859 星、451 Fork、394 个开放 Issue 属该细分训练框架的正常体量,未见针对本技能自身的独立第三方评测 |
| 可用性 | 8 | 技能本身零部署门槛——获取配方建议不需要预先拥有 GPU 集群;SKILL.md 内含决策树、参数调整规则、故障对照表、代码路径索引,文档完整;技能目录最近一次内容同步在近日,维护活跃;实际执行推荐的训练命令仍需用户自备 GPU/多节点环境,故未给满分 |
| 安全性 | 9 | 纯本地检索与建议逻辑,不联网外发数据、不涉及任何凭据的读写;正文全篇未见可疑指令或混淆代码;License 清晰;作者为 NVIDIA 官方组织 |
安全检查清单:①无 Shell 执行,技能只输出供用户自行运行的命令文本;②不联网外发数据;③不涉及 API Key/凭据;④通读全文未见可疑指令或混淆代码;⑤作者为 NVIDIA 官方组织,无造假迹象;⑥License(Apache-2.0)明确;⑦技能目录最近一次内容同步在近日,维护活跃。
7. 跟同类Skills相比的优势
| 工具 | 定位 | 与本技能的差异 |
|---|---|---|
| Axolotl | 开源 YAML 配置驱动的微调框架,自带多组 DeepSpeed/FSDP 预置配置 | 预置配置需要用户自行判断哪一份适合自己的模型和硬件;本技能按用户输入的模型、GPU 数量、训练目标直接给出匹配的具体配方与调整规则 |
| LLaMA-Factory | 提供 Web UI 封装 DeepSpeed 多卡训练的配置复杂度 | 面向图形界面操作,不是编码 Agent 可直接调用的技能形态;本技能以 SKILL.md 形式嵌入编码 Agent 工作流,输出的是可直接粘贴执行的命令行 |
| TorchTune | PyTorch 原生、显式代码风格的微调配方,强调底层可控性 | 需要用户自己编写或修改训练脚本代码;本技能面向 Megatron Bridge 的既有配方索引做选型与参数调整建议,不要求用户改动训练代码本身 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。其所属的 Megatron Bridge 训练库有独立 GitHub 仓库(859 星、451 Fork、394 个开放 Issue),显示存在活跃使用群体,但未见针对“配方推荐”这一具体技能功能的第三方评价。
9. 其他补充
该技能同属 NVIDIA 官方 “skills” 仓库,内容由 Megatron Bridge 团队每日自动从产品仓库同步;同一命名空间下还有十余个 nemo-mbridge-perf-* 性能调优姊妹技能(如序列打包、CUDA Graph、专家并行通信重叠等专项调优指南),可与本技能配合使用,先选定起点配方再逐项深入优化。
10. 安装使用方式
推荐方式(需 Node.js/npm):
npx skills add nvidia/skills --skill nemo-mbridge-recipe-recommender --agent claude-code
将 --agent claude-code 替换为 --agent codex 等即可装到其他官方支持的 Agent;可重复传入 --agent 一次装多个。装完在 Claude Code 里运行 /reload-skills 生效。
手动方式(无 Node.js 环境时): 复制仓库 skills/nemo-mbridge-recipe-recommender/ 整个目录(含 SKILL.md 与 references/recipe-index.md),放入对应 Agent 的技能目录,如 Claude Code 的 ~/.claude/skills/。
安装后向 Agent 提出“帮我选一个 Megatron Bridge 训练配方”或类似需求即可触发;实际运行推荐的训练命令前,需要本机已配置好 Megatron Bridge 代码库与对应 GPU 环境。
11. 注意事项
- OpenClaw、Hermes Agent 均不在官方技能安装器的
--agent目标列表内,技能文件能否被这两者原生加载未经验证。 - 技能给出的是配方与参数建议,实际训练仍需用户自行准备匹配的 GPU 数量与集群环境,单卡或资源不足时多数预训练配方无法直接跑通(PEFT/LoRA 类配方对资源要求最低)。
- 基准测试配方(
perf_recipes/)的损失与检查点不代表真实收敛效果,不应被当作生产训练结果使用,技能正文已明确提示。 - 收敛相关参数(数据集、精度、优化器等)与执行性能参数(并行度、重计算、通信重叠等)改动性质不同,调参前建议先按技能中的分层说明确认改的是哪一类,避免无意间产生新的收敛实验却当成同一次结果比较。