1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | data-designer-nvidia-skills(SKILL.md 内部名称 data-designer) |
GitHub |
| 作者/维护者 | NVIDIA(技能目录仓库 NVIDIA/skills);底层工具 NeMo Data Designer 由 NVIDIA 收购的 Gretel 团队并入后持续维护 |
GitHub API |
| 来源链接 | https://github.com/NVIDIA/skills/tree/main/skills/data-designer | — |
| 许可证 | Apache-2.0 | GitHub API |
| GitHub Stars/Forks | 技能所属合集仓库 NVIDIA/skills 整体 2,748★/320 forks(覆盖 260+ 个不同产品的技能,不代表本技能自身热度);本技能实际封装的开源项目 NVIDIA-NeMo/DataDesigner 单独 2,137★/199 forks |
GitHub API |
| 最新版本 | v0.6.1(据官方技能治理卡片 skill-card.md 记录的 git tag) | GitHub(skill-card.md) |
| 安装方式 | npx skills add nvidia/skills --skill data-designer;或直接 pip install data-designer 安装底层 CLI |
GitHub README |
2. 功能介绍与亮点
Data Designer 教 agent 用一套声明式 Python 配置,把统计采样器(category/number/person 等)、LLM 生成列、Jinja2 模板变量、Python/SQL/远程校验器和可选的 LLM-as-judge 打分组合进同一条数据生成流水线,产出可复现的合成数据集,替代手写零散生成脚本。
主要亮点:
- 交互/自动两种工作流:用户明确表示“你决定就行”时走 Autopilot 模式一次性生成;默认走 Interactive 模式,agent 先读取
data-designer agent context弄清当前可用的采样器/校验器 schema,再和用户逐步澄清数据集的“多样性维度”、种子数据、输出字段结构。 - 强制预览-校验循环:正式生成前必须先
validate通过,再用preview --save-results产出可点开查看的 HTML 样例,用户满意后才允许create批量生成——SKILL.md 明确写明“最终生成命令不要代替用户执行,交给用户自己触发”。 - 官方发布跨 Agent 评测数据:NVIDIA 为该技能配套了
skill-card.md,公开了针对 Claude Code 与 Codex 两个 agent 的量化评测结果(安全性、正确率、可发现性、有效性、效率五个维度),这在社区 skill 中并不常见。 - 技术血统:其底层引擎脱胎自合成数据公司 Gretel 被 NVIDIA 收购后并入的核心产品,据 Hacker News 上一位自称 Gretel 联合创始人的评论,该框架也是 NVIDIA 内部用于构建 Nemotron 系列模型预训练与后训练数据的同一套工具。
3. 适用场景
所属分类:数据分析与可视化
适合需要为模型微调/评测构建高质量合成数据集、缺少真实数据但需要结构化测试数据、或需要在保护隐私前提下复现真实数据统计特征的机器学习工程师、数据科学家与 QA/测试工程师。
4. 跨 Agent 兼容性
| Agent | 结论 | 依据 |
|---|---|---|
| Claude Code | ✅ 原生支持 | 官方文档提供 --agent claude-code 安装选项,skill-card.md 单独发布了 Claude Code 的评测结果 |
| Codex | ✅ 原生支持 | 官方文档提供 --agent codex 安装选项,skill-card.md 单独发布了 Codex 的评测结果 |
| OpenClaw | ❓ 未验证 | 官方安装文档列出的目标 agent 中未点名 OpenClaw,现有材料不足以判断 |
| Hermes Agent | ❓ 未验证 | 现有材料未提及 |
5. 推荐理由
这个技能把“生成合成数据”从一次性写脚本,变成一套带预览校验闭环的声明式流水线,且不依赖任何 NVIDIA 专属 GPU 硬件——任何配置了 LLM 推理端点的 Python 环境即可运行,同时官方公开发布了针对 Claude Code / Codex 的量化评测结果,是数据分析类技能里少见的、拿真实评测数据说话的产品。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 底层开源项目 NVIDIA-NeMo/DataDesigner 上线不到 10 个月即积累 2,137★/199 forks 且近日仍有提交;Hacker News 出现专门讨论帖,一位自称 Gretel 联合创始人的用户在评论区直接说明其内部渊源;OpenRouter 官方博客将其作为核心合成数据管线单独撰文介绍并做集成 |
| 可用性 | 8 | pip install data-designer 或 npx skills add 一条命令安装;SKILL.md 配 3 份 references 文档与 interactive/autopilot 两套完整工作流;需要额外运行 data-designer config 配置一个 LLM 模型别名才能实际生成数据,不是零配置;仓库最近一次提交在 2026-07-31,持续维护 |
| 安全性 | 8 | 见下方检查清单 |
安全检查清单:①仅调用官方 data-designer CLI 自身的 validate/preview/create 子命令,权限范围明确,SKILL.md 明确要求“最终生成命令交给用户自己触发,不要代替执行” ②生成阶段会联网调用用户在 data-designer config 里自选配置的 LLM 推理端点,目标透明,无写死的未声明第三方 ③需要配置 LLM 提供方的访问凭据,但存储与调用方式遵循该 CLI 自身机制,SKILL.md 未要求把凭据交给技能本身或写入代码 ④通读 SKILL.md、3 份 references 文档及两套工作流文件,未发现可疑指令或隐蔽外发 ⑤NVIDIA 官方仓库出品,底层项目团队来自其收购的 Gretel,无造假迹象 ⑥License 为 Apache-2.0,明确 ⑦目录仓库与底层库均在最近一周内有提交,非弃置项目
7. 跟同类 Skills 相比的优势
| 竞品 | 定位 | 与 Data Designer 的差异 |
|---|---|---|
| 社区通用测试数据/fixture 生成类技能 | 按工厂模式与边界值规则批量生成随机化桩数据,用于单元测试 | 只做规则化随机填充,不含 LLM 生成列、统计采样器与人工预览-校验闭环,无法覆盖需要“看起来像真实数据”的训练/评测集场景 |
| Synthetic Data Vault(SDV,sdv-dev/SDV,3,536★,开源表格数据合成库) | 用统计/深度生成模型拟合真实表格数据分布,生成同分布合成表格 | 是纯 Python 库,没有面向 Claude Code/Codex 的声明式向导流程与技能形态封装,需要用户自行编写建模脚本;Data Designer 把“agent 引导用户澄清需求→生成配置→预览→迭代”整套流程做成了开箱即用的对话式体验 |
| 直接调用 LLM 写 prompt 生成数据(“just prompt it”) | 靠一次性提示词让模型直接吐数据 | 缺少统计多样性控制、字段间相关性、自动校验与可复现的流水线定义,Data Designer 的价值正是替代这种做法(HN 评论原话即用此对比) |
8. 用户评价
Hacker News 用户 alexwatson405(自称 Gretel 联合创始人)在题为“Nvidia open sources the synthetic data framework used to build Nemotron datasets”的帖子下留言:该框架是 Gretel 的核心产品,现已是 NVIDIA 内部用于 Nemotron 预训练与后训练数据的框架,开源版本“Python 优先、模块化”,可在同一条流水线里混用统计采样器、LLM 生成列与种子数据集,并公开邀请社区反馈缺失功能。
OpenRouter 官方博客《Distillable Models and Synthetic Data Pipelines with NeMo Data Designer》将其定位为可“生成具备明确、可执行许可证保证的大规模合成数据”,并与 OpenRouter 的可蒸馏模型过滤能力组合,用于模型蒸馏与推理成本优化的生产工作流,是该技能之外一个独立第三方服务商的正式集成案例。
9. 其他补充
底层项目 NVIDIA-NeMo/DataDesigner 于 2025 年 10 月创建于独立的 NVIDIA-NeMo GitHub 组织下,是 Gretel 被 NVIDIA 收购后原产品线开源化的结果;NVIDIA/skills 目录仓库通过每日自动同步管线从各产品团队仓库镜像技能内容并保持更新。
10. 安装使用方式
- 推荐方式:
npx skills add nvidia/skills --skill data-designer --agent claude-code(Codex 用--agent codex,也可省略--agent走交互式选择) - 直接安装底层 CLI:
pip install data-designer,随后运行data-designer config配置至少一个模型别名(LLM 推理端点) - 安装后注意事项:Claude Code 中需运行
/reload-skills才能加载新装技能;首次使用前必须先完成data-designer config,否则 CLI 会在技能的“Learn”步骤直接中止并提示先配置 - 环境要求:Python ≥ 3.10;使用低于 v1.5.16 的旧版
skillsCLI 安装时可能无法在 Claude Code 技能列表中正确显示
11. 注意事项
- 不依赖任何 NVIDIA 专属 GPU 硬件,但数据生成速度与费用取决于用户自选的 LLM 推理服务,需要自备可用的 API 访问权限
- 按设计,技能不会代替用户执行最终的批量生成命令,只能引导到“预览确认”这一步,不适合追求完全无人值守端到端自动化的场景
- 通过
npx skills生态分发管理,更新需执行npx skills update,工具会在上游技能被合并/重命名时提示清理本地过期副本 - OpenClaw、Hermes Agent 上的兼容性尚未获得官方材料证实