1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | gpt-image2-ppt-skills |
| 作者/维护者 | JuneYaooo(GitHub 个人账号,另有 1 名外部贡献者 oQAQo 提交过合并 PR) |
| 来源链接 | https://github.com/JuneYaooo/gpt-image2-ppt-skills |
| 许可证 | Apache-2.0(GitHub API) |
| GitHub Stars | 1,092(GitHub API) |
| Forks | 58(GitHub API) |
| 最新版本 | 未发布正式 Release/Tag,以最新提交为准(2026-07-17) |
| 安装方式 | git clone 后运行仓库自带安装脚本,或让 Agent 读取安装说明文档自动完成安装 |
2. 功能介绍与亮点
gpt-image2-ppt-skills 不走传统“模板填字”路线,而是调用 OpenAI 官方 gpt-image-2 图片模型,把每一页幻灯片当作完整视觉稿直接生成,再打包成 16:9 .pptx:
- 模板克隆模式:喂给它任意一份
.pptx模板,技能渲染出每页截图并分析版式/配色,仿照原视觉语言生成新内容 - 内置风格库:40 余套预设视觉风格(Spatial Glass、Tech Blue、Dark Aurora、Riso、Swiss Grid 等),并配套场景起步模板(
examples/) - 自然语言精准编辑:可针对单页说“改第 3 页副标题”,仅重生成目标页而非整份重做
- 默认关闭的可编辑模式:用户明确要求时,把生成的视觉稿拆解重建为原生 PowerPoint 文本框、图形与独立图层
- 并发出图:默认 10 路并发,约 30 秒完成 10 页初稿;建议先出一页封面确认风格再批量生成
模板渲染无需打开 PowerPoint,本机自动依次尝试 PowerPoint COM / Keynote AppleScript / LibreOffice。
3. 适用场景
所属固定分类:文档与办公自动化。面向需要快速产出视觉统一、审美在线的演示文稿,又不具备专业设计能力的用户:产品发布/融资路演、周报月报、课程课件、论文答辩等场景均有对应起步模板;企业用户也可用“模板克隆”功能仿照公司现有 PPT 模板批量换内容,保持视觉一致性。
4. 跨 Agent 兼容性
- Claude Code:原生支持——安装脚本提供
--target claude选项,SKILL.md 遵循标准格式 - Codex:原生支持——安装文档给出专门的 Codex 原生出图路径(复用 Codex 自带的
image_gen工具调用 gpt-image-2,无需额外配置 API Key),仓库 issue 中也有用户实测调用该路径 - OpenClaw:原生支持——安装脚本提供
--target openclaw选项;仓库 issue #5 中有具名用户实测在 OpenClaw 上运行并反馈了使用体验 - Hermes Agent:原生支持——SKILL.md 明确将 Hermes 列为支持平台之一,同一位用户在 issue #5 中确认已在 Hermes 上完成测试
5. 推荐理由
多数 PPT 生成类技能走“往模板里填字”的老路,视觉上限有限;gpt-image2-ppt-skills 把 gpt-image-2 的构图与审美能力直接用在整页设计上,模板克隆模式能在保留原版式语言的前提下批量换内容,同时用可选的可编辑重建兼顾了“好看”和“能改”两个通常矛盾的诉求,适合没有设计资源但对成稿观感有要求的用户。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 上线约 3 个月积累 1,092 GitHub Stars、58 Forks,落在 1k-5k 区间;有第三方评测网站收录及独立技术社区讨论帖 |
| 可用性 | 8 | 一条安装命令 + 详尽 SKILL.md/README/安装文档与场景模板;4 天前仍有提交,维护活跃;但依赖付费的 OpenAI API Key(或 Codex 原生出图路径),并非零依赖 |
| 安全性 | 8 | 代码执行范围明确可审计(文件拷贝 + pip 安装依赖);网络外发目标透明(OpenAI 官方 Images API,可选的第三方视觉模型需用户自行指定并有“不要贴未知 URL”的明确提示);凭据存储指引推荐系统级密钥管理而非明文写入项目文件;License 清晰;无可疑指令或混淆代码 |
综合评分:7.7
安全检查清单:① Shell 命令——安装脚本执行文件拷贝与 pip install -r requirements.txt,范围明确 ② 联网外发——调用 OpenAI 官方 Images API;可选的模板视觉分析可指向用户自定义的兼容中转站,文档中明确提示“替换为自己信任的端点,不要贴未知 URL” ③ API Key——需要 OPENAI_API_KEY,文档建议存入 Agent 级配置或系统环境变量、避免写入项目 .env ④ 可疑指令——SKILL.md、安装脚本与依赖清单均未发现提示注入或混淆代码 ⑤ 作者信誉——个人开发者,GitHub 账号 2020 年注册,仓库互动记录(issue 讨论、外部 PR 合并)显示为真实社区项目,未见刷星等异常信号 ⑥ License——Apache-2.0,明确 ⑦ 最近维护——最新提交 2026-07-17,活跃
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 与 gpt-image2-ppt-skills 的差异 |
|---|---|---|
| pptx-anthropics-skills(Anthropic 官方) | 通用 PPTX 创建/编辑技能,免费、无需 API Key | 风格数量有限,走结构化生成路线;本技能以 gpt-image-2 整页出图为核心,视觉表现力更强但需付费 API |
| image-to-editable-ppt-skill(ningzimu) | 把已有截图/扫描件形式的 PPT 通过 OCR 与版面识别还原成可编辑 pptx | 起点是“已有图片型 PPT 转可编辑”,本技能起点是“从零或仿模板生成全新设计稿”,两者解决的是内容管线的不同阶段 |
| dashi-ppt-skill | 面向行业研究、竞品分析等场景,产出结构完整、可持续编辑的演示文稿 | 更偏重内容结构与可编辑性,视觉风格预设少;本技能强项在多套现成美术风格与模板克隆 |
| codex-ppt-skill(ningzimu) | 把长文章/报告快速转成视觉统一的演示文稿 | 输入形态是长文本转述,本技能更适合已有清晰大纲或需要仿照指定模板的场景 |
8. 用户评价
- GitHub 用户 jma614851-sys 在仓库 issue 中反馈:分别在 Hermes 与 OpenClaw 上实测,累计花费约 63 元人民币的 OpenAI API 调用费用;主要问题是生成结果为整页图片、原生模式下不便二次编辑,且模板仿真度有时无法完全还原、多页之间偶有版式不一致。作者回应会建群继续沟通调优
- 开源设计社区 Open Design(nexu-io/open-design)贡献者 kokisanai 在 issue 中评价该项目“模板克隆、风格画廊与效果对比图让思路非常好理解”,并邀请其加入设计生态共创
9. 其他补充
仓库提供中英双语 README;examples/ 目录内置产品发布、投融资路演、周报、课程课件、论文答辩、读书分享六类场景的起步模板(recipe),可在用户需求模糊时作为结构参考。
10. 安装使用方式
- 自动安装(推荐):把仓库提供的安装说明文档链接发给 Claude Code / Codex / OpenClaw / Hermes 等支持 Skills 的 Agent,由 Agent 自行克隆仓库并完成安装
- 手动安装:
git clone https://github.com/JuneYaooo/gpt-image2-ppt-skills.git,进入目录后执行bash install_as_skill.sh --target claude(或codex/openclaw) - 安装后需重启当前 Agent 使技能生效;首次使用模板克隆模式前需确认本机具备可用的 PPTX 渲染后端(LibreOffice / PowerPoint / Keynote 任一),必要时先安装
- 使用 API 直连路径(非 Codex 原生出图)时需提供
OPENAI_API_KEY(或兼容中转站的 base_url + key),建议通过 Agent 级配置或系统环境变量注入 - 触发方式:直接用自然语言描述主题、页数与风格即可,例如“帮我做一份关于XX的6页PPT,风格要有科技感”
11. 注意事项
- 依赖 OpenAI
gpt-image-2付费 API(Codex 原生出图路径除外),实际使用有调用成本,具体费用视页数与图片质量设置而定 - 默认输出为整页图片型 PPTX,原生不便逐个文字/图形单独编辑;如需可编辑对象需显式要求触发可编辑模式,且该模式依赖本机 PPTX 渲染后端
- 模板克隆的仿真度受模型能力限制,复杂版式或多页之间的视觉一致性可能无法完全还原,如有用户反馈需要人工微调
- 尚无正式 Release 版本号,版本追踪需以提交历史为准