1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | image-to-editable-ppt-skill |
| 作者/维护者 | ningzimu(个人开发者,GitHub 关注者 216,同时维护同类工具 codex-ppt-skill) |
| 来源链接 | https://github.com/ningzimu/image-to-editable-ppt-skill |
| 许可证 | MIT(GitHub API 确认) |
| GitHub Stars | 1,449(GitHub API) |
| Forks | 76(GitHub API) |
| 最新版本 | v0.3.2(2026-07-19 发布,GitHub Releases) |
| 安装方式 | 向支持技能加载的 Agent 发送安装指令即可,见第 10 章 |
2. 功能介绍与亮点
image-to-editable-ppt-skill 解决的是“图已经存在,但改不动”的问题:把截图式幻灯片、扫描版 PPT/PPTX、或图片版 PDF 讲义,重建为对象级可编辑的 .pptx——文字尽量恢复为原生文本框,简单几何图形恢复为 PowerPoint 形状,无法拆解的复杂视觉元素则保留为带来源记录的独立图片资产,三者互不混淆。
核心亮点:
- 测量驱动而非目测:预处理阶段为每页生成文字标注(框坐标、按原图墨水实测的字号、同级字号分组),模型据此还原文字尺寸和位置,而不是凭感觉估算。
- 多页任务走子 Agent 并行:单图/单页由主 Agent 本地处理,多页输入按并发槽位分派给独立的 page worker,各自负责一个页面目录,互不干扰。
- 图片后端有明确优先级:优先调用 Agent 运行时内置的图像生成/编辑工具,只有内置工具不可用或报错时才降级到独立的
editppt imageCLI(内部依次尝试 Codex OAuth 与用户配置的 OpenAI 兼容 API),行为可预期。 - 过程透明可核查:每一步都落盘为
manifest.json/validation.json/page_result.json,editppt run record会对照 manifest 校验产物,不是黑箱一次性吐出结果。
3. 适用场景
所属分类:文档与办公自动化
- 手头只有幻灯片截图、扫描版讲义或图片版 PPT/PDF,需要拿到能直接改文字、挪位置的
.pptx。 - 需要把多张设计图或多页 PDF 合并成一份保留原始页序的可编辑 PPT。
- 需要在保留原始备注(speaker notes)的前提下,把图片版 PPT 转成可二次编辑版本。
- 复刻某页视觉设计的同时保留文本可编辑性,用于后续内容更新或本地化改写。
不适合的场景:从大纲、文章或想法直接生成一份全新 PPT——这不是本技能的定位,作者另有 codex-ppt-skill 覆盖该场景。
4. 跨 Agent 兼容性
| Agent | 结论 | 依据 |
|---|---|---|
| Codex | 原生支持 | 深度绑定 Codex:优先调用 Codex 内置 image_gen.imagegen,CLI 兜底时优先用本机 Codex OAuth;README 提供 Codex 专属的“完全访问权限”配置说明 |
| Claude Code | 需适配 | README 明确将其列为“非 Codex 环境”之一,需用户自行配置 OpenAI 兼容 API(base URL、模型名、API key)作为图像生成兜底 |
| OpenClaw | 需适配 | 同上,README 原文点名 OpenClaw,依据同一条 API 兜底配置路径 |
| Hermes Agent | 需适配 | 同上,README 原文点名 Hermes Agent |
5. 推荐理由
它是同类 PPT 工具里少数专注“从图像忠实重建可编辑对象”而非“从文字生成新页面”的技能,测量驱动的文字还原和分层落盘的校验流程让整个转换过程可核查、可调试,而不是一次性黑箱输出。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | GitHub 1,449 Stars/76 Forks,6 个 Issue 中有具名用户就 OCR 队列、转换质量等具体问题与作者互动 |
| 可用性 | 8 | 中英双语文档 + docsify 文档站、结构化 CHANGELOG、独立 tests 目录,近期版本迭代密集;但复杂多页任务耗时可达单页 10 分钟以上、token 消耗是同规模生成任务的 2-3 倍,需要在 Codex 中开启“完全访问权限”才不被频繁打断 |
| 安全性 | 8 | 见下方检查清单 |
安全检查清单:
① Shell/权限范围:执行 OCR 调用、图片生成/编辑、文件读写、子 Agent 分派,均限定在当次转换任务目录内,未见越界操作
② 联网外发:会向百度 PaddleOCR-VL(可选,用于文字校正)及用户配置的图像生成 API 发送任务相关的页面图像;SKILL.md 正文明确写明“只发送当次转换所需的页面图像/提示词/参考图,禁止发送无关本地文件、API key、凭据或非必需的生成产物”
③ API key/凭据存储:OCR Token 与图像 API 凭据统一存于用户级配置文件(~/.editppt/config.yaml),输出中做遮蔽处理,且文档明确要求不得写入项目目录或技能目录
④ 未发现 SKILL.md 或脚本中存在诱导执行无关操作的可疑指令
⑤ 作者为个人开发者,同一账号下还维护着另一个 PPT 相关技能 codex-ppt-skill,账号有一定可信历史
⑥ License 为 MIT,明确
⑦ 最近一次提交 2026-07-19,近期发布节奏密集(v0.2.0 至 v0.3.2 均在近两个月内)
⚠️ 使用中需注意:部分 Agent 运行时的默认安全策略会将 OCR 外发判定为“不可接受风险”而拦截(详见第 8 章用户评价),这属于运行时侧的保守策略,技能本身在文档中已声明该调用是完成转换任务所必需、且传输范围仅限任务相关页面图像。
7. 跟同类 Skills 相比的优势
| Skill | 定位 | 与本技能的差异 |
|---|---|---|
| pptx(Anthropic 官方) | 通用 .pptx 创建/编辑/解析工具,基于 pptxgenjs 脚本与 XML 直接操作 |
面向“从内容或模板生成/编辑”场景,不处理“从一张幻灯片截图反推可编辑对象”这类图像级重建任务 |
| codex-ppt-skill(同作者) | 从大纲/内容一次性生成全新 PPT | 输入是文字内容而非现成图像,产出是全新设计的页面,与“复原已有视觉稿”是两种不同起点 |
| dashi-ppt-skill | 从文档内容生成带 12 套主题、可在浏览器控制台调整版式的 HTML 演示,再导出可编辑 PPTX | 同样强调可编辑,但起点仍是文档内容驱动的排版生成,不针对图片/扫描件的像素级还原 |
8. 用户评价
- wytowen(GitHub Issue #10):反馈 Codex 的默认审批策略会因 PaddleOCR 外发判定为“不可接受风险”而拦截转换;作者 ningzimu 回应可在转换请求中明确提及使用 OCR 以通过审批,且技能在不使用百度 OCR 时会自动退化为内置离线算法,只是文字尺寸还原效果会打折扣。
- OneMoreChen(GitHub Issue #16):反馈某次转换效果不理想、图片元素还原较差;作者确认是生图模型未生效导致,问题已定位。
9. 其他补充
文档提供中英文双语版本(README.md / README_en.md),并搭建了基于 docsify 的独立文档站(首页、快速开始、设计说明、安装、工作流、FAQ、Prompt 示例)。项目通过 GitHub Issues 接受问题反馈与需求讨论。
10. 安装使用方式
在支持技能加载的 Agent 对话框中直接发送:
安装 image-to-editable-ppt 这个 skill,地址是 https://github.com/ningzimu/image-to-editable-ppt-skill
安装完成后,将图片、PDF 或图片版 .pptx 粘贴/附加到对话框,或提供本地路径,用自然语言描述转换需求即可,例如“把这张图片转成可编辑 PPT”。首次使用如需启用百度 OCR 文字校正,Agent 会主动询问并引导申请免费 Token(https://aistudio.baidu.com/account/accessToken);不提供也可运行,仅文字还原精度会下降。若不在 Codex 环境使用,需按提示配置 OpenAI 兼容 API 作为图像生成兜底。
11. 注意事项
- 该技能流程较重,非轻量转换器:多智能体协作 + 自我检查 + 修正循环,单页复原可能耗时 10 分钟以上,整体 token 消耗可达同规模生成任务的 2-3 倍,官方建议 ChatGPT Pro 级别订阅用户使用。
- 不保证 100% 复刻原始页面,复杂视觉元素可能有轻微位置偏移。
- 官方说明不保证 gpt-5.5 以下模型的使用效果。
- 该技能定位是“复原已有视觉稿”,如果需求是“从零生成一份新 PPT”,作者建议改用其同名系列的 codex-ppt-skill。