SkillsScout
DOCS-OFFICE / 文档与办公自动化

image-to-editable-ppt-skill

收录日期 2026-07-21·来源仓库 ↗·2026-07-22 修订
受欢迎程度
7
可用程度与相关性
8
安全性
8
7.7SCOUT SCORE

1. 基本信息

项目 内容
名称 image-to-editable-ppt-skill
作者/维护者 ningzimu(个人开发者,GitHub 关注者 216,同时维护同类工具 codex-ppt-skill)
来源链接 https://github.com/ningzimu/image-to-editable-ppt-skill
许可证 MIT(GitHub API 确认)
GitHub Stars 1,449(GitHub API)
Forks 76(GitHub API)
最新版本 v0.3.2(2026-07-19 发布,GitHub Releases)
安装方式 向支持技能加载的 Agent 发送安装指令即可,见第 10 章

2. 功能介绍与亮点

image-to-editable-ppt-skill 解决的是“图已经存在,但改不动”的问题:把截图式幻灯片、扫描版 PPT/PPTX、或图片版 PDF 讲义,重建为对象级可编辑.pptx——文字尽量恢复为原生文本框,简单几何图形恢复为 PowerPoint 形状,无法拆解的复杂视觉元素则保留为带来源记录的独立图片资产,三者互不混淆。

核心亮点:

3. 适用场景

所属分类:文档与办公自动化

不适合的场景:从大纲、文章或想法直接生成一份全新 PPT——这不是本技能的定位,作者另有 codex-ppt-skill 覆盖该场景。

4. 跨 Agent 兼容性

Agent 结论 依据
Codex 原生支持 深度绑定 Codex:优先调用 Codex 内置 image_gen.imagegen,CLI 兜底时优先用本机 Codex OAuth;README 提供 Codex 专属的“完全访问权限”配置说明
Claude Code 需适配 README 明确将其列为“非 Codex 环境”之一,需用户自行配置 OpenAI 兼容 API(base URL、模型名、API key)作为图像生成兜底
OpenClaw 需适配 同上,README 原文点名 OpenClaw,依据同一条 API 兜底配置路径
Hermes Agent 需适配 同上,README 原文点名 Hermes Agent

5. 推荐理由

它是同类 PPT 工具里少数专注“从图像忠实重建可编辑对象”而非“从文字生成新页面”的技能,测量驱动的文字还原和分层落盘的校验流程让整个转换过程可核查、可调试,而不是一次性黑箱输出。

6. 评分

维度 分数 说明
受欢迎程度 7 GitHub 1,449 Stars/76 Forks,6 个 Issue 中有具名用户就 OCR 队列、转换质量等具体问题与作者互动
可用性 8 中英双语文档 + docsify 文档站、结构化 CHANGELOG、独立 tests 目录,近期版本迭代密集;但复杂多页任务耗时可达单页 10 分钟以上、token 消耗是同规模生成任务的 2-3 倍,需要在 Codex 中开启“完全访问权限”才不被频繁打断
安全性 8 见下方检查清单

安全检查清单

① Shell/权限范围:执行 OCR 调用、图片生成/编辑、文件读写、子 Agent 分派,均限定在当次转换任务目录内,未见越界操作 ② 联网外发:会向百度 PaddleOCR-VL(可选,用于文字校正)及用户配置的图像生成 API 发送任务相关的页面图像;SKILL.md 正文明确写明“只发送当次转换所需的页面图像/提示词/参考图,禁止发送无关本地文件、API key、凭据或非必需的生成产物” ③ API key/凭据存储:OCR Token 与图像 API 凭据统一存于用户级配置文件(~/.editppt/config.yaml),输出中做遮蔽处理,且文档明确要求不得写入项目目录或技能目录 ④ 未发现 SKILL.md 或脚本中存在诱导执行无关操作的可疑指令 ⑤ 作者为个人开发者,同一账号下还维护着另一个 PPT 相关技能 codex-ppt-skill,账号有一定可信历史 ⑥ License 为 MIT,明确 ⑦ 最近一次提交 2026-07-19,近期发布节奏密集(v0.2.0 至 v0.3.2 均在近两个月内)

⚠️ 使用中需注意:部分 Agent 运行时的默认安全策略会将 OCR 外发判定为“不可接受风险”而拦截(详见第 8 章用户评价),这属于运行时侧的保守策略,技能本身在文档中已声明该调用是完成转换任务所必需、且传输范围仅限任务相关页面图像。

7. 跟同类 Skills 相比的优势

Skill 定位 与本技能的差异
pptx(Anthropic 官方) 通用 .pptx 创建/编辑/解析工具,基于 pptxgenjs 脚本与 XML 直接操作 面向“从内容或模板生成/编辑”场景,不处理“从一张幻灯片截图反推可编辑对象”这类图像级重建任务
codex-ppt-skill(同作者) 从大纲/内容一次性生成全新 PPT 输入是文字内容而非现成图像,产出是全新设计的页面,与“复原已有视觉稿”是两种不同起点
dashi-ppt-skill 从文档内容生成带 12 套主题、可在浏览器控制台调整版式的 HTML 演示,再导出可编辑 PPTX 同样强调可编辑,但起点仍是文档内容驱动的排版生成,不针对图片/扫描件的像素级还原

8. 用户评价

9. 其他补充

文档提供中英文双语版本(README.md / README_en.md),并搭建了基于 docsify 的独立文档站(首页、快速开始、设计说明、安装、工作流、FAQ、Prompt 示例)。项目通过 GitHub Issues 接受问题反馈与需求讨论。

10. 安装使用方式

在支持技能加载的 Agent 对话框中直接发送:

安装 image-to-editable-ppt 这个 skill,地址是 https://github.com/ningzimu/image-to-editable-ppt-skill

安装完成后,将图片、PDF 或图片版 .pptx 粘贴/附加到对话框,或提供本地路径,用自然语言描述转换需求即可,例如“把这张图片转成可编辑 PPT”。首次使用如需启用百度 OCR 文字校正,Agent 会主动询问并引导申请免费 Token(https://aistudio.baidu.com/account/accessToken);不提供也可运行,仅文字还原精度会下降。若不在 Codex 环境使用,需按提示配置 OpenAI 兼容 API 作为图像生成兜底。

11. 注意事项