1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | lanshu-create-ai-presenter-video |
| 作者/维护者 | cclank |
| 来源链接 | https://github.com/cclank/lanshu-create-ai-presenter-video |
| 许可证 | MIT(GitHub API) |
| GitHub Stars | 638(GitHub API) |
| Forks | 102(GitHub API) |
| 最新版本 | 未发布正式 tag/release,仅维护 main 分支 |
| 安装方式 | git clone 到 ~/.codex/skills/ 目录 |
项目自述名称与正式名称一致,界面展示名为“岚叔 · 通用数字人视频制作”(agents/openai.yaml 中的展示别名)。
2. 功能介绍与亮点
lanshu-create-ai-presenter-video 是一个面向 Codex 的通用数字人(AI 主播)视频制作 Skill:输入一段主题或完整文案,加上一张经过授权的成年人物参考图,即可产出配音、人物讲解画面、口型同步、字幕和成品剪辑的完整讲解视频。
核心亮点:
- 供应商中立:不绑定任何单一视频生成、语音合成或口型同步服务商,按运行环境中实际可用的能力自动选型,避免用户被锁定在某一家付费平台。
- 状态机式生产流程:把制作过程拆成 intake → 内容锁定 → 音频锁定 → 视觉方案锁定 → 人物生成 → 合成校验 → 渲染 → 验收八个阶段,每一步都要求留存证据文件,支持从任意中断点续做而不必重新生成已通过的内容。
- 本地质检与交付工具链:内置基于
ffmpeg/ffprobe的技术验收脚本,自动完成响度归一化、主片与分享版双规格编码、九宫格接触表抽帧,交付前强制人工回看。 - CI 自检:仓库自带 GitHub Actions 工作流,每次提交自动校验 SKILL.md 元数据、脚本语法与文件可移植性(不含开发者本机路径)。
3. 适用场景
所属分类:内容创作与知识管理
适合需要批量、低成本产出讲解型视频内容的场景:产品说明视频、企业培训与内训素材、社交媒体短视频文案配讲解人、多语言版本的口播内容再制作等。受益人群主要是内容运营、市场团队与独立创作者——尤其是希望用同一套流程适配多个视频生成后端(而非被单一云服务商锁定)的用户。
4. 跨 Agent 兼容性
- Codex:原生支持。仓库明确面向 Codex 设计,安装路径为
~/.codex/skills/,并提供agents/openai.yaml专属接口配置。 - Claude Code:需适配。SKILL.md 遵循 YAML front matter + Markdown 正文的通用 Agent Skills 规范,核心指令与参考文档可直接读取,但需手动复制到 Claude Code 的 skills 目录,且
agents/openai.yaml、$skill-name触发写法为 Codex 专属产物,不会被 Claude Code 使用。 - OpenClaw:未验证。
- Hermes Agent:未验证。
5. 推荐理由
在同类数字人视频生成 Skill 中,多数产品把用户锁死在单一付费云服务(如指定必须用某厂商的数字人 API),而本技能坚持供应商中立设计,同时把“确认肖像授权、成年状态、远程上传许可、声音克隆授权”作为生成前的强制检查项写入操作规则——这在同类工具里并不常见。配合完整的三份参考文档、状态机式的可续做流程和本地质检脚本,对需要规模化产出讲解视频、又不想被单一供应商绑定的团队而言是一套工程质量扎实的现成方案。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 6 | 独立仓库自身 638 stars、102 forks,数据来自 GitHub API;本技能独立分发,未与合集仓库共享该数字 |
| 可用性 | 8 | 一条 git clone 即可安装,三份参考文档 + README 覆盖生成/剪辑/质检全流程,近期持续维护;但实际生成仍需环境中配置至少一种视频/语音/口型同步能力,非零配置开箱即用 |
| 安全性 | 8 | 见下方检查清单 |
安全检查清单:
| 检查项 | 结果 |
|---|---|
| ① Shell 命令执行范围 | 仅限本地媒体处理(ffprobe 探测、ffmpeg 编码、路径与文件名合法性校验),无越权操作 |
| ② 运行时联网外发 | 仓库自身脚本不包含网络请求代码,远程生成动作委托给运行环境中已配置的第三方能力,未在仓库内硬编码外发目标 |
| ③ API key/凭据存储 | 仓库不直接索取或存储任何凭据 |
| ④ 可疑指令 | 未发现 prompt injection 或夹带无关推广的迹象 |
| ⑤ 作者/组织信誉 | 作者账号注册于 2017 年,274 名关注者、126 个公开仓库;未发现主动造假证据 |
| ⑥ License | MIT,明确 |
| ⑦ 最近维护时间 | 仓库创建于 2026-08-20,最近一次提交同日 |
7. 跟同类 Skills 相比的优势
| 项目 | 定位 | 与本技能的差异 |
|---|---|---|
| talking-head-video(goose-skills 合集) | 面向营销团队、从文档/更新日志一键生成讲解视频 | 绑定 HeyGen 单一付费 API,不支持更换后端;本技能供应商中立,可切换任意可用的生成能力 |
| ai-avatar-video(inference-sh/skills 合集) | 通过 inference.sh 平台调用多种数字人模型(P-Video-Avatar、OmniHuman 等) | 需额外先安装 belt CLI 前置技能并绑定 inference.sh 付费平台;本技能无此类前置依赖,安装步骤更少 |
| aliyun-wan-digital-human(alicloud-skills 合集) | 封装阿里云百炼平台 wan2.2-s2v 数字人模型 | 绑定阿里云特定模型与账号体系,主要服务国内云生态;本技能不绑定特定云厂商 |
8. 用户评价
该技能目前在第三方平台(GitHub Issues/Discussions、Reddit、Hacker News)尚无具名用户评价。
9. 其他补充
仓库提供 CI 校验(GitHub Actions),每次提交自动检查 SKILL.md 元数据一致性、脚本语法正确性,以及是否残留开发者本机路径,保证跨机器可移植性。
10. 安装使用方式
git clone https://github.com/cclank/lanshu-create-ai-presenter-video.git \
~/.codex/skills/lanshu-create-ai-presenter-video
安装后在对话中直接触发,例如:
使用 $lanshu-create-ai-presenter-video,把这份文案和人物图做成一条 16:9、30 秒、带实时字幕的数字人讲解视频。
也可先初始化标准任务目录再逐步推进:
SKILL_DIR=~/.codex/skills/lanshu-create-ai-presenter-video
python3 "$SKILL_DIR/scripts/init_job.py" \
--job-dir ~/Videos/my-presenter-video \
--presenter-image ~/Pictures/presenter.png \
--topic "视频主题"
python3 "$SKILL_DIR/scripts/preflight.py" ~/Videos/my-presenter-video/job.json
安装后无需重启 Agent;本地需具备 Python 3.9+、FFmpeg/ffprobe、Bash、jq、awk、sed,以及至少一种当前环境可调用的视频生成/语音生成/口型同步能力。
11. 注意事项
- 实际视频生成依赖运行环境中配置的第三方能力(如具体视频/语音/口型同步服务),本技能本身不包含任何生成后端,需自行准备并可能产生对应费用。
- 仓库创建于 2026-08-20,尚缺长期维护记录;使用前建议关注后续更新频率。
- 技能明确要求生成前确认人物肖像授权、成年状态与声音克隆授权,使用者仍需自行对素材来源的合法性负责。