1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | video-podcast-maker | GitHub API |
| 作者/维护者 | Agents365-ai(GitHub 团队账号,同名下另维护 ttsCN、assetSeeker、imagenCN、videogenCN、drawio-skill 等配套技能仓库) | GitHub API |
| 来源链接 | https://github.com/Agents365-ai/video-podcast-maker | — |
| 许可证 | CC BY-NC 4.0(署名-非商业性使用) | GitHub README |
| GitHub Stars | 1,477 | GitHub API |
| Forks | 154 | GitHub API |
| 最新版本 | v4.2.1(2026-07-18 发布:“polish scorecard visibility + Step 9 taste wiring”) | GitHub API |
| 安装方式 | 365-skills 插件市场安装(推荐),或手动克隆 + npx create-video 搭建 Remotion 工程 |
GitHub README |
2. 功能介绍与亮点
video-podcast-maker 是一条“选题 → 4K 讲解视频播客”的全自动流水线:agent 依次完成选题调研、脚本撰写、多引擎语音合成(11 个 TTS 后端经统一的 ttsCN 桥接组件路由)、Remotion 视频渲染与 FFmpeg 配乐混音,最终产出可直接发布的成片。
核心亮点:
- 资产层可溯源:v3.0 引入的 Asset Engine 为每条视频生成
manifest.json,逐项登记素材来源与授权(自有文件、素材库、AI 生成图/视频、透明叠加层),付费 AI 生成前必须先出报价并等待用户确认,不会静默扣费 - 多平台原生适配:针对 B 站(一键三连话术、章节时间戳)、YouTube(SEO 标题/关键词描述)、小红书、抖音、微信视频号分别做了脚本结构与发布信息模板
- 默认零成本路径:语音合成默认使用免费的 Edge TTS,Azure/MiniMax/豆包等付费后端均为可选,未配置对应密钥时自动降级,不强制付费
3. 适用场景
固定分类:内容创作与知识管理
适合需要把一个知识点或选题快速做成讲解类视频播客、但不具备视频制作或字幕/配乐合成经验的内容创作者与自媒体运营者;也适合技术团队把内部分享、产品说明快速转成多平台短视频。
4. 跨 Agent 兼容性
依据仓库 README 明确列出的兼容声明判断:
- Claude Code:✅ 原生支持(README 明确列出,另提供插件市场安装路径)
- Codex:✅ 原生支持(README 明确列出)
- OpenClaw:✅ 原生支持(README 明确列出,可通过 ClawHub 安装;SKILL.md 内含
openclaw:专属元数据段,声明所需二进制与 brew 安装方式) - Hermes Agent:❓ 未验证(README 未点名列出;技能遵循通用 SKILL.md 规范,理论上可安装,但无法仅凭已抓取材料确认)
5. 推荐理由
把“一个选题”变成“一条可发布的讲解视频”涉及调研、写稿、配音、剪辑、字幕、多平台适配六个环节,普通用户往往因缺一个环节而放弃。这个技能把六个环节串成一条 agent 可执行的流水线,且默认路径完全免费、每一步付费操作都要求显式确认,对刚开始尝试用 agent 做内容生产的用户friendly,风险和成本都可控。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | GitHub 1,477 星、154 fork,规模在同类内容生成技能中处于中上游;GitHub Issues 可见多位具名用户的功能请求与代码贡献,互动真实 |
| 可用性 | 7 | README/AGENTS.md 文档完整,v4.2.1 距今仅数日,维护活跃;但完整可用需要系统级依赖(ffmpeg/node/python3)、搭建 Remotion 工程、并额外安装配套的 ttsCN 技能,属多组件安装,非一条命令即用 |
| 安全性 | 8 | 见下方安全检查清单 |
| 综合 | 7.3 | 三项均值 |
安全检查清单:
| 检查项 | 结果 |
|---|---|
| ① shell 命令及权限范围 | SKILL.md 显式声明 permissions: env, file_read, file_write, network, shell;shell 用于调用 ffmpeg/node/npx 完成本地渲染,用途明确可审计,轻微扣分 |
| ② 运行时是否联网外发数据 | 会调用用户自选的 TTS/素材生成商业 API,但目标服务商在文档中逐一列出且需用户主动配置密钥才会启用,非隐蔽外发 |
| ③ 是否要求 API key/凭据 | 默认后端(Edge TTS)无需任何密钥;.env.example 完整列出全部 11 个可选后端的环境变量名,凭据处理方式透明可查 |
| ④ 可疑指令(prompt injection) | SKILL.md 及脚本未见异常指令或混淆代码 |
| ⑤ 作者/组织信誉 | GitHub 团队账号,同时维护多个互相配合的配套技能仓库,形成一致的产品体系,未见刷星等异常迹象;GitHub 组织公开资料有限,无法进一步核实机构背景 |
| ⑥ License 是否明确 | CC BY-NC 4.0,明确但限制商业使用,需在第 11 章提醒 |
| ⑦ 最近维护时间 | 最近发布 v4.2.1 为 2026-07-18,近期持续有版本迭代 |
7. 跟同类 Skills 相比的优势
| 特性 | video-podcast-maker | notebooklm-py(同类竞品) | HeyGen(商业平台,公开信息) |
|---|---|---|---|
| 产出形式 | 4K 视频(含字幕、配乐、章节) | 音频(对话式播客摘要) | 视频(真人数字分身讲解) |
| 是否面向 coding agent | 是,SKILL.md 原生集成 | 是,Python CLI + agent 技能封装 | 否,独立 Web/API 产品 |
| 默认是否需付费 | 否(Edge TTS 免费,付费项均可选) | 依赖 Google 账号,走 NotebookLM 免费层 | 是,订阅制 SaaS |
| 多平台发布模板 | B 站/YouTube/小红书/抖音/视频号 | 无(仅生成音频文件) | 无内置发布,需自行导出 |
notebooklm-py 定位是把 Google NotebookLM 的播客摘要能力接进命令行,胜在零搭建成本,但只产出音频、不做视觉呈现;HeyGen 类商业平台胜在数字人讲解的真实感,但是独立付费产品、不与 coding agent 工作流集成。video-podcast-maker 的差异化在于把“视频”与“多平台发布规范”都做进了同一条 agent 流水线。
8. 用户评价
- 来源:GitHub Issue #6(https://github.com/Agents365-ai/video-podcast-maker/issues/6),用户 koffuxu 提交并被合并的功能贡献:“feat: add Doubao TTS support, bundled CJK fonts, and subtitle style tweaks”,为项目补充了国产 TTS 后端与中日字体支持。
- 来源:GitHub Issue #20(https://github.com/Agents365-ai/video-podcast-maker/issues/20),用户 Formangarden524 提交并被合并的功能贡献:“feat: slide-level audio sync + audio-sync-guard skill”,改进了音画同步的校验机制。
- 两条记录均为实际提交并被维护者采纳的代码贡献,反映有真实开发者在使用并扩展该技能,而非仅有点赞。
9. 其他补充
- 内置中文(简体)、英文双语脚本模板、TTS 音色与字幕字体
- 提供组件库(对比卡片、时间线、代码块、流程图等)供拼装差异化的视频版式
10. 安装使用方式
方式一:365-skills 插件市场(推荐) 按仓库 365-skills 说明安装插件后,SKILL.md、脚本与模板会安装到 agent 的插件目录下。
方式二:手动克隆
# 系统依赖
brew install ffmpeg node python3 # macOS
# 或 sudo apt install ffmpeg nodejs python3 python3-pip # Ubuntu/Debian
# 搭建 Remotion 工程(该技能依赖 Remotion 项目作为渲染基础)
npx create-video@latest my-video-project
cd my-video-project && npm i
# 安装本技能的 Python 依赖
pip install -r skills/video-podcast-maker/requirements.txt
# 安装必需的配套技能 ttsCN
# 见 https://github.com/Agents365-ai/ttsCN
安装后无需重启;用自然语言描述选题即可,agent 会逐步引导完成调研、选稿、配音、渲染确认。默认使用免费的 Edge TTS,如需切换付费语音后端,在 .env 中设置对应 TTS_BACKEND 与密钥即可。
11. 注意事项
- 许可证为 CC BY-NC 4.0,禁止商业性使用,商业内容团队采用前需自行确认授权范围
- 完整功能依赖搭建 Remotion 工程与安装配套的 ttsCN 技能,初次配置步骤较多,并非开箱即用
- 作者在 README 中明确说明项目仍在活跃迭代中、尚未完全成熟,功能细节可能变化
- Hermes Agent 兼容性未获验证,该生态用户安装前建议先做小范围试用