1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | speech-to-text(合集仓库 elevenlabs/skills 子技能) |
| 作者/维护者 | ElevenLabs(语音 AI 厂商,官方 GitHub 组织) |
| 来源链接 | https://github.com/elevenlabs/skills/tree/main/speech-to-text |
| 许可证 | MIT(GitHub API 核实,仓库级声明) |
| GitHub Stars | 401(elevenlabs/skills 合集仓库整体,不代表本子技能个体热度) |
| Forks | 55(同上,合集仓库整体) |
| 最新版本 | 无独立版本号,随仓库滚动更新,本目录最近一次改动为 2026-07-22 |
| 安装方式 | npx skills add elevenlabs/skills 一条命令;或手动克隆复制子目录 |
2. 功能介绍与亮点
ElevenLabs 官方发布的语音转文字技能,基于其 Scribe v2 模型把音频/视频转成文字:
- 90+ 语言支持,可用于批量转录长音频,也可用于字幕生成
- 词级时间戳:为每个词标注起止时间与类型,方便做字幕对轴或二次剪辑
- 说话人分离(diarization):自动区分“谁在什么时候说了什么”,通话录音场景可进一步设置
detect_speaker_roles直接标注“客服/客户”角色;已注册声纹库时还可匹配到具体已知说话人 - 批量与实时两种模式:
scribe_v2面向长音频批量转录,scribe_v2_realtime系列面向低延迟(约 150ms)的实时转录/语音助手场景 - 三种接入方式:Python、JavaScript/TypeScript、cURL 均提供开箱即用的示例代码
- 遵循开放的 Agent Skills 规范(agentskills.io),MIT 开源
3. 适用场景
固定分类:内容创作与知识管理。适用于需要把音频/视频内容转成文字的场景,例如生成视频字幕、转录会议纪要、整理播客/采访录音为文字稿、为通话记录做客服质检等,面向内容创作者、需要处理大量语音素材的知识工作者,以及在自己的 agent 工作流里需要“听写”能力的开发者。
4. 跨 Agent 兼容性
- Claude Code:✅ 原生支持——ElevenLabs 官方博客明确点名“Claude Code 将技能存放在
.claude/skills目录”,并提供通用安装命令 - OpenClaw:✅ 原生支持——SKILL.md front matter 内含专门的
openclawmetadata 字段,声明所需环境变量ELEVENLABS_API_KEY,属官方点名适配 - Codex:❓ 未验证——官方材料只泛称“遵循 Agent Skills 规范,可用于任何兼容的 AI 编码助手”,未点名 Codex,已抓取材料不足以判断
- Hermes Agent:❓ 未验证——已抓取材料未提及
5. 推荐理由
官方 ElevenLabs 出品,一条命令即可让 agent 具备 Scribe v2 级别的语音转文字能力:90+ 语言、说话人分离、词级时间戳一应俱全,把“听录音写文字稿/生成字幕”这类繁琐但高频的内容处理工作,变成可以直接交给 agent 完成的标准化技能。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 合集仓库整体 401 Stars/55 Forks 不计入个体评分;本子目录自身有 30 次提交,是仓库内 6 个同类音频技能中 GitHub 活跃度最高的一个,且有 13 个 issue、36 个 PR 指向该目录,持续到最近一次仓库推送;官方博客专文发布,另有多个第三方 Agent Skills 聚合目录站独立收录索引 |
| 可用性 | 8 | npx skills add elevenlabs/skills 一条命令安装;SKILL.md 与配套安装指南覆盖 Python/JavaScript/cURL 三种接入方式,近日仍在维护;需要配置 ElevenLabs API Key 才能调用,属轻量级前置配置 |
| 安全性 | 8 | 见下方检查清单 |
安全检查清单:
① shell 命令执行——仅涉及标准的 pip install / npm install 包安装命令,无其他 shell 越权操作
② 联网外发——调用 ElevenLabs 官方自有 API(api.elevenlabs.io),属技能核心功能且目标透明,非隐蔽外发
③ 凭据存储——通过标准环境变量 ELEVENLABS_API_KEY 存储,是官方 SDK 的常规做法
④ 无可疑指令——通读 SKILL.md 与安装指南均为标准 API 调用示例,未发现诱导性或数据外发指令
⑤ 作者信誉——ElevenLabs 为知名语音 AI 厂商,仓库归属其官方 GitHub 组织
⑥ License——MIT,仓库级明确声明
⑦ 最近维护——本目录 2026-07-22 有提交,仓库整体 2026-07-30 仍有其他子技能更新,维护活跃
7. 跟同类 Skills 相比的优势
| 竞品 | 定位 | 差异 |
|---|---|---|
| text-to-speech(同仓库姊妹技能) | 把文字合成为逼真语音 | 与本技能方向相反(文字→语音 vs 语音→文字),二者互补,常配合用于“转录-编辑-再合成”的完整音频处理链路 |
| AssemblyAI 官方 assemblyai-skill | AssemblyAI 厂商自有的语音转文字技能 | 仓库尚处早期阶段,缺少 README 与安装说明,尚未形成可直接上手的文档体系 |
| Deepgram 官方 skills | Deepgram 厂商自有的语音转文字技能,附带 Claude Code 插件清单 | 同样处于早期阶段,面向最终用户的使用文档和示例代码不如本技能完整 |
8. 用户评价
该技能目前在第三方平台尚无独立验证的具名用户评价;ElevenLabs 官方博客发布了专门介绍全部六个技能(含本技能)的文章,多个第三方 Agent Skills 聚合目录站也对其做了收录索引,但站上标注的具体安装量等数字未能亲自核实,故不在此引用。
9. 其他补充
同仓库还提供 text-to-speech(文字转语音)、agents(构建对话式语音 AI 代理)、speech-engine(为自有 LLM/聊天机器人加装实时语音对话能力)、music(AI 音乐生成)、sound-effects(文字生成音效)、voice-changer(变声)、voice-isolator(人声分离/降噪)、setup-api-key(引导获取 API Key)等姊妹技能,可按需搭配安装。仓库自带 evals/ 评测目录,可运行触发与功能测试验证技能行为。
10. 安装使用方式
- 通用安装:
npx skills add elevenlabs/skills(安装整个仓库,含全部子技能,agent 按任务描述自动触发对应的一个) - 手动安装:
git clone https://github.com/elevenlabs/skills.git,将speech-to-text目录复制到对应 agent 的 skills 目录 - 配置 API Key:
export ELEVENLABS_API_KEY="your-api-key",也可用同仓库setup-api-key技能引导获取 - 依赖库:Python 用户需
pip install --upgrade elevenlabs;JavaScript/TypeScript 用户需npm install @elevenlabs/elevenlabs-js@latest(注意不要误装已弃用的elevenlabsv1.x 包) - 安装后无需重启即可生效;agent 会根据任务描述(如“把这段录音转成文字”“帮我生成字幕”)自动触发,也可显式提及技能名手动调用
11. 注意事项
- 需要有效的 ElevenLabs API Key 及可用额度,该服务为按量计费的第三方付费服务,是否提供免费额度未验证,如有预算顾虑应先查阅 ElevenLabs 官方定价页
- 依赖公网访问 ElevenLabs API,无法离线使用
- Codex、Hermes Agent 的兼容性尚未验证
- JavaScript 生态需注意区分
@elevenlabs/elevenlabs-js(当前维护)与已弃用的elevenlabsv1.x 包,误装旧包会导致 API 不兼容