SkillsScout
CONTENT-KNOWLEDGE / 内容创作与知识管理

speech-to-text-elevenlabs-skills

收录日期 2026-08-01·来源仓库 ↗
受欢迎程度
7
可用程度与相关性
8
安全性
8
7.7SCOUT SCORE

1. 基本信息

项目 内容
名称 speech-to-text(合集仓库 elevenlabs/skills 子技能)
作者/维护者 ElevenLabs(语音 AI 厂商,官方 GitHub 组织)
来源链接 https://github.com/elevenlabs/skills/tree/main/speech-to-text
许可证 MIT(GitHub API 核实,仓库级声明)
GitHub Stars 401(elevenlabs/skills 合集仓库整体,不代表本子技能个体热度)
Forks 55(同上,合集仓库整体)
最新版本 无独立版本号,随仓库滚动更新,本目录最近一次改动为 2026-07-22
安装方式 npx skills add elevenlabs/skills 一条命令;或手动克隆复制子目录

2. 功能介绍与亮点

ElevenLabs 官方发布的语音转文字技能,基于其 Scribe v2 模型把音频/视频转成文字:

3. 适用场景

固定分类:内容创作与知识管理。适用于需要把音频/视频内容转成文字的场景,例如生成视频字幕、转录会议纪要、整理播客/采访录音为文字稿、为通话记录做客服质检等,面向内容创作者、需要处理大量语音素材的知识工作者,以及在自己的 agent 工作流里需要“听写”能力的开发者。

4. 跨 Agent 兼容性

5. 推荐理由

官方 ElevenLabs 出品,一条命令即可让 agent 具备 Scribe v2 级别的语音转文字能力:90+ 语言、说话人分离、词级时间戳一应俱全,把“听录音写文字稿/生成字幕”这类繁琐但高频的内容处理工作,变成可以直接交给 agent 完成的标准化技能。

6. 评分

维度 分数 说明
受欢迎程度 7 合集仓库整体 401 Stars/55 Forks 不计入个体评分;本子目录自身有 30 次提交,是仓库内 6 个同类音频技能中 GitHub 活跃度最高的一个,且有 13 个 issue、36 个 PR 指向该目录,持续到最近一次仓库推送;官方博客专文发布,另有多个第三方 Agent Skills 聚合目录站独立收录索引
可用性 8 npx skills add elevenlabs/skills 一条命令安装;SKILL.md 与配套安装指南覆盖 Python/JavaScript/cURL 三种接入方式,近日仍在维护;需要配置 ElevenLabs API Key 才能调用,属轻量级前置配置
安全性 8 见下方检查清单

安全检查清单: ① shell 命令执行——仅涉及标准的 pip install / npm install 包安装命令,无其他 shell 越权操作 ② 联网外发——调用 ElevenLabs 官方自有 API(api.elevenlabs.io),属技能核心功能且目标透明,非隐蔽外发 ③ 凭据存储——通过标准环境变量 ELEVENLABS_API_KEY 存储,是官方 SDK 的常规做法 ④ 无可疑指令——通读 SKILL.md 与安装指南均为标准 API 调用示例,未发现诱导性或数据外发指令 ⑤ 作者信誉——ElevenLabs 为知名语音 AI 厂商,仓库归属其官方 GitHub 组织 ⑥ License——MIT,仓库级明确声明 ⑦ 最近维护——本目录 2026-07-22 有提交,仓库整体 2026-07-30 仍有其他子技能更新,维护活跃

7. 跟同类 Skills 相比的优势

竞品 定位 差异
text-to-speech(同仓库姊妹技能) 把文字合成为逼真语音 与本技能方向相反(文字→语音 vs 语音→文字),二者互补,常配合用于“转录-编辑-再合成”的完整音频处理链路
AssemblyAI 官方 assemblyai-skill AssemblyAI 厂商自有的语音转文字技能 仓库尚处早期阶段,缺少 README 与安装说明,尚未形成可直接上手的文档体系
Deepgram 官方 skills Deepgram 厂商自有的语音转文字技能,附带 Claude Code 插件清单 同样处于早期阶段,面向最终用户的使用文档和示例代码不如本技能完整

8. 用户评价

该技能目前在第三方平台尚无独立验证的具名用户评价;ElevenLabs 官方博客发布了专门介绍全部六个技能(含本技能)的文章,多个第三方 Agent Skills 聚合目录站也对其做了收录索引,但站上标注的具体安装量等数字未能亲自核实,故不在此引用。

9. 其他补充

同仓库还提供 text-to-speech(文字转语音)、agents(构建对话式语音 AI 代理)、speech-engine(为自有 LLM/聊天机器人加装实时语音对话能力)、music(AI 音乐生成)、sound-effects(文字生成音效)、voice-changer(变声)、voice-isolator(人声分离/降噪)、setup-api-key(引导获取 API Key)等姊妹技能,可按需搭配安装。仓库自带 evals/ 评测目录,可运行触发与功能测试验证技能行为。

10. 安装使用方式

11. 注意事项