1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | iflytek-pdf-image-ocr-iflytek-ifly-skills |
| 作者/维护者 | iFLYTEK(讯飞) |
| 来源链接 | https://github.com/iflytek/iFly-Skills/tree/main/skills/iflytek-pdf-image-ocr |
| 许可证 | Apache-2.0(GitHub API) |
| GitHub Stars | 211(所属合集仓库整体数字,GitHub API;不代表本技能单独热度) |
| Forks | 27(合集仓库整体,GitHub API) |
| 最新版本 | v1.0.0(技能自带 _meta.json 标注;仓库未发布正式 GitHub Release) |
| 安装方式 | 克隆仓库取子目录,或通过 iFLYTEK Skillhub / ClawHub / Skills.sh 等第三方技能市场安装 |
2. 功能介绍与亮点
这是讯飞官方 OCR 能力的技能封装,覆盖两类识别任务:
- 图片 OCR:基于讯飞大模型的图像文字识别,支持多语言文本提取、版面结构保留、自动纠偏与降噪,输出 JSON 或 Markdown。
- PDF 文档 OCR:将 PDF 批量转换为 Word、Markdown 或 JSON,单份文档最多支持 100 页,可逐页取回结果,也支持直接传入公网 PDF 链接而无需先下载。
亮点:官方一手出品,认证流程(HMAC-SHA256 / MD5+HMAC-SHA1 双签名机制)、任务状态机、错误码表均在 SKILL.md 中逐条列出,文档详尽到可直接排障;含数学公式文档转 Markdown 的专门提示。
3. 适用场景
固定分类:文档与办公自动化
- 行政、财务等岗位需要把扫描件、拍照文档批量数字化为可编辑 Word 或 Markdown
- 需要从各类图片(截图、照片、扫描页)中提取结构化文字的场景
- 含数学公式的技术文档、论文转换为 Markdown 保留排版
4. 跨 Agent 兼容性
| Agent | 结论 | 依据 |
|---|---|---|
| Claude Code | ✅ 原生支持 | 标准 SKILL.md 格式,可直接放入 skills 目录 |
| OpenClaw | ✅ 原生支持 | metadata 中显式含 openclaw 字段(emoji/dimensions/user_instructions/所需环境变量) |
| Codex | ⚠️ 需适配 | 需手动放入 .codex/skills/ 目录,无官方一键安装脚本 |
| Hermes Agent | ⚠️ 需适配 | Hermes 官方要求 front matter 显式含 name/description/version 三字段,而本技能 version 只出现在 _meta.json,front matter 中缺失 |
5. 推荐理由
官方开箱即用的图片与 PDF OCR 能力,直接解决“纸质/图片文档数字化”这一高频办公需求;认证流程、任务轮询、错误码全部有文档可查,遇到问题能自行排查,而不是靠猜。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | iFLYTEK 官方出品;所属合集仓库整体 211 stars,该数字属整个合集,不代表本技能自身热度;经检索未发现独立第三方讨论 |
| 可用性 | 8 | 一条命令即可运行;需配置讯飞开放平台的 API 凭据(APP_ID/API_KEY/API_SECRET);文档含完整参数表、认证步骤与错误码对照;最近一次提交 2026-08-11,维护活跃 |
| 安全性 | 8 | 见下方检查清单 |
安全检查清单:
① Shell 命令:仅执行本地 Python 脚本调用讯飞 API,范围明确、可审计 ② 联网外发:连接讯飞官方 OCR 端点(iocr.xfyun.cn),目标单一透明 ③ 凭据:APP_ID/API_KEY/API_SECRET 通过环境变量传入,标准做法 ④ SKILL.md 与脚本中未发现可疑指令 ⑤ 讯飞是国内领先的 AI/语音技术厂商,无造假迹象 ⑥ License 明确(Apache-2.0) ⑦ 最近维护时间近(6 天前有提交),弃置风险低
7. 跟同类 Skills 相比的优势
| 技能 | 定位 | 与本技能的差异 |
|---|---|---|
| pdf(Anthropic 官方) | PDF 表单填写、合并/拆分、加密、图片抽取等通用 PDF 操作 | 不含扫描件/图片的 OCR 文字识别能力,面向“已是数字文本”的 PDF 操作 |
| iflytek-ocr-invoice(同合集姊妹技能) | 专门识别发票等票据类型,输出结构化字段 | 面向票据这一垂直场景,本技能面向通用图片与 PDF 文档,覆盖面更广但不做票据字段级结构化 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
9. 其他补充
仓库提供中英双语 README,并同步分发至 iFLYTEK Skillhub、ClawHub、Skills.sh、腾讯云 SkillHub、SkillsMP、LobeHub 等多个第三方技能市场。
10. 安装使用方式
- 克隆仓库并复制子目录到你的 agent 技能目录:
或通过 iFLYTEK Skillhub / ClawHub / Skills.sh 等注册表直接安装。git clone https://github.com/iflytek/iFly-Skills.git cp -r iFly-Skills/skills/iflytek-pdf-image-ocr ~/.claude/skills/ - 前往讯飞开放平台控制台注册应用,获取
APP_ID、API_KEY、API_SECRET,并设置为环境变量。 - 安装 Python 依赖
requests(唯一第三方依赖)。 - 调用示例:
python3 scripts/image_ocr.py /path/to/image.jpg --format markdown python3 scripts/pdf_ocr.py document.pdf --format word
11. 注意事项
- PDF 单份最多支持 100 页;加密/密码保护的 PDF 不支持
- 认证签名要求本地时间戳与服务器时间误差在 ±5 分钟内
- 讯飞官方仓库中不同子技能的环境变量前缀尚不统一(本技能用
IFLY_*,部分姊妹技能用XFYUN_*或XFEI_*);本技能自身文档内部一致,仅在同时安装多个讯飞技能时需留意 - 需要讯飞云服务账号及相应调用额度,非完全免费;额度或授权不足会返回明确错误码