1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | prompt-injection(UnitOneAI/SecuritySkills 合集内子技能) | — |
| 作者/维护者 | UnitOneAI(GitHub 组织账号,署名 unitoneai) |
GitHub API |
| 来源链接 | https://github.com/UnitOneAI/SecuritySkills/tree/main/skills/ai-security/prompt-injection | — |
| 许可证 | MIT | GitHub API |
| GitHub Stars / Forks | 45 / 129(整仓库数字,合集仓库整体热度,不代表本子技能个体热度) | GitHub API |
| 最新版本 | SKILL.md frontmatter 标注 1.0.2,仓库未发布正式 Release |
GitHub API |
| 安装方式 | 复制子技能目录到对应 agent 的 skills 目录(详见第 10 章) | 仓库 README |
项目自述名称:仓库整体标题为「Security Skills for AI Coding Agents」(UnitOneAI/SecuritySkills),prompt-injection 是其中一个独立的子技能目录。
2. 功能介绍与亮点
prompt-injection 对 LLM 集成应用做结构化的提示词注入漏洞评估,对齐 OWASP LLM01:2025(Prompt Injection) 与 MITRE ATLAS AML.T0051。正文按六个步骤展开:① 梳理 LLM 交互面(用户输入通道、外部内容源、系统提示词组装方式、工具/插件接口、多轮上下文);② 识别直接注入向量(提示词拼接模式、指令边界强度、多轮注入、参数注入);③ 识别间接注入向量(RAG 管道输入、邮件/消息集成、网页抓取、数据库记录、文件上传、第三方 API 响应);④ 按目标劫持、提示词泄露、权限提升、数据外泄、越狱五类逐项测试;⑤ 评估输入校验、权限分离、人工确认、输出过滤、金丝雀 token、指令层级等防御措施;⑥ 产出含严重度分级(Critical/High/Medium/Low/Informational)的结构化评估报告模板。
区别于泛化的安全清单,本技能专门针对“自适应攻击”辟出独立章节,引用 2026 年最新研究(PISmith 强化学习优化的黑盒注入攻击)说明静态防御(硬编码系统提示词、简单关键词过滤)已不足以应对,并给出 InjecAgent、AgentDojo 等面向 agentic 场景的评测基准供持续红队测试参考。全文引用 Perez & Ribeiro (2022)、Greshake et al. (2023) 等原始研究论文界定直接/间接注入的学术定义,而非停留在泛泛而谈。
正文含独立的安全声明章节,明确本技能仅用于对自己拥有或已获授权的应用做防御性测试,不提供针对第三方系统的攻击指导;并标注 injection-hardened: true。
3. 适用场景
所属分类:安全与合规。
适用于开发或安全团队在 LLM 应用(尤其是接入 RAG 管道、处理外部内容、或让 LLM 调用工具产生副作用的 agentic 应用)上线前或架构评审阶段,系统排查提示词注入风险;也适用于持续红队测试环节,对照 OWASP LLM01 与 MITRE ATLAS 生成可追踪的漏洞发现清单。不适用于对第三方系统发起未授权的实际攻击测试——技能正文明确要求先获得授权。
4. 跨 Agent 兼容性
- Claude Code:原生支持——技能以标准
SKILL.md目录格式提供,README 明确标注支持自动发现(cp -r skills/*/* ~/.claude/skills/)。 - Codex:支持——README 提供 Codex CLI 专用调用示例(
codex --context skills/ai-security/prompt-injection/SKILL.md "...")。 - OpenClaw:支持——README 明确将 OpenClaw 列为兼容宿主之一,采用同一份
SKILL.md文件加载。 - Hermes Agent:未验证——仓库文档未提及 Hermes Agent,未检索到相关证据。
5. 推荐理由
多数通用安全审计技能把“提示词注入”仅作为 OWASP LLM Top 10 清单里的一项一带而过,而 prompt-injection 把这一单一漏洞类别拆成六个可执行步骤的深度评估流程,覆盖直接与间接两种注入路径、五类具体攻击场景与七项防御措施的逐条核验,并把“自适应攻击下静态防御失效”这一 2026 年才成为共识的前沿问题显式写入正文、引用具体研究与评测基准。对于正用 Claude Code、Codex 等工具构建 LLM/RAG/agentic 应用的团队,这是一份可以直接拿来对着自己的应用逐项自查的深度参考,而不是需要自己再展开的一句话清单条目。全文只读、无外联、无凭据索取。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 5 | 所属仓库 UnitOneAI/SecuritySkills 为新兴安全团队维护的开源项目(45 Stars/129 Forks/MIT 许可证),非广为人知的一线厂商或专业机构;专门检索未找到本子技能独立于母仓库的第三方讨论、市场收录或安装量数据 |
| 可用性 | 9 | 单个 SKILL.md 文件(约 20KB、298 行)即为完整安装单元,六步流程逐项展开,含交互面清单、测试类别表、防御评估清单、严重度分级表与输出模板;仓库为 Claude Code/Codex CLI/OpenClaw 分别给出安装方式;该文件最近一次实质提交为 2026-06-16,距今约 8 周 |
| 安全性 | 9 | frontmatter 声明 allowed-tools: Read, Grep, Glob,无 shell 执行、无写入、无联网工具;正文明确声明仅用于已授权的防御性测试,不提供攻击第三方系统的指导;MIT 许可证明确;作者为可查证的 GitHub 组织账号,无主动造假迹象 |
综合评分:7.67(三项均值)
安全检查清单:
① 仅声明 Read/Grep/Glob 只读工具权限,无 shell 命令执行能力
② 不联网外发数据
③ 不涉及任何 API Key 或凭据索取
④ 全文未见可疑指令或混淆代码;正文的“测试类别”章节均以“评估应用是否易受该风险影响”为表述框架,未见教唆攻击第三方系统的内容
⑤ 作者为新兴安全团队,信誉一般,无主动造假迹象
⑥ MIT 许可证明确
⑦ 该文件最近一次实质提交 2026-06-16,距今约 8 周,维护尚属近期
7. 跟同类 Skills 相比的优势
| 技能 | 定位 | 与本技能的差异 |
|---|---|---|
| llm-top-10-unitoneai-securityskills(同仓库) | 对照 OWASP LLM Top 10 全部十类风险逐类给出检测方法与修复建议的清单式技能 | 广度优先,提示词注入只是其中一类、每类展开有限;本技能反过来只做提示词注入这一类,但拆到六步方法论、五种攻击场景与自适应攻击对策的深度 |
| claude-code-owasp(agamm/claude-code-owasp) | 对照 2026 Agentic AI Security 标准做通用只读代码安全评审,覆盖面向所有 OWASP 风险类别 | 定位是“平时写代码时的常驻安全评审”,覆盖面广但单一风险类别的方法论较浅;本技能定位是“LLM 应用上线前或红队测试时”的专项深挖,两者可搭配使用 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
9. 其他补充
仓库同时提供了 45 个同风格的安全技能,按 appsec/ai-security/cloud/compliance/devsecops/identity/incident-response/network/secops/vuln-management 十个领域分类组织,prompt-injection 隶属于 ai-security 领域,同领域内还有 llm-top-10、agentic-top-10、model-supply-chain、agent-security 等姊妹技能。
10. 安装使用方式
Claude Code(全局安装)
git clone https://github.com/UnitOneAI/SecuritySkills.git
cp -r SecuritySkills/skills/ai-security/prompt-injection ~/.claude/skills/
安装后可通过自然语言触发(如“帮我评估这个 RAG 应用有没有提示词注入风险”)或直接调用 /prompt-injection [target-file-or-directory]。
Codex CLI
codex --context skills/ai-security/prompt-injection/SKILL.md "评估这段代码处理的外部内容是否存在提示词注入风险"
其他宿主(OpenClaw 等):将对应 agent 指向 prompt-injection/SKILL.md 文件路径即可加载,具体挂载方式见各宿主自身文档。
安装后无需重启,首次调用即可生效;无付费依赖。
11. 注意事项
- 技能自身在“局限性”章节说明:产出结果依赖可获得的代码、配置、日志、文档与用户提供的上下文,证据缺失、仅存在于运行时或超出评审范围时,无法证明控制确实存在或威胁确实不存在,发现项应视为待验证假设。
- 技能不会实际执行注入攻击或调用外部工具验证漏洞,纯粹基于用户提供的材料做静态评审。
- 该子技能背后的母仓库尚缺乏长期维护记录与外部社区反馈,建议持续关注后续版本更新。