1. 基本信息
| 项目 | 内容 | 数据来源 |
|---|---|---|
| 名称 | airunway-aks-setup-microsoft-azure-skills | — |
| 项目自述名称 | AI Runway AKS Setup | SKILL.md |
| 作者/维护者 | Microsoft(Azure Skills Plugin 团队) | GitHub API |
| 来源链接 | https://github.com/microsoft/azure-skills/tree/main/skills/airunway-aks-setup | — |
| 许可证 | MIT | GitHub API |
| GitHub Stars / Forks | 1,465 / 245(合集仓库整体,非该子技能单独数据) | GitHub API |
| 最新版本 | 1.1.1(SKILL.md metadata) | SKILL.md |
| 安装方式 | APM 统一安装 / 各 Agent 插件市场(见第 10 章) | 官方文档 |
2. 功能介绍与亮点
该技能引导 agent 把一个已有的 Azure Kubernetes Service(AKS)集群,从裸集群一步步搭建成可运行开源大模型推理服务的平台——底层依托的是微软 2026 年 KubeCon 上发布的 AI Runway:一套面向推理工作负载的通用 Kubernetes API,附带 HuggingFace 模型目录集成、GPU 显存适配指示与实时成本估算。
流程分六步:集群校验(节点清单、GPU 检测)→ 安装 AI Runway 控制器与 CRD → GPU 硬件评估(识别显卡型号、标记 dtype/attention 机制限制)→ 选择并安装推理提供方(KAITO / Dynamo / KubeRay)→ 首次模型部署 → 汇总与冒烟测试。
核心亮点:
- 按硬件自动匹配推理方案:根据检测到的 GPU 显存给出模型与量化建议(如纯 CPU 用 GGUF 量化的 Gemma-3-1B,单张 T4 用 Phi-3-mini,4×A100 80GB 用 Llama-3.1-70B 张量并行),避免用户凭猜测选错模型规格导致部署失败
- 成本与操作双重确认:正文开头即提示 GPU 节点池费用(A100-80GB 每小时 3–5 美元以上),要求在用户明确知情后才继续;任何安装或部署动作都需用户逐步确认,不会静默执行
- 凭据处理规范:HuggingFace 访问令牌通过交互式无回显输入读取、写入权限受限的临时文件后立即用于创建 Kubernetes Secret 并清理,不落入 shell 历史
- 支持断点续跑:可用
skip-to-step N从任意步骤恢复一次中断的设置过程,并配有分步骤的错误处理对照表(控制器崩溃、供应商未就绪、模型部署卡住等) - 该子目录最近一次提交为 2026-07-28(约 6 周前),随插件仓库的自动同步机制持续更新
3. 适用场景
所属分类:DevOps 与基础设施
适用于以下人群:
- 已有 Azure Kubernetes 集群、需要把开源大模型部署为可用推理服务的开发者与运维人员
- 希望在自建 Kubernetes 环境里对比 KAITO / Dynamo / KubeRay 等推理运行时、而非直接锁定某个托管模型服务的团队
- 需要在部署前就摸清 GPU 硬件与模型规格是否匹配(避免显存不足或量化方式选错)的场景
- 教学或预算有限、希望先用纯 CPU 环境跑通 ModelDeployment 抽象再上 GPU 的学习场景
4. 跨 Agent 兼容性
| Agent | 结论 | 依据 |
|---|---|---|
| Claude Code | 原生支持 ✅ | 官方在 Claude Code 插件市场直接提供安装(/plugin install azure@claude-plugins-official) |
| Codex | 原生支持 ✅ | 官方提供 Codex CLI 插件市场安装(codex plugin marketplace add microsoft/azure-skills),并可在 Codex 内通过 /plugins 单独安装/启停 |
| OpenClaw | 未验证 | 官方渠道列出的是 GitHub Copilot、Cursor、Gemini CLI、IntelliJ IDEA 及经 APM 统一安装支持的 “OpenCode”(与 OpenClaw 为不同项目),未见 OpenClaw 相关说明 |
| Hermes Agent | 未验证 | 官方渠道未提及 |
5. 推荐理由
在 Kubernetes 上跑大模型推理,本来要自己拼凑 GPU 调度、Operator 选型、模型量化与显存匹配这几件事,任何一步判断错误都可能导致部署失败或资源浪费。这个技能把这条路径封装成一个从裸集群到可用模型服务的引导流程:先摸清集群与 GPU 现状,再按硬件给出量化匹配的模型与运行时建议,全程在关键操作前显式确认成本与风险。对已经在用 AKS、想把开源模型接进现有 Kubernetes 生态而不是另外接入一个托管推理产品的团队,这提供了一条比手写 YAML 更不容易踩坑的现成路径。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | Microsoft 官方团队维护;所属插件仓库整体 1,465 星/245 fork,该数字属于整个合集,不代表本技能自身热度;其底层 AI Runway 技术 2026 年 3 月在 KubeCon 上公开发布并获科技媒体报道,但该技能本身目前无独立于合集之外的第三方引用或讨论数据 |
| 可用性 | 8 | 主文档结构清晰、含分步骤参考文档与错误处理对照表,支持断点续跑,最近一次更新约 6 周前维护活跃;但前提是已有 AKS 集群(若没有需先用同仓库 azure-kubernetes 技能搭建)且需要 kubectl/make 等工具链就绪,未达到“复制即用”的 9–10 档 |
| 安全性 | 9 | 见下方安全检查清单 |
安全检查清单:
| 检查项 | 结果 |
|---|---|
| ① Shell/权限范围 | 执行 kubectl、make 等命令,范围限定在用户自己的 Kubernetes 集群资源上;任何安装或部署动作前都要求用户逐步确认,不会静默执行 |
| ② 运行时联网外发 | 仅拉取用户指定的开源模型权重(如 HuggingFace)与官方文档,无第三方数据外发 |
| ③ 凭据处理 | HuggingFace 令牌通过交互式无回显输入读取、写入权限受限(chmod 600)的临时文件、用完即经 trap 清理,不写入 shell 历史,处理方式规范 |
| ④ 可疑指令 | 未发现注入迹象 |
| ⑤ 作者信誉 | Microsoft 官方仓库维护 |
| ⑥ License | MIT,明确 |
| ⑦ 维护时间 | 该子目录最近一次提交约 6 周前,维护活跃 |
综合评分:8.00(三项均值)
7. 跟同类 Skills 相比的优势
| 方案 | 定位 | 与本技能的差异 |
|---|---|---|
| azure-kubernetes(同仓库姊妹技能) | 从零搭建/配置 AKS 集群本身(节点池、网络、身份等基础设施层) | 解决的是“有没有集群”;本技能解决的是“集群已经有了,怎么在上面跑起模型推理”,两者是前后衔接关系而非重叠——本技能的前置条件之一就是先用它建好集群 |
| 手写 Kubernetes YAML + Helm Chart 部署推理服务(业界通用做法) | 自行编写 Deployment/Service 清单,手动选择推理框架与量化方式 | 需要使用者自己判断 GPU 显存与模型规格是否匹配、自行排查 AMQP/调度类故障;本技能把这些判断封装成按检测结果自动匹配的推荐表,并内置常见故障对照表 |
| 云厂商托管推理服务(如直接调用云端托管的大模型 API) | 不需要自建 Kubernetes 推理层,按调用量付费 | 更省心但模型选择与部署方式被托管方限定;本技能面向想保留模型选型自由度、且已经在自建 Kubernetes 环境里运行其他工作负载、不想额外接入托管服务的团队 |
8. 用户评价
该技能目前在第三方平台尚无独立具名用户评价。其底层依托的 AI Runway 技术于 2026 年 3 月在 KubeCon 大会上公开发布,获得科技媒体报道;技能本身已被多个第三方 agent skill 聚合目录收录展示。
9. 其他补充
该技能所属的 Azure Skills Plugin 同时提供 Azure MCP Server 与 Foundry MCP,三者打包安装;插件支持 APM、GitHub Copilot CLI、VS Code、Claude Code、Gemini CLI、Cursor、Codex CLI、IntelliJ IDEA 共 8 种安装渠道。本技能所依托的 KAITO(Kubernetes AI Toolchain Operator)已进入 CNCF Sandbox,是 AI Runway 支持的推理运行时之一,另两种为 NVIDIA Dynamo 与 KubeRay。
10. 安装使用方式
- APM(跨多个 Agent 一次安装):
apm install microsoft/azure-skills - Claude Code:
/plugin install azure@claude-plugins-official,或运行/plugin在插件市场搜索 “azure” - Codex CLI:先
codex plugin marketplace add microsoft/azure-skills添加市场,再通过/plugins安装azure - GitHub Copilot CLI:
/plugin marketplace add microsoft/azure-skills后/plugin install azure@azure-skills - Gemini CLI:
gemini extensions install https://github.com/microsoft/azure-skills - Cursor / IntelliJ IDEA:通过对应插件市场搜索 “Azure” 安装
安装后注意事项:需要已有 AKS 集群并配置好 kubectl 上下文;需要 make 命令行工具用于控制器与推理提供方的安装;如部署 Llama 系列等受限模型,需提前准备好 HuggingFace 访问令牌;无需重启 Agent,安装完成后用自然语言描述需求(如“帮我在这个集群上部署一个模型”)即可触发。
11. 注意事项
- 使用前提是已有可用的 AKS 集群,本技能本身不负责从零创建集群(需先用同仓库
azure-kubernetes技能) - GPU 节点池会产生显著的计算费用(如 A100-80GB 每小时 3–5 美元以上),部署前需自行核实预算
- 大模型(13B 以上)下载权重耗时可能远超 10 分钟,70B 级别模型视网络情况可能需要 20–40 分钟以上
- OpenClaw 与 Hermes Agent 的支持情况官方未提及,实际可用性未经验证