1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | diversity-analysis-gptomics-bioskills |
| 项目自述名称 | bioSkills(子技能目录名 microbiome/diversity-analysis) |
| 作者/维护者 | GPTomics(独立生物信息学 AI 实验室) |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/microbiome/diversity-analysis |
| 许可证 | MIT(GitHub API 获取) |
| GitHub Stars / Forks | 1,116 / 193(属整个 bioSkills 合集,561 个子技能共享,不代表本技能个体热度;GitHub API 获取) |
| 最新版本 | 未见独立版本号;该子技能最近一次实质更新于 2026-06-10(GitHub 提交历史获取) |
| 安装方式 | 克隆仓库后运行对应 agent 的安装脚本(见第 10 章) |
2. 功能介绍与亮点
diversity-analysis 是 bioSkills 合集里专门处理扩增子(16S/ITS)群落多样性的技能,覆盖组内丰富度/均匀度(alpha 多样性:observed features、Shannon、Pielou 均匀度、Faith 系统发育多样性)与组间差异(beta 多样性:Bray-Curtis、Jaccard、加权/非加权/广义 UniFrac、Aitchison/RPCA),底层对接 QIIME2 的 core-metrics-phylogenetic、R 的 phyloseq/vegan/picante,以及 Python 的 scikit-bio。
核心亮点是把“一个多样性数值是怎么算出来的”讲透彻:技能明确指出,任何 alpha/beta 多样性数值都是三个前置选择(稀释深度、进化树来源、距离指标)共同决定的输出,而不是群落的直接测量结果。文中逐条拆解三个最容易踩的坑:--p-sampling-depth 会静默丢弃低于该深度的样本且不报警;de novo 建树在短读长数据上拓扑不稳定,应优先用 SEPP 片段插入或 Greengenes2;稀释处理适用于多样性分析但不适用于差异丰度检验。技能正文附带 8 条“常见错误”对照表(触发条件、机制、症状、修复方法)与 13 条文献引用,覆盖 Faith 1992、Lozupone 2005/2007、Chen 2012、Janssen 2018、McMurdie 2014 等该领域的奠基性论文。
3. 适用场景
所属分类:数据分析与可视化。
适用于处理 16S/ITS 扩增子测序数据、需要比较不同样本组间微生物群落丰富度或结构差异的场景:临床队列的肠道菌群对比、环境样本的群落生态学分析、动物模型的微生物组干预效果评估等。目标用户是已具备扩增子分析基础流程(DADA2/QIIME2 出表)、需要在多样性这一步做出可复现且经得起推敲判断的科研人员或数据分析师。
4. 跨 Agent 兼容性
- Claude Code:原生支持——仓库提供
install-claude.sh,可全局或按项目安装,支持按类别选择性安装。 - Codex:原生支持——提供
install-codex.sh,用法与 Claude Code 版一致。 - OpenClaw:原生支持——提供
install-openclaw.sh(含--tool-type-metadata、--dry-run等选项),并可直接从 ClawHub(clawhub.ai/djemec/bioskills)安装。 - Hermes Agent:原生支持——Hermes Agent 官方文档的生物信息学技能网关页面明确将
diversity-analysis列为 microbiome 类目下的具名技能。
(判断依据:均来自实际抓取的仓库 README 安装说明与 Hermes Agent 官方文档页面。)
5. 推荐理由
多样性分析是微生物组研究里最容易“跑一遍代码就出图表、但结论经不起复现检验”的一步——同一份数据换个稀释深度、换棵树、换个指标,显著性说变就变。这个技能把决定结果的隐藏参数摆到台面上,并把每种失效模式的触发条件、识别症状和修复方式都列成表格,比“给一段能跑的 QIIME2 代码”更进一步地降低了误用门槛,对经验尚浅但已上手扩增子分析的用户尤其有价值。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 属合集仓库子技能,不沿用合集整体 1,116 星;该技能被 Hermes Agent 官方生物信息学网关、GoekeLab/awesome-genomic-skills 策展列表等独立第三方渠道收录引用,但缺少子技能自身的量化采用数据 |
| 可用性 | 8 | SKILL.md 含决策树、代码示例(R/Python/CLI 三语言)、常见错误表与版本兼容性说明;依赖 QIIME2/phyloseq/vegan 等既有科研环境,非一键可用;子目录最近一次更新于 2026-06-10,在活跃维护窗口内 |
| 安全性 | 9 | 纯本地计算(调用用户已安装的 QIIME2/R/Python 工具处理本地文件),无联网外发、无需 API Key 或凭据;仓库 MIT 协议、内容公开可审计;未发现可疑指令或混淆代码 |
| 综合 | 8.0 | 三项均值 |
安全检查清单:①Shell 命令均为本地 QIIME2/R/Python 调用,权限范围与用途明确匹配;②运行时不联网、不外发数据;③不要求 API Key 或任何凭据;④SKILL.md 及示例代码未发现可疑指令或 prompt injection 迹象;⑤作者 GPTomics 为独立实验室,仓库提交历史清晰、主要贡献者身份可查,无刷量或造假迹象;⑥License 为 MIT,明确;⑦仓库最近提交为 2026-07-25,子目录本身最近提交为 2026-06-10,维护活跃。
7. 跟同类 Skills 相比的优势
| 技能 | 定位 | 与本技能的差异 |
|---|---|---|
| dia-analysis(同合集,proteomics) | 处理 DIA 质谱蛋白组学数据的肽段/蛋白鉴定与定量 | 面向完全不同的组学数据类型(质谱蛋白而非扩增子测序),处理的是“如何从原始信号识别蛋白”而非“如何量化群落结构” |
| mofa-integration(同合集,multi-omics-integration) | 用 MOFA2 做跨组学(转录组/蛋白组/甲基化)无监督因子分解 | 关注多组学层面共享的潜在变异轴,而非单一微生物群落数据本身的组成差异 |
| flux-balance-analysis(同合集,systems-biology) | 基于基因组尺度代谢模型做通量平衡分析预测生长表型 | 是计算建模/模拟工具,预测代谢网络行为,而非对实测群落数据做统计描述 |
| spatial-deconvolution(同合集,spatial-transcriptomics) | 从空间转录组数据反卷积每个采样点的细胞类型组成 | 处理空间单细胞/组织尺度的细胞类型构成问题,应用场景与数据类型均不同 |
| kegg-pathways(同合集,pathway-analysis) | 用 KEGG 通路库做富集分析与信号通路拓扑扰动评分 | 面向基因列表/排序向量到通路数据库的映射,是功能注释类分析,不涉及样本间群落结构比较 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。GPTomics 发布过基于 Bio-Task Bench 数据集的 bioSkills 整体评估报告(bioskills_eval_20260328.pdf),但该报告针对整个合集,未见针对本技能的独立评测数据。
9. 其他补充
bioSkills 合集共 561 个技能覆盖 63 个类别,microbiome 类目下还包含扩增子处理(amplicon-processing)、分类学注释(taxonomy-assignment)、组间差异丰度检验(differential-abundance)、功能预测(functional-prediction)与 QIIME2 全流程编排(qiime2-workflow),可与本技能配套使用。
10. 安装使用方式
git clone git@github.com:GPTomics/bioSkills.git
cd bioSkills
# Claude Code(全局安装,或按类别只装 microbiome)
./install-claude.sh
./install-claude.sh --categories "microbiome"
# Codex
./install-codex.sh --categories "microbiome"
# OpenClaw(或直接从 ClawHub 安装)
./install-openclaw.sh --categories "microbiome"
安装后需确保本机已配置 QIIME2、R(phyloseq/vegan/picante/GUniFrac)与/或 Python scikit-bio 环境;技能本身只提供分析指导与代码模板,不代为安装这些科研计算依赖。安装完成后无需重启,直接在对话中描述多样性分析需求即可触发。
11. 注意事项
- 使用前需已具备 ASV/OTU 群落表及配套系统发育树(该技能不负责从原始测序数据生成这些输入,上游步骤见 amplicon-processing)。
- 依赖 QIIME2、R、Python 科研计算栈,配置门槛高于纯提示词类技能,适合已有生物信息学分析环境的用户。
- 涉及散粒(shotgun)宏基因组数据(而非扩增子)的多样性分析不在本技能范围内,需改用同合集的 metagenomics 相关技能。