1. 基本信息
| 字段 | 内容 | 数据来源 |
|---|---|---|
| 名称 | selection-statistics-gptomics-bioskills | — |
| 作者/维护者 | GPTomics | GitHub API |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/population-genetics/selection-statistics | — |
| 许可证 | MIT(整仓库统一许可) | GitHub API |
| GitHub Stars | 1,126(合集仓库整体;不代表本技能个体热度,见下方评分说明) | GitHub API |
| Forks | 193(合集仓库整体) | GitHub API |
| 最新版本 | 无独立版本号,随仓库滚动更新;该子目录最近一次提交 2026-06-14 | GitHub API |
| 安装方式 | 仓库自带多平台安装脚本 / OpenClaw ClawHub / Hermes 官方网关 / LobeHub 第三方市场 | GitHub 仓库、Hermes 网关文档、LobeHub |
2. 功能介绍与亮点
该技能面向“在群体基因组数据中扫描自然选择信号”这一任务,系统性覆盖三大类统计量:
- 位点频谱(SFS)检验:Tajima’s D、Fay & Wu H、Zeng E,以及基于复合似然比的 SweepFinder2 CLR;
- 单倍型检验:iHS、nSL(检测未固定的进行中清除)、XP-EHH、Rsb(检测已固定清除)、H12(检测软清除);
- 群体分化:FST(Hudson / Weir-Cockerham 两种估计量)与三群体的 PBS。
核心亮点是把“没有任何单一统计量能在单个位点上把自然选择和群体历史(瓶颈、扩张、群体结构)区分开”这一方法论共识,转化为可执行的工程约束:要求按基因组尺度的经验分位数取异常值、交叉验证多个正交信号、并用人口统计学模型模拟校准,而不是套用固定阈值。正文附有工具选型决策树、逐统计量的失败模式表(触发条件/机制/症状/修复)、定量阈值参考表,以及 15 篇带 DOI 的学术文献支撑(Tajima 1989、Voight 2006、Sabeti 2007、DeGiorgio 2016 等选择性清除领域的经典与近年方法论文献)。
3. 适用场景
所属分类:数据分析与可视化(对群体基因组数据执行统计计算与结果解读,与库内同类的群体遗传学/变异分析技能同属一类)。
适用于:处理全基因组测序或基因型芯片数据、需要执行选择性清除扫描的群体遗传学与进化生物学研究者;在 1000 Genomes 或同类队列数据上运行 iHS/XP-EHH/FST 分析的生物信息学工程师;以及需要避免“用固定 D<-2 判定清除”“iHS 与 XP-EHH 标准化方法搞混”“单外群极化伪造信号”等常见方法学错误的初中级用户。
4. 跨 Agent 兼容性
| Agent | 支持情况 | 依据 |
|---|---|---|
| Claude Code | 原生支持 | 仓库提供 install-claude.sh,支持全局/项目/按分类安装 |
| Codex | 原生支持 | 仓库提供 install-codex.sh,用法与 Claude Code 版本一致 |
| OpenClaw | 原生支持 | 仓库提供专用 install-openclaw.sh;亦可直接经 ClawHub(clawhub.ai/djemec/bioskills)安装 |
| Hermes Agent | 原生支持 | Hermes 官方生物信息学技能网关文档在“Population Genetics & GWAS”类目下按名列出 selection-statistics,用户经 hermes skills install official/research/bioinformatics 安装该网关后可直接取用 |
5. 推荐理由
它把选择性清除扫描领域“没有万能统计量”这一共识,拆解成场景决策树、标准化陷阱清单与失败模式表,帮助使用者在 iHS/nSL/XP-EHH/FST 等一组容易互相混淆的工具间做出正确选择,并规避未标准化、绝对阈值、极化偏差等真实存在的方法学错误。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | GPTomics 为专注生物信息学技能的小型专业团队,非广为人知的一线厂商;该子技能被 Hermes Agent 官方生物信息学网关在“Population Genetics & GWAS”类目按名收录并直链源仓库,且在 LobeHub 第三方技能市场拥有独立收录页,构成技能自身可查证的独立第三方证据(合集仓库 1,126 星为整仓库共享数字,不计入本技能个体热度) |
| 可用性 | 8 | 文档详实(工具分类表 + 场景决策树 + 逐统计量失败模式表 + 定量阈值表 + 15 篇学术引用),该路径近期仍有独立提交(最近一次 2026-06-14,约两个月前);但需额外安装 scikit-allel、selscan、SweepFinder2 等外部工具并准备分相单倍型数据,非纯复制即用 |
| 安全性 | 9 | 全文仅为本地 Python/CLI 代码模式,未见任何网络外发、API Key 索取或可疑指令,MIT 许可证明确 |
安全检查清单:①仅调用本地 CLI 工具(selscan、SweepFinder2、norm)与 Python 库,无远程代码执行 ②运行时不联网外发数据,全部为本地文件读写 ③不涉及任何 API Key 或凭据索取 ④全文未见可疑指令或混淆代码 ⑤作者信誉一般,为专业领域技能维护团队 ⑥MIT 许可证明确 ⑦该子目录约两个月前仍有提交,维护活跃。
综合评分 = 三项均值 = 8.0。
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
| PLINK / scikit-allel 官方文档 | 工具自身的命令与 API 参考 | 只是工具文档,不是可安装的 agent skill;不包含标准化陷阱、失败模式表与场景决策树等封装知识 |
| population-structure(同仓库姊妹技能) | 群体结构推断:PCA、ADMIXTURE、FST、f 统计量 | 回答“这个群体的遗传结构是什么”;本技能回答“这个位点是否经历了自然选择”,二者是同一分析流水线上的互补环节而非功能重叠 |
| genomic-variant-interpretation 类临床变异解读技能 | 单变异层面的致病性/临床意义判读 | 面向临床变异分类,不涉及群体层面的选择性清除扫描与人口统计学校准 |
8. 用户评价
该技能目前在第三方平台尚无具名文字评价。LobeHub 技能市场为其提供独立收录页(标识符 gptomics-bioskills-selection-statistics,分类 data-analytics),页面显示已有 13 次安装记录,但评分栏为空、尚无用户打分。
9. 其他补充
同一仓库的 population-genetics/ 子目录内还有 association-testing(GWAS 关联检验)、plink-basics(PLINK 格式与 QC)、linkage-disequilibrium(连锁不平衡)、population-structure(群体结构)、rare-variant-association(罕见变异聚合检验)、scikit-allel-analysis(Python 群体遗传学计算)等姊妹技能,覆盖群体遗传学全流程的不同环节,可按需组合安装。
10. 安装使用方式
- Claude Code:
git clone git@github.com:GPTomics/bioSkills.git cd bioSkills ./install-claude.sh --categories "population-genetics" - Codex:同一仓库下运行
./install-codex.sh --categories "population-genetics" - OpenClaw:运行
./install-openclaw.sh --categories "population-genetics",或直接从 ClawHub(clawhub.ai/djemec/bioskills)安装 - Hermes Agent:运行
hermes skills install official/research/bioinformatics安装官方生物信息学网关后即可取用 - 第三方市场:LobeHub 收录页
gptomics-bioskills-selection-statistics - 安装后注意事项:技能本身零额外安装,但运行其推荐代码需预先安装
scikit-allel、numpy(pip install scikit-allel numpy)以及selscan(conda install -c bioconda selscan)与SweepFinder2;单倍型类统计量(iHS/nSL/XP-EHH)还需要预先完成分相(phasing)并准备遗传图谱;无需重启 agent,对话中出现“选择性清除”“iHS”“XP-EHH”“FST”“Tajima’s D”等关键词或直接引用技能名即可触发。
11. 注意事项
- 该技能是方法论与代码模式的封装,本身不提供选择扫描的图形界面或托管计算资源,仍需使用者自行安装并运行底层工具(scikit-allel、selscan、SweepFinder2);
- 单倍型类统计量(iHS、nSL、XP-EHH、Rsb、H12)要求输入数据已完成分相,未分相数据需先经配套的 phasing 技能处理,否则结果会因 switch error 而失真;
- 正文明确指出:Tajima’s D 等 SFS 检验的结果会与群体历史(瓶颈、扩张、群体结构)混淆,不能脱离基因组尺度背景单独解读为选择信号。