SkillsScout
DATA-ANALYSIS / 数据分析与可视化

scikit-allel-analysis-gptomics-bioskills

收录日期 2026-08-07·来源仓库 ↗
受欢迎程度
7
可用程度与相关性
8
安全性
9
8.0SCOUT SCORE

1. 基本信息

字段 内容 数据来源
名称 scikit-allel-analysis-gptomics-bioskills
作者/维护者 GPTomics GitHub API
来源链接 https://github.com/GPTomics/bioSkills/tree/main/population-genetics/scikit-allel-analysis
许可证 MIT(整仓库统一许可) GitHub API
GitHub Stars 1,126(合集仓库整体;不代表本技能个体热度,见下方评分说明) GitHub API
Forks 193(合集仓库整体) GitHub API
最新版本 无独立版本号,随仓库滚动更新;该子目录最近一次提交 2026-06-14 GitHub API
安装方式 仓库自带多平台安装脚本 / OpenClaw ClawHub / Hermes 官方网关 / LobeHub 第三方市场 GitHub 仓库、Hermes 网关文档、LobeHub

2. 功能介绍与亮点

该技能面向“用 Python scikit-allel 库对基因型数组做群体遗传学计算”这一任务,覆盖 GenotypeArray/HaplotypeArray/AlleleCountsArray 三种核心数据结构的正确使用,以及四类统计量的计算:

核心亮点是把该库里“几乎每个统计量都是比值或密度,分母算错却不报错”这一隐蔽陷阱,拆成两类可识别的具体场景:一是按位点多样性计算省略 is_accessible 掩膜参数时,分母会从“可信区域碱基数”悄悄变成“区间总跨度”,导致 π/theta 被压低 2–5 倍且失真程度随窗口可信度浮动;二是 FST 若按逐位点比值取平均而非“分子求和除以分母求和”聚合,会被低频变异位点系统性拉偏(Bhatia 2013)。正文还记录了容易踩的 API 细节,如 to_n_alt() 默认把缺失基因型当作纯合参考型、sfs() 默认未折叠且要求输入衍生等位基因计数而非替代等位基因计数、scikit-allel 本身已进入维护模式而后继者 sgkit 尚未功能对等。附场景决策树、逐函数失败模式表(触发条件/机制/症状/修复)、定量正确性参考表,以及 11 篇带 DOI/PMID 的学术文献支撑(Weir & Cockerham 1984、Hudson 1992、Bhatia 2013、Patterson 2006/2012、Voight 2006、Sabeti 2007、Garud 2015 等)。

3. 适用场景

所属分类:数据分析与可视化(对基因型数据执行统计计算与推断,与库内同类的群体遗传学分析技能同属一类)。

适用于:在 Python 中直接操作基因型数组、需要计算多样性、FST、admixture 统计量或运行选择扫描的群体遗传学与进化生物学研究者;已完成 VCF 读取但需要确认多样性/FST 计算未因分母错误而系统性偏低的生物信息学工程师;以及容易在 to_n_alt 缺失值填充、SFS 折叠与否、iHS/XP-EHH 标准化等细节上踩坑的初中级用户。PLINK 格式质控与 CLI 层面的祖源结构推断(PCA/ADMIXTURE)不在本技能范围,分见姊妹技能 plink-basics 与 population-structure。

4. 跨 Agent 兼容性

Agent 支持情况 依据
Claude Code 原生支持 仓库提供 install-claude.sh,支持全局/项目/按分类安装
Codex 原生支持 仓库提供 install-codex.sh,用法与 Claude Code 版本一致
OpenClaw 原生支持 仓库提供专用 install-openclaw.sh;亦可直接经 ClawHub(clawhub.ai/djemec/bioskills)安装
Hermes Agent 原生支持 Hermes 官方生物信息学技能网关文档在“Population Genetics & GWAS”类目下按名列出 scikit-allel-analysis,且该网关的环境安装清单明确包含 scikit-allel 这一 Python 包;用户经 hermes skills install official/research/bioinformatics 安装该网关后可直接取用

5. 推荐理由

群体遗传学计算里最危险的错误往往不是程序崩溃,而是分母算错却仍返回一个“看起来合理”的数字。该技能把这类隐蔽的正确性陷阱系统化为决策树与失败模式表,并给出符合学术惯例的正确聚合方式(如 FST 用“求和之比”而非“比值之和”),配合 11 篇权威文献支撑,帮助使用者产出经得起同行评审的计算结果,而不是悄悄错了也不自知的数字。

6. 评分

维度 分数 说明
受欢迎程度 7 GPTomics 为专注生物信息学技能的小型专业团队,非广为人知的一线厂商;该子技能被 Hermes Agent 官方生物信息学网关在“Population Genetics & GWAS”类目按名收录(安装清单亦明确点名 scikit-allel 包),且在 LobeHub 第三方技能市场拥有独立收录页(已有 14 次安装记录),构成技能自身可查证的独立第三方证据(合集仓库 1,126 星为整仓库共享数字,不计入本技能个体热度)
可用性 8 文档详实(数据模型表 + 场景决策树 + 逐函数失败模式表 + 定量正确性参考表 + 11 篇学术引用 + 常见错误对照表),该路径近期仍有独立提交(最近一次 2026-06-14,约两个月前);但需预先安装 Python 环境与 scikit-allel/numpy/zarr 等依赖,且要求使用者已掌握 VCF 转数组的前置步骤,非纯复制即用
安全性 9 全文仅为本地 Python 代码模式,未见任何网络外发、API Key 索取或可疑指令,MIT 许可证明确

安全检查清单:①仅提供本地 Python 库(scikit-allel、numpy)调用代码,无远程代码执行 ②运行时不联网外发数据,全部为本地内存/文件操作 ③不涉及任何 API Key 或凭据索取 ④全文未见可疑指令或混淆代码 ⑤作者信誉一般,为专业领域技能维护团队 ⑥MIT 许可证明确 ⑦该子目录约两个月前仍有提交,维护活跃。

综合评分 = 三项均值 = 8.0

7. 跟同类 Skills 相比的优势

对比对象 定位 与本技能的差异
scikit-allel 官方文档 库自身的 API 参考手册 只罗列函数签名与参数,不是可安装的 agent skill;不含“哪个函数在哪种输入下会静默算错”的失败模式归纳
population-structure(同仓库姊妹技能) CLI 工具链(plink2/smartpca/ADMIXTURE/AdmixTools)的祖源结构方法选型 面向命令行工具链的场景决策;本技能面向 Python 数组 API 的底层正确调用方式,二者互为上下游
plink-basics(同仓库姊妹技能) PLINK 格式转换与质控前处理 处理 VCF/PLINK 格式转换与样本过滤;本技能处理转换完成后的内存数组级统计计算

8. 用户评价

该技能目前在第三方平台尚无具名文字评价。LobeHub 技能市场为其提供独立收录页(标识符 gptomics-bioskills-scikit-allel-analysis),页面显示已有 14 次安装记录,但评分栏为空、尚无用户打分。

9. 其他补充

同一仓库的 population-genetics/ 子目录内还有 population-structure(祖源结构推断)、selection-statistics(选择性清除信号设计与解读)、association-testing(GWAS 关联检验)、plink-basics(PLINK 格式与 QC)、linkage-disequilibrium(连锁不平衡)等姊妹技能,覆盖群体遗传学全流程的不同环节,可按需组合安装。

10. 安装使用方式

11. 注意事项