1. 基本信息
| 字段 | 内容 | 数据来源 |
|---|---|---|
| 名称 | population-structure-gptomics-bioskills | — |
| 作者/维护者 | GPTomics | GitHub API |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/population-genetics/population-structure | — |
| 许可证 | MIT(整仓库统一许可) | GitHub API |
| GitHub Stars | 1,126(合集仓库整体;不代表本技能个体热度,见下方评分说明) | GitHub API |
| Forks | 193(合集仓库整体) | GitHub API |
| 最新版本 | 无独立版本号,随仓库滚动更新;该子目录最近一次提交 2026-06-14 | GitHub API |
| 安装方式 | 仓库自带多平台安装脚本 / OpenClaw ClawHub / Hermes 官方网关 / LobeHub 第三方市场 | GitHub 仓库、Hermes 网关文档、LobeHub |
2. 功能介绍与亮点
该技能面向“推断基因型数据背后的群体结构”这一任务,系统性覆盖四类方法:
- 主成分分析(PCA):plink2
--pca(大样本用approx近似算法)、smartpca/EIGENSOFT(附 Tracy-Widom 显著性检验与lsqproject古 DNA/低质量样本投影)、FlashPCA2(十万级生物样本库随机化 PCA); - 模型聚类:ADMIXTURE(跨 K 值交叉验证的最大似然混合比例估计)、fastSTRUCTURE(变分贝叶斯快速 K 值探索);
- 群体分化:Weir-Cockerham 与 Hudson 两种 FST 估计量,明确二者在不平衡样本量下的适用差异;
- f 统计量:经 AdmixTools/admixr 计算的 f3/f4/D 统计量,用于正式检验混血与基因流。
核心亮点是把“每一种群体结构方法输出的都是模型条件下的方差描述,而非群体历史真相”这一方法论共识,转化为可执行的工程约束:PCA 前必须剔除长程连锁不平衡区域与近亲个体(否则某条主成分会锁定在染色体倒位或近亲家族而非真实祖源)、ADMIXTURE 的 K 值交叉验证只是参考不是群体数真值、FST 必须按“分子求和除以分母求和”而非“逐位点比值取平均”聚合、f3/f4/D 若无区块刀切法(block jackknife)标准误则显著性系数是虚构的。正文附完整工具选型决策树、逐方法失败模式表(触发条件/机制/症状/修复)、定量阈值参考表,以及 12 篇带 DOI 的学术文献支撑(Patterson 2006、Alexander 2009、Bhatia 2013、Pickrell 2012 等群体遗传学领域的经典与主流方法论文献)。
3. 适用场景
所属分类:数据分析与可视化(对基因型数据执行统计推断与结果可视化,与库内同类的群体遗传学分析技能同属一类)。
适用于:处理全基因组测序或基因型芯片数据、需要推断样本祖源结构或群体分化程度的群体遗传学与进化生物学研究者;在 GWAS 分析中需要计算主成分作为分层校正协变量的生物信息学工程师;以及需要避免“把 ADMIXTURE 交叉验证最小值当作真实群体数”“PCA 投影收缩误读为混血证据”“FST 逐位点取平均”等常见方法学错误的初中级用户。
4. 跨 Agent 兼容性
| Agent | 支持情况 | 依据 |
|---|---|---|
| Claude Code | 原生支持 | 仓库提供 install-claude.sh,支持全局/项目/按分类安装 |
| Codex | 原生支持 | 仓库提供 install-codex.sh,用法与 Claude Code 版本一致 |
| OpenClaw | 原生支持 | 仓库提供专用 install-openclaw.sh;亦可直接经 ClawHub(clawhub.ai/djemec/bioskills)安装 |
| Hermes Agent | 原生支持 | Hermes 官方生物信息学技能网关文档在“Population Genetics & GWAS”类目下按名列出 population-structure,用户经 hermes skills install official/research/bioinformatics 安装该网关后可直接取用 |
5. 推荐理由
它把群体结构推断领域“PCA/ADMIXTURE 输出的是模型描述而非真相”这一共识,拆解成预处理清单(连锁不平衡剔除、近亲移除、倒位区域排除)、方法选型决策树与逐方法失败模式表,帮助使用者在 PCA、ADMIXTURE、FST、f 统计量等一组容易混用的工具间做出正确选择,并规避把主成分误读为祖源、把 K 值交叉验证误读为真实群体数等真实存在的方法学错误。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | GPTomics 为专注生物信息学技能的小型专业团队,非广为人知的一线厂商;该子技能被 Hermes Agent 官方生物信息学网关在“Population Genetics & GWAS”类目按名收录并直链源仓库,且在 LobeHub 第三方技能市场拥有独立收录页(已有 13 次安装记录),构成技能自身可查证的独立第三方证据(合集仓库 1,126 星为整仓库共享数字,不计入本技能个体热度) |
| 可用性 | 8 | 文档详实(工具分类表 + 场景决策树 + 逐方法失败模式表 + 定量阈值表 + 12 篇学术引用),该路径近期仍有独立提交(最近一次 2026-06-14,约两个月前);但需额外安装 plink2、ADMIXTURE、EIGENSOFT(smartpca)等外部 CLI 工具并准备已完成 QC 的基因型数据,非纯复制即用 |
| 安全性 | 9 | 全文仅为本地 CLI/Python/R 代码模式,未见任何网络外发、API Key 索取或可疑指令,MIT 许可证明确 |
安全检查清单:①仅调用本地 CLI 工具(plink2、admixture、smartpca)与 Python/R 库(scikit-allel、admixr),无远程代码执行 ②运行时不联网外发数据,全部为本地文件读写 ③不涉及任何 API Key 或凭据索取 ④全文未见可疑指令或混淆代码 ⑤作者信誉一般,为专业领域技能维护团队 ⑥MIT 许可证明确 ⑦该子目录约两个月前仍有提交,维护活跃。
综合评分 = 三项均值 = 8.0。
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
| plink2 / ADMIXTURE 官方文档 | 工具自身的命令行参数参考 | 只是工具文档,不是可安装的 agent skill;不包含预处理陷阱清单、失败模式表与场景决策树等封装知识 |
| selection-statistics(同仓库姊妹技能) | 选择性清除信号扫描:iHS、XP-EHH、FST 异常值检测 | 回答“这个位点是否经历了自然选择”;本技能回答“这个群体的遗传结构是什么”,二者是同一分析流水线上的互补环节而非功能重叠 |
| scikit-allel-analysis(同仓库姊妹技能) | Python 数组化的群体遗传学底层计算(多样性、FST、准入位点掩膜) | 面向数组级 API 的正确调用方式;本技能面向 PCA/ADMIXTURE/f 统计量的方法选型与工具链(plink2/smartpca/ADMIXTURE/AdmixTools),二者互为上下游 |
8. 用户评价
该技能目前在第三方平台尚无具名文字评价。LobeHub 技能市场为其提供独立收录页(标识符 gptomics-bioskills-population-structure,分类 data-analytics),页面显示已有 13 次安装记录,但评分栏为空、尚无用户打分。
9. 其他补充
同一仓库的 population-genetics/ 子目录内还有 association-testing(GWAS 关联检验)、plink-basics(PLINK 格式与 QC)、linkage-disequilibrium(连锁不平衡)、selection-statistics(选择性清除扫描)、scikit-allel-analysis(Python 群体遗传学计算)等姊妹技能,覆盖群体遗传学全流程的不同环节,可按需组合安装。
10. 安装使用方式
- Claude Code:
git clone git@github.com:GPTomics/bioSkills.git cd bioSkills ./install-claude.sh --categories "population-genetics" - Codex:同一仓库下运行
./install-codex.sh --categories "population-genetics" - OpenClaw:运行
./install-openclaw.sh --categories "population-genetics",或直接从 ClawHub(clawhub.ai/djemec/bioskills)安装 - Hermes Agent:运行
hermes skills install official/research/bioinformatics安装官方生物信息学网关后即可取用 - 第三方市场:LobeHub 收录页
gptomics-bioskills-population-structure - 安装后注意事项:技能本身零额外安装,但运行其推荐代码需预先安装
plink2(conda install -c bioconda plink2)、ADMIXTURE(conda install -c bioconda admixture)、EIGENSOFT(提供 smartpca,conda install -c bioconda eigensoft)以及 R 包admixr(f 统计量部分需 AdmixTools);无需重启 agent,对话中出现“PCA”“ADMIXTURE”“FST”“祖源分析”“群体结构”等关键词或直接引用技能名即可触发。
11. 注意事项
- 该技能是方法论与代码模式的封装,本身不提供群体结构推断的图形界面或托管计算资源,仍需使用者自行安装并运行底层工具(plink2、ADMIXTURE、EIGENSOFT、AdmixTools);
- ADMIXTURE 的 Q 值是给定 K 值下的最大似然混合权重,不是“真实祖源比例”;CV 误差曲线的最小值只是预测精度上的建议值,正文明确要求跨多个种子重复运行并用 CLUMPP/pong 对齐标签后再判读;
- FST 必须按“分子求和除以分母求和”聚合,逐位点比值取平均会因低频变异位点主导而产生系统性偏差;负的逐位点 FST 是正常抽样现象,不应被截断为零。