1. 基本信息
| 字段 | 内容 | 数据来源 |
|---|---|---|
| 名称 | linkage-disequilibrium-gptomics-bioskills | — |
| 作者/维护者 | GPTomics | GitHub API |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/population-genetics/linkage-disequilibrium | — |
| 许可证 | MIT(整仓库统一许可) | GitHub API |
| GitHub Stars | 1,126(合集仓库整体;不代表本技能个体热度,见下方评分说明) | GitHub API |
| Forks | 193(合集仓库整体) | GitHub API |
| 最新版本 | 无独立版本号,随仓库滚动更新;该子目录最近一次提交 2026-06-14 | GitHub API |
| 安装方式 | 仓库自带多平台安装脚本 / OpenClaw ClawHub / Hermes 官方网关 / LobeHub 第三方市场 | GitHub 仓库、Hermes 网关文档、LobeHub |
2. 功能介绍与亮点
该技能封装用 PLINK 1.9/2.0 与 scikit-allel 计算连锁不平衡(LD)的完整方法论:度量 r2 与 D’、按 LD 剪枝变异、对 GWAS 汇总统计量做 p 值感知的位点聚类(clumping)、以及 Gabriel 置信区间法定义单倍型分块。
核心亮点是把两组长期被混用的概念讲透:r2(= chi2/N)回答“一个变异能多好地预测另一个”这一统计问题,是标签变异、插补与 GWAS 功效计算的正确货币;D’ 回答“两个位点间是否观测到重组”这一历史/结构问题,在稀有变异上系统性偏高,不能替代 r2 做标签充分性判断。同样,剪枝(--indep-pairwise,基因型盲、与表型无关)与聚类(--clump,p 值感知)是两种常被混淆的独立操作。正文附带完整工具分类表、按场景的决策树、长程 LD 区域(MHC、8p23.1、17q21.31、LCT)必须按坐标而非阈值预先剔除的说明、7 种典型失败模式表(长程 LD 残留污染主成分、D’ 在低等位基因计数下虚高、EM 单倍型 r2 在结构化数据上失真、祖源不匹配的 LD 参考静默产生错误结果等)、定量阈值参考表,以及一段可直接运行的 shell 示例脚本(长程区域剔除 → 剪枝 → r2 计算 → 可选聚类 → 单倍型分块,输出写入调用方指定目录)。全文引用 8 篇带 DOI 的学术文献,从 Lewontin 1964 到 Bulik-Sullivan 2015 的 LD score regression。
3. 适用场景
所属分类:数据分析与可视化(对基因型数据执行统计计算与变异筛选,与库内同类的群体遗传学与变异分析技能同属一类)。
适用于:需要为主成分分析、ADMIXTURE 或亲缘关系矩阵构建近独立标记集的群体遗传学研究者;需要把 GWAS 显著位点归并为每个位点一个代表信号的统计遗传学分析人员;需要正确选择 r2 或 D’ 以避免“标签变异实际无效”“单倍型分块被稀有变异人为撑大”等常见方法学错误的初中级生物信息学工程师。
4. 跨 Agent 兼容性
| Agent | 支持情况 | 依据 |
|---|---|---|
| Claude Code | 原生支持 | 仓库提供 install-claude.sh,支持全局/项目/按分类安装 |
| Codex | 原生支持 | 仓库提供 install-codex.sh,用法与 Claude Code 版本一致 |
| OpenClaw | 原生支持 | 仓库提供专用 install-openclaw.sh;亦可直接经 ClawHub(clawhub.ai/djemec/bioskills)安装 |
| Hermes Agent | 原生支持 | Hermes 官方生物信息学技能网关文档在“Population Genetics & GWAS”类目下按名列出 population-genetics/ 一行,逐字包含 linkage-disequilibrium,并直链源仓库 https://github.com/GPTomics/bioSkills;用户经 hermes skills install official/research/bioinformatics 安装该网关后可直接取用 |
5. 推荐理由
它把 LD 分析中最容易踩坑的两组混淆讲清楚——r2 与 D’ 回答不同的问题、剪枝与聚类是不同的操作——并系统说明长程 LD 区域为什么必须按坐标而非阈值剔除、D’ 为什么在稀有变异上系统性虚高、祖源不匹配的 LD 参考为什么会静默产生错误的精细定位结果。附带可直接运行的完整流水线脚本与 7 种失败模式的逐条排查表,帮助初中级用户在 PLINK 1.9/2.0 与 scikit-allel 之间正确选择工具并规避真实存在的方法学陷阱。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | GPTomics 为专注生物信息学技能的小型专业团队,非广为人知的一线厂商;该子技能被 Hermes Agent 官方生物信息学网关在“Population Genetics & GWAS”类目下按名逐字列出并直链源仓库,且在 LobeHub 第三方技能市场拥有独立收录页(19 次安装),构成技能自身可查证的独立第三方证据(合集仓库 1,126 星为整仓库共享数字,不计入本技能个体热度) |
| 可用性 | 8 | 文档详实(工具分类表 + 场景决策树 + 定量阈值表 + 7 种失败模式表 + 可直接运行的示例脚本 + 8 篇学术引用),该路径仍有独立提交(最近一次 2026-06-14);但需额外安装 PLINK 1.9/2.0 与 scikit-allel,且聚类/精细定位步骤要求祖源匹配的 LD 参考数据,非纯复制即用 |
| 安全性 | 9 | 示例脚本全程调用本地 PLINK/scikit-allel 命令,set -euo pipefail 严格模式,输出写入调用方指定或临时目录,无远程代码执行、无网络外发、无凭据索取;未见可疑指令或混淆代码;MIT 许可证明确 |
安全检查清单:①仅调用本地 CLI 工具(PLINK 1.9/2.0)与 Python 库(scikit-allel)进行统计计算,无远程代码执行 ②全程本地文件读写,无联网外发 ③不涉及任何 API Key 或凭据索取 ④全文(含示例脚本)未见可疑指令或混淆代码 ⑤作者信誉一般,为专业领域技能维护团队 ⑥MIT 许可证明确 ⑦该子目录最近一次提交 2026-06-14,维护活跃。
综合评分 = 三项均值 = 8.0。
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
PLINK 官方文档(--r2 / --indep-pairwise / --clump / --blocks) |
各命令自身的参数参考 | 只是命令行参数手册,不是可安装的 agent skill;不包含 r2 与 D’ 的方法学辨析、长程 LD 区域坐标清单或失败模式排查表 |
| scikit-allel 官方文档 | Python 库 API 参考 | 只说明函数签名与返回值格式(如 rogers_huff_r 返回压缩上三角向量),不涉及何时该用 PLINK、何时该用 scikit-allel 的场景判断 |
| plink-basics(同仓库姊妹技能) | PLINK 文件格式转换与样本/变异质控 | 回答“数据该怎么转换和清洗”;本技能回答“清洗后的数据如何计算 LD、剪枝与聚类”,是下游步骤而非重叠 |
| population-structure(同仓库姊妹技能) | 用剪枝后的标记集做 PCA/ADMIXTURE | 消费本技能剪枝步骤的输出做群体结构分析;两者是流水线的前后环节 |
| association-testing(同仓库姊妹技能) | 执行 GWAS 关联检验本身 | 产出待聚类的汇总统计量;本技能负责把这些结果归并为独立位点,按流程先后互补 |
8. 用户评价
该技能目前在第三方平台尚无具名文字评价。LobeHub 技能市场为其提供独立收录页(标识符 gptomics-bioskills-linkage-disequilibrium),显示 19 次安装、版本号 1.0.2。
9. 其他补充
同一仓库 population-genetics/ 子目录内还有 plink-basics(格式转换与质控)、population-structure(群体结构分析)、association-testing(GWAS 关联检验)、selection-statistics(选择压力统计)、scikit-allel-analysis(基于 scikit-allel 的分析流程)等姊妹技能;相邻的 phasing-imputation/ 子目录另有单倍型分相、基因型插补等技能承接下游分析,可按研究流程组合安装。
10. 安装使用方式
- Claude Code:
git clone git@github.com:GPTomics/bioSkills.git cd bioSkills ./install-claude.sh --categories "population-genetics" - Codex:同一仓库下运行
./install-codex.sh --categories "population-genetics" - OpenClaw:运行
./install-openclaw.sh --categories "population-genetics",或直接从 ClawHub(clawhub.ai/djemec/bioskills)安装 - Hermes Agent:运行
hermes skills install official/research/bioinformatics安装官方生物信息学网关后即可取用 - 第三方市场:LobeHub 收录页
gptomics-bioskills-linkage-disequilibrium - 安装后注意事项:技能本身零额外安装,但运行其推荐代码需预先安装 PLINK 1.9/2.0 与 scikit-allel;做 GWAS 聚类或精细定位时,LD 参考数据必须与研究样本祖源匹配,否则会静默产生错误结果;无需重启 agent,对话中出现“连锁不平衡”“LD”“r2”“D’”“PLINK 剪枝”“GWAS 聚类”等关键词或直接引用技能名即可触发。
11. 注意事项
- 该技能是方法论与代码模式的封装,本身不提供 LD 计算的托管资源,仍需使用者自行安装 PLINK 1.9/2.0 或 scikit-allel;
- 剪枝前必须先按坐标剔除长程 LD 区域(MHC、8p23.1、17q21.31、LCT 等),否则这些区域会以真实但非结构信号的高 LD 污染主成分分析结果;
- D’ 在低等位基因计数(约 <10-20)下会因第四种单倍型未被观测到而系统性虚高至接近 1,不应在此区间用于判断“完全连锁”;
- 用于聚类、精细定位或 LD score regression 的参考面板必须与研究样本祖源匹配,正文特别提醒祖源不匹配不会报错,只会静默产生错误的分组或置信集合。