1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | batch-correction-gptomics-bioskills |
| 作者/维护者 | GPTomics |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/crispr-screens/batch-correction |
| 许可证 | MIT(数据来自 GitHub API) |
| GitHub Stars | 所属合集仓库 1,123(数据来自 GitHub API;该数字属整个 bioSkills 合集,不代表本技能个体热度) |
| Forks | 所属合集仓库 193(数据来自 GitHub API) |
| 最新版本 | 无独立版本号,随合集仓库更新,本技能路径最近一次提交时间 2026-07-25(数据来自 GitHub API) |
| 安装方式 | 克隆仓库后运行仓库自带的多 Agent 安装脚本,或手动复制该子目录到对应 skills 目录;亦可通过第三方技能市场 mdskill.dev 一条命令安装 |
2. 功能介绍与亮点
batch-correction 把 CRISPR 筛选多批次联合分析中最容易被做错的一步——“要不要校正批次效应、用哪种方法校正”——整理成一份带诊断流程与失败模式的决策指南,覆盖 ComBat 经验贝叶斯校正、RUV(Remove Unwanted Variation)、SVA(Surrogate Variable Analysis)、对照 sgRNA 锚定归一化,以及把批次直接作为 MAGeCK MLE / Chronos 协变量建模这一“优先推荐”的替代路径:
- 批次来源速查表:列出文库批次、细胞传代队列、感染日期、测序 run、Cas9 酶批次、血清批次、活体实验的组织制备批次等 7 类典型批次来源及各自可用什么诊断手段识别
- PCA + 方差分解诊断:给出量化“批次方差 vs 条件方差”占比的代码,用 F 统计量判断该不该校正,而不是凭经验直接上手校正
- 批次与生物学混杂的核心警示:反复强调批次效应若与实验条件系统性重合(如“药物组恰好都在第二批处理”),强行校正会把生物学信号一起抹掉,此时应改用协变量建模或重新设计实验,而非盲目校正
- 5 类失败模式排查表:ComBat 抹除生物学信号、RUV 参数 k 设置过高引入噪声、批次协变量与设计矩阵其他列共线导致 MLE 报错、ComBat 与 RUV 叠加使用造成双重校正、单批次样本量不足导致校正不稳定,按触发条件、机制、症状、修复方法四栏列出
- 量化阈值参考表:汇总 PC1 批次/条件 F 值比、ComBat 单批次最少样本数、RUV k 值默认取值、对照 sgRNA 归一化所需最少数量等 5 项行业惯例阈值及出处
亮点是没有停留在“这几种方法怎么用”的工具罗列,而是把“该不该校正”“校正会不会把生物学信号一起删掉”这个更容易出错、也更容易被忽视的判断环节单独讲透,并给出协变量建模优先于预校正的方法论立场及理由。
3. 适用场景
所属分类:数据分析与可视化
适合需要合并多批次 CRISPR 筛选数据做联合分析的生物信息学研究者,例如 DepMap 式的多细胞系癌症筛选面板整合、跨批次比较筛选结果,或诊断“重复相关性组内高、组间低”这类异常是否源于批次效应。它与同仓库 screen-qc(发现筛选整体质控异常)、mageck-analysis(用协变量设计矩阵做统计检验)在同一分析流程中互为衔接:screen-qc 发现异常后,batch-correction 负责诊断是否为批次问题并给出校正或建模方案。
4. 跨 Agent 兼容性
- Claude Code:原生支持——仓库自带
install-claude.sh专用安装脚本,SKILL.md 为标准 Agent Skills 格式 - Codex:原生支持——仓库自带
install-codex.sh,安装时自动转换为 Codex 的 Agent Skills 目录结构 - OpenClaw:原生支持——仓库自带
install-openclaw.sh,亦可直接从 ClawHub 市场安装 - Hermes Agent:原生支持——已被 Hermes 官方生物信息学网关“CRISPR & Genome Engineering”类目具名收录
5. 推荐理由
它把分散在 ComBat/RUV/SVA 三个统计包文档与论文方法学附录里的批次校正决策逻辑——尤其是“批次是否与生物学条件混杂、校正会不会把信号也删掉”这个最容易踩坑的判断——整理成一份带诊断代码、失败模式与阈值参考的分析指南,能帮研究者在合并多批次筛选数据时少走“校正完发现效应量全没了”的弯路。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 已被 Hermes 官方生物信息学网关“CRISPR & Genome Engineering”类目具名收录,并被第三方技能市场 mdskill.dev 收录索引;所属合集仓库星数(1,123)按惯例不计入单个子技能自身热度 |
| 可用性 | 8 | SKILL.md 与 usage-guide.md 文档详尽,含诊断决策树、5 类失败模式排查表、量化阈值表与可运行的 Python/R 代码;本技能路径最近一次提交为 2026-07-25(评估时不到两周前);但完整使用需通过 pip 安装 combat 包、conda 安装 MAGeCK,以及 R 的 BiocManager 安装 sva/RUVSeq/limma,需要一定环境配置,非零配置直接可用 |
| 安全性 | 9 | 纯方法论参考文档与本地示例代码,不执行任意 shell 命令、不联网外发数据、无需 API key 或凭据,MIT 许可证完全开源可审计 |
综合评分(三项均值):8.0
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
| jacks-analysis-gptomics-bioskills | 同仓库子技能,负责跨批次联合分析中用 JACKS 方法联合估计 sgRNA 效能 | jacks-analysis 处理“如何用统计模型跨批次联合建模”;batch-correction 处理“要不要校正、该用哪种方法”这一前置诊断与方法选择,二者可搭配使用——先诊断,若选择联合建模路线再调用 jacks-analysis |
| screen-qc-gptomics-bioskills | 同仓库子技能,负责筛选整体质量控制 | screen-qc 评估“这批数据本身干不干净”(重复相关性、读数分布等通用 QC 指标);batch-correction 专注“多批次之间是否存在系统性偏差、该如何处理”这一具体问题,通常是 screen-qc 发现批次相关异常后的下一步动作 |
| sva / RUVSeq / limma(Bioconductor 独立 R 包,非 agent skill) | 提供批次校正的底层统计算法实现 | 这些是 batch-correction 内部会调用的算法库本身,使用者需自行判断该选哪个、如何设参数;batch-correction 把诊断流程、方法选择决策树与失败模式整理成可对话调用的分析指南,降低误用(如漏加生物学协变量导致信号被抹除)的风险 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
10. 安装使用方式
- Claude Code:
git clone https://github.com/GPTomics/bioSkills && cd bioSkills && ./install-claude.sh,安装后按提示选择性安装crispr-screens类目 - Codex:同仓库运行
./install-codex.sh - OpenClaw:同仓库运行
./install-openclaw.sh,或通过 ClawHub 市场搜索安装 - 通用方式:手动将
crispr-screens/batch-correction/目录复制到对应 Agent 的 skills 目录 - 第三方市场:
npx mdskill add GPTomics/bioSkills/bio-crispr-screens-batch-correction - 安装后无需重启,在对话中直接描述批次校正需求(如“帮我诊断这批多批次CRISPR筛选数据是否需要批次校正”)即可触发
- 完整使用需自行安装 Python 的 combat 包、conda 的 MAGeCK,以及 R 的 sva/RUVSeq/limma(视所选校正方法而定,非全部方法都要装齐)
11. 注意事项
- 批次是否与实验条件混杂需要研究者结合实验设计自行判断,技能给出诊断代码与警示,但不能替代对实验本身的理解
- ComBat/RUV/SVA 依赖 Python 与 R 两套环境的多个包,纯 Python 环境需额外配置 R 及 BiocManager
- 对照 sgRNA 锚定归一化要求文库中至少有约 500 个非靶向对照,数量不足时该方法本身会不稳定
- 该技能专注批次校正这一环节,不含实验前的文库设计(见同仓库 library-design)与校正后的统计检验/打分(见同仓库 mageck-analysis、hit-calling)