1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | screen-qc-gptomics-bioskills |
| 作者/维护者 | GPTomics |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/crispr-screens/screen-qc |
| 许可证 | MIT(数据来自 GitHub API) |
| GitHub Stars | 所属合集仓库 1,122(数据来自 GitHub API;该数字属整个 bioSkills 合集,不代表本技能个体热度) |
| Forks | 所属合集仓库 193(数据来自 GitHub API) |
| 最新版本 | 无独立版本号,随合集仓库最近一次提交更新,最近提交时间 2026-07-25(数据来自 GitHub API) |
| 安装方式 | 克隆仓库后运行仓库自带的多 Agent 安装脚本,或手动复制该子目录到对应 skills 目录 |
2. 功能介绍与亮点
screen-qc 为混合池化 CRISPR 敲除/干扰/编辑筛选实验提供决策级质控(QC)流程,把一次筛选实验拆成六个可能出问题的瓶颈阶段——质粒库、Day-0 感染、筛选期、终点测序、生物学信号、拷贝数伪影——并对每一阶段给出可执行的 Python 代码与判定阈值:
- 文库代表性诊断:零计数占比、低计数占比、p90/p10 偏度比,定位复杂度丢失发生在哪一步
- Gini 系数:分阶段(质粒/Day-0/终点)给出优秀/可接受/警戒/失败四档阈值
- 重复样本一致性:log 计数 Pearson 相关与原始秩 Spearman 相关双指标,并说明“Pearson 高但 Spearman 低”意味着少数离群 sgRNA 主导
- 必需基因组信号回收率:用 CEGv2/NEGv1 参考基因集计算 PR-AUC,判断筛选是否具备可解读的生物学信号
- 拷贝数伪影诊断:识别扩增区域基因被误判为“必需”的经典假阳性模式
- 测序深度审计、MOI 感染复数验证、PCA 批次效应可视化、DepMap 式综合质量评分
亮点是附带的“失败模式”表——按触发条件、机制、症状、修复方法四栏结构化列出 6 类常见质控异常(如“PR-AUC 随时间下降但 Gini 稳定”对应 Cas9 未预先筛选阳性细胞),并引用 12 篇同行评审文献(Hart 2017、Li 2014/2015 MAGeCK 系列、Aguirre 2016、Munoz 2016 等)为每个数值阈值标注出处,区分哪些是发表定论、哪些是操作性共识。
3. 适用场景
所属分类:数据分析与可视化
适合正在执行池化 CRISPR 筛选实验的计算生物学研究者、生物信息学工程师或博士生,在做正式的 hit calling(基因命中判定)之前,用它审计一批测序计数数据是否达标、该继续分析、该抢救、还是该重做;也适合诊断“已知必需基因没有被正常检出”“扩增区域基因异常富集”这类具体质控异常的根因。
4. 跨 Agent 兼容性
- Claude Code:原生支持——仓库自带
install-claude.sh专用安装脚本,SKILL.md 为标准 Agent Skills 格式 - Codex:原生支持——仓库自带
install-codex.sh,安装时自动转换为 Codex 的 Agent Skills 目录结构(examples/→scripts/,usage-guide.md→references/) - OpenClaw:原生支持——仓库自带
install-openclaw.sh,亦可直接从 ClawHub 市场安装 - Hermes Agent:原生支持——已被 Hermes 官方生物信息学网关“CRISPR & Genome Engineering”类目具名收录
5. 推荐理由
它把分散在多篇发表文献里的质控阈值(六个瓶颈阶段各自的通过/警戒/失败线)整理成一份带出处的决策参考,配合可直接运行的 Python 计算代码与结构化的失败诊断表,能替研究者省下逐篇翻文献核对阈值、以及排查“数据看起来正常却通不过质控”这类隐蔽问题的时间,是 hit calling 前的必经关卡。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 已被 Hermes 官方生物信息学网关“CRISPR & Genome Engineering”类目具名收录;所属合集仓库星数(1,122)按惯例不计入单个子技能自身热度,独立第三方技能索引站点尚未见该子技能单独收录 |
| 可用性 | 8 | SKILL.md 与 usage-guide.md 文档完整、含可直接运行代码与十余条示例 prompt;仓库最近一次提交为 2026-07-25(评估时不到两周前);但需额外安装 MAGeCK-VISPR、可选 R 包 MAGeCKFlute 等外部工具,非零配置直接可用 |
| 安全性 | 9 | 纯 Python/R 方法论与阈值参考,不执行任意 shell 命令、不联网外发数据、无需 API key 或凭据,MIT 许可证完全开源可审计 |
综合评分(三项均值):8.0
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
| library-design-gptomics-bioskills | 同仓库子技能,负责筛选文库/sgRNA 设计 | 处于筛选流程上游(实验开始前设计文库),screen-qc 处于下游(测序数据回来后审计质量),二者是同一流程的前后接力而非替代关系 |
| mageck-analysis-gptomics-bioskills | 同仓库子技能,MAGeCK 计数与假设检验方法选型 | 产出“哪些基因显著富集/耗竭”的统计结果,screen-qc 产出的是“这批数据能不能拿去做统计”的质控判定,是它的前置关卡 |
| MAGeCK-VISPR(底层命令行工具,非 agent skill) | 生成交互式 QC 仪表盘,可视化 Gini、计数分布等原始数字 | 只输出数字与图表,不给“该不该继续”“哪个环节出了问题该怎么修”的判断;screen-qc 把六阶段阈值与失败诊断整理成可执行的决策规则,弥补原始工具“有数字没结论”的缺口 |
8. 用户评价
该技能所属的 GPTomics/bioSkills 仓库内,部分同类子技能(如 library-design、hit-calling)已被第三方技能索引站点 playbooks.com 收录并可独立浏览,但 screen-qc 本身尚未见于该索引,目前也无具名用户评价。
9. 其他补充
该技能所属仓库是一个规模较大的生物信息学技能合集,覆盖测序 I/O、变异检测、单细胞分析、结构生物学等 15 个以上领域;所在的 crispr-screens 目录本身还包含文库设计、批次校正、拷贝数校正、体内筛选等十余个紧密关联的技能,可按分析流程的不同阶段组合使用。
10. 安装使用方式
- Claude Code:
git clone git@github.com:GPTomics/bioSkills.git && cd bioSkills && ./install-claude.sh --categories "crispr-screens"(或全量安装./install-claude.sh) - Codex CLI:
./install-codex.sh --categories "crispr-screens" - OpenClaw:从 ClawHub(clawhub.ai/djemec/bioskills)直接安装,或
./install-openclaw.sh --categories "crispr-screens" - Antigravity(Gemini CLI 继任者):
./install-antigravity.sh --categories "crispr-screens" - 也可手动复制
crispr-screens/screen-qc/目录到对应 Agent 的 skills 目录 - 安装后注意事项:需另行安装 MAGeCK-VISPR(
conda install -c bioconda mageck mageck-vispr)及可选的 R 包 MAGeCKFlute,才能配合该技能给出的代码实际运行;无需重启 Agent,安装完成后下一次对话即可触发(如“帮我审计这批 CRISPR 筛选数据的质量”)
11. 注意事项
- 六阶段阈值中部分为社区操作惯例而非发表文献定论,SKILL.md 中已逐条标注哪些有文献出处、哪些是操作性共识
- 需要外部生物信息学工具链(MAGeCK-VISPR、可选 R 包)配合才能落地运行代码,并非纯提示词、零依赖的技能
- 拷贝数偏差诊断、MOI 验证等模块依赖额外实验元数据(如匹配的 WGS/SNP-array 拷贝数谱、滴度板数据),缺失这些输入时相应模块无法运行
- 本技能与仓库内其余上百个生物信息学技能共享同一许可证与维护节奏,但不共享受欢迎程度评分——仓库整体星数不代表本技能个体热度