1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | bagel-essentiality-gptomics-bioskills |
| 作者/维护者 | GPTomics |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/crispr-screens/bagel-essentiality |
| 许可证 | MIT(数据来自 GitHub API) |
| GitHub Stars | 所属合集仓库 1,125(数据来自 GitHub API;该数字属整个 bioSkills 合集,不代表本技能个体热度) |
| Forks | 所属合集仓库 193(数据来自 GitHub API) |
| 最新版本 | 无独立版本号,随合集仓库更新,本技能路径最近一次提交时间 2026-07-25(数据来自 GitHub API) |
| 安装方式 | 克隆仓库后运行仓库自带的多 Agent 安装脚本,或手动复制该子目录到对应 skills 目录 |
2. 功能介绍与亮点
bagel-essentiality 把 BAGEL2(Kim & Hart 2021《Genome Medicine》)贝叶斯分类器判定 CRISPR-Cas9 适应性筛选中必需基因的完整流程整理成可对话调用的分析指南:
- 贝叶斯框架拆解:讲清从每条 sgRNA 的对数倍数变化(LFC)出发,对照 CEGv2 核心必需基因参考集(684 个,Hart 2017)与 NEGv1 非必需基因参考集(927 个,Hart 2014)的核密度估计计算对数似然比,逐基因累加得到贝叶斯因子(BF)的完整推导链条
- BAGEL2 相较 BAGEL1 的两项关键改进:线性外推突破原版 KDE 边界截断的限制,使 BF 动态范围更宽、能识别正向选择的抑癌基因;多靶点脱靶校正(需同时给出
-m/--filter-multi-target与--align-info)避免脱靶信号污染必需性判定 - BF 阈值校准指引:BF>6 对应约 90% 后验概率(Hart 2017 给出 BF≥6 配对 FDR≤3%),并明确更严格的阈值(BF>12、BF>30)是 BAGEL 社区惯例而非发表的 FDR 映射关系,提醒使用者用
BAGEL.py pr对自己的筛选数据重新生成精确率-召回率曲线校准,而非套用固定值 - 与 MAGeCK/drugZ 结果协调:给出 BF 5-7 边界区间与 MAGeCK FDR 结果不一致时的判读思路
- 可运行的端到端脚本:
examples/run_bagel2.sh覆盖倒数变化计算、贝叶斯因子计算、精确率-召回率校准三步流程,并对下游 BF 阈值给出分级建议(探索性/标准/高置信度/超严格)
亮点是把参考集选择的陷阱单独成节讲透——若误用某个具体细胞系自身的筛选结果作参考集而非标准化的 CEGv2/NEGv1,会把该细胞系的特异性生物学偏差带入模型,这是初学者极易踩的坑。
3. 适用场景
所属分类:数据分析与可视化
适合分析 CRISPR-Cas9 适应性筛选数据、需要用贝叶斯方法而非纯排序统计判定必需基因的生物信息学研究者与计算生物学博士生,尤其是需要同时识别正向选择(抑癌基因富集)信号、或需要将 BAGEL2 结果与 MAGeCK/drugZ 结果交叉验证的场景。它与同仓库 mageck-analysis(基于 RRA/MLE 的命中排序)、hit-calling(跨七种方法的选型与结果协调框架)共同覆盖 CRISPR 筛选命中判定这一环节的不同统计路径。
4. 跨 Agent 兼容性
- Claude Code:原生支持——仓库自带
install-claude.sh专用安装脚本,SKILL.md 为标准 Agent Skills 格式 - Codex:原生支持——仓库自带
install-codex.sh - OpenClaw:原生支持——仓库自带
install-openclaw.sh - Hermes Agent:未验证——Hermes 官方生物信息学网关“CRISPR & Genome Engineering”类目下未见此技能具名收录
5. 推荐理由
它把 BAGEL2 贝叶斯必需性分析中最容易出错的两个环节——参考基因集选择的陷阱与 BF 阈值该如何针对自己的数据重新校准而非套用固定值——整理成带明确判据的操作指南,并配合 BAGEL1→BAGEL2 的算法改进说明与端到端可运行脚本,能显著降低研究者误用参考集或误读贝叶斯因子置信度的风险。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 6 | Hermes 官方生物信息学网关未见此技能具名收录,第三方技能市场(mdskill.dev、claudemarketplaces.com)亦未见独立索引记录,GitHub 提交历史仅单一作者、无第三方 PR 参与;所属合集仓库星数(1,125)为整个 bioSkills 合集所共享,不代表本技能自身热度 |
| 可用性 | 8 | SKILL.md 文档详尽,含贝叶斯框架完整推导、算法改进对比、参考集陷阱说明与可运行的端到端 Shell 脚本;本技能路径最近一次提交为 2026-07-25,维护近日仍活跃;但完整使用需自行 git clone 安装 BAGEL2(无 PyPI 发行版)并下载参考基因集,非零配置直接可用 |
| 安全性 | 9 | 纯方法论参考文档与本地示例脚本,脚本仅从 hart-lab/bagel 官方仓库下载固定参考文件,不执行任意 shell 命令、不联网外发数据、无需 API key 或凭据,MIT 许可证完全开源可审计 |
综合评分(三项均值):7.7
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与本技能的差异 |
|---|---|---|
| mageck-analysis-gptomics-bioskills | 同仓库子技能,基于 MAGeCK 的 alpha-RRA 检验与最大似然模型做命中排序 | MAGeCK 是频率派排序统计方法,依赖 sgRNA 秩次;BAGEL2 是贝叶斯分类器,依赖对已知必需/非必需基因集的似然建模,对识别正向选择的抑癌基因更敏感,两者常被交叉验证而非互相替代 |
| hit-calling-gptomics-bioskills | 同仓库子技能,提供跨 MAGeCK/BAGEL2/drugZ/JACKS 等七种方法的选型决策框架与多方法共识判定 | hit-calling 解决“该用哪个工具、多个工具结果不一致时信谁”的元问题;bagel-essentiality 专注把 BAGEL2 这一种方法本身的贝叶斯推导、参数陷阱与阈值校准讲透,两者是选型层与执行层的关系 |
| BAGEL2 官方仓库文档(hart-lab/bagel,非 agent skill) | 提供命令行工具本身与参数说明 | 官方文档聚焦命令参数罗列,不解释贝叶斯框架背后的推导逻辑,也不提供参考集误用风险、BF 阈值校准方法论层面的提示;本技能把这些隐性知识整理成可直接对话调用的操作指南 |
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
10. 安装使用方式
- Claude Code:
git clone https://github.com/GPTomics/bioSkills && cd bioSkills && ./install-claude.sh,安装后按提示选择性安装crispr-screens类目 - Codex:同仓库运行
./install-codex.sh - OpenClaw:同仓库运行
./install-openclaw.sh - 通用方式:手动将
crispr-screens/bagel-essentiality/目录复制到对应 Agent 的 skills 目录 - 安装后无需重启,在对话中直接描述必需基因判定或 BAGEL2 分析需求(如“用 BAGEL2 分析我的筛选数据识别必需基因”)即可触发
- 使用前需自行
git clone https://github.com/hart-lab/bagel获取 BAGEL2 工具本体(无 PyPI 发行版),并下载 CEGv2/NEGv1 参考基因集
11. 注意事项
- BAGEL2 本身无 PyPI/conda 发行版,需通过
git clone安装并直接调用BAGEL.py - 若使用非标准化的自定义参考基因集(如单一细胞系自身数据)替代 CEGv2/NEGv1,会把该细胞系的特异性偏差带入模型,技能内已明确提示但仍需使用者主动规避
- 多靶点脱靶校正需要
-m/--filter-multi-target与--align-info两个参数同时给出才会生效,遗漏其一不会报错但校正不会执行 - 该技能只覆盖 BAGEL2 一种贝叶斯方法,需要横向对比多方法结果时应配合同仓库 hit-calling 使用