1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | dia-analysis-gptomics-bioskills |
| 作者/维护者 | GPTomics(GitHub 组织,自述为专注生物信息学与 AI 的研究实验室) |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/proteomics/dia-analysis |
| 许可证 | MIT(GitHub API 确认,仓库根 LICENSE 文件) |
| GitHub Stars | 1,116(GitHub API;数字属整个 bioSkills 合集,不代表本技能自身热度) |
| Forks | 193(同上,合集整体) |
| 最新版本 | 无独立版本标签;该技能目录最近一次实质性提交为“proteomics update”(2026-06-16),仓库整体最近 push 于 2026-07-25 |
| 安装方式 | 见第 10 章 |
2. 功能介绍与亮点
dia-analysis 教 agent 用 DIA-NN、Spectronaut、OpenSWATH、EncyclopeDIA 等工具处理数据非依赖式采集(DIA)蛋白质组学数据,覆盖从峰组打分到跨批次矩阵过滤的完整流程:
- 核心洞见:DIA 定量的本质是把重建出的碎片色谱峰组(peak group)与诱饵(decoy)空模型打分比对,而不是传统的“谱图匹配”——因为宽隔离窗口下每一张 MS2 谱图天然是多个前体离子叠加的嵌合谱,问题变成解卷积与峰组打分。技能强调“1% FDR”这句话本身没有意义,必须同时说明 LEVEL(前体/肽段/蛋白组)与 CONTEXT(单次运行 vs 实验全局),否则按单次运行阈值过滤会在跨运行拼接时把误差在整个队列中累积放大。
- 方法选择决策树:按“无湿实验谱图库的发现性队列”“Astral 2-Th 数据的快速单次发现”“已有深度实验谱图库”“需要可审计 FDR 上下文的监管场景”等场景,分别给出 DIA-NN 预测库路线、library-free directDIA、library-based 路线、OpenSWATH+PyProphet 的选择依据。
- 采集设计科普:系统解释固定窗口、可变窗口、交错解复用窗口、diaPASEF(离子淌度维度)、Astral 窄窗口五种采集设计各自的“选择性 vs 占空比”权衡,帮助使用者理解自己拿到的数据属于哪种采集方式、该用什么引擎处理。
- 失败模式表:按“触发-机制-症状-修复”结构列出 library-free 库污染、library-based 谱图库物种/修饰不匹配、跨运行队列 FDR 累积、Match-between-runs 误传递、交错采集未解复用等五类真实报错场景。
- 引用 9 篇正式文献,涵盖 DIA 方法奠基论文(Gillet 2012 Mol Cell Proteomics)、DIA-NN 工具论文(Demichev 2020 Nat Methods)与最新 Astral 窄窗口研究(Guzman 2024 Nat Biotechnol);Version Compatibility 区块要求代码报错时先核对已装工具版本,而非盲目重试。
亮点:该技能在 LobeHub 技能市场有以 bio-proteomics-dia-analysis 为标题的独立收录页、在 skills.sh 聚合站也有独立子技能页;所属仓库另被 Hermes Agent 官方技能网关文档在 Proteomics 类目下具名列出。
3. 适用场景
所属分类:数据分析与可视化(技能产出是对质谱蛋白质组学数据的统计打分与代码生成,属数据分析范畴,与库内同仓库其余生物信息学分析技能一致)。
适用人群:拿到 DIA 模式质谱原始数据(DIA-NN report.parquet、Spectronaut 或 OpenSWATH 输出)、需要正确识别定量蛋白并按恰当 FDR 阈值过滤的生物信息学研究者与质谱数据分析人员;尤其适合初次接触 DIA 蛋白质组学、容易在“1% FDR 到底指哪个层级和范围”、跨运行矩阵过滤阈值选择上踩坑的中级用户。
4. 跨 Agent 兼容性
| Agent 生态 | 结论 | 依据 |
|---|---|---|
| Claude Code | 原生支持 | 仓库提供 install-claude.sh,支持全局/按项目/按类别安装 |
| Codex | 原生支持 | 仓库提供 install-codex.sh,用法与 Claude Code 版本一致 |
| OpenClaw | 原生支持 | 仓库提供专用 install-openclaw.sh |
| Hermes Agent | 需适配 | Hermes Agent 官方文档在 Proteomics 类目下具名列出 dia-analysis,但做法是浅克隆整个仓库后按需读取 SKILL.md 作参考资料,并非以 Hermes 原生技能格式直接安装 |
5. 推荐理由
DIA 蛋白质组学数据分析里最容易被忽视、却后果最严重的坑,是把“1% FDR”当成一个不需要多问的默认值——不区分层级和范围地随手过滤,很容易让一个看似合规的分析在跨样本队列拼接时把假阳性率放大到远超预期。这个技能没有停留在“跑一条 DIA-NN 命令”,而是把 LEVEL/CONTEXT 这层容易被忽略的方法学决策讲透,同时按五种真实采集设计(固定窗口、可变窗口、交错解复用、diaPASEF、Astral 窄窗口)分别给出适配的处理路径,并把常见报错整理成“触发-机制-症状-修复”表,帮助 agent 在生成分析代码时主动避开这些隐蔽但代价高昂的错误。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | GPTomics 是小型专业研究实验室,非广为人知的一线厂商;本技能具体路径在 LobeHub、skills.sh 两个独立技能市场均有专属收录页,所属仓库另被 Hermes Agent 官方技能网关文档在 Proteomics 类目下具名收录——多个独立第三方平台的可查证收录 |
| 可用性 | 8 | 需自行安装 DIA-NN、Spectronaut(商业)或 OpenSWATH/EncyclopeDIA 等开源工具,非一条命令复制即用;但文档完整(SKILL.md 含决策树、失败模式表、常见错误对照表、可运行代码块),全部核心工具路径(DIA-NN、OpenSWATH)免费开源,该目录 2026 年内持续有实质性提交 |
| 安全性 | 9 | 纯方法论文档与 CLI 命令模式,无自动执行脚本,不索取任何 API key 或凭据,全部计算基于用户本地提供的质谱数据文件、无需运行时联网;MIT 许可证明确;通读全文未发现任何可疑指令 |
安全检查清单:
① shell 命令执行:技能本身不含自动执行的 shell 脚本,示例脚本(examples/diann_analysis.sh)需用户/agent 在自己环境中手动运行,且内容与其注释描述一致
② 联网外发数据:核心流程完全离线,基于用户本地提供的质谱数据计算,不查询任何在线数据库或外部服务
③ API key/凭据:不需要
④ 可疑指令:通读 SKILL.md 全文(236 行)及示例脚本,未发现 prompt injection 或其他可疑指令
⑤ 作者/组织信誉:GPTomics 为 GitHub 组织,未发现刷星或 SEO 操纵措辞
⑥ License:MIT,明确
⑦ 最近维护时间:该技能路径最近实质性提交 2026-06-16,仓库整体最近 push 于 2026-07-25,在近 3 个月维护窗口内
7. 跟同类 Skills 相比的优势
| 竞品 | 定位 | 与本技能的差异 |
|---|---|---|
同合集 spectral-libraries(bioSkills) |
构建实验/色谱图/预测谱图库本身 | 本技能明确在 OUT OF SCOPE 中把谱图库构建划给该技能,自身只负责用库做搜索与在正确 FDR 层级/范围下过滤结果,两者是流水线上下游关系 |
同合集 differential-abundance(bioSkills) |
对已过滤的蛋白矩阵做统计检验 | differential-abundance 消费本技能产出的定量矩阵做组间比较;dia-analysis 负责更上游的“从原始 DIA 数据到可信定量矩阵”这一步 |
| Skyline(MacCoss 实验室开源软件) | 图形化手动峰型审查与靶向定量,长于人工核查与 PRM | 面向可视化人工操作的桌面软件,非发现性搜索引擎;本技能封装的是命令行自动化搜索流程与决策规则,两者常配合使用(Skyline 做微观核查) |
8. 用户评价
该技能目前在 LobeHub 与 skills.sh 两个第三方平台均无具名用户评价或评分记录,GitHub 仓库中也未检索到专门针对该子技能的 issue 或 PR 讨论。
9. 其他补充
所属仓库 bioSkills 创建于 2026-01-15,README 自述覆盖 63 个功能类目、约 561 个子技能。proteomics 类目下还有 data-import、peptide-identification、protein-inference、quantification、ptm-analysis、proteomics-qc、spectral-libraries 等相邻技能,覆盖蛋白质组学分析流程的其余环节。
10. 安装使用方式
- Claude Code(推荐):
git clone https://github.com/GPTomics/bioSkills.git && cd bioSkills && ./install-claude.sh --categories "proteomics"按类别安装,或不带参数全量安装;也可手动把proteomics/dia-analysis/目录复制到.claude/skills/ - Codex:同一仓库下运行
./install-codex.sh - OpenClaw:运行专用的
./install-openclaw.sh - 安装后注意事项:技能本身零额外安装,但运行其推荐代码需预先装好 DIA-NN(或 Spectronaut/OpenSWATH/EncyclopeDIA 等对应工具);无需重启 agent;对话中出现“DIA”“DIA-NN”“数据非依赖式采集”“dia-analysis”等关键词或直接引用技能名即可触发
11. 注意事项
- 该技能提供的是方法选择、采集设计科普与命令行模式,不代替用户安装 DIA-NN 等质谱分析工具本身
- Spectronaut 为商业软件,需付费许可证;技能同时给出 DIA-NN、OpenSWATH、EncyclopeDIA 等免费开源替代路径
- 合集仓库整体 1,116 stars 与 193 forks 覆盖数百个子技能,不代表本技能个体的采用热度