1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | spatial-preprocessing-gptomics-bioskills |
| 项目自述名称 | Spatial Preprocessing(SKILL.md 内部标题;front matter name 字段为 bio-spatial-transcriptomics-spatial-preprocessing) |
| 作者/维护者 | GPTomics Organization |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/spatial-transcriptomics/spatial-preprocessing |
| 许可证 | MIT(数据来源:GitHub API,仓库级) |
| GitHub Stars / Forks | 所属合集仓库 bioSkills 整体 1,162 / 195(数据来源:GitHub API;⚠️ 为整个合集的数字,不代表本技能自身热度) |
| 最新版本 | 仓库整体最新 release 为 3.0(2026-02-14);本子技能内容最近一次提交于 2026-06-28(数据来源:GitHub API commits,按该子目录路径查询) |
| 安装方式 | 复制 spatial-transcriptomics/spatial-preprocessing/ 整个目录(含 SKILL.md、examples/、usage-guide.md)到 agent 的 skills 目录,或用仓库自带安装脚本按分类批量安装 |
2. 功能介绍与亮点
- 面向空间转录组数据的质控、过滤与标准化,核心是先判断数据属于“测序/spot”平台(Visium、Visium HD、Slide-seq、Stereo-seq)还是“成像/原位”平台(Xenium、MERSCOPE/MERFISH、CosMx),因为两者的质控阈值与标准化方法完全不同
- 关键论点:在单细胞 RNA-seq 中文库大小是需要除掉的技术噪音,但在空间数据中“文库大小承载着生物学信息”——Visium 上总计数与每 spot 细胞数及组织细胞密度相关,成像平台上总计数与细胞体积/面积相关,粗暴地按文库大小归一化会抹去这些真实的空间结构,引用 Bhuva 2024 Genome Biology 与 Atta/Fan 2024 Genome Biology 两篇论文的量化结果佐证(歪斜靶向面板上基因计数类归一化方法会引入最高约 13% 的差异表达误差,且最多 19% 的基因出现倍数变化方向反转)
- 明确指出把单细胞 RNA-seq 的质控默认值套用到成像数据是错误的:成像平台每个细胞仅有几十到几百条转录本(比液滴法单细胞低一到两个数量级),
min_counts=500这类默认下限会删掉几乎所有真实细胞,且会优先误删体积较小的真实细胞类型(如淋巴细胞) - 给出成像平台专属的“阴性对照探针/空白条码假发现率”计算方法(这是成像数据唯一原生的特异性指标),以及归一化方法对照表(
normalize_total+log1pvs 解析 Pearson 残差 vs SCTransform v2 vs 细胞体积/面积归一化 vs SpaNorm),说明 Pearson 残差与 SCTransform 并不能修复歪斜靶向面板的偏差、仍需改用与基因计数无关的体积/面积归一化 - 强调质控必须在组织空间坐标上可视化检查,而非只看小提琴图——平滑的空间梯度往往是切片边缘效应或渗透不均等技术伪影而非生物学信号;附带 10 条“症状-成因-修复”常见错误对照表与 9 篇同行评审文献引用
- 附带可直接运行的
examples/preprocess_spatial.py(用 Squidpy 内置 Visium 与 MERFISH 数据集端到端演示两条分叉分支)与独立usage-guide.md
3. 适用场景
所属分类:数据分析与可视化
面向处理空间转录组原始数据、需要在质控与标准化阶段按平台类型选对阈值与方法的生物信息学分析者。典型场景包括:Xenium/MERFISH/CosMx 等成像平台数据设定质控下限而不误删真实的低表达细胞、判断歪斜靶向面板该用哪种归一化方法而不是套用单细胞默认流程、计算成像数据的阴性对照假发现率、以及在组织坐标上排查质控伪影。
4. 跨 Agent 兼容性
- Claude Code:原生支持——仓库提供
install-claude.sh,标准 SKILL.md(YAML front matter + 指令正文)可直接安装 - Codex:原生支持——仓库同时提供
install-codex.sh - OpenClaw:原生支持——仓库提供专用
install-openclaw.sh,保留原始目录结构 - Hermes Agent:需适配——Hermes Agent 官方生物信息学技能网关页面把 bioSkills 列为参考技能来源之一,按名列出
spatial-preprocessing,但明确说明这类技能“不是 Hermes 格式的技能”,只作为专家领域参考指南(含正确参数与代码模式,非可直接执行的流水线)被引用,而非以原生 Hermes 技能格式安装
5. 推荐理由
质控与标准化是空间转录组分析流水线的第一步,也是最容易把后续分析全部带偏的一步:如果在这一步套用单细胞的默认阈值,成像平台的真实细胞会被大量误删;如果不假思索地做文库大小归一化,Visium 数据里承载着组织解剖结构的信号会被抹平。该技能把“先判断平台族群、再分别决定阈值与归一化方法”这套框架,连同量化的文献证据、成像平台专属的假发现率指标与常见错误对照表打包成可直接调用的方法论,帮助 agent 在拿到原始数据的第一步就走对方向。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 所属合集仓库整体约 1,162 stars 不代表本技能自身热度;LobeHub 独立市场页单独收录本技能,Hermes Agent 官方生物信息学技能网关按名列出该技能,均为技能级独立第三方证据 |
| 可用性 | 9 | pip install squidpy scanpy anndata spatialdata 一条命令即可装好,无付费依赖;SKILL.md + usage-guide.md + 可直接运行示例脚本齐全;本子技能内容最近一次实质提交为 2026-06-28,在近 3 个月维护窗口内 |
| 安全性 | 9 | 纯 Python 本地分析代码,无 shell 越权执行,无网络外发,无需 API key 或凭据;MIT 许可证明确;通读全文与示例脚本未见混淆逻辑或可疑指令 |
安全检查清单:①无 shell 命令执行,内容为标准科学计算库调用与本地数据处理代码 ②不联网外发数据,全部计算在本地完成 ③无凭据或 API key 要求 ④SKILL.md 与示例脚本经通读未见可疑指令 ⑤GPTomics 为持续维护该开源合集的组织账号,未见刷星等造假迹象 ⑥MIT 许可证清晰 ⑦最近一次实质提交为 2026-06-28
7. 跟同类 Skills 相比的优势
| 维度 | 本技能(spatial-preprocessing) | spatial-deconvolution(同合集) | image-analysis(同合集) |
|---|---|---|---|
| 定位 | 空间转录组数据的质控、过滤与标准化,是下游分析前的第一道预处理关卡 | 从质控后的数据估算每个 spot 的细胞类型组成,覆盖 8 种反卷积方法选型 | 处理已是单细胞分辨率的成像平台数据,做细胞分割与图像特征提取 |
| 核心价值 | 平台族群分叉判断框架、成像平台专属假发现率指标、归一化方法对照表 | 分辨率分岔判断框架、参考质量优先原则、跨方法选型对比 | 分割策略选型与转录本溢出风险判断 |
| 适用数据类型 | 覆盖 Visium、Visium HD、Slide-seq、Xenium、MERFISH、CosMx 等全部主流平台 | Visium/GeoMx 等多细胞混合捕获平台为主 | Xenium/MERFISH/CosMx 等单细胞分辨率成像平台 |
三者在 SKILL.md 的“Related Skills”章节互相交叉引用,分工覆盖空间转录组分析流水线的不同阶段(预处理→分割/反卷积→下游分析),属互补而非重叠关系。
8. 用户评价
该技能目前在第三方平台尚无具名用户评价;LobeHub 与 Hermes Agent 官方网关均为收录/索引性质的列表页,不构成使用评价。
9. 其他补充
SKILL.md 的“Related Skills”章节交叉引用同合集内的 spatial-data-io(加载 Visium/Xenium/MERFISH 原始数据)、image-analysis(成像数据的细胞分割,决定成像质控用到的细胞面积从哪来)、spatial-deconvolution(质控标准化之后的下一步)、single-cell/preprocessing(本技能刻意背离的单细胞质控基线)与 single-cell/clustering(质控完成后的下一道工序),可见本技能在合集内承担“空间数据入口质控关卡”这一专项角色。
10. 安装使用方式
- 从 GitHub 下载或克隆仓库子目录:
spatial-transcriptomics/spatial-preprocessing/ - 复制整个目录(含
SKILL.md、examples/、usage-guide.md)到所用 agent 的 skills 目录(如 Claude Code 的~/.claude/skills/或项目内.claude/skills/);也可克隆整个仓库后用./install-claude.sh --categories "spatial-transcriptomics"批量安装同分类下全部技能 - 安装依赖:
pip install squidpy scanpy anndata spatialdata - 无需重启 agent,安装后下次对话即可通过自然语言描述需求触发(如“我的 Xenium 细胞每个大约 100 条转录本,该用什么计数下限才不会误删真实的淋巴细胞”)
11. 注意事项
- 平台族群分叉是前置判断:把 scRNA-seq 的质控下限(如
min_counts=500)直接套到成像平台数据会删掉几乎所有真实细胞,必须先判断数据属于测序/spot 还是成像/原位平台 - 成像平台通常无法做线粒体比例质控(线粒体基因一般不在靶向面板内),也不应把“每细胞基因数偏高”当作双细胞信号——基因数的天花板就是面板大小本身
- 归一化不是默认动作:文库大小在空间数据中承载真实的生物学信息,粗暴按文库大小归一化可能抹去空间结构,需按数据类型从归一化方法对照表中选择
- 成像平台归一化推荐依赖细胞分割得到的面积/体积字段,若无该字段可改用 SpaNorm(R/Bioconductor)而非直接套用基因计数类方法
- 仓库为社区维护的生物信息学技能合集,非任何厂商官方出品,选用前建议自行核对示例代码与当前环境包版本是否匹配