1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | sequence-logos-gptomics-bioskills |
| 项目自述名称 | Sequence Logos(SKILL.md 内部标题) |
| 作者/维护者 | GPTomics Organization |
| 来源链接 | https://github.com/GPTomics/bioSkills/tree/main/data-visualization/sequence-logos |
| 许可证 | MIT(数据来源:GitHub API,仓库级) |
| GitHub Stars / Forks | 所属合集仓库 bioSkills 整体 1,152 / 195(数据来源:GitHub API;⚠️ 为整个合集的数字,不代表本技能自身热度) |
| 最新版本 | 本子技能内容最近一次提交于 2026-05-24(数据来源:GitHub API commits,按该子目录路径查询) |
| 安装方式 | 复制 data-visualization/sequence-logos/ 整个目录(含 SKILL.md、examples/、usage-guide.md)到 agent 的 skills 目录,或用仓库自带安装脚本按分类批量安装 |
2. 功能介绍与亮点
- 系统封装序列 logo(sequence logo)绘制的核心决策逻辑:清晰区分 bits(信息量编码,Schneider-Stephens 1990)与 probability(原始频率)两种编码方式的语义差异,并明确“默认应使用 bits 编码”这一行业惯例
- 覆盖三套主流实现:R 的
ggseqlogo(支持 PWM 矩阵与序列向量两种输入、多 logo 堆叠比较)、Python 的Logomaker(支持 counts→information/weight 矩阵转换、log-odds 富集/缺失可视化)、CLI/网页版WebLogo - 给出背景频率校正的具体数值参考(如人类基因组 A=0.29/C=0.21/G=0.21/T=0.29),并解释未做校正时信息量会如何被高估或低估
- 系统整理 7 类具体失败模式对照表(bits/probability 编码混淆、背景频率设置错误、PWM 矩阵行列颠倒、非常规字母表无法识别、小样本量 logo 的信息量偏差等),逐条给出触发条件、症状与修复方法
- 附独立
usage-guide.md与多组可直接套用的自然语言提示词范例(转录因子结合位点、剪接位点、CRISPR spacer、磷酸化位点等场景),并列出规范参考文献(Schneider-Stephens 1990、Crooks 2004 WebLogo 原始论文、Wagih 2017 ggseqlogo 论文等)
3. 适用场景
所属分类:数据分析与可视化
面向需要将比对后的 DNA/RNA/蛋白质基序可视化为序列 logo 图的生物信息学研究者,典型场景包括:转录因子结合位点(TF binding site)的 PWM 可视化、剪接位点组成分析、CRISPR sgRNA 的位置组成图、磷酸化位点邻近氨基酸的功能分类配色 logo,以及多个转录因子 motif 的堆叠比较。这类图表编码方式选错(如误用 probability 而非 bits)或背景频率设置不当会直接扭曲对保守性的科学解读,该技能把这套容易出错的决策逻辑显式化。
4. 跨 Agent 兼容性
- Claude Code:原生支持——仓库提供
install-claude.sh,标准 SKILL.md(YAML front matter + 指令正文)可直接安装 - Codex:原生支持——仓库提供
install-codex.sh,用法与 Claude Code 版本一致 - OpenClaw:原生支持——仓库提供专用
install-openclaw.sh,保留原始目录结构 - Hermes Agent:未验证——未获取到该技能是否被 Hermes 官方技能网关索引的材料;SKILL.md 遵循通用 Agent Skills 格式,理论上可手动安装,但缺乏官方网关层面的确认
5. 推荐理由
序列 logo 是分子生物学论文中最常见的图表类型之一,但 bits 与 probability 两种编码方式外观相似、语义却完全不同,编码选错或背景频率设置不当会让图表看起来比实际更保守(或更不保守),这类错误在制图阶段很难被发现。该技能把这套判断逻辑与三套主流工具(ggseqlogo / Logomaker / WebLogo)的具体调用方式打包成可直接执行的方法论,帮助 agent 一次产出编码正确、经得起审稿人推敲的 motif 图。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 5 | 所属合集仓库整体约 1,150 stars 不代表本技能自身热度;未检索到针对该子技能的具名第三方评价或独立采用数据 |
| 可用性 | 9 | SKILL.md(约 13KB)+ 独立 usage-guide.md + 多组可直接套用的提示词范例,内容详尽且开头即给出版本核验方法;依赖为一条 install.packages/pip 命令即可装好的开源包(ggseqlogo/Logomaker/WebLogo),无付费依赖;本子技能内容最近一次提交为 2026-05-24 |
| 安全性 | 9 | 纯提示词模板 + 本地 R/Python/CLI 绘图代码,无 shell 命令执行,无任何网络外发;MIT 许可证明确;通读全文与代码示例未见混淆逻辑或可疑指令 |
安全检查清单:①无 shell 命令执行,内容为 R/Python/CLI 绘图代码与配置示例 ②不主动联网外发数据,全部处理在本地完成 ③无凭据或 API key 要求 ④SKILL.md 与 usage-guide 均为公开的 ggseqlogo/Logomaker/WebLogo 用法说明,未见可疑指令 ⑤GPTomics 为持续维护该开源合集的组织账号,未见刷星等造假迹象 ⑥MIT 许可证清晰 ⑦最近一次提交为 2026-05-24
7. 跟同类 Skills 相比的优势
| 维度 | 本技能(sequence-logos) | 直接使用 ggseqlogo/Logomaker/WebLogo 原始工具 | genome-tracks(同合集) |
|---|---|---|---|
| 定位 | 序列基序(motif)保守性可视化的编码选择与背景校正方法论封装 | 单纯的绘图库/CLI,不附带编码选型或背景校正的决策指导 | 基因组坐标区间的多轨道可视化(覆盖度、注释、结构变异),与基序无关 |
| 核心价值 | 明确“何时用 bits、何时用 probability”及背景频率校正的具体数值,避免保守性被视觉误导 | 需要使用者自行掌握信息论编码原理才能正确调用 | 服务完全不同的可视化目标(基因组区域而非单个基序) |
| 失败模式覆盖 | 7 类失败模式逐条给出触发条件与修复方法(编码混淆、矩阵转置错误、小样本偏差等) | 原始文档通常只给 API 参数说明,不覆盖典型误用场景 | 不适用(非同类图表) |
该技能与合集内 genome-tracks、heatmaps-clustering 等技能服务不同的图表需求,彼此互补而非替代;相对于直接调用底层绘图库,其价值在于把容易被忽视的编码语义与背景校正决策显式化。
8. 用户评价
该技能目前在第三方平台尚无具名用户评价;所属仓库当前未见针对本子技能的具名 Issue 反馈。
9. 其他补充
SKILL.md 的“Related Skills”交叉引用同合集内的 chip-seq/motif-analysis(发现该转化为 logo 的 PWM)、atac-seq/footprinting、clip-seq/clip-motif-analysis、alignment/multiple-alignment(提供 logo 输入所需的比对序列)与 data-visualization/color-palettes(自定义字母表配色),可见本技能在合集内承担“基序可视化下游呈现”这一专项角色。
10. 安装使用方式
- 从 GitHub 下载或克隆仓库子目录:
data-visualization/sequence-logos/ - 复制整个目录(含
SKILL.md、examples/、usage-guide.md)到所用 agent 的 skills 目录(如 Claude Code 的~/.claude/skills/或项目内.claude/skills/);也可克隆整个仓库后用./install-claude.sh --categories "data-visualization"批量安装同分类下全部技能 - 安装依赖:R 用户
install.packages('ggseqlogo');Python 用户pip install logomaker;CLI 用户pip install weblogo - 无需重启 agent,安装后下次对话即可通过自然语言描述需求触发(如“用 bits 编码画一张 CTCF 结合位点的序列 logo,人类基因组背景频率校正,ggseqlogo 核苷酸配色”)
11. 注意事项
- 默认应使用 bits 编码而非 probability 编码,后者无法区分“高度保守”与“完全不保守但恰好某碱基占多数”两种情况
- 基因组来源的基序必须传入对应的背景频率(
bg_freq/background参数),否则信息量会被系统性高估或低估 - 样本量过小(N<20)时信息量存在小样本偏差,logo 会显得比实际数据支撑的更“保守”,需做 Schneider 1986 小样本校正或在图注标明 N
- 仓库为社区维护的生物信息学技能合集,非任何厂商官方出品,选用前建议自行核对示例代码与当前环境版本是否匹配