1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | rigorous-experiments(glebis/claude-skills 仓库子技能) |
| 作者/维护者 | Gleb Kalinin(柏林个人开发者,持续维护该仓库) |
| 来源链接 | https://github.com/glebis/claude-skills/tree/main/rigorous-experiments |
| 许可证 | MIT(GitHub API 确认,仓库整体) |
| GitHub Stars / Forks | 345 / 52(仓库整体,GitHub API 确认;本技能为合集内子目录,评分未沿用该数字) |
| 最新版本 | 无正式 Release;仓库最近一次提交 2026-08-04 |
| 安装方式 | git clone 仓库后复制 rigorous-experiments/ 目录到 ~/.claude/skills/,或按需手动拷贝单个技能目录 |
2. 功能介绍与亮点
这是一个把统计实验方法论固化成可执行流程的技能,专为分析个人/观察性时间序列数据(健康指标、语音/文本语料、行为日志、日记、n-of-1 自我追踪)设计。SKILL.md 明确写道其规则“提炼自一个 54 次实验的 n-of-1 项目,其中采样置换检验、缺失数据伪影、App 分类 bug 反复制造又被推翻’发现’”——每条规则的存在都对应一次真实踩坑。
核心能力:
- 六种模式:design(设计假设)、conduct(实现并运行)、validate-data(新数据源可信度校验)、cross-validate(对抗式代码复核+外部模型交叉验证)、investigate-leads(p<0.06 未达 FDR 阈值的线索排查)、audit(复核历史结论)。
- 十条不可妥协的核心规则:计算前预注册假设与检验方式;小样本一律用精确置换检验而非采样置换(避免虚假精度);BH 多重比较用设计时声明的固定 m 而非
len(tests)(防止破坏预注册的事后调整);相关性分析前先做平稳性检验;分组前先做辛普森悖论分层检查;隐私规则——原始文本/音频永不进入输出文件。 - 自带结果查看器(
explorer.py,仅监听本地回环地址,绝不暴露到非本机接口)与自动化评测套件(evals/run_evals.py),可对实验脚本/结果对是否满足预注册、精确置换、无原始文本泄漏等标准做自动 lint。
3. 适用场景
固定分类:数据分析与可视化。适用于对自己的健康指标、习惯追踪、写作/语音语料等观察性数据做统计分析的个人量化自我实践者,以及需要为小样本时间序列设计站得住脚的假设检验流程、避免“发现”被后续复核推翻的数据分析师。
4. 跨 Agent 兼容性
- Claude Code:原生支持——遵循标准 Agent Skills 目录结构(SKILL.md + scripts/ + references/ + evals/),可直接复制到
~/.claude/skills/使用。 - Codex / OpenClaw / Hermes Agent:仓库主 README 未提供分平台安装说明,技能本体是纯 Markdown 指令 + Python 脚本,理论上可手动指向 SKILL.md 路径使用,但未见官方验证,未验证。
5. 推荐理由
个人数据分析最容易在“看起来像发现”和“真的是发现”之间踩坑——小样本采样置换会虚报精度、混杂变量会掩盖真实效应方向、事后调整的多重比较阈值会让噪声看起来显著。这个技能把这些具体的、曾经真实发生过的错误各自对应成一条硬性规则,而不是一句笼统的“统计要严谨”,并配有自动化评测套件在执行后核验是否被遵守。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 5 | 所属仓库 345 stars/52 forks,该数字覆盖仓库内约 90 个子技能,不代表本技能自身热度;本技能自身尚无独立的第三方讨论或采用证据 |
| 可用性 | 9 | 唯一外部依赖是 numpy(轻量、标准 Python 生态);五份参考文档(design/statistics/data-validation/cross-validation/lead-investigation)覆盖完整工作流;自带评测套件可自我校验;仓库最近一次提交为 2026-08-04,维护活跃 |
| 安全性 | 9 | 执行的 Python 脚本范围明确(统计计算、结果可视化),无可疑指令;结果查看器显式限定仅监听本地回环地址;SKILL.md 明文规定原始文本/音频不得进入输出文件或外部上传;License MIT 明确 |
安全检查清单:① Shell 命令/权限——运行本地 Python 统计脚本与本地回环 HTTP 查看器,范围明确、有文档说明;② 联网外发——查看器显式禁止绑定非回环接口,无其他外联;③ API key/凭据——不涉及;④ 可疑指令——未发现;⑤ 作者信誉——同一开发者仓库内已有多个子技能持续维护,无造假迹象;⑥ License——MIT,明确;⑦ 最近维护——2026-08-04,五天内。
7. 跟同类 Skills 相比的优势
| 对比对象 | 定位 | 与 rigorous-experiments 的差异 |
|---|---|---|
| 通用统计分析提示/脚本(无专门技能) | 依赖用户自行判断该用哪种检验、如何处理多重比较 | 无固定方法论,容易重复踩“采样置换虚报精度”“事后调整 FDR 阈值”这类具体错误 |
| 学术向研究方法技能(如同索引内的学术研究类技能) | 面向文献综述、论文写作等学术研究全流程 | 不专注统计检验本身的正确性细节,缺少针对小样本时间序列的精确置换、平稳性检验等专项规则 |
目前第三方渠道未见专门针对个人观察性时间序列数据设计的统计严谨性技能;该技能的差异化在于把一次真实的 54 次实验踩坑历史转化成可执行、可自动核验的规则集,而非通用统计教科书式的建议。
8. 用户评价
该技能目前在第三方平台尚无具名用户评价。
9. 其他补充
技能内置的评测套件(evals/run_evals.py + evals/cases/)用真实的通过/失败案例文档化了“预注册存在”“固定字面量 m”“使用精确置换”“结果含 caveats”“输出不含原始文本”等检查项,本身可作为学习该方法论的参考材料。
10. 安装使用方式
git clone https://github.com/glebis/claude-skills.git
mkdir -p ~/.claude/skills
cp -r claude-skills/rigorous-experiments ~/.claude/skills/
安装后无需重启,Claude Code 会自动发现该技能;描述“帮我设计一个实验”“这个相关性是真的吗”“审计一下这些发现”等请求即可触发。查看已有结果可运行 python3 scripts/explorer.py <结果目录> 启动本地查看器。
11. 注意事项
- 该技能面向有一定统计基础的用户设计,规则本身假定使用者理解置换检验、FDR、平稳性等概念,初学者需要额外学习成本才能判断技能给出的建议是否被正确执行。
- 受欢迎程度评分基于该子技能自身证据的欠缺,仅可参考所属仓库的整体规模作为背景信息。
- Codex、OpenClaw、Hermes Agent 的具体接入方式未经实测验证,使用前建议先在小范围内确认兼容性。