1. 基本信息
| 项目 | 内容 |
|---|---|
| 名称 | codex-autoresearch |
| 作者/维护者 | Linxiao Li(GitHub 账号 leo-lilinxiao,CITATION.cff 署名一致) |
| 来源链接 | https://github.com/leo-lilinxiao/codex-autoresearch |
| 许可证 | MIT(GitHub API 实测,仓库 LICENSE 文件原文一致) |
| GitHub Stars | 1,991(GitHub API 实测) |
| Forks | 115(GitHub API 实测) |
| 最新版本 | v0.6.0(仓库 tag) |
| 安装方式 | Codex 内 $skill-installer install 一条命令 |
2. 功能介绍与亮点
codex-autoresearch 把“改一点、测一下、留好的、扔坏的”这套实验方法论产品化成 Codex 的自主优化技能:用户说明一个可测量的目标(如把某脚本的错误数降到 0、提高测试覆盖率、缩短延迟),技能反复执行“检查证据 → 改一处 → 验证 → 保留或撤销 → 记录”,直到达标。
亮点:
- 数字指标驱动:目标必须落到一个可执行命令输出的具体数字或 JSON 字段上,不接受“AI 觉得改好了”这种主观判断。
- 每次尝试都是一次可回滚的 git 提交:验证通过则保留,不通过则自动
revert,不会在仓库里堆积失败改动。 - 写入前必须用户确认:首次写入或启动前,技能会列出目标、涉及路径、验证命令、模式,需用户明确回复(如“go”)才会动手。
- 完整审计轨迹:所有基线、尝试、保留/丢弃、完成事件都追加写入
events.jsonl,可导出为 TSV 或生成自包含的 HTML 报告。 - 前台/后台两种模式:前台配合 Codex 官方 Goal 机制持续对话式跟进;后台可交由独立 controller 长时间或过夜运行。
- 文档含英、中、日、韩、法、德、西、葡、俄九种语言版本。
3. 适用场景
所属分类:元技能与 Agent 增强。适合使用 Codex、且优化目标能落到具体数字上的开发者——例如清零某类测试失败、提升代码覆盖率、压缩构建产物体积、优化某段代码的运行延迟;也适合需要长时间或过夜运行优化任务、并要求过程留痕可追溯(而非“AI 说它改好了”)的团队。
4. 跨 Agent 兼容性
- Codex:原生支持,专为 Codex CLI 设计,依赖
codex exec与 Codex 官方 Goal 机制维持前台持续运行。 - Claude Code:不支持,未见适配层;安装机制(
$skill-installer)与运行时钩子均绑定 Codex CLI。 - OpenClaw / Hermes Agent:未验证,已抓取材料中未见相关说明。
5. 推荐理由
把严谨的“假设-验证-取舍”实验方法论产品化成可复用的 Codex 技能,用可验证的数字指标和逐次可回滚的 git 提交取代模糊的“改好了”判断,长时间自主迭代任务因此变得可控、可审计、可复盘。
6. 评分
| 维度 | 分数 | 说明 |
|---|---|---|
| 受欢迎程度 | 7 | 1,991 Stars、115 Forks(GitHub API 实测),创建约 4 个月以来增长平稳;仓库 Issue 区有多位不同用户提出工作区模式、Windows 兼容性、多目标评分等真实使用问题,显示有稳定的实际用户群体 |
| 可用性 | 9 | 一条命令安装;README/GUIDE/EXAMPLES/INSTALL 四份文档齐全并配九种语言翻译;已迭代至 v0.6.0,最近一次提交在 8 天前;不依赖付费服务 |
| 安全性 | 7 | 见下方安全检查清单 |
| 综合 | 7.7 | 三项均值 |
安全检查清单:
① shell 执行权限:前台需以 --dangerously-bypass-approvals-and-sandbox 启动 Codex,后台模式默认 danger-full-access——权限较宽,但用途明确(自主改代码、跑验证命令、git 提交/回滚均依赖此权限),且首次写入前强制走用户确认。
② 外发数据:审阅约 1,584 行的控制脚本,未发现任何网络请求相关代码;验证与守卫命令均为用户在本机指定的本地命令。
③ 凭据要求:不要求任何 API Key,仅依赖本地 Codex CLI 与 git。
④ 可疑指令:SKILL.md 与控制脚本中未见隐藏指令或混淆代码;文档明确要求“绝不静默猜测或修复状态”。
⑤ 作者信誉:独立开发者,CITATION.cff 提供真实署名,未见刷星或 SEO 操纵措辞。
⑥ License:MIT,清晰明确。
⑦ 维护:最近一次提交 8 天前,版本持续迭代,维护活跃。
扣分原因:需要较宽的 shell 执行权限(含沙箱 bypass)才能完成自主修改与提交,虽范围明确、全程留痕、无外联无凭据要求,但相比不执行代码的纯提示词类技能,风险敞口更大。
7. 跟同类 Skills 相比的优势
| Skill | 定位 | 与本技能的差异 |
|---|---|---|
| ralph-loop(Anthropic 官方) | Claude Code 的 Stop Hook 循环:拦截会话退出,把同一提示词重新喂回去,直到输出预设“完成口令” | 面向 Claude Code 而非 Codex;是否完成依赖 Claude 在对话中给出的口令,没有可验证的数字指标,也没有逐次提交/回滚机制 |
| autoharness | Claude Code 后台的自学习技能层:分析近期会话,把摸索出的经验自动沉淀为新的 SKILL.md | 目标是积累技能库本身,不针对某个可测量指标做优化,也不涉及 git 级别的提交与失败回滚 |
codex-autoresearch 的差异化核心是“数字指标驱动 + git 级可回滚的审计闭环”:把优化过程变成一份可验证、可复盘的实验记录,而不是靠对话轮次或口头判断来决定“是否做完了”。
8. 用户评价
- GitHub 用户 dantetemplar 在 Issue #14 中反馈:他的排课调度脚本只有一组难以量化优先级的评价标准,没有现成的单一分数或权重——反映了该工具已被用于教育排课等真实工程场景,也暴露出面向多准则、难量化目标时的使用门槛。
- GitHub 用户 PolarisLight 在 Issue #19 中报告:Windows 环境下
codex exec因[WinError 5] Access is denied无法启动后台运行时,问题出在系统进程启动层而非工作区权限层,为 Windows 用户提供了明确的已知限制线索。
该技能目前在第三方评测平台尚无具名评价,社区反馈集中在 GitHub Issue 区的技术讨论。
9. 其他补充
- 文档提供英、中、日、韩、法、德、西、葡、俄九种语言版本。
- 实验历史可导出为 TSV 表格,或生成自包含的静态 HTML 报告,便于团队复盘或分享。
- 提供 CITATION.cff,支持学术场景引用。
10. 安装使用方式
在 Codex 中安装:
$skill-installer install https://github.com/leo-lilinxiao/codex-autoresearch
随后以完整权限打开一个干净的 Git 仓库:
codex --dangerously-bypass-approvals-and-sandbox
在对话中输入 $codex-autoresearch 加一句目标描述唤起技能,例如“把 python3 scripts/score.py 的 error_count 降到 0”。Codex 会先给出基线值、验证命令、修改范围等确认信息,需用户明确回复确认词(如“go”)后才会开始写入与提交。也可选择后台模式支持长时间或过夜运行,随时可通过 $codex-autoresearch 查询状态、暂停或恢复。
注意事项:需要一个已初始化、状态干净(无未提交改动)的具名 Git 分支;一次运行只管理一个仓库的一个实验。
11. 注意事项
- 仅支持 OpenAI Codex,不支持 Claude Code / OpenClaw / Hermes Agent。
- 需要以较宽权限(bypass 沙箱审批)运行 Codex,建议仅在信任的代码仓库内使用,并留意每次实验都会产生真实的 git 提交历史。
- Windows 环境下后台模式可能因
codex exec进程启动层问题无法运行(对应仓库 Issue #19,尚未确认修复)。 - 依赖用户给出可用数字或 JSON 字段衡量的验证命令,对难以量化、需要多准则权衡的目标支持有限。