SkillsScout
META-AGENT / 元技能与 Agent 增强

codex-autoresearch

收录日期 2026-07-21·来源仓库 ↗
受欢迎程度
7
可用程度与相关性
9
安全性
7
7.7SCOUT SCORE

1. 基本信息

项目 内容
名称 codex-autoresearch
作者/维护者 Linxiao Li(GitHub 账号 leo-lilinxiao,CITATION.cff 署名一致)
来源链接 https://github.com/leo-lilinxiao/codex-autoresearch
许可证 MIT(GitHub API 实测,仓库 LICENSE 文件原文一致)
GitHub Stars 1,991(GitHub API 实测)
Forks 115(GitHub API 实测)
最新版本 v0.6.0(仓库 tag)
安装方式 Codex 内 $skill-installer install 一条命令

2. 功能介绍与亮点

codex-autoresearch 把“改一点、测一下、留好的、扔坏的”这套实验方法论产品化成 Codex 的自主优化技能:用户说明一个可测量的目标(如把某脚本的错误数降到 0、提高测试覆盖率、缩短延迟),技能反复执行“检查证据 → 改一处 → 验证 → 保留或撤销 → 记录”,直到达标。

亮点:

3. 适用场景

所属分类:元技能与 Agent 增强。适合使用 Codex、且优化目标能落到具体数字上的开发者——例如清零某类测试失败、提升代码覆盖率、压缩构建产物体积、优化某段代码的运行延迟;也适合需要长时间或过夜运行优化任务、并要求过程留痕可追溯(而非“AI 说它改好了”)的团队。

4. 跨 Agent 兼容性

5. 推荐理由

把严谨的“假设-验证-取舍”实验方法论产品化成可复用的 Codex 技能,用可验证的数字指标和逐次可回滚的 git 提交取代模糊的“改好了”判断,长时间自主迭代任务因此变得可控、可审计、可复盘。

6. 评分

维度 分数 说明
受欢迎程度 7 1,991 Stars、115 Forks(GitHub API 实测),创建约 4 个月以来增长平稳;仓库 Issue 区有多位不同用户提出工作区模式、Windows 兼容性、多目标评分等真实使用问题,显示有稳定的实际用户群体
可用性 9 一条命令安装;README/GUIDE/EXAMPLES/INSTALL 四份文档齐全并配九种语言翻译;已迭代至 v0.6.0,最近一次提交在 8 天前;不依赖付费服务
安全性 7 见下方安全检查清单
综合 7.7 三项均值

安全检查清单: ① shell 执行权限:前台需以 --dangerously-bypass-approvals-and-sandbox 启动 Codex,后台模式默认 danger-full-access——权限较宽,但用途明确(自主改代码、跑验证命令、git 提交/回滚均依赖此权限),且首次写入前强制走用户确认。 ② 外发数据:审阅约 1,584 行的控制脚本,未发现任何网络请求相关代码;验证与守卫命令均为用户在本机指定的本地命令。 ③ 凭据要求:不要求任何 API Key,仅依赖本地 Codex CLI 与 git。 ④ 可疑指令:SKILL.md 与控制脚本中未见隐藏指令或混淆代码;文档明确要求“绝不静默猜测或修复状态”。 ⑤ 作者信誉:独立开发者,CITATION.cff 提供真实署名,未见刷星或 SEO 操纵措辞。 ⑥ License:MIT,清晰明确。 ⑦ 维护:最近一次提交 8 天前,版本持续迭代,维护活跃。 扣分原因:需要较宽的 shell 执行权限(含沙箱 bypass)才能完成自主修改与提交,虽范围明确、全程留痕、无外联无凭据要求,但相比不执行代码的纯提示词类技能,风险敞口更大。

7. 跟同类 Skills 相比的优势

Skill 定位 与本技能的差异
ralph-loop(Anthropic 官方) Claude Code 的 Stop Hook 循环:拦截会话退出,把同一提示词重新喂回去,直到输出预设“完成口令” 面向 Claude Code 而非 Codex;是否完成依赖 Claude 在对话中给出的口令,没有可验证的数字指标,也没有逐次提交/回滚机制
autoharness Claude Code 后台的自学习技能层:分析近期会话,把摸索出的经验自动沉淀为新的 SKILL.md 目标是积累技能库本身,不针对某个可测量指标做优化,也不涉及 git 级别的提交与失败回滚

codex-autoresearch 的差异化核心是“数字指标驱动 + git 级可回滚的审计闭环”:把优化过程变成一份可验证、可复盘的实验记录,而不是靠对话轮次或口头判断来决定“是否做完了”。

8. 用户评价

  1. GitHub 用户 dantetemplar 在 Issue #14 中反馈:他的排课调度脚本只有一组难以量化优先级的评价标准,没有现成的单一分数或权重——反映了该工具已被用于教育排课等真实工程场景,也暴露出面向多准则、难量化目标时的使用门槛。
  2. GitHub 用户 PolarisLight 在 Issue #19 中报告:Windows 环境下 codex exec[WinError 5] Access is denied 无法启动后台运行时,问题出在系统进程启动层而非工作区权限层,为 Windows 用户提供了明确的已知限制线索。

该技能目前在第三方评测平台尚无具名评价,社区反馈集中在 GitHub Issue 区的技术讨论。

9. 其他补充

10. 安装使用方式

在 Codex 中安装:

$skill-installer install https://github.com/leo-lilinxiao/codex-autoresearch

随后以完整权限打开一个干净的 Git 仓库:

codex --dangerously-bypass-approvals-and-sandbox

在对话中输入 $codex-autoresearch 加一句目标描述唤起技能,例如“把 python3 scripts/score.py 的 error_count 降到 0”。Codex 会先给出基线值、验证命令、修改范围等确认信息,需用户明确回复确认词(如“go”)后才会开始写入与提交。也可选择后台模式支持长时间或过夜运行,随时可通过 $codex-autoresearch 查询状态、暂停或恢复。

注意事项:需要一个已初始化、状态干净(无未提交改动)的具名 Git 分支;一次运行只管理一个仓库的一个实验。

11. 注意事项