Codex Autoresearch 的 7 个确认值一次讲清:目标、范围、度量与护栏完全指南
【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearch
Codex Autoresearch是面向 OpenAI Codex 的开源 Skill,把"修好测试、消除类型错误、降低延迟"这类仓库级目标,变成一个可度量的自主迭代循环:Codex 每次只改一处,用数字指标验证,改进就保留、失败就回滚,反复循环直到达标。在写下第一行代码之前,它会把7 个确认值列出来请你逐项确认——本文一次讲清它们分别是什么、为什么必须确认。
🎯 为什么要先确认再动手?
自主迭代意味着 Codex 可能在无人值守下跑几十轮。如果目标含糊或边界不清,跑偏的成本会成倍放大。所以 Autoresearch 规定:
- 写任何文件、初始化、启动控制器之前,必须先展示一份简洁的确认清单,等你明确批准(比如回复 "Go")才动手;
- 确认后,这 7 个值被锁定为不可变配置(
autoresearch-results/run.json),运行中不会悄悄改变; - 每个试验都是一次 Git 提交,失败的试验用
git revert回滚,全程留痕可追溯。
简单说:确认清单就是给自主实验划好的"跑道"。
📋 7 个确认值一次讲清
| # | 确认值 | 它决定什么 | 例子 |
|---|---|---|---|
| 1 | Goal 目标 | 要达成什么结果 | 消除类型错误 |
| 2 | Scope 范围 | 允许修改哪些文件 | src、tests/types |
| 3 | Metric 度量 | 盯哪一个数字 | 类型错误数量 |
| 4 | Direction 方向 | 哪个方向算更好 | lower(越小越好) |
| 5 | Verify 验证命令 | 怎么测出这个数字 | python3 scripts/score.py |
| 6 | Target 目标值 | 数字到多少算完成 | 0 |
| 7 | Guard 护栏 | 除指标外还要守住什么 | npm test |
1️⃣ Goal(目标):描述结果,而不是方案
用一句大白话说清"想要什么结果",例如"把src下的错误数降到 0"。官方指南特别强调:给结果,不给实现方案——实现策略是 Codex 在循环里自己迭代出来的,你只需要定义终点。
2️⃣ Scope(范围):它能动哪里
仓库相对路径的文件或目录前缀,例如src而不是src/**/*.ts(不支持通配符)。范围就是硬边界:一旦检测到越界修改,运行会立刻停止报错,而不是悄悄放行。
3️⃣ Metric(度量):实验的"温度计"
整个运行只用一个数字指标来判断好坏。它必须可重复测量——适合做度量的包括:失败用例数、类型错误数、分支覆盖率、p95 延迟、二进制体积、可复现的安全问题数等。
4️⃣ Direction(方向):哪个方向算进步
只有两个取值:lower(越小越好)或higher(越大越好)。错误数选 lower,覆盖率选 higher。方向错了,"改进"和"变差"就会完全颠倒。
5️⃣ Verify(验证命令):怎么测出这个数字
度量必须靠一条命令输出,且有两条硬性契约:
- 测量成功时退出码必须为 0——哪怕当前数字很难看("测到了 30 个错误"本身也算测量成功);
- stdout 最后一行非空内容必须是一个有限数字,或一个 JSON 对象(此时需显式指定取哪个数值键,如
error_count)。
如果测试命令失败就非零退出,它更适合作为 Guard,而不是度量命令。
6️⃣ Target(目标值):到多少才算完成
一个数字,代表"可以收工了"。例如错误数降到0、覆盖率提到90。只有当保留下来的指标值真正到达目标值,运行才会报告complete——中途的数字波动不算数。
7️⃣ Guard(护栏):指标之外还要守住什么
可选,但强烈推荐。Guard 是通过/失败二值检查(看退出码),用来保护指标覆盖不到的行为。经典搭配:
Verify: python3 scripts/score.py -> 只看 error_count 是否下降 Guard: python3 -m pytest -q -> 保证现有测试不被改坏两个关键规则:Guard必须在基线上就通过;指标下降但 Guard 失败,该次试验照样回滚。护栏宁可拦掉一次"疑似改进",也不允许悄悄破坏已有行为。
⚙️ 顺带确认两件事:怎么跑、跑多久
确认清单里还有两个可选设置:
- 运行模式:前台(foreground)留在当前 Codex 任务里,可实时观察和引导;后台(background)启动独立控制器,适合长时间或过夜运行,默认 Full Access 权限,因为每轮迭代都要提交和回滚 Git;
- 迭代上限:可选,给循环兜底,防止无限试错。
🔁 确认之后:自主循环如何运转
你批准后,循环就按固定节拍转起来:
观察证据 -> 只改一个假设 -> finish(自动提交试验 + 跑度量和护栏) -> 改进且护栏通过:保留该提交 -> 否则:git revert 回滚 -> 追加审计事件 -> 重复,直到达到目标状态全部落在autoresearch-results/目录:run.json是不可变配置,events.jsonl是只追加的历史。任何缺失、矛盾或格式错误的状态都直接报错停止——系统从不靠猜恢复结果,这正是长时间自主运行可以信任的原因。
跑完后,用一句 "generate an HTML report" 就能生成带指标曲线、保留/丢弃时间线和提交记录的可视化报告:
📚 快速参考
- 完整配置、生命周期与排错:docs/GUIDE.md
- 现成的提示词与度量模式(覆盖率、延迟、体积等):docs/EXAMPLES.md
- Skill 主契约与实验循环规则:SKILL.md
- 实验契约:测量规则、Git 边界、失败语义:references/experiment.md
- 控制脚本入口:scripts/autoresearch.py
- 安装与验证步骤:docs/INSTALL.md
【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearch
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考