为什么 ARIS 坚持用两个模型审稿?跨模型对抗协作原理深度揭秘
【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep
ARIS(Auto-Research-In-Sleep,睡眠中自动做研究)是一款纯 Markdown 的轻量级自动化 ML 研究工具集,它的核心机制是跨模型审稿(cross-model review):一个模型负责执行研究,另一个完全独立的模型负责审稿打分,两者轮流转,直到论文质量达标。很多新手都会问:为什么 ARIS 非要"两个模型"配合,而不是让同一个模型既当运动员又当裁判?本文带你从零看懂这套跨模型对抗协作的设计原理,以及它如何让研究质量在几轮循环里稳步提升。
💡 一句话总结:执行模型驱动流程,独立模型做裁决——"它能驱动(drive),但永远不能自证清白(acquit)"。
为什么"同一个模型自审自批"行不通?
这是理解 ARIS 的第一个关键问题。让 Claude 写代码、再让 Claude 检查自己的代码,听起来很省事,但 ARIS 的官方文档README.md直接给出了结论:
为什么不用单一模型自博弈?同一个模型审查自己的模式,会陷入局部最优(local minima)——它会产生"盲区",看不见自己习惯性的错误。
ARIS 用一个博弈论类比来解释这件事:
- 单模型自审 = 随机性赌博徒问题(stochastic bandits):噪声是"可预测的",模型总能猜到自己会怎么犯错,所以自审很容易"蒙混过关";
- 跨模型审稿 = 对抗性赌博徒问题(adversarial bandits):审稿模型会主动攻击执行模型没有预料到的薄弱环节,而这种对抗在原理上更难被"钻空子"。
换句话说,两个不同家族的模型(比如 Anthropic 的 Claude 和 OpenAI 的 GPT)训练数据、推理风格、审美偏好都不同。你的"盲区"恰好是对方的"锐眼"。这就是 ARIS 坚持双模型的根本原因。
双模型对抗协作的工作流程是怎样的?
跨模型审稿在 ARIS 里由 skills/auto-review-loop/SKILL.md 这个技能实现,它是一个完全自主的循环:审稿 → 修复 → 再审稿,最多 4 轮(MAX_ROUNDS = 4)。
整个流程可以拆成 5 步:
- Phase A 审稿:执行模型把论文草稿、代码、原始实验结果以文件路径的形式交给审稿模型(默认是 Codex MCP 里的 GPT-6-Astra,开 xhigh 推理强度),并附上一句狠话:"请假设这份工作在某个地方是坏的,你的任务就是找到它。"
- Phase B 解析:审稿模型返回 1–10 分 + 结论(ready / almost / not ready)+ 按严重程度排序的弱点清单。
- Phase C 修复:执行模型按优先级逐项修复——改代码、跑实验、补分析、更新文档。
- Phase D 等待结果:实验跑完,收集结果,顺便做训练健康检查。
- Phase E 记录:把本轮全部原始审稿意见一字不差地存档,然后进入下一轮。
只有当分数 ≥ 6 且结论是 ready/almost 两个条件同时满足时,循环才停止(停止条件)。每轮结束时,tools/review_gate.py 会做一道"停止门禁"校验,防止执行模型自己宣布"我过关了"。
上面那张分数曲线图就是真实运行的记录:初始审稿 5.0 分 → 4 轮对抗循环后 7.5 分,稳稳越过投稿门槛线。
三种对抗强度,你可以按需选择
ARIS 还设计了三个"难度档位"(REVIEWER_DIFFICULTY),对抗性逐级加强:
| 档位 | 审稿方式 | 适合场景 |
|---|---|---|
| 🟢 medium(默认) | 执行模型提供上下文,审稿模型独立判断 | 日常迭代 |
| 🟠 hard | 审稿模型拥有跨轮记忆,还会执行辩论协议:执行模型可以对审稿意见逐条反驳(rebuttal),审稿模型再裁定"成立 / 驳回 / 部分成立" | 重要节点 |
| 🔴 nightmare | 审稿模型直接codex exec读取整个仓库——执行模型无法过滤它看到的内容,审稿人独立核对"论文里的数字和代码里的结果是否一致" | 投稿前终检 |
nightmare 模式的注释说得很直白:这是"最接近一个真实的敌意审稿人读你的论文和补充材料"的场景。
审稿人独立性协议:内容必须"原封不动"地送达
跨模型对抗要真正起作用,还有一个前提,写在 skills/shared-references/reviewer-independence.md 里:
内容必须以未过滤的状态到达审稿人。执行模型只提供文件路径和任务,审稿模型自己去读、去判断。
为什么这么严格?因为一旦执行模型先给审稿模型"总结""解读",审稿模型审的就不是你的论文,而是执行模型的框架——这等于把异构审稿要消除的"相关盲区"又带了回来。
所以协议划了一条清晰的线:
- ✅可以传给审稿模型:角色设定("以 NeurIPS 级审稿人身份评审")、文件路径、审稿任务;
- ❌禁止传给审稿模型:执行模型对内容的总结、解释、上一轮审稿反馈的"执行方解读"。
配套的 skills/shared-references/reviewer-routing.md 还规定了模型家族必须跨家族(Claude ↔ GPT、Google 等),同家族组合直接 fail-closed(拒绝运行)。这套"证据链"设计在 ARIS-Movie-Director 项目里也用同样的模式落地——每一格画面都要过"CC / Gemini / Codex"三方 panel_gate 的对抗审核才能通过:
审稿意见到底长什么样?
真实运行中,独立审稿模型给出的意见是这种风格(来自社区论文评审展示):
注意细节:审稿人不仅给了分数,还回答了"为什么不是 6 分?为什么不是 8 分?"——这种"分数校准"式的对抗追问,正是单模型自审几乎不会主动做的事。
为什么是"两个"模型,而不是四个、八个?
ARIS 在README.md里也正面回答了这个问题:
为什么两个,而不是更多?两个是打破自博弈盲区的最小数量,而且 2 人博弈比 n 人博弈收敛到纳什均衡要高效得多。再加审稿人只会增加 API 成本和协调开销,收益递减——最大的收益来自 1→2,而不是 2→4。
同时,两个模型的风格恰好互补(README.md):
- Claude Code:快、流畅、擅长执行(speed);
- Codex(GPT-6-Astra xhigh):慢,但批评更审慎、更严苛(rigor)。
速度 × 严谨的组合,胜过任何一个模型自己跟自己说话。
没有 Claude 或 OpenAI 的 API?照样能跑
"跨模型"不等于"Claude + GPT 二选一"。ARIS 内置了 10 条替代路线(Z.ai GLM、阿里 Kimi/Qwen、MiniMax、ModelScope 免费 DeepSeek、OpenRouter、Google Antigravity 的 Gemini 等),完整路由表见 docs/MODEL_COMBINATIONS.md。唯一不可妥协的不变量是:审稿模型和执行模型必须来自不同家族,任何同家族组合都会被系统直接拒绝。
审稿通道本身也是一个独立的小型 MCP 服务器(mcp-servers/codex-exec/),即使宿主是 Codex CLI 而非 Claude Code,同一套跨模型审稿流程也原样可用——这正是 ARIS"无框架、无锁定"设计哲学的体现。
快速上手三步
- 克隆仓库:
git clone https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep- 按 SETUP_GUIDE.md 安装 skills 并注册 Codex 审稿器;
- 对任意研究技能追加跨模型审稿指令,例如:
/auto-review-loop "my research topic" — difficulty: hard剩下的交给两个模型去"对抗",你只需要第二天早上看review-stage/AUTO_REVIEW.md里的最终分数和结论。
小结
- 🔍为什么双模型:单模型自审有相关盲区,跨模型对抗才能暴露你没预料到的弱点;
- 🔄如何运转:review → fix → re-review 自主循环,分数 + 结论双条件达标才停;
- 🛡️如何保证公正:审稿人独立性协议 + 跨家族强制校验 + 可审计的证据链;
- ⚖️为什么是两个:两个是打破自博弈盲区的理论最小值,且性价比最高。
如果你正在用 LLM Agent 做研究,不妨把"让另一个家族的模型来当审稿人"写进你的工作流——这可能是当前投入产出比最高的一个设计决策。
【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考