尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
为什么 ARIS 坚持用两个模型审稿?跨模型对抗协作原理深度揭秘
为什么 ARIS 坚持用两个模型审稿跨模型对抗协作原理深度揭秘【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleepARISAuto-Research-In-Sleep睡眠中自动做研究是一款纯 Markdown 的轻量级自动化 ML 研究工具集它的核心机制是跨模型审稿cross-model review一个模型负责执行研究另一个完全独立的模型负责审稿打分两者轮流转直到论文质量达标。很多新手都会问为什么 ARIS 非要两个模型配合而不是让同一个模型既当运动员又当裁判本文带你从零看懂这套跨模型对抗协作的设计原理以及它如何让研究质量在几轮循环里稳步提升。 一句话总结执行模型驱动流程独立模型做裁决——它能驱动drive但永远不能自证清白acquit。为什么同一个模型自审自批行不通这是理解 ARIS 的第一个关键问题。让 Claude 写代码、再让 Claude 检查自己的代码听起来很省事但 ARIS 的官方文档README.md直接给出了结论为什么不用单一模型自博弈同一个模型审查自己的模式会陷入局部最优local minima——它会产生盲区看不见自己习惯性的错误。ARIS 用一个博弈论类比来解释这件事单模型自审 随机性赌博徒问题stochastic bandits噪声是可预测的模型总能猜到自己会怎么犯错所以自审很容易蒙混过关跨模型审稿 对抗性赌博徒问题adversarial bandits审稿模型会主动攻击执行模型没有预料到的薄弱环节而这种对抗在原理上更难被钻空子。换句话说两个不同家族的模型比如 Anthropic 的 Claude 和 OpenAI 的 GPT训练数据、推理风格、审美偏好都不同。你的盲区恰好是对方的锐眼。这就是 ARIS 坚持双模型的根本原因。双模型对抗协作的工作流程是怎样的跨模型审稿在 ARIS 里由 skills/auto-review-loop/SKILL.md 这个技能实现它是一个完全自主的循环审稿 → 修复 → 再审稿最多 4 轮MAX_ROUNDS 4。整个流程可以拆成 5 步Phase A 审稿执行模型把论文草稿、代码、原始实验结果以文件路径的形式交给审稿模型默认是 Codex MCP 里的 GPT-6-Astra开 xhigh 推理强度并附上一句狠话请假设这份工作在某个地方是坏的你的任务就是找到它。Phase B 解析审稿模型返回 1–10 分 结论ready / almost / not ready 按严重程度排序的弱点清单。Phase C 修复执行模型按优先级逐项修复——改代码、跑实验、补分析、更新文档。Phase D 等待结果实验跑完收集结果顺便做训练健康检查。Phase E 记录把本轮全部原始审稿意见一字不差地存档然后进入下一轮。只有当分数 ≥ 6 且结论是 ready/almost 两个条件同时满足时循环才停止停止条件。每轮结束时tools/review_gate.py 会做一道停止门禁校验防止执行模型自己宣布我过关了。上面那张分数曲线图就是真实运行的记录初始审稿 5.0 分 → 4 轮对抗循环后 7.5 分稳稳越过投稿门槛线。三种对抗强度你可以按需选择ARIS 还设计了三个难度档位REVIEWER_DIFFICULTY对抗性逐级加强档位审稿方式适合场景 medium默认执行模型提供上下文审稿模型独立判断日常迭代 hard审稿模型拥有跨轮记忆还会执行辩论协议执行模型可以对审稿意见逐条反驳rebuttal审稿模型再裁定成立 / 驳回 / 部分成立重要节点 nightmare审稿模型直接codex exec读取整个仓库——执行模型无法过滤它看到的内容审稿人独立核对论文里的数字和代码里的结果是否一致投稿前终检nightmare 模式的注释说得很直白这是最接近一个真实的敌意审稿人读你的论文和补充材料的场景。审稿人独立性协议内容必须原封不动地送达跨模型对抗要真正起作用还有一个前提写在 skills/shared-references/reviewer-independence.md 里内容必须以未过滤的状态到达审稿人。执行模型只提供文件路径和任务审稿模型自己去读、去判断。为什么这么严格因为一旦执行模型先给审稿模型总结解读审稿模型审的就不是你的论文而是执行模型的框架——这等于把异构审稿要消除的相关盲区又带了回来。所以协议划了一条清晰的线✅可以传给审稿模型角色设定以 NeurIPS 级审稿人身份评审、文件路径、审稿任务❌禁止传给审稿模型执行模型对内容的总结、解释、上一轮审稿反馈的执行方解读。配套的 skills/shared-references/reviewer-routing.md 还规定了模型家族必须跨家族Claude ↔ GPT、Google 等同家族组合直接 fail-closed拒绝运行。这套证据链设计在 ARIS-Movie-Director 项目里也用同样的模式落地——每一格画面都要过CC / Gemini / Codex三方 panel_gate 的对抗审核才能通过审稿意见到底长什么样真实运行中独立审稿模型给出的意见是这种风格来自社区论文评审展示注意细节审稿人不仅给了分数还回答了为什么不是 6 分为什么不是 8 分——这种分数校准式的对抗追问正是单模型自审几乎不会主动做的事。为什么是两个模型而不是四个、八个ARIS 在README.md里也正面回答了这个问题为什么两个而不是更多两个是打破自博弈盲区的最小数量而且 2 人博弈比 n 人博弈收敛到纳什均衡要高效得多。再加审稿人只会增加 API 成本和协调开销收益递减——最大的收益来自 1→2而不是 2→4。同时两个模型的风格恰好互补README.mdClaude Code快、流畅、擅长执行speedCodexGPT-6-Astra xhigh慢但批评更审慎、更严苛rigor。速度 × 严谨的组合胜过任何一个模型自己跟自己说话。没有 Claude 或 OpenAI 的 API照样能跑跨模型不等于Claude GPT 二选一。ARIS 内置了 10 条替代路线Z.ai GLM、阿里 Kimi/Qwen、MiniMax、ModelScope 免费 DeepSeek、OpenRouter、Google Antigravity 的 Gemini 等完整路由表见 docs/MODEL_COMBINATIONS.md。唯一不可妥协的不变量是审稿模型和执行模型必须来自不同家族任何同家族组合都会被系统直接拒绝。审稿通道本身也是一个独立的小型 MCP 服务器mcp-servers/codex-exec/即使宿主是 Codex CLI 而非 Claude Code同一套跨模型审稿流程也原样可用——这正是 ARIS无框架、无锁定设计哲学的体现。快速上手三步克隆仓库git clone https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep按 SETUP_GUIDE.md 安装 skills 并注册 Codex 审稿器对任意研究技能追加跨模型审稿指令例如/auto-review-loop my research topic — difficulty: hard剩下的交给两个模型去对抗你只需要第二天早上看review-stage/AUTO_REVIEW.md里的最终分数和结论。小结为什么双模型单模型自审有相关盲区跨模型对抗才能暴露你没预料到的弱点如何运转review → fix → re-review 自主循环分数 结论双条件达标才停️如何保证公正审稿人独立性协议 跨家族强制校验 可审计的证据链⚖️为什么是两个两个是打破自博弈盲区的理论最小值且性价比最高。如果你正在用 LLM Agent 做研究不妨把让另一个家族的模型来当审稿人写进你的工作流——这可能是当前投入产出比最高的一个设计决策。【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

Argo Workflows 同步锁遥测:利用 mutex 与 semaphore 计数器定位未释放锁导致的阻塞

Argo Workflows 同步锁遥测:利用 mutex 与 semaphore 计数器定位未释放锁导致的阻塞

Argo Workflows 同步锁遥测:利用 mutex 与 semaphore 计数器定位未释放锁导致的阻塞 【免费下载链接】argo-workflows Workflow Engine for Kubernetes 项目地址: https://gitcode.com/gh_mirrors/ar/argo-workflows Argo Workflows(Workflow Eng…

📅 2026/9/21 2:31:56
SharePoint 2021入门指南:从概念解析到环境部署

SharePoint 2021入门指南:从概念解析到环境部署

简介:这是一份面向SharePoint初学者的入门手册借鉴PDF,以图文结合方式系统梳理了从进入网站到日常管理维护的常用操作。内容覆盖首页界面、网站内容与设置、添加应用程序、列表和文档库配置、人员和组维护、网站权限、库设置、页面编辑、Web部件插入与编…

📅 2026/9/21 2:26:56
企业在线学习与考试平台怎么选?四大产品深度对比

企业在线学习与考试平台怎么选?四大产品深度对比

1. 先搞清楚四家平台各自的定位和适用场景说实话,市面上的企业在线学习与考试平台已经不少了,但真正把“学”和“考”两个环节同时做扎实的并不算多。泛微青蓝阁、考试星、酷学院、云学堂这四家,经常被放在一起比较,但这四家其实都…

📅 2026/9/21 2:26:56
MORE NEWS

更多资讯

📰

从零开始学Linux WiFi驱动:mac80211、PCIe与固件加载实战解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Slang 编译器 CLI 选项白盒覆盖测试套件:`coverage/cli-options` 的意图、设计与维护指南

Slang 编译器 CLI 选项白盒覆盖测试套件:coverage/cli-options 的意图、设计与维护指南 【免费下载链接】slang Making it easier to work with shaders 项目地址: https://gitcode.com/GitHub_Trending/sl/slang 导读 docs/generated/tests/coverage/cli-o…

📰

StatsD 入门与实践:基于 Node.js 的实时指标聚合守护进程完全指南

StatsD 入门与实践:基于 Node.js 的实时指标聚合守护进程完全指南 【免费下载链接】statsd Daemon for easy but powerful stats aggregation 项目地址: https://gitcode.com/gh_mirrors/st/statsd StatsD 是一个运行在 Node.js 平台上的网络守护进程&#x…

📰

基于分层分离树(HST)的可扩展差分隐私聚类:hst_clustering 实现与实战指南

基于分层分离树(HST)的可扩展差分隐私聚类:hst_clustering 实现与实战指南 【免费下载链接】google-research Google Research 项目地址: https://gitcode.com/gh_mirrors/go/google-research 导读 本文围绕 hst_clustering 模块&…

📰

12bit高分辨率示波器:看清电源纹波与信号细节的关键

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Android性能优化实战:冷启动、内存与卡顿排查全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬