尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
「不碰权重,只改策略」:Dream-RSI 如何用「做梦」实现递归自我改进
2026 年Anthropic、OpenAI 相继把「递归自我改进」Recursive Self-Improvement, RSI从论文概念推到了公众视野也把它最刺耳的那面亮了出来如果一个 AI 能不断地改进自己的改进能力它的能力曲线会不会脱离人类的理解与控制绝大多数讨论都默认 RSI 等于「模型改自己的权重、或者生成下一代模型」。但 Google DeepMind 联合马里兰大学、弗吉尼亚大学发布的Dream-RSI走了一条更另类、也更克制的路它完全不碰模型权重只在探索策略这一层完成递归进化。底层那个写代码的智能体从头到尾没变过变的是一段轻量级的、决定「下一步怎么搜」的编排代码。这篇文章我不想复述论文的新闻稿而是想把它的底层机制拆开讲透——它凭什么能用近乎零成本「做梦」又凭什么说自己比传统 RSI 更安全。一、核心洞察一个已经跑完的发现过程本身就是一台免费模拟器要理解 Dream-RSI得先理解它在「利用」什么资源。当一个编码智能体去解一个难题比如设计一个更快的 GPU 内核、一个更好的回归求解器时它走的不是一条直线而是一棵搜索树。每一步智能体提出一个候选方案环境给出评估跑测试、算得分、报诊断智能体再决定下一步往哪走。论文把这个迭代过程称为「提议-评估循环」propose-evaluate loop。关键在于每一次尝试都会留下完整的执行轨迹——当时的文件系统快照、生成的代码、评估诊断、最终得分。这些轨迹不是散落的日志而是按树状结构组织起来构成了一棵发现树discovery tree。树上的每一个节点都是一个「如果当初走这条路会得到什么结果」的确定答案。Dream-RSI 最锋利的一句话是所有可能的结果已经被记录下来了。这意味着一套新的探索策略根本不需要重新运行任何代码。它只要沿着这棵已经存在的树用不同的方式「遍历」——选不同的分支子集、以不同的顺序、采用不同的并行分组和止损决策——就能评估出「如果当时用这个策略会搜出什么、花多少代价」。这本质上是模型无关强化学习里**世界模型world model**的翻版智能体在一个内部模拟环境里预演而不是在真实环境里试错。区别在于这个世界模型不是学出来的而是「记录」出来的——是历史自己成了世界。论文的原话是一个已完成的发现过程其积累的历史记录本身就是一台免费的模拟器。这里有一个必须说清的前提回放模拟器的质量取决于发现树的覆盖度。如果历史记录太稀疏某些分支根本没被探索过那模拟器对这个区域的表现就缺乏依据——它只能模拟「走过的路」模拟不了「没走过的路」。这是后面要谈的局限先记下。二、三阶段闭环在线探索 → 离线做梦 → 部署扩展Dream-RSI 的运行是一个自我强化的循环由三个阶段构成。阶段一在线探索与完整日志记录。当前策略驱动发现智能体去真正执行搜索任务同时把每一轮「提议-评估」的轨迹完整记下来。这一阶段没有任何魔法成本和传统搜索方法一样。阶段二模拟器构建与「做梦」。已经完成的发现树被转换成一个可复用的模拟器池。候选策略在这个池子里做「梦境」评估——也就是沿着历史记录遍历模拟不同策略会如何导航同一片搜索空间。因为所有结果已经存在评估只需要读取记录不调用模型、不执行代码成本接近于零。阶段三策略部署与循环扩展。在梦境里表现最优的策略被重新部署回在线环境去驱动下一轮真实搜索。而新一轮探索产生的新历史又会被加进模拟器池让池子越来越大、越来越能代表真实搜索空间。整篇论文的杠杆点就压在阶段二上它把最贵的部分——在线搜索替换成了在历史记录上的离线回放。传统 RSI 想加速发现得让模型更聪明改权重代价巨大且危险Dream-RSI 加速发现靠的是让「怎么搜」这件事被反复、廉价地优化。一次在线探索的代价可以被之后无数次免费的梦境评估摊薄。三、它在 RSI 谱系里的真实位置策略层而非权重层要评价 Dream-RSI 的意义得把它放进 RSI 的自主性坐标系里看。研究者通常把 RSI 的自主性分成 L1 到 L5 五档L1 执行人类指定的改进流程L2 自主决定改进策略L3 自主决定学习什么L4 涉及部署与环境适应L5 是对改进机制本身的递归修改。今天绝大多数系统停在 L2–L3。Dream-RSI 占据的位置很微妙它在 L2–L3 的策略层完成了递归但明确不触碰 L5。被它递归改进的只是一段轻量级的编排层 Python 代码——它决定每一轮从哪个节点继续、一次开启多少并行尝试、何时止损。而那个真正干活的底层编码智能体论文用的是 Gemini 3.1 Pro 和 Gemini 3.7 Flash在整个过程中权重完全不变。这个区分在 RSI 的安全讨论里是重量的。传统 RSI 路线——让模型修改自身参数、或生成下一代模型——直接踩在 Anthropic 等机构反复警告的「失控」风险上能力可能以超出人类理解的速度自我迭代。而 Dream-RSI 把递归限制在一个语义透明、可审计、可回滚的层面探索策略的改进是在历史记录上离线完成的它改变的是「搜索的调度方式」不是「模型本身的能力」。当然这不意味着它没有安全含义。策略层的优化本身就能显著加速发现——162 倍的成本压缩意味着同样预算下发现系统的迭代速度能提升两个数量级。当这种加速和前沿模型的能力结合累积效应仍值得警惕。但它的可控性和传统改权重路线不在一个量级。四、实验结果数量级级别的成本压缩光有机制还不够得看它省了多少。Dream-RSI 在三个技术领域做了验证。算法工程Lasso 正则化路径求解器。它产出的求解器在六个留出数据集上优于 scikit-learn 和 glmnet 等标准库。相比此前最优的发现系统 SimpleTES智能体调用次数从 51,200 次降到 317 次——约162 倍的减少相比不改进策略的固定基线也减少了约 1.7 倍。数学优化和差问题、自相关不等式、圆填充。在达到或超过既有发现系统的同时算力成本降低50 倍以上其中圆填充问题的结果追平了 Google 自家 AlphaEvolve V2 的最强纪录。GPU 内核工程基于 KernelBench。在达到目标性能时生成次数减少了 1.79 倍到 2.43 倍或在相同预算下交付了最高 2.09 倍更快的内核。这一方向的收益相对温和但方向一致。怎么理解这个压缩它不是因为模型变聪明了而是因为「怎么搜」被优化了。同样的底层智能体、同样的算力上限只是换了更会调度的策略就把无效探索砍掉了两个数量级。这正是策略层 RSI 区别于权重层 RSI 的直接证据能力边界没动但边界内的探索效率被大幅拉伸。五、最本质的一点它优化的是「如何搜索」不是「搜索什么」讲完机制和结果我必须泼一盆冷水——这也是理解 Dream-RSI 边界最该记住的一句话它优化的是「如何搜索」而非「搜索什么」或「如何推理」。它让智能体在给定的能力边界内更高效地探索但它不扩展这个边界本身。那个写代码的智能体还是只能写出现在能力范围内的代码不会因为策略被递归改进就突然学会它原本不会的东西。真正的通用 RSI——系统能够改进自己的推理能力、学习效率、乃至改进机制本身——仍然不在这项工作的射程内。更底层的几个开放问题也得摊开实证基础偏薄论文是 8 个任务、3 个领域样本量不大而且没有报告「做梦」过程本身的墙上时钟耗时——省的是调用次数和算力预算不是绝对时间。模拟器有盲区回放模拟器的质量依赖历史发现树的覆盖。树没覆盖到的区域模拟器无从评估策略可能在这些盲区里做出错误判断。搜索 ≠ 智能把「怎么搜」做到极致解决的是效率问题不是能力问题。一个不会某个任务的模型再会搜也搜不出它能力之外的方案。结语Dream-RSI 的价值不在于它「破解了 RSI」而在于它重新定义了 RSI 的一个可行切面。当大多数讨论还困在「模型自我修改」的宏大叙事里时它展示了一条更务实、更可控的路径让系统学会如何更好地搜索而不是改变系统本身。历史即世界策略即进化。这或许是递归自我改进从理论思辨走向工程化的一个关键转折点——也提醒我们通往更强 AI 的路不一定非要从改权重开始。
RELATED

相关推荐

《鸿蒙PC三方库适配实战:aegisub 3.4.2从编译报错到348测试通过的完整复盘》

《鸿蒙PC三方库适配实战:aegisub 3.4.2从编译报错到348测试通过的完整复盘》

摘要:本文记录我参加开源鸿蒙 PC 专项积分赛、完成 aegisub 字幕编辑器核心库适配的全过程。从源码获取、meson 构建配置、依赖链处理到 gtest 全量测试,覆盖高难度库适配完整链路。适配过程中遇到 wxWidgets GUI 模块缺失、LuaJIT 平台检测失败、Boost …

📅 2026/9/25 18:16:45
《机器学习快速入门》10周教学提纲

《机器学习快速入门》10周教学提纲

文章目录《机器学习快速入门》10周教学提纲(精简实践版)课程定位第1周:机器学习是什么?第1课:认识机器学习内容三类学习方式1.监督学习2.无监督学习3.强化学习实践第2周:从数据到模型第2课:机器…

📅 2026/9/25 18:11:45
OpenCode+Harness:AI数据分析全流程实操指南

OpenCode+Harness:AI数据分析全流程实操指南

最近在折腾 OpenCode 和 Harness 这套组合,把一条数据分析全流程真正跑通之后,我忍不住想把它整理成一篇实操笔记。标题里的“OpenCode”指的是那个跑在终端里的 AI 编程代码智能体,“Harness”指的是负责编排和调度智能体运行的框架&#xf…

📅 2026/9/25 18:11:45
MORE NEWS

更多资讯

📰

Atlas 300V 24G部署YOLO实战:从环境配置到推理调优全流程

1. 先搞清楚Atlas 300V到底是什么拿到“atlas”这个标题时,我一开始也愣了一下。因为Atlas这个词在技术圈里指代的东西太多了——华为的昇腾AI计算产品线叫Atlas,NVIDIA的老款显卡有ATLAS系列,甚至还有各种叫Atlas的开源项目。直到配合上热搜…

📰

Axure Chrome扩展V0.6.3:解决HTML原型白屏与交互调试

简介:这是一款专为Axure原型设计工具打造的Chrome浏览器本地HTML预览插件,版本V0.6.3,主要面向需要在真实浏览器环境中验证界面与交互效果的UI/UX设计师。插件可直接加载本地HTML文件,无需上传服务器,也无需额外复杂配…

📰

电气元件选型工具:基于IEC/GB标准的闭环校验系统

简介:这是一款面向电气工程师、自动化设计人员及高校相关专业师生的实用型选型辅助工具,聚焦电缆线径与载流量的快速计算,解决传统人工查表选型效率低、易出错的问题,适用于工业配电、建筑电气设计等实际工程场景。资源为3.37MB的…

📰

大模型工程化落地:算力调度、数据治理与推理优化实战

1. 项目概述:一场看不见硝烟的“算力数据工程”三重博弈最近刷到“AI大模型军备竞赛”这个说法,朋友圈和行业群几乎天天刷屏。但说实话,很多人一听到“军备竞赛”,下意识想到的是堆卡、烧钱、抢人才——这确实是一部分事实&#x…

📰

ArcGIS要素编号小工具全解析:字段计算器与ArcPy脚本实现流水号自动化

简介:面向地理信息系统领域的数据管理人员、制图人员以及需要批量要素标识的ArcGIS用户,这款编号小工具可针对mdb、gdb与shp三种常见地理数据格式自动添加顺序编号,替代逐条手动录入的重复劳动。mdb适合轻量级个人数据库存储,gdb在…

📰

A2A + CrewAI + OpenRouter 图表生成 Agent 教程:用 TaoToken 统一 Key 打通多智能体协作链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬