2026 年Anthropic、OpenAI 相继把「递归自我改进」Recursive Self-Improvement, RSI从论文概念推到了公众视野也把它最刺耳的那面亮了出来如果一个 AI 能不断地改进自己的改进能力它的能力曲线会不会脱离人类的理解与控制绝大多数讨论都默认 RSI 等于「模型改自己的权重、或者生成下一代模型」。但 Google DeepMind 联合马里兰大学、弗吉尼亚大学发布的Dream-RSI走了一条更另类、也更克制的路它完全不碰模型权重只在探索策略这一层完成递归进化。底层那个写代码的智能体从头到尾没变过变的是一段轻量级的、决定「下一步怎么搜」的编排代码。这篇文章我不想复述论文的新闻稿而是想把它的底层机制拆开讲透——它凭什么能用近乎零成本「做梦」又凭什么说自己比传统 RSI 更安全。一、核心洞察一个已经跑完的发现过程本身就是一台免费模拟器要理解 Dream-RSI得先理解它在「利用」什么资源。当一个编码智能体去解一个难题比如设计一个更快的 GPU 内核、一个更好的回归求解器时它走的不是一条直线而是一棵搜索树。每一步智能体提出一个候选方案环境给出评估跑测试、算得分、报诊断智能体再决定下一步往哪走。论文把这个迭代过程称为「提议-评估循环」propose-evaluate loop。关键在于每一次尝试都会留下完整的执行轨迹——当时的文件系统快照、生成的代码、评估诊断、最终得分。这些轨迹不是散落的日志而是按树状结构组织起来构成了一棵发现树discovery tree。树上的每一个节点都是一个「如果当初走这条路会得到什么结果」的确定答案。Dream-RSI 最锋利的一句话是所有可能的结果已经被记录下来了。这意味着一套新的探索策略根本不需要重新运行任何代码。它只要沿着这棵已经存在的树用不同的方式「遍历」——选不同的分支子集、以不同的顺序、采用不同的并行分组和止损决策——就能评估出「如果当时用这个策略会搜出什么、花多少代价」。这本质上是模型无关强化学习里**世界模型world model**的翻版智能体在一个内部模拟环境里预演而不是在真实环境里试错。区别在于这个世界模型不是学出来的而是「记录」出来的——是历史自己成了世界。论文的原话是一个已完成的发现过程其积累的历史记录本身就是一台免费的模拟器。这里有一个必须说清的前提回放模拟器的质量取决于发现树的覆盖度。如果历史记录太稀疏某些分支根本没被探索过那模拟器对这个区域的表现就缺乏依据——它只能模拟「走过的路」模拟不了「没走过的路」。这是后面要谈的局限先记下。二、三阶段闭环在线探索 → 离线做梦 → 部署扩展Dream-RSI 的运行是一个自我强化的循环由三个阶段构成。阶段一在线探索与完整日志记录。当前策略驱动发现智能体去真正执行搜索任务同时把每一轮「提议-评估」的轨迹完整记下来。这一阶段没有任何魔法成本和传统搜索方法一样。阶段二模拟器构建与「做梦」。已经完成的发现树被转换成一个可复用的模拟器池。候选策略在这个池子里做「梦境」评估——也就是沿着历史记录遍历模拟不同策略会如何导航同一片搜索空间。因为所有结果已经存在评估只需要读取记录不调用模型、不执行代码成本接近于零。阶段三策略部署与循环扩展。在梦境里表现最优的策略被重新部署回在线环境去驱动下一轮真实搜索。而新一轮探索产生的新历史又会被加进模拟器池让池子越来越大、越来越能代表真实搜索空间。整篇论文的杠杆点就压在阶段二上它把最贵的部分——在线搜索替换成了在历史记录上的离线回放。传统 RSI 想加速发现得让模型更聪明改权重代价巨大且危险Dream-RSI 加速发现靠的是让「怎么搜」这件事被反复、廉价地优化。一次在线探索的代价可以被之后无数次免费的梦境评估摊薄。三、它在 RSI 谱系里的真实位置策略层而非权重层要评价 Dream-RSI 的意义得把它放进 RSI 的自主性坐标系里看。研究者通常把 RSI 的自主性分成 L1 到 L5 五档L1 执行人类指定的改进流程L2 自主决定改进策略L3 自主决定学习什么L4 涉及部署与环境适应L5 是对改进机制本身的递归修改。今天绝大多数系统停在 L2–L3。Dream-RSI 占据的位置很微妙它在 L2–L3 的策略层完成了递归但明确不触碰 L5。被它递归改进的只是一段轻量级的编排层 Python 代码——它决定每一轮从哪个节点继续、一次开启多少并行尝试、何时止损。而那个真正干活的底层编码智能体论文用的是 Gemini 3.1 Pro 和 Gemini 3.7 Flash在整个过程中权重完全不变。这个区分在 RSI 的安全讨论里是重量的。传统 RSI 路线——让模型修改自身参数、或生成下一代模型——直接踩在 Anthropic 等机构反复警告的「失控」风险上能力可能以超出人类理解的速度自我迭代。而 Dream-RSI 把递归限制在一个语义透明、可审计、可回滚的层面探索策略的改进是在历史记录上离线完成的它改变的是「搜索的调度方式」不是「模型本身的能力」。当然这不意味着它没有安全含义。策略层的优化本身就能显著加速发现——162 倍的成本压缩意味着同样预算下发现系统的迭代速度能提升两个数量级。当这种加速和前沿模型的能力结合累积效应仍值得警惕。但它的可控性和传统改权重路线不在一个量级。四、实验结果数量级级别的成本压缩光有机制还不够得看它省了多少。Dream-RSI 在三个技术领域做了验证。算法工程Lasso 正则化路径求解器。它产出的求解器在六个留出数据集上优于 scikit-learn 和 glmnet 等标准库。相比此前最优的发现系统 SimpleTES智能体调用次数从 51,200 次降到 317 次——约162 倍的减少相比不改进策略的固定基线也减少了约 1.7 倍。数学优化和差问题、自相关不等式、圆填充。在达到或超过既有发现系统的同时算力成本降低50 倍以上其中圆填充问题的结果追平了 Google 自家 AlphaEvolve V2 的最强纪录。GPU 内核工程基于 KernelBench。在达到目标性能时生成次数减少了 1.79 倍到 2.43 倍或在相同预算下交付了最高 2.09 倍更快的内核。这一方向的收益相对温和但方向一致。怎么理解这个压缩它不是因为模型变聪明了而是因为「怎么搜」被优化了。同样的底层智能体、同样的算力上限只是换了更会调度的策略就把无效探索砍掉了两个数量级。这正是策略层 RSI 区别于权重层 RSI 的直接证据能力边界没动但边界内的探索效率被大幅拉伸。五、最本质的一点它优化的是「如何搜索」不是「搜索什么」讲完机制和结果我必须泼一盆冷水——这也是理解 Dream-RSI 边界最该记住的一句话它优化的是「如何搜索」而非「搜索什么」或「如何推理」。它让智能体在给定的能力边界内更高效地探索但它不扩展这个边界本身。那个写代码的智能体还是只能写出现在能力范围内的代码不会因为策略被递归改进就突然学会它原本不会的东西。真正的通用 RSI——系统能够改进自己的推理能力、学习效率、乃至改进机制本身——仍然不在这项工作的射程内。更底层的几个开放问题也得摊开实证基础偏薄论文是 8 个任务、3 个领域样本量不大而且没有报告「做梦」过程本身的墙上时钟耗时——省的是调用次数和算力预算不是绝对时间。模拟器有盲区回放模拟器的质量依赖历史发现树的覆盖。树没覆盖到的区域模拟器无从评估策略可能在这些盲区里做出错误判断。搜索 ≠ 智能把「怎么搜」做到极致解决的是效率问题不是能力问题。一个不会某个任务的模型再会搜也搜不出它能力之外的方案。结语Dream-RSI 的价值不在于它「破解了 RSI」而在于它重新定义了 RSI 的一个可行切面。当大多数讨论还困在「模型自我修改」的宏大叙事里时它展示了一条更务实、更可控的路径让系统学会如何更好地搜索而不是改变系统本身。历史即世界策略即进化。这或许是递归自我改进从理论思辨走向工程化的一个关键转折点——也提醒我们通往更强 AI 的路不一定非要从改权重开始。
企业数字化 ERP 产品动态
相关推荐
《鸿蒙PC三方库适配实战:aegisub 3.4.2从编译报错到348测试通过的完整复盘》 摘要:本文记录我参加开源鸿蒙 PC 专项积分赛、完成 aegisub 字幕编辑器核心库适配的全过程。从源码获取、meson 构建配置、依赖链处理到 gtest 全量测试,覆盖高难度库适配完整链路。适配过程中遇到 wxWidgets GUI 模块缺失、LuaJIT 平台检测失败、Boost … · 2026/9/25 18:16:43
文档欠着、线上 Bug 又急:用 Caravel 把两条线并行跑起来 摘要: 文档和修 Bug 常常撞车。串行会浪费一小时,开两个终端又容易丢上下文。本文用一次完整演示说明:在 Caravel 工作台里先让补文档任务跑着,再新建修 Bug 任务并选择另一个 Agent,最后在列表里并排看两条线的状态。… · 2026/9/25 18:16:37
CMO环境模型-地表覆盖模型详解 /// <summary>
/// 地面单元隐蔽能力计算器(对应 ActiveUnit.LandCoverMaskingCapability)。
/// </summary>
public static class LandCoverMaskingCalculator
{/// <summary>/// 根据地表覆盖类型查表得到地面单元的隐蔽能力值。///… · 2026/9/25 18:16:31
Atlas 300V 24G推理加速卡上部署YOLO模型全流程解析 “atlas部署yolo”和“atlas 300v 24g 是运算加速卡吗”——这两类问题最近被问得特别密集。一边是大家都在做边缘侧目标检测,手里攒着现成的YOLO模型,想在便宜、低功耗的AI加速卡上跑起来;另一边是华为昇腾的Atlas产品线型号复杂,… · 2026/9/25 18:52:32
DMR数字对讲机组网实战:50人工地选型、信道规划与中继部署实用指南 本文基于建筑施工现场通信部署经验,从DMR制式原理、信道规划、中继部署到场测验收,讲解中型场景下无线对讲系统的技术落地方法。适合读者:通信集成商、IT运维、项目技术负责人。目录
现场通信的常见问题需求分析:人员架构与环境特… · 2026/9/25 18:52:26
机器人跨区域运行梯控设计:地下车库到大堂任务连续性分析 摘要: 机器人从地下车库进入大堂等跨区域场景时,需要面对不同网络环境、设备状态和任务流程变化。梯控系统需要保证机器人任务连续,避免区域切换造成运行中断。导语: 单一区域机器人应用通常只需要解决移动和导航问题,… · 2026/9/25 18:52:20
IronClaw Decision Capture 技能实战:在 Agent 会话中自动检测、持久化与追踪决策 人工智能AI 应用交互助手AI Agent 【免费下载链接】ironclaw IronClaw is an Agent OS focused on privacy, security and extensibility 项目地址: https://gitcode.com/gh_mirrors/iro/ironclaw 点击查看 免费下载 IronClaw 的 decision-capture 技能是一套面向 … · 2026/9/25 18:52:08
内蒙古口碑好的大口径铁箍纸桶联系方式生产厂家避坑挑选指南 内蒙古口碑好的大口径铁箍纸桶生产厂家避坑挑选指南辽阳市万兴包装制品厂是深耕纸包装行业三十年的源头生产厂家,主营高强度环保铁箍纸桶,可提供定制化包装解决方案,兼顾出口级品质与高性价比,适配化工、医药等行业的存储运输及出… · 2026/9/25 18:52:02
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37