跳到主内容
爱游戏APP下载

谷歌RSI论文:AI自进化,做梦吧

2026-09-17 · 郑海燕 · 更新于 2026-09-18

谷歌的RSI研究刚刚被证实,一篇关于AI实现自我进化的论文随即被官方发布到网上。

它的实现方式相当奇特,被称为“做梦”。

没错,不是让大模型重新训练自己,也不是让AI直接修改自身权重,而是采用Dream-RSI,简单来说就是“在梦中学习”。

不开玩笑,正经地说,研究人员发现了一个有趣的现象:

AI真实探索过程中留下的历史记录,本身就是一个模拟世界。

因此,在一次昂贵的真实探索结束后,Agent不需要真的重新进行几百次或几千次实验,就可以在已经存在的搜索树中进行虚拟推演(做梦),反复测试新的搜索策略。

一旦找到更好的策略,再回到真实环境中执行一次。

新的探索会产生一棵更大的搜索树。

接着再用来“做梦”。

如此循环往复。

这不仅节省了大量成本,而且这个方法确实有效。在算法工程、数学优化和GPU内核工程这三类任务中,研究人员证明,Dream‑RSI不仅能显著降低探索的计算成本,还能达到甚至超越原有方案的效果。

历史就是世界

我们来仔细分析一下这篇论文。

论文的核心思路可以这样概括:将AI走过的弯路,变成AI新的训练场。

谷歌的研究人员认为,RSI的核心驱动力在于高效探索。因此,如何管理和优化探索策略是一个关键问题。

实际上,许多AI科研系统已经实现了一个循环:

生成方案 → 运行实验 → 查看结果 → 修改方案 → 再运行实验。

问题是,随着搜索空间的扩大,固定的探索策略无法自适应调整;而在线策略优化又面临迭代时间长、反馈滞后、成本高昂等困境。

Dream-RSI抓住了一个此前未被充分利用的东西:历史。

一次Agent探索任务执行下来,会留下非常丰富的记录,形成一棵发现树(Discovery Tree)。

类似这样:

谷歌的研究人员换个角度来看,发现这一堆历史日志本身就是一个模拟器!

举个例子,Agent首次执行的策略是按顺序运行A、B、C分支,每个节点的结果都被保存下来:A1的得分、B1是否报错、C2的效果以及各自消耗的计算量。

现在,我们换一种搜索策略,比如:先运行C,如果C1不够好,再走A。

完全不需要重新运行一遍,因为C、C1、A、A1这些结果可以直接调用。只需让新策略在旧树上“重新走一遍”,就能算出“如果当时这样做,需要多少计算量,能达到什么效果”。

也就是说,在Agent已经探索过的区域里,历史就是世界。

只需要一次真实执行,大量新的策略探索就能以更低成本在这个“模拟世界”中验证。

在梦中自我进化

整个Dream-RSI系统分为三个步骤。

第一步,真实探索。

当前探索策略控制一个Coding Agent,决定开启哪些分支、继续哪些方案、运行多少个并行任务以及何时结束。

所有过程被记录为一棵发现树。

第二步,开始做梦。

引入另一个大语言模型来负责开发探索策略。

每生成一种新的探索方案,不重新运行实验,而是在过去积累的所有发现树上“回放”结果。

最终,综合考虑答案质量、搜索成本和并行效率,找出更好的动态策略。

**第三步,将赢家重新派出去。

新策略进入真实环境,指挥下一轮探索。

由于策略已经变化,它可能会到达上一代Agent没有探索过的位置。

这样就会产生新的发现树,继续扩大下一轮的“梦境”。

也就是:

真实探索 → 产生更多历史 → 历史变成更多模拟世界 → 在模拟世界中优化探索策略 → 更好的策略产生新的历史……

大幅降低计算成本,效果不降反增

研究团队将Dream-RSI应用于8个发现任务,涵盖三个领域:算法工程、数学优化和GPU内核优化。

最直接的对照组是Recursive Fixed Exploration。

它与Dream-RSI使用相同的模型、相同的评估器、相同的初始策略和资源约束。

不同之处在于,一个每轮都会学习如何重新组织探索,另一个始终按照第一轮的固定策略继续搜索。

算法工程

研究团队让Agent优化Lasso regularization path。

当模型为Gemini 3.1 Pro时,固定探索最终消耗550次Agent调用,六个测试数据集平均运行时间为3587.1毫秒。

Dream-RSI则使用了317次调用,最终达到2931.0毫秒。

换成Gemini 3.7 Flash也是类似结果:

固定策略使用了3200次Agent调用,平均耗时为2516.7毫秒;Dream-RSI使用了1879次,耗时降至2350.6毫秒。

与SimpleTES的对比结果差距更明显。

SimpleTES对应实验预算达到51200次调用。Dream-RSI在部分设置下只需几百次调用。

两者最高相差162倍。

GPU内核

在VGG16和LayerNorm任务中,Dream-RSI分别相差2.43倍和1.79倍的生成次数,达到相近性能。

在ConvDiv和ConvMax中,则在接近的计算预算下,将性能分别提高2.09倍和1.44倍。

数学优化

在Sum Difference上,Dream-RSI达到1.145427,高于论文列出的多个基线;Circle Packing达到2.635983。

但在Auto Correlation中,SimpleTES仍然是当前最优。不过Dream-RSI在结果相近的情况下,调用量做到了1000次对比51200次。

One More Thing

有趣的是,研究人员还发现,给AI总结“经验教训”,结果反而更差。

他们将之前探索中遇到的问题直接塞进下一轮提示词,结果出乎意料:

加入显式语义指导后,无论是固定探索还是Dream-RSI,表现都普遍下降了。

论文给出的解释是:

长程科研搜索往往同时存在许多并行路线。

如果过早总结“高层结论”,相当于给未来的探索增加了很强的先验。

结果可能不是少走弯路,而是直接把一些看似无望但实际上可能有价值的路线堵死了。

最后,简单总结一下,在Dream-RSI的整个实验中,模型本身没有被重新训练。与其说是模型的自进化,更像是工具的自进化。

过去我们谈论Agent自进化时,主要关注两件事:一是将成功经验写入记忆;二是将历史数据重新用于训练模型。

Dream-RSI提供了第三条路径:

模型可以不变,知识甚至不需要先总结成文字,先让“寻找知识的方法”自己进化。

下一代Agent不必只从上一代留下的“答案”中学习。

而是学习:

上一代到底是如何找到答案的,以及——有没有一种更好的寻找方法。

论文由Google、Google DeepMind、马里兰大学和弗吉尼亚大学的研究者共同完成,目前论文、项目页面和代码仓库均已公开。

更多文章