• 王伟
  • 2026年9月1
  • 12.5万次浏览
  • 48条评论

谷歌近期公开了一项关于RSI的研究,其论文内容涉及如何让AI实现自我进化,而方法颇为独特,被形容为“做梦”。

具体来说,并非让大模型重新训练自身,也不涉及AI直接修改权重,而是采用了一种名为Dream-RSI的机制,即在梦境中学习。

研究人员发现了一个有趣的现象:AI在真实探索中留下的历史记录,本身就能构成一个模拟世界。因此,在一次昂贵的真实探索结束后,智能体无需重复进行成百上千次实验,只需在已有的搜索树中进行虚拟推演(即“做梦”),反复测试新的搜索策略。待找到更优策略后,再回到真实环境中执行一次。新的探索会生成更大的搜索树,进而用于下一次“做梦”,形成循环。爱游戏网站

这种方法不仅节省了大量成本,而且效果显著。在算法工程、数学优化和GPU内核工程这三类任务中,Dream-RSI被证明能大幅降低探索的计算开销,同时达到甚至超越原有方案的发现性能。

历史即世界

论文的核心思路可概括为:将AI走过的弯路转化为新的训练场。研究人员认为,RSI的关键驱动力在于高效探索,因此如何管理和优化探索策略至关重要。许多AI科研系统已实现一个循环:生成方案、运行实验、查看结果、修改方案、再运行实验。然而,随着搜索空间扩大,固定策略难以自适应调整,而在线策略优化又面临迭代时间长、反馈滞后、成本高等问题。

Dream-RSI则充分利用了此前未被重视的资源:历史数据。一次智能体探索任务完成后,会留下丰富的记录,形成一棵发现树。例如,若智能体首次执行策略时依次探索了A、B、C分支,每个节点的结果(如A1得分、B1错误率、C2效果及计算量)都会被保存。当尝试新策略(如先跑C,若C1不佳再走A)时,无需重新执行整个流程,因为已有结果可直接调用。只需让新策略在旧树上“重走一遍”,即可推算出所需计算量和效果。换言之,在智能体已探索的区域内,历史即世界。只需一次真实执行,大量新策略就能以更低成本在这个“模拟世界”中验证。

在梦中自我进化

Dream-RSI系统分为三步。第一步是真实探索:当前探索策略控制一个编码智能体,决定分支选择、方案推进、并行任务数量及结束时机,所有过程记录为发现树。第二步是开始“做梦”:引入另一个大语言模型来开发探索策略。每生成一种新方案,无需重新实验,而是在所有历史发现树上“回放”结果,综合考虑答案质量、搜索成本和并行效率,找出更优的动态策略。第三步,将获胜策略重新投入真实环境,指挥下一轮探索。由于策略已变,智能体可能抵达上一代未涉足的区域,从而生成新的发现树,扩大下一轮的“梦境”。如此循环:真实探索产生更多历史,历史变为更多模拟世界,在模拟世界中优化探索策略,更好的策略又产生新历史。

大幅降低计算成本,效果不降反增

研究团队将Dream-RSI应用于8个发现任务,涵盖算法工程、数学优化和GPU内核优化三个方向。对照组为Recursive Fixed Exploration,使用相同模型、评估器、初始策略和资源约束,但每轮不学习如何重组探索,而是沿用固定策略。

在算法工程任务中,团队优化了Lasso regularization path。使用Gemini 3.1 Pro模型时,固定探索消耗550次智能体调用,六个测试数据集平均运行时间3587.1毫秒;而Dream-RSI仅用317次调用,最终达到2931.0毫秒。换成Gemini 3.7 Flash后,固定策略使用3200次调用,平均耗时2516.7毫秒;Dream-RSI使用1879次调用,耗时降至2350.6毫秒。与SimpleTES的对比更为显著:SimpleTES的实验预算高达51200次调用,而Dream-RSI在某些设置下仅需几百次,两者相差最高达162倍。

在GPU内核任务中,针对VGG16和LayerNorm,Dream-RSI分别以2.43倍和1.79倍的生成次数差异实现了相近性能。在ConvDiv和ConvMax任务中,在相近计算预算下,性能分别提升了2.09倍和1.44倍。在数学优化任务中,Dream-RSI在Sum Difference上达到1.145427,高于多个基线;Circle Packing达到2.635983。但在Auto Correlation任务中,SimpleTES仍为最佳状态,不过Dream-RSI在结果相近的情况下,调用量为1000次,远低于SimpleTES的51200次。

额外发现

有趣的是,研究人员发现,给AI总结“经验教训”反而效果更差。他们将之前探索中遇到的困难直接加入下一轮提示,结果显式语义指导导致固定探索和Dream-RSI的表现普遍下降。论文解释称,长程科研搜索常涉及多条并行路线,过早总结“高层结论”会引入强先验,可能堵死一些看似无望但实际有价值的路径。

总而言之,在Dream-RSI的全部实验中,模型本身并未被重新训练。与其说是模型的自进化,不如说是工具框架的自进化。过去讨论智能体自进化时,主要关注两点:将成功经验写入记忆,或利用历史数据重新训练模型。Dream-RSI提供了第三条路径:模型可以保持不变,知识甚至无需先总结成文字,而是先让“寻找知识的方法”自行进化。下一代智能体不必仅从上一代留下的“答案”中学习,而是学习上一代如何找到答案,以及是否存在更好的方法。

该论文由Google、Google DeepMind、马里兰大学和弗吉尼亚大学的研究者共同完成,目前论文、项目页面及代码仓库均已公开。本文来自微信公众号“量子位”,作者关注前沿科技,经36氪授权发布。

爱游戏体育专注爱游戏网站,为用户提供专业可靠的体验。

围绕爱游戏下载,爱游戏体育持续打磨更优质的服务。

爱游戏体育深耕爱游戏官网领域,用心服务每一位用户。