产业 / 媒体
让 AI 智能体通过「做梦」优化搜索策略
Google DeepMind 研究团队提出了一种名为 Dream-RSI 的新方法,旨在帮助 AI 智能体更高效地完成复杂搜索任务。该方法的核心思路是让智能体利用已完成搜索的历史记录,在不重新调用模型或评估器的前提下,测试不同的搜索策略——研究者将这一过程称为「做梦」。与现有方法相比,Dream-RSI 仅调整搜索策略本身,底层 AI 模型保持不变。研究团队使用 Gemini 3.1 Pro 和 Gemini 3.7 Flash 在基因组学计算、数学优化和 GPU 内核编写等八项任务上进行了测试,结果显示 Dream-RSI 在多项任务中以更少的尝试次数达到了相当甚至更优的性能表现。在 GPU 内核任务中,该方法最多可将所需运行次数减少 2.43 倍,或在相同计算预算内实现最高 2.09 倍的性能提升。
自我改进型 AI 智能体的基本工作流程是:提出方案、评估结果、从中学习、再次尝试。面对复杂任务时,搜索空间可能极为庞大,智能体需要不断判断哪些方向值得深入探索、哪些应当放弃。这一「探索」过程直接决定搜索是否成功,也是计算资源消耗的主要来源。现有方法要么采用固定策略、无法从经验中学习,要么在搜索过程中动态调整策略但代价高昂,因为验证每种策略是否有效都需要完整地重新运行搜索流程。
Dream-RSI 的解决思路类似于人类在陌生地区探路的经验积累。第一次走陌生路线时,人们会碰壁、折返、反复摸索;但一旦形成心理地图,就可以在脑中规划新路线,而无需再次亲身走遍每个角落。Dream-RSI 将这一原理应用于记录下来的搜索历史:智能体在搜索过程中保存所有尝试及其结果,形成搜索树;之后,新策略可以直接在这棵树上「回放」,检验若当初选择不同路径会发生什么,而无需重新生成或评估任何解决方案。
由于所有结果均已存储在搜索树中,智能体可以在不调用模型或评估器的情况下,测试数千种备选策略,从中选出最优方案后再用于下一次真实搜索。这一「做梦-执行」循环持续迭代:每次真实搜索结束后,智能体利用记录的结果测试更好的策略,再将改进后的策略应用于下一轮。整个过程中,只有搜索策略在演化,生成解决方案的底层模型始终不变。
研究团队在多项任务上验证了 Dream-RSI 的效果。在基因组学和金融领域常用的统计计算任务中,Dream-RSI 生成的程序在全部六个测试数据集上均优于 sklearn 和 glmnet 等成熟库。使用 Gemini 3.1 Pro 时,平均运行时间从 3587 毫秒降至 2931 毫秒,尝试次数从 550 次降至 317 次,而竞争方法 SimpleTES 完成同类任务需要 51200 次运行。在 GPU 内核编写任务中,Dream-RSI 最多以 2.43 倍更少的生成次数达到相同性能,或在相同预算内实现最高 2.09 倍的性能提升。
研究团队还测试了另一种利用历史搜索记录的方式:将其压缩为明确指令,告知智能体应在哪些区域搜索。结果发现,在某个 GPU 任务上,加入明确指令的版本反而表现更差。研究者认为,过于具体的方向会压缩搜索空间,阻碍智能体探索更广泛的可能性。这一发现与 Google Research 此前推出的 WikiSkill 系统形成对比——后者将历史失败与成功记录转化为可复用指令,而 Dream-RSI 的分析表明,在开放式搜索任务中,此类显式指令可能适得其反。
Dream-RSI 是近期递归自我改进领域持续升温的缩影。Google DeepMind 于 2025 年推出的 AlphaEvolve 同样基于类似原理,由 Gemini Flash 生成代码提案、Gemini Pro 分析评估,再通过进化算法筛选最优版本。Dream-RSI 则在此之上更进一步,专门优化搜索策略本身,而非直接优化解决方案。随着 Anthropic CEO Dario Amodei 等业界领袖对 AI 研究节奏发出警示,这一领域的进展正受到越来越广泛的关注。
要点
- Dream-RSI 通过回放历史搜索记录测试新策略,避免重复昂贵计算,将迭代次数最多减少 2.43 倍
- 该方法仅调整搜索策略,底层 AI 模型保持不变,形成「做梦-执行」持续迭代循环
- 在基因组统计计算任务中,Dream-RSI 生成的程序优于 sklearn 和 glmnet,且所需尝试次数远少于竞争方法 SimpleTES
- 过于明确的搜索指令可能压缩探索空间,在开放式任务中反而降低性能
- Dream-RSI 代表了递归自我改进研究的新进展,在 AlphaEvolve 等已有工作基础上,将优化层级提升至搜索策略本身
原始标题:Google Deepmind's Dream-RSI helps AI agents improve by “dreaming” about past attempts
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。