AI资讯 / 产业

产业 / 媒体

谷歌DeepMind的AI协作科学家已能规划实验、操控设备并撰写论文

The Decoder

谷歌DeepMind将其多智能体系统Co-Scientist从单纯的假说生成工具,扩展为能够深度融入实验室工作流程的研究伙伴。该系统基于最新Gemini模型构建,现已具备规划实验、编写代码、控制实验设备以及生成科学论文的能力,形成了从研究问题到成果发表的闭环工作流。系统内置验证模块,可将论文中的数值声明与代码执行日志进行交叉核验,以降低捏造结果的概率。在三个不同学科的验证中,Co-Scientist分别完成了材料合成配方设计、生物图像分析流水线构建,以及完全自主设计医疗AI架构等任务,自主程度逐步递增。可靠性模块将关键结果的捏造率从46%压缩至4%,但系统仍存在选择性报告和方法描述与实际代码不符等问题。研究人员坦言,AI系统真正驾驭科学研究的物理现实仍有漫长的路要走。

谷歌DeepMind于2025年2月首次推出Co-Scientist,彼时系统基于Gemini 2.0,在事实核查和文献综述方面存在明显短板。此次升级后,Co-Scientist构建了一套完整的闭环研究工作流:系统从研究问题出发推导假说,制定实验计划,生成可供机器读取的实验室协议,分析结果,最终输出科学论文草稿。内置的验证模块会将论文中每一项数值声明与实际代码执行结果进行比对,从源头遏制数据捏造。

在材料科学领域,研究团队将Co-Scientist与半自动化高温炉配对使用。系统为一种此前主要依赖危险蚀刻工艺生产的二维材料,找到了更为安全的合成路径,并生成了适配实验室设备的完整生长配方。经过25轮人工优化迭代后,团队成功制备出层状结构样品,其性质与目标材料相近,但原子结构的最终确认仍有待进一步验证。在另一组实验中,系统借助Gemini 3 Deep Think直接控制设备,将三种半导体薄膜的配方开发时间从数天压缩至数分钟,但快速模式产出的晶体尺寸较小且均匀性较差。

在生物学实验中,Co-Scientist自主构建了一套图像分析流水线,用于预测经基因改造的大肠杆菌菌落在不同化学浓度下形成的图案。借助Gemini 3 Pro Image生成的预测结果,在四项形态特征中有三项与未公开的实验室数据吻合。研究人员坦承,该系统目前只能在已知条件之间进行推理,无法预测全新系统中的行为表现,而后者才是真正意义上的科学发现。

计算机科学实验则在几乎无人工干预的条件下独立完成。Co-Scientist自主设计了名为「Agent_H」的医疗AI架构,该架构能够对输入查询进行分类,并行生成大量候选回复后加以精炼。在健康领域基准测试中,Agent_H超越了包括GPT-5和Claude Opus 5在内的六个前沿模型。然而,基准测试的亮眼表现并未在人工评估中得到印证——三位持证医师从九个维度对回复进行盲评,Agent_H仅在降低潜在有害回复风险这一项上表现出统计显著优势,自动化评估工具与医师判断之间的相关性也持续偏低。

在可靠性方面,研究团队通过30位领域专家、450次独立评审对150篇自主生成论文进行了双盲评估。启用可靠性模块后,Co-Scientist捏造关键结果的比例降至4%,而未启用时这一比例高达46%,对照系统则达到90%。完全捏造的数据在Co-Scientist的输出中从未出现,但在对照系统的论文中占比44%。尽管如此,系统仍存在选择性报告的倾向,且论文中描述的方法有时与实际执行的代码并不一致,这一差距提示当前AI系统距离真正自主的科学研究者仍有相当距离。

要点

  • Co-Scientist已形成从假说推导到论文生成的完整闭环研究工作流,并可直接控制实验室设备,将配方开发时间从数天压缩至数分钟。
  • 内置可靠性模块将关键结果捏造率从46%大幅降至4%,但选择性报告和方法描述与代码不符的问题依然存在。
  • 在医疗AI架构设计实验中,基准测试与人工医师评估之间的显著差异,揭示了当前AI评估体系的局限性。
  • 系统在三个学科中展现出递进式自主能力,但研究人员明确指出,AI真正驾驭科学研究的物理现实仍需漫长探索。
查看原始来源

原始标题:Google Deepmind's AI Co-Scientist now plans experiments, runs lab equipment, and writes scientific papers

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。