AI资讯 / 产业

产业 / 媒体

AI编程智能体能加速科研软件现代化,但无法判断科学正确性

The Decoder

OpenAI与多所学术机构合作发布的一份实地报告显示,AI编程智能体在现代化老旧科研软件方面展现出显著潜力。报告涵盖八个案例,主要集中在生物学领域,使用了Codex和Claude Code等工具,项目范围从基础构建维护到完整的语言重写不等。其中,RustQC将15个独立质控工具合并为一个程序,运行时间从15小时34分钟缩短至14分钟54秒,提速超过60倍;HelixForge的GPU原生重写版本比原有CPU工具快59.6倍。然而,报告同时揭示了一个核心局限:智能体能快速完成明确定义的编程任务,却无法可靠判断其输出是否在科学上正确。参与者指出,这些系统「措辞流畅、令人信服,却以难以察觉的方式犯下错误」。工作重心因此从编写代码转向耗时的科学正确性验证,人类专家的判断力与领域知识依然不可或缺。

许多被广泛使用的科研工具最初只是某篇论文的配套代码,由小型学术团队在时间和资源有限的情况下编写,缺乏完善的测试、维护和优化。这类软件往往十分脆弱,却对整个研究领域至关重要,需要持续修补。OpenAI与学术合作伙伴发布的这份报告,记录了AI编程智能体如何尝试填补这一空白,涵盖从简单的构建现代化到完整GPU原生重写的八个项目。

在具体案例中,MHCflurry迁移项目将约一万行代码从TensorFlow移植到PyTorch,由Claude Code和Codex交替扮演开发者与审查者角色。rustar-aligner项目则更为雄心勃勃,用Rust从头重建了基因组比对工具STAR。原版STAR包含逾两万行C和C++代码且已停止维护,但仍是众多研究流程的组成部分。测试显示,新版本在单端读取上与原版结果吻合率达99.815%,双端读取吻合率为99.883%。

尽管速度提升令人印象深刻,但报告揭示了一个贯穿所有案例的核心问题:智能体无法可靠判断自身工作是否科学正确,即便代码存在错误,系统也常以十足的自信呈现结果。RustQC负责人Philip Ewels将智能体描述为「措辞流畅、令人信服,却以难以察觉的方式自信地犯错」,因此他从不允许模型评判自身工作的准确性,而是构建了独立的测试框架。

bayesm案例清晰展示了此类错误的隐蔽性。其Rust重写版本运行速度比原版快2至20倍,但两个高级方法的首版均包含难以从输出结果直接发现的错误。其中一个方法中,智能体将关键控制参数取了倒数;另一个错误影响了计算本身,研究人员在对数千个已知结果的合成数据集进行详细校准测试后才得以发现。这表明,表面上合理的测试结果并不足以证明代码的正确性。

各项目遵循一致的分工模式:人类负责定义目标、成功标准和验证方法,智能体负责具体实现。hifiasm项目中,研究人员在要求GPT-5.5进行优化前,先建立了包含独立训练集和验证集的测试环境,最终将真实人类基因组数据的运行时间缩短近15%。HI.SIM库的优化则只需极少人工介入,两轮优化合计将运行时间减少约31%,且输出结果不变。

报告还指出了低成本重写带来的长期隐患。若智能体能解决四分之一至二分之一的科研软件安装问题,100个软件包节省的研究时间价值在60万至近500万美元之间。然而,廉价重写可能导致用户社区分裂,并进一步稀释本已有限的资深维护者精力。验证、科学准确性与长期维护,仍是这一领域尚待解决的核心挑战。

要点

  • AI编程智能体可将老旧科研软件的运行速度提升数十倍,RustQC案例实现了超过60倍的加速,但性能提升不等于科学正确性。
  • 智能体擅长快速完成明确定义的编程任务,却无法可靠判断输出结果是否符合科学要求,错误往往以令人信服的方式呈现,难以察觉。
  • 有效的人机协作模式是:人类专家定义目标、验证标准和测试框架,智能体负责代码实现,科学判断力不可外包给模型。
  • 低成本重写可能带来社区分裂和维护资源稀释等长期问题,验证与长期维护仍是科研软件AI现代化面临的核心挑战。
  • 模型能力的代际差异至关重要,早期MHCflurry移植尝试失败,被归因于当时可用模型能力不足,而非工具本身的问题。
查看原始来源

原始标题:AI coding agents can modernize research software but can't judge if the science is right

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。