产业 / 媒体
打破埃鲁姆定律的关键一环
自1950年代以来,新药研发成本每九年翻一番,这一现象被称为「埃鲁姆定律」。如今,一款新药从研发到上市平均耗时10至15年,花费高达10亿至25亿美元,失败率超过90%。AI被制药行业寄予厚望,希望借此压缩时间线、提升成功率。在早期药物发现阶段,AI已能从零设计候选化合物并预测其与靶点的相互作用,大幅减少对物理筛选的依赖。然而,AI模型的性能高度依赖训练数据的质量与完整性。当前公开数据集普遍存在发表偏倚——只记录成功实验,失败数据被埋没在实验室笔记中从未被利用。与此同时,生成式AI的普及使数据造假更加容易,进一步威胁模型可靠性。未来,以「暗实验室」为代表的全自动化实验室有望实现预测、测试、优化的持续闭环,但前提是实验室系统的深度整合与数据基础设施的全面升级。
药物研发长期面临高成本、高风险的双重压力。自1950年代以来,新药开发成本每九年翻一番,业界将这一规律称为「埃鲁姆定律」。目前,一款新药从立项到上市平均需要10至15年,耗资10亿至25亿美元,且超过90%的候选药物最终以失败告终。在这一背景下,AI成为制药行业押注最重的技术方向,核心逻辑是:越早筛选出高质量候选化合物,后期临床阶段的失败风险就越低。
在药物发现的早期阶段,AI最具潜力的应用场景之一是「苗头化合物识别」。传统方式依赖对数十万乃至数百万个化合物进行物理筛选,产出的是简单的是否结合的二元数据。而AI可以从零开始设计候选分子,并在实验室验证之前预测其与疾病靶点的相互作用,从根本上突破了物理筛选规模的限制。Cytiva蛋白质研究战略总监保罗·贝尔彻指出,AI不仅能提升苗头化合物的数量,还能在物理测试之前剔除低质量候选物,节省大量时间与资源。
然而,AI加速了对数据的需求,也同时暴露了数据质量的根本性缺陷。许多早期AI模型基于公开数据集训练,如今已触及贝尔彻所说的「数据墙」——各家模型使用相同数据,得出相似结论,边际收益持续递减。更深层的问题在于发表偏倚:科学界几乎只发表阳性结果,失败实验的数据被束之高阁,从未用于指导后续研究。贝尔彻将此比喻为「单手绑在背后做研究」,缺乏失败数据的模型无法真正理解风险,预测可靠性大打折扣。
数据造假问题在生成式AI时代愈发严峻。以蛋白质检测中常用的蛋白质印迹法图像为例,荷兰微生物学家伊丽莎白·比克的研究发现,早在2016年,就有近4%的生物医学论文存在图像重复或篡改问题。如今生成式AI使图像伪造变得轻而易举,一旦被用于训练模型,后果可能是灾难性的。对此,Cytiva推出了基于区块链哈希算法的图像完整性检测工具,能够识别科学图像是否遭到篡改,已引起多家学术出版机构的关注。
贝尔彻描绘的药物发现未来图景,是以「暗实验室」为核心的全自动化研究体系。这类实验室全天候运转,在AI模型的驱动下持续循环完成预测、实验、优化三个环节,并将每轮结果反馈回模型以指导下一轮实验。这种闭环机制有望从根本上提升进入临床试验的候选药物质量。但实现这一愿景的前提,是实验室系统的高度互操作性、结构化数据集的全面建立,以及信息在各环节之间的无缝流通——而这恰恰是当前大多数实验室尚未具备的能力。
AI在药物发现领域的潜力毋庸置疑,但其落地效果最终取决于数据基础设施的成熟程度。负面数据的系统性收集与共享、数据完整性验证工具的普及、实验室自动化系统的深度整合,将共同决定AI能否真正打破埃鲁姆定律的魔咒。制药行业正站在一个关键节点:技术能力已经超前,而支撑技术发挥作用的数据生态与基础设施,仍需大规模补课。
要点
- AI正将药物发现从经验性筛选转向预测性设计,可在物理实验前剔除低质量候选化合物,显著压缩研发时间线。
- 公开数据集的发表偏倚导致失败实验数据严重缺失,AI模型因此无法全面理解失败模式,预测可靠性受限。
- 生成式AI使科学图像造假门槛大幅降低,数据完整性验证工具(如基于区块链哈希算法的检测方案)正成为学术出版的新需求。
- 全自动化「暗实验室」代表药物发现的未来方向,但其实现依赖实验室系统的高度互操作性与结构化数据基础设施的全面建立。
- AI模型性能的天花板,本质上是训练数据质量与覆盖范围的天花板,数据闭环的完整性将决定AI制药的最终成效。
原始标题:Closing the data loop in AI-driven drug discovery
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。