AI资讯 / Agent

Agent / 分析

Xaira Therapeutics 的 X-Cell 模型如何重塑药物发现

Latent Space

Xaira Therapeutics 的首席发现官 Ci Chu 和首席 AI 科学家 Bo Wang 在 Latent Space 播客中分享了他们的核心策略:因果模型需要因果数据。他们发现,传统模型在参数超过 15 亿后测试损失停滞,原因是数据信息量不足。为此,团队构建了 X-Atlas 数据集,通过 CRISPR 实验并行运行数百万次测试,生成因果数据,并训练出 X-Cell 模型。该模型采用扩散架构,能预测基因变化对细胞的影响,在真实实验中表现优异,甚至击败了线性基线。这一方法将数据收集视为关键投资,预算类似强化学习部署,而非传统预训练。X-Cell 的推出标志着虚拟细胞模型从相关性走向因果性的重要一步。

Xaira Therapeutics 正在押注信息丰富的数据作为 AI 驱动药物开发的关键。在 Latent Space 播客中,首席发现官 Ci Chu 和首席 AI 科学家 Bo Wang 详细解释了他们的策略:因果模型需要因果数据。他们发现,当模型参数超过 15 亿时,测试损失趋于平缓,而训练损失仍随规模下降,这表明模型受限于数据中的信息量。训练单一、较小的数据集暴露了信息缺口:31 亿参数的模型偏离了扩展趋势,参数和计算都无法突破这一瓶颈。

为了预测基因表达的变化,团队需要更富含信息的数据。他们构建了 X-Atlas 数据集,通过 CRISPR 实验并行运行数百万次测试,生成因果数据。这些数据揭示了基因之间的上下游关系,例如改变一个基因如何影响其他基因的表达。基于此,他们训练了 X-Cell 模型,采用扩散架构而非自回归方法,以更好地捕捉基因变化的因果效应。

X-Cell 模型在真实实验室实验中表现出色,甚至击败了线性基线。团队还证明了,通过引入多种先验知识,模型性能得到进一步提升。Bo Wang 指出,数据收集实验和基础设施的成本估计在数千万美元,而计算、人力和研究费用为数百万美元。这一预算更像强化学习部署,而非数据丰富的预训练。

X-Cell 的推出标志着虚拟细胞模型从相关性走向因果性的重要一步。传统模型基于 CELLxGENE 数据库(包含 1.68 亿个细胞的数据)训练,能描述细胞类型和状态的关系,但难以预测基因变化的影响。X-Atlas 和 X-Cell 通过因果数据填补了这一空白,为药物发现和基因编辑提供了更精准的工具。

Bo Wang 还分享了作为学术领袖与行业领袖的差异,以及他的实验室如何跟上 AI 创新的快速步伐。他强调,信息丰富的数据是模型扩展的关键,而 X-Cell 的成功证明了这一策略的有效性。未来,Xaira 计划将这一方法应用于更多药物研发场景。

要点

  • Xaira Therapeutics 通过构建因果数据集 X-Atlas 和扩散模型 X-Cell,突破了基因表达预测的瓶颈。
  • 传统模型在参数超过 15 亿后测试损失停滞,原因是数据信息量不足,而非模型规模。
  • CRISPR 实验并行运行数百万次测试,生成因果数据,揭示了基因之间的上下游关系。
  • X-Cell 在真实实验室实验中击败了线性基线,证明了因果数据的价值。
  • 数据收集预算类似强化学习部署,而非传统预训练,凸显了信息丰富数据的重要性。
查看原始来源

原始标题:🔬Causal Models Need Causal Data - Xaira’s X-Cell model for Drug Discovery (Bo Wang & Ci Chu, Chief Discovery Officer & Chief AI Scientist)

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。