一家制药巨头的算力困境
Bristol Myers Squibb(BMS)是全球领先的制药企业之一,在肿瘤、血液、免疫和心血管等领域拥有深厚的研发管线。官方案例描述 BMS 拥有"赋能免疫系统对抗肿瘤的突破性癌症疗法"以及"细胞疗法和蛋白质降解技术"等创新领域。BMS 及其前身企业的创新历史可以追溯到十九世纪初。但药物研发的竞争环境正在发生根本变化:监管要求更复杂、竞争对手更密集、技术迭代更快,留给每一轮实验的窗口越来越短。
BMS 多年来一直在投资计算科学和 AI 能力,也长期使用云端资源进行研究计算。云的优势——快速部署、弹性伸缩——在 GPU 供给充裕时运转良好。但 GPU 市场的供需格局发生了变化。稀缺性推高了云端 GPU 的价格,同时限制了可用性。更棘手的是,GPU 消耗量和技术变化的速度使得预测几乎不可能。研究科学家发现自己花越来越多的时间在预测资源需求和担忧成本上,而不是专注于实验本身。
这不仅仅是预算问题。当科学家无法高效地构思和运行新实验时,产生的是机会成本——每一天的延迟都意味着患者等待新疗法的时间更长。BMS 面临一个根本性的选择:继续在不确定的云环境中修补,还是从底层重建研究计算的基础设施。
从第一性原理出发的基础设施决策
BMS 研究 IT 高级副总裁 Bill Mayo 在官方案例中描述了团队的方法论:他们把研究人员和技术人员组织在一起,用内部称为"第一性原理"(First Principles)的方式重新审视每一个环节——从团队结构、运营模式到资源分配、技能匹配、技术采购和战略合作。这不是在现有系统上叠加补丁,而是从头构建一个适合当前研发需求的计算能力。官方案例还提到,BMS 建立了 AI 卓越中心(AI Center of Excellence)作为推动 AI 能力建设的组织单元,但未进一步披露该中心的具体职能范围和治理结构。
最终的架构选择是 NVIDIA DGX SuperPOD,一个集中式的高性能 GPU 集群平台。选择它的核心理由有三个:第一,保证 GPU 的稳定可用性,不再受云端市场波动影响;第二,架构本身支持在需要时扩展到云端,保留弹性;第三,通过合作伙伴分工降低运维负担。
架构概览
BMS 集中式研究计算平台的核心组件与协作关系
在这个架构中,三方各有明确分工。Equinix 负责管理 DGX SuperPOD 的基础设施、共址数据中心和互联能力。Mark III 作为 NVIDIA 解决方案合作伙伴,提供 AI 和运营专业支持。BMS 研究计算总监 Brian Wong 在官方案例中特别提到,Mark III 的专业能力是团队从孤立的单节点用例快速演进到高性能多节点训练的关键催化剂。这种分工让科学家获得了可纵向和横向扩展的计算资源,而不需要增加系统管理人员或系统管理费用。
平台落地与研究工作流的重构
官方场景
BMS 研究团队的 AI 计算平台工作环境
DGX SuperPOD 在 2024 年 3 月投入运行。从官方案例的描述来看,平台上线后承担了两个主要研究方向的计算任务。
第一个方向是肿瘤基础 AI 模型的开发。官方案例在目标部分提到,BMS 使用了数十万张(hundreds of thousands)临床试验影像用于训练。团队利用这些 CT 和 MR 扫描数据,使用 NVIDIA MONAI 框架和 DGX SuperPOD 的推理能力,自动分割病灶区域。为了增强模型的鲁棒性,团队采用自监督学习方法,通过掩码图像建模(mask image modeling)在内部数据集上训练模型。这个基础模型随后在公开数据集上进行了微调和基准测试,在下游任务中表现出较强的性能。官方案例称,这些成果显著加速了研究时间线,提高了分割准确性和处理效率。需要指出的是,官方案例将该平台描述为"为肿瘤研究和临床决策的持续创新提供坚实基础",但未说明模型输出是否已进入任何临床工作流,也未界定探索性研究模型与临床决策系统之间的边界。
第二个方向是免疫肿瘤学研究。在这个领域,预测哪些患者会对特定治疗产生响应是一个核心挑战。BMS 研究人员使用大型语言模型和 Transformer 架构来分析复杂的临床试验数据。他们的创新之处在于把多样化的数据——包括基因组学、生活方式和治疗细节——当作类似自然语言的"语法句子"来处理。通过将这些数据与生存期和不良事件等结局指标一起嵌入,BMS 构建了一个预测患者结局的模型。训练过程结合了内部临床数据、公开数据集和科学文献。据官方案例描述,利用 DGX SuperPOD 的算力,模型表现超过了标准基线 Transformer——但该结论为定性表述,未给出具体指标、样本量或统计检验方法。
实施与协作
从平台上线到研究落地的阶段、角色与人机分工
Brian Wong 在官方案例中描述了平台的弹性使用方式:科学家可以根据工作负载需求灵活调整资源,在需要时增加节点用于大型语言模型训练,在不需要时将节点重新分配给深度学习任务。这种资源调度的灵活性是集中式平台相对于分散式云资源的核心优势之一。
需要指出的是,官方材料未披露以下实施细节:平台的具体 GPU 型号和节点规模、研究模型从探索阶段进入临床决策的审批流程、模型输出的质量验证标准、异常情况下的回退方式,以及内部数据与公开数据集的具体混合比例。对于希望复现类似项目的组织,这些都是需要在自身环境中独立验证的关键环节。
官方结果的口径与未解答的问题
官方案例列出了四项结果。第一项也是唯一的量化结果是"相较此前模式整体成本节省 55%",出自 Brian Wong 的直接引述,原文语境是在描述 DGX SuperPOD 与 Equinix 公有云集成实现了成本高效的数据移动之后给出的。第二项是"统一平台支持从训练到部署的端到端 AI",这是对平台架构能力的描述性总结。第三项是"提高了计算科学的速度和敏捷性",为定性评价,未给出量化指标。第四项是"显著加速研究时间线,提高分割准确性和处理效率",同样为定性描述。
55% 这个数字的统计口径需要仔细理解。首先,"此前模式"(prior model)指的是什么?从上下文推断,最可能的对比基线是 BMS 此前依赖的云端 GPU 计算模式,但官方案例没有展开说明这个基线是否包含全部云费用、是否包含人力成本、是否包含数据传输和存储费用。其次,"整体成本"(overall cost)的边界也未明确——它是否包含 Equinix 的托管费、Mark III 的服务费、SuperPOD 硬件的折旧?第三,这是一个时点比较还是年化比较?是峰值负载下的比较还是平均负载下的比较?
免疫肿瘤学方向的 LLM 模型被官方案例描述为能够"以前所未有的准确性预测患者结局",并"将数据转化为可能革新肿瘤治疗策略的可操作洞察"。但"前所未有的准确性"没有给出量化指标,"可能革新"(could revolutionize)使用的是条件语态。这些表述更接近研究愿景而非已兑现的临床成果。
证据边界
官方披露结果的口径分析与未披露维度
这并不意味着 55% 的成本节省不可信。对于从按需云 GPU 迁移到自有/托管集群的组织来说,在高利用率条件下实现显著成本下降是合理的。但读者在引用这个数字时,应当理解它来自供应商官方案例、由企业自报、未经独立审计,且比较基线未完全展开。
基础设施就绪与临床价值之间的距离
BMS 案例同时涉及两个层面:基础设施层面(如何提供稳定、经济的 GPU 算力)和应用层面(如何用这些算力推进肿瘤研究)。官方案例在基础设施层面的叙述相对完整——决策动因、架构选择、合作方分工和成本结果都有交代。但在应用层面,从模型训练到临床价值的路径仍有大量未解答的问题。探索性模型与可用于临床决策的系统之间存在数据治理、模型验证、监管审批和工作流集成等多个环节,这些不在本案例的披露范围内。
这种区分很重要。BMS 在基础设施层面解决了一个真实且紧迫的问题——GPU 稀缺和成本不确定性确实在阻碍研究效率。但基础设施的就绪并不自动等于临床价值的实现。官方案例中"可能革新"(could revolutionize)等条件语态的使用,也表明这些应用方向仍处于研究探索阶段而非已兑现的临床成果。
对其他组织的参考价值
DataHub 判断(前提:工作负载密度):
补充信息与证据说明(1)
编辑说明与证据边界
证据等级 B:供应商官方客户案例。55% 成本节省为企业自报,未经独立审计,比较基线未完全展开。模型性能均为定性描述。标注"DataHub 判断"的内容为编辑推论,不代表企业立场。