AI资讯 / 工程

工程 / 工程

MLflow 与 Amazon SageMaker 模型注册表同步:单账户模型治理实践

AWS Machine Learning

Amazon SageMaker AI 上的托管 MLflow 迎来重要升级:模型注册表同步功能现在能够携带更丰富的元数据,包括训练指标、评估结果、推理规格以及模型血缘信息,同时支持由 MLflow 侧驱动的生命周期阶段晋升。此前,模型虽然可以同步至注册表,但缺乏上述关键信息,治理人员不得不在 MLflow 与注册表之间来回切换,手动收集审查所需的上下文。新版同步机制激活后,数据科学家在 MLflow 中注册模型时,系统会自动在 SageMaker 模型注册表中创建对应的模型包组与版本,并将四类元数据一并写入:运行元数据、评估指标、推理规格以及血缘关系。治理人员可直接在注册表中完成审批、审计与生命周期管控,无需数据科学家改变现有实验工作流。本文为两篇系列文章的第一篇,聚焦单账户场景下通过 IAM 权限边界分离数据科学家与治理人员角色的实践方案。

在机器学习工程实践中,实验阶段与生产治理之间长期存在一道鸿沟:数据科学家在 MLflow 中追踪数十个候选模型运行,而治理人员则需要一个权威注册表来验证、审批并审计最终进入生产的模型。Amazon SageMaker AI 上的托管 MLflow 此前已支持将 MLflow 中注册的模型自动同步至 SageMaker 模型注册表,但同步内容较为有限,缺少指标、评估结果与血缘信息,治理人员无法仅凭注册表完成候选模型的审查工作。

此次升级后,同步机制携带了四类关键元数据。第一类是运行元数据,涵盖模型参数、训练指标、训练数据集位置与模型产物路径;第二类是评估指标,以模型卡片形式附加在模型包版本上,并在 Amazon SageMaker Studio 的评估标签页中直接渲染,方便治理人员与模型性能数据并排审查;第三类是推理规格,定义容器镜像、模型数据位置与支持的实例类型,使模型可直接从注册表部署;第四类是血缘关系,记录 MLflow 实验、模型版本、容器镜像与模型包组之间的关联关系。

启用模型注册表同步是一项可选功能,可在创建或更新 MLflow 应用时通过将模型注册模式设置为 AutoModelRegistrationEnabled 来激活。激活前需为 MLflow 应用的 IAM 服务角色配置相应权限,包括创建模型包组与版本、添加标签以及记录血缘关联。数据科学家只需在训练运行中调用标准 MLflow 接口记录模型,并可选择性地附加评估指标与推理规格,随后通过一次注册调用即可触发全部同步流程,无需额外操作。

生命周期阶段晋升是此次更新的另一项核心能力。治理人员可通过 SageMaker 模型注册表的生命周期阶段构造管理模型流转,既可使用预定义的阶段模板,也可根据业务需求自定义。结合 IAM 条件键,组织可以确保只有具备相应权限的用户才能将模型从一个阶段晋升至下一阶段。数据科学家可通过在 MLflow 中设置符合 sagemakerlifecycle-{stage}-{status} 命名规范的别名来触发对应 SageMaker 模型包生命周期的自动更新,实现从实验到生产的无缝衔接。

本文是两篇系列文章的第一篇,重点介绍单账户场景下的治理实践:数据科学家与治理人员两种角色通过 IAM 权限边界加以区分,而非依赖账户边界隔离。这一设计适合中小规模团队快速落地模型治理流程。第二篇文章将在此基础上扩展至跨账户治理拓扑,面向规模更大或受监管行业的组织。两篇文章的配套工作笔记本均已发布至 GitHub 仓库,供读者参考实践。

要点

  • 托管 MLflow 的模型注册表同步功能现已支持携带训练指标、评估结果、推理规格与血缘信息,治理人员可直接在 SageMaker 注册表中完成完整审查,无需返回 MLflow。
  • 生命周期阶段晋升可由 MLflow 侧通过别名命名规范触发,结合 IAM 条件键实现权限管控,确保只有授权用户才能推进模型进入生产阶段。
  • 同步功能为可选项,通过设置 AutoModelRegistrationEnabled 模式激活,数据科学家无需改变现有实验工作流即可享受自动化治理能力。
  • 单账户场景下可通过 IAM 权限边界分离数据科学家与治理人员角色,为中小团队提供低门槛的模型治理起点;跨账户拓扑将在第二篇文章中介绍。
查看原始来源

原始标题:Govern models with MLflow and Amazon SageMaker AI Model Registry sync: Part 1

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。