AI资讯 / 工程

工程 / 工程

SageMaker AI 推理基准与推荐结果接入 MLflow,实验追踪实现实时统一

AWS Machine Learning

亚马逊云科技为 Amazon SageMaker AI 的推理优化推荐任务与基准测试任务新增 MLflow 集成。提交任务时附带 MlflowConfig,结果即可自动写入用户指定的 SageMaker MLflow App,在统一界面实时查看延迟、吞吐等指标,无需再从多个日志中手工拼接。多次运行的实验可归入同一 MLflow 实验名下,便于横向对比不同实例、批次大小或推测解码策略对性能的影响。整条流水线同时记录参数、时间戳、检查点指标与产物,支持长期可追溯。团队成员也能围绕同一实验视图协作,减少重复试验。官方提供基于 Qwen2-0.5B-Instruct 在 ml.g6.12xlarge 上的端到端示例笔记本,完整流程约 45 到 120 分钟。

亚马逊云科技宣布 Amazon SageMaker AI 的推理优化推荐任务与基准测试任务正式支持 MLflow 集成。用户在创建任务时传入 MlflowConfig,结果便会自动写入指定的 SageMaker MLflow App,跳过手工汇总日志与配置的繁琐步骤。多次任务可在同一 MLflow 实验名下并行展示,方便横向比对。

此前,团队评估生成式 AI 模型部署方案时,往往要在数十种 GPU 实例、推理容器、并行策略与推测解码等组合中反复试验,人工拼凑结果常耗费数周。新集成让指标、参数与图表以流式方式实时刷新,延迟与吞吐量在测试过程中持续可见,工程师可以据此判断任务是否达到预期并提前结束低效搜索。

每次实验运行都会捕获任务参数、时间戳、检查点指标以及生成的工件,形成可查询、可复现的审计记录。组织可以追溯哪些配置带来了性能提升,何处出现瓶颈,并在数月之后仍然回放完整决策链路。这对治理与跨班次协作同样有益,团队共享同一份实验视图,避免重复试错。

集成部署门槛较低:在 SageMaker Studio 中创建 MLflow App,向执行角色授予 sagemaker-mlflow:* 权限,并在任务请求中附带 MlflowConfig 即可。需要注意的是,该集成仅支持 SageMaker MLflow App,不写入用户自建的 MLflow 跟踪服务器;SageMaker 工具版本应不低于 0.8.0 以启用嵌套运行支持。

官方示例以 Qwen2-0.5B-Instruct 在 ml.g6.12xlarge 上的部署为案例,演示如何用同一个 MLflow 实验同时承载基准测试任务与推荐任务。其中基准测试评估现有实时端点,推荐任务则对 S3 中的模型产物进行配置排序。完整流程通常需要 45 到 120 分钟,受端点就绪状态、模型规模、负载配置、实例可用性与搜索空间影响。

前置条件包括已配置 SageMaker Studio、创建 SageMaker MLflow App、准备运行中的 OpenAI 兼容端点、存放模型产物的 S3 桶,以及具备 SageMakerFullAccess 与 MLflow、端点调用权限的 IAM 执行角色。S3 输出桶必须与任务位于同一区域。

要点

  • SageMaker AI 推理推荐与基准测试任务现在可直接将结果流式写入 SageMaker MLflow App,无需手工收集日志。
  • 实时刷新的延迟与吞吐量指标帮助工程师在长时任务中判断走向,必要时提前终止低效配置搜索。
  • 实验元数据、参数、检查点指标与工件被一并记录,提供数月可追溯的审计链路。
  • 同一 MLflow 实验名下汇总多次运行,便于按实例类型、批次大小或解码策略横向对比。
  • 集成仅支持 SageMaker MLflow App,不写入自建 MLflow 服务器,工具版本需不低于 0.8.0。
查看原始来源

原始标题:Streaming benchmark and recommendation results to MLflow with Amazon SageMaker AI

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。