工程 / 工程
SageMaker AI 上线生成式 AI 推理推荐可视化界面
亚马逊云科技在 Amazon SageMaker AI Studio 中推出生成式 AI 推理推荐的图形化界面,作为原有 API 的低代码与无代码补充。开发团队此前需要通过编程方式调用推理推荐 API,并自行决定参数与解读基准测试结果。新界面提供预置用例模板,覆盖聊天、内容生成、文档摘要等常见流量模式;用户可选择最小化延迟、最大化吞吐或最小化成本作为优化目标。模型来源支持 JumpStart 模型库、Amazon S3 自有模型工件、模型注册表以及历史 SageMaker 模型。优化完成后,系统通过可视化方式对比各配置性能,并支持将推荐配置一键部署到生产端点。生成推荐本身不收取额外费用,但基准测试期间运行的优化作业与端点按标准计算资源计费。
亚马逊云科技在 Amazon SageMaker AI Studio 中正式上线生成式 AI 推理推荐的可视化界面,作为 2026 年 4 月推出的推理推荐 API 的低代码与无代码补充。API 形态虽然功能完整,但要求使用者熟悉参数设定并能解读原始基准测试输出;新界面则通过引导式工作流降低了这一门槛,使缺乏深度基础设施经验的团队也能独立完成生产级推理配置。
界面的入口位于 Studio 左侧导航的 Jobs 菜单下的 Inference optimization 选项,整体流程涵盖工作负载配置、运行优化、模型选取与部署四个阶段。用户首先在策略配置步骤中选择用例模板:Interact 对应短输入、中等输出的聊天场景;Generate 面向输出更长的内容生成场景;Summarize 针对文档摘要中高输入输出比的特征;若现有模板无法匹配,用户也可选择 Custom 并自行提供 JSONL 评估数据集、并发数与最大输出 token 数。
优化目标设置与用例模板相互配合。Minimize latency 适合对响应时延敏感的交互式应用,Maximize throughput 面向批量或高吞吐场景,Minimize cost 则在预设流量预期下寻求最具成本效益的配置。所选目标会直接影响 SageMaker AI 应用的优化技术以及最终推荐的排序逻辑。
模型来源方面,界面支持从 Amazon SageMaker JumpStart 模型库挑选基础模型,也可指向 Amazon S3 上的自有模型工件、使用模型注册表中已注册的包版本,或直接复用此前部署或训练任务产生的 SageMaker 模型。在选定模型后,用户既可让系统自动匹配合适的实例类型,也可在 Minimize latency 或 Maximize throughput 目标下手动限定评估范围,例如 ml.g6e.2xlarge 或 g7e.2xlarge 等规格。对于持有灵活训练计划预留容量的用户,界面还会列出可用的计算来源。
在结果呈现与部署环节,界面提供不同配置的性能可视化对比,方便用户权衡成本与性能。确认推荐配置后,可一键将模型部署至生产端点;高级用户仍可回到 API 路径进行细粒度定制。机器学习工程师借助该流程验证下一次部署,技术人员则可在统一界面中评估成本与性能取舍,从而压缩从模型选定到可上配置的整体周期。
费用方面,运行优化作业与基准测试期间所配置的端点遵循标准计算资源计费规则,生成推荐本身不另收额外费用。该界面适用于希望绕开手动基准测试、依赖数据驱动配置决策的工程与产品团队。
要点
- Amazon SageMaker AI Studio 新增生成式 AI 推理推荐可视化界面,作为 2026 年 4 月上线 API 的低代码与无代码形态补充。
- 界面提供 Interact、Generate、Summarize 三类预置用例模板,并支持通过 Custom 选项导入自有数据集与并发配置。
- 优化目标覆盖 Minimize latency、Maximize throughput、Minimize cost 三种模式,决定优化技术与推荐排序逻辑。
- 模型来源支持 JumpStart 模型库、亚马逊 S3 自有工件、模型注册表条目以及历史 SageMaker 模型。
- 用户可在界面内完成可视化结果对比与一键部署,同时保留 API 方式供高级用户进行细粒度配置;生成推荐不另收费用,基准测试期间按标准计算资源计费。
原始标题:Launching UI for generative AI inference recommendations in Amazon SageMaker AI
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。