工程 / 工程
面向代理与编码场景的开放权重方案
MiniMax 全系列 M2 模型已在 Amazon Bedrock 全面开放,包括 M2、M2.1 以及最新上线的 M2.5,均提供标准、优先级与弹性三种服务等级。三款模型都采用混合专家架构,能够在不牺牲知识容量的前提下控制单次推理成本。M2.5 主打代理原生执行,针对工具调用、多步任务拆解与长链路编码做了专项强化。开发团队可以借助推荐的 bedrock-mantle 端点配合 Chat Completions 接口快速接入,也可以通过 bedrock-runtime 调用 Converse 与 InvokeModel,从而使用 Guardrails、Agents、Flows 等原生 Bedrock 能力。整套部署由 AWS 基础设施托管,输入与输出数据不会被用于训练,也不会回传给模型厂商。
随着企业将 AI 工作负载从实验阶段推向生产环境,模型选型越来越多地受两类需求驱动:一是模型能力是否匹配具体场景,二是推理环境能否满足组织的数据安全与合规要求。越来越多团队希望在保留前沿模型能力的同时,确保数据不外流、不被用于训练。Amazon Bedrock 作为 AWS 全托管的基础模型服务,正是在这一背景下承接第三方前沿模型的接入需求,推理全程跑在 AWS 自有基础设施上,用户的提示词与生成结果既不参与任何模型训练,也不会被共享给模型提供方。
MiniMax 此次登陆 Bedrock 的 M2 系列共有三款开放权重模型。M2 作为首发版本,主打多语言文本生成、推理与编码能力,并提供一百万 token 的上下文窗口,适合长文档处理。M2.1 进一步强化了推理深度、编码准确度与指令遵循能力。M2.5 是目前 Bedrock 上最新的 MiniMax 模型,定位于代理原生执行,在工具调用、多步任务拆解以及长链路编码任务上进行了有针对性的强化训练。
M2.5 采用混合专家(MoE)架构,总参数量为 230B,但每次前向传播仅激活 10B 参数。这意味着模型在保持大模型知识容量的同时,单次推理的计算开销显著降低,更适合代理型工作负载中高频调用的场景。三款模型均支持标准、优先级与弹性三种服务等级,最大输出均为 8K token,开发者可以根据延迟与成本诉求灵活选择。
在接入方式上,Bedrock 提供两类端点。推荐的 bedrock-mantle 端点对应新一代推理引擎,对外暴露与 OpenAI Python 与 TypeScript SDK 完全兼容的 Chat Completions 接口,团队只需替换 base URL 与模型 ID 即可把现有应用切换到 MiniMax 模型上,同时支持 Bedrock API key、项目管理以及客户端工具调用。对于需要使用 Guardrails、Agents、Flows 以及模型评估等原生 Bedrock 能力的场景,则可以走 bedrock-runtime 端点,通过 AWS SDK 调用 Converse 或 InvokeModel 接口。
对于想快速试用的团队,可以直接打开 Bedrock 控制台的 Chat/Text playground,分类中选择 MiniMax 并加载 M2.5 模型,即可向其发起编码与设计相关的推理请求,例如让其设计一个带错误处理、输入校验与单元测试的 Python REST 微服务,并要求其解释设计取舍。这种低门槛方式让开发者无需自行托管权重或搭建推理栈,就能在生产级基础设施上体验开放权重模型的能力。
要点
- MiniMax M2 系列三款模型已在 Amazon Bedrock 全面上线,其中 M2.5 主打代理原生执行,针对工具调用与长链路编码做了专项训练。
- 三款模型均采用混合专家架构,M2.5 总参数量为 230B,每次推理仅激活 10B 参数,可在控制成本的同时维持大模型的知识容量。
- 开发者可使用 bedrock-mantle 端点配合与 OpenAI SDK 兼容的 Chat Completions 接口快速接入,也可通过 bedrock-runtime 调用 Guardrails、Agents 等原生 Bedrock 能力。
- 整个服务由 AWS 全托管,用户的提示词与生成数据不参与模型训练,也不会被共享给模型厂商,便于满足企业合规与数据隔离需求。
原始标题:Run MiniMax models on Amazon Bedrock
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。