返回岗位列表

MiniMax

大模型训练基础设施稳定性与效率资深工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

训练全栈基础设施保障:负责GPU算力(机器交付、健康管理、坏卡检测与自愈)、RDMA/高性能网络(IB/RoCE稳定性、抖动定位)、网络通信库(NCCL调优与故障定位)、高性能存储(数据与checkpoint高吞吐链路)、集群调度(大规模作业调度、故障容错与弹性伸缩)及训练任务生命周期(启动、断点…

岗位职责

  • 训练全栈基础设施保障:负责GPU算力(机器交付、健康管理、坏卡检测与自愈)、RDMA/高性能网络(IB/RoCE稳定性、抖动定位)、网络通信库(NCCL调优与故障定位)、高性能存储(数据与checkpoint高吞吐链路)、集群调度(大规模作业调度、故障容错与弹性伸缩)及训练任务生命周期(启动、断点续训、快速恢复)
  • 训练稳定性工程:建设训练专属可观测体系,实现硬件健康、慢节点检测;建立故障自动发现、定位、自愈闭环,降低MTTR;以ETTR、有效训练时长等指标量化并持续改善稳定性
  • 训练效率工程:定位并消除通信、IO、计算、调度等瓶颈,与算法和框架团队协同提升MFU、扩展效率与吞吐
  • 深入训练框架层:理解Megatron-LM/DeepSpeed等分布式训练框架的并行策略、通信模式和checkpoint机制,将框架层问题转化为基础设施侧改进

任职要求

  • 5年以上相关经验,具备大规模GPU集群(千卡级及以上)训练稳定性或AI Infra一线实战经验
  • 在RDMA/高性能网络、NCCL等通信库、并行/高性能存储、大规模作业调度、GPU集群运维与故障处理中至少2-3个方向有深度理解
  • 熟悉分布式训练原理与框架(Megatron/DeepSpeed至少其一),理解并行训练中常见hang、慢、OOM、掉队问题的成因与定位手段
  • 扎实的编程与工程化能力(Python/Go/C++至少一门过硬),能通过代码和自动化构建平台工具
  • 成熟的稳定性方法论:掌握SLO、可观测、根因分析、先止损再定位等体系化方法
  • 强Owner意识与跨团队协同能力,能端到端扛事,与算法、训练、网络、存储等多方拉通

福利待遇

  • 参与公司最核心的大模型训练项目,直接决定旗舰模型成败
  • 端到端Owner角色,拥有从0到1搭建训练稳定性体系的广阔空间
  • 与顶尖算法和训练团队紧密协作,深入技术前沿
  • 持续学习与成长机会,接触AI/大模型领域最新技术