返回岗位列表

MiniMax

大模型训练工程专家-稳定性方向

地点:北京 薪资:60-90K 日期:2026-09-18

岗位摘要

负责训练全栈基础设施保障,横向拉通GPU算力、RDMA高性能网络、通信库、高性能存储、集群调度与训练任务生命周期等多个技术域;负责GPU机器交付与健康管理,处理坏卡、掉卡、降频等问题的检测与自愈,管理节点池并实现快速置换

岗位职责

  • 负责训练全栈基础设施保障,横向拉通GPU算力、RDMA高性能网络、通信库、高性能存储、集群调度与训练任务生命周期等多个技术域
  • 负责GPU机器交付与健康管理,处理坏卡、掉卡、降频等问题的检测与自愈,管理节点池并实现快速置换
  • 保障IB/RoCE网络的稳定性与拓扑感知,定位并消除网络抖动、丢包、降速等异常
  • 负责NCCL及同类通信库的调优与故障定位,排查hang、慢all-reduce、拓扑不亲和等问题的根因
  • 建设训练数据与checkpoint的高吞吐存储链路,包括并行文件系统、对象存储与缓存加速,避免读写成为训练瓶颈
  • 负责大规模训练作业调度,包括gang scheduling、拓扑感知、抢占与配额,并实现故障容错与弹性伸缩
  • 管理训练任务生命周期,包括任务启动、断点续训、故障后的快速恢复与自动拉起
  • 建设训练专属可观测体系,覆盖训练指标、硬件健康与慢节点/掉队者检测,实现问题可发现、可定位
  • 建立故障自动发现、定位、自愈与快速恢复的闭环,压低MTTR,沉淀事故复盘与标准预案
  • 以ETTR、有效训练时长、中断次数等为北极星指标,量化并持续改善训练稳定性
  • 定位并消除通信、IO、计算、调度等训练瓶颈,与算法及框架团队协同提升MFU、扩展效率与吞吐
  • 深入Megatron-LM、DeepSpeed等分布式训练框架,理解并行策略、通信模式与checkpoint机制,将框架层问题转化为基础设施侧的改进

任职要求

  • 5年以上相关经验,具备千卡级及以上大规模GPU集群训练稳定性或AI Infra的一线实战经验
  • 在RDMA/高性能网络、NCCL等通信库、并行/高性能存储、大规模作业调度、GPU集群运维与故障处理中,至少2-3个方向有真深度,能讲清原理、权衡与踩过的坑
  • 懂分布式训练原理与框架,熟悉Megatron或DeepSpeed至少其一,理解并行训练中hang、慢、OOM、掉队等常见问题的成因与定位手段
  • 具备扎实的编程与工程化能力,Python、Go、C++至少一门过硬,能够用代码和自动化打造平台与工具,而非纯oncall运维
  • 具备成熟的稳定性方法论,熟悉SLO、可观测、根因分析、先止损再定位,有体系而非靠蛮力重启
  • 具备强Owner意识与跨团队协同能力,能端到端扛事、兑现承诺,与算法、训练、网络、存储多方拉通并清晰表达自身价值
  • 加分项:具备NCCL/通信库源码级理解,或GPU kernel与性能profiling经验
  • 加分项:有故障预测、弹性/容错训练、超大规模(万卡级)训练稳定性经验
  • 加分项:有训练框架二次开发经验或相关开源社区贡献
  • 加分项:对AI与大模型有强烈兴趣与持续学习倾向(AI Native)

福利待遇

  • 提供60-90K、16薪的薪酬结构
  • 参与公司最核心、最烧算力的大模型训练战役,直接决定旗舰模型能否按期炼成
  • 拥有从0到1搭建训练稳定性体系的空间,可观测、故障自愈、预案、效率工程均有大片可建设地带
  • 作为端到端Owner岗位,向上直面算法与训练团队的真实诉求,横向拉通多方技术团队

工作地址

北京海淀区蓟门壹号8楼