返回岗位列表

MiniMax

大模型训练框架研发工程师

地点:北京 薪资:50-80K 日期:2026-09-18

岗位摘要

主导数据并行、张量并行、流水线并行、专家并行等大规模分布式训练策略的研发与优化,提升近万卡训练集群利用率;面向上百亿至万亿参数模型,实践高效并行范式,优化高性能通信、计算通信掩盖与显存复用

岗位职责

  • 主导数据并行、张量并行、流水线并行、专家并行等大规模分布式训练策略的研发与优化,提升近万卡训练集群利用率
  • 面向上百亿至万亿参数模型,实践高效并行范式,优化高性能通信、计算通信掩盖与显存复用
  • 系统性分析训练吞吐瓶颈,包括通信、计算、IO、算子与显存,并针对关键路径进行算子融合、精度压缩、通信调度、显存管理等深度优化
  • 与推理体系协同推进量化、MoE、Speculative Training等最新机制在训练端的落地
  • 根据兴趣及特长,可主导前沿训练范式、训练稳定性或可扩展性研究中的一类方向
  • 与底层kernel、runtime、compiler团队协作,共同推进compute-bound和comm-bound场景的极限性能
  • 设计能充分压榨GPU/NPU的训练模式,让硬件运行在更高速度

任职要求

  • 可以没有优化经验,但在其他领域有过优秀成果
  • 熟悉高级编程语言,具备扎实的数据结构、并行编程与系统基础
  • 对PyTorch、DeepSpeed、Megatron、Horovod、JAX、XLA等之一有体系化理解
  • 对大型分布式训练(DP/TP/PP/MoE)、GPU/多机通信优化(NCCL、RDMA、通信拓扑)、训练框架/执行引擎研发、大模型训练性能与稳定性优化中任一方向有深入经验或潜力
  • 对前沿训练问题有明确兴趣,如scaling law、混合并行策略、优化器系统、极致显存压缩,以及量化训练、KV cache aware training、speculative training等推理端协同方向
  • 有千卡至万卡大规模模型训练经验者优先
  • 有顶会论文、开源贡献或能展示能力的工程项目是加分项,但非必要

加分项

  • 为什么加入我们
  • 你将直接参与 领先通用大模型的核心训练体系,工作成果会快速转化为真实产品力
  • 足够高的解决问题自由度,我们的工作不仅局限于特定scope,也不受限于特定工程算法方案,只要能够挑战更高的极限,可以放下当前所有的约束
  • 和有“偏执工程美学”的伙伴一起,把“更快、更稳、更大规模”做成一种乐趣

福利待遇

  • 直接参与领先通用大模型的核心训练体系,工作成果会快速转化为真实产品力
  • 拥有足够高的解决问题自由度,工作不局限于特定scope,也不受限于特定工程算法方案,只要能够挑战更高极限,可以放下当前所有约束
  • 与具有偏执工程美学的伙伴一起,把更快、更稳、更大规模做成一种乐趣

工作地址

北京海淀区蓟门壹号8楼