返回岗位列表

MiniMax

大模型训练框架研发工程师

地点:北京 薪资:薪资未公开 日期:2023-01-03

岗位摘要

你将加入一支把“把万卡集群跑到极致”当日常的团队,与业内领先的通用大模型一起成长。你的核心任务是:突破大规模训练的速度、成本与稳定性的极限;大规模分布式训练系统研发(Scale Matters)

岗位职责

  • 你将加入一支把“把万卡集群跑到极致”当日常的团队,与业内领先的通用大模型一起成长。你的核心任务是:突破大规模训练的速度、成本与稳定性的极限
  • 大规模分布式训练系统研发(Scale Matters)
  • 主导 Data / Tensor / Pipeline / Expert 并行 策略的研发与优化
  • 优化高性能通信、计算通信掩盖、显存复用,提升近万卡训练的集群利用率
  • 面向上百亿〜万亿参数模型,实践高效并行范式
  • 性能极限优化(Performance Engineering)
  • 系统性分析训练吞吐瓶颈(comm / compute / IO / kernel / memory)
  • 针对关键路径做深度优化:算子融合、精度压缩、通信调度、显存管理策略
  • 与推理体系协同推进量化、MoE、Speculative Training 等最新机制的训练端落地
  • 前沿训练技术探索(Frontier Research → Engineering)

任职要求

  • 我们希望你具备(不求全,但求强)
  • 可以 0 优化经验,但在其他领域有过优秀成果
  • 熟悉高级编程语言,具备扎实的数据结构、并行编程、系统基础
  • 对 PyTorch、DeepSpeed、Megatron、Horovod、JAX、XLA 等之一有体系化理解
  • 对以下任一方向有深入经验或潜力
  • 大型分布式训练(DP/TP/PP/MoE)
  • GPU/多机通信优化(NCCL、RDMA、通信拓扑)
  • 训练框架/执行引擎研发
  • 大模型训练的性能与稳定性优化
  • 对前沿训练问题有明确兴趣,如

加分项

  • 为什么加入我们
  • 你将直接参与 领先通用大模型的核心训练体系,工作成果会快速转化为真实产品力
  • 足够高的解决问题自由度,我们的工作不仅局限于特定scope,也不受限于特定工程算法方案,只要能够挑战更高的极限,可以放下当前所有的约束
  • 和有“偏执工程美学”的伙伴一起,把“更快、更稳、更大规模”做成一种乐趣