大模型训练框架研发工程师
岗位摘要
主导数据并行、张量并行、流水线并行、专家并行等大规模分布式训练策略的研发与优化,提升近万卡训练集群利用率;面向上百亿至万亿参数模型,实践高效并行范式,优化高性能通信、计算通信掩盖与显存复用
岗位职责
- 主导数据并行、张量并行、流水线并行、专家并行等大规模分布式训练策略的研发与优化,提升近万卡训练集群利用率
- 面向上百亿至万亿参数模型,实践高效并行范式,优化高性能通信、计算通信掩盖与显存复用
- 系统性分析训练吞吐瓶颈,包括通信、计算、IO、算子与显存,并针对关键路径进行算子融合、精度压缩、通信调度、显存管理等深度优化
- 与推理体系协同推进量化、MoE、Speculative Training等最新机制在训练端的落地
- 根据兴趣及特长,可主导前沿训练范式、训练稳定性或可扩展性研究中的一类方向
- 与底层kernel、runtime、compiler团队协作,共同推进compute-bound和comm-bound场景的极限性能
- 设计能充分压榨GPU/NPU的训练模式,让硬件运行在更高速度
任职要求
- 可以没有优化经验,但在其他领域有过优秀成果
- 熟悉高级编程语言,具备扎实的数据结构、并行编程与系统基础
- 对PyTorch、DeepSpeed、Megatron、Horovod、JAX、XLA等之一有体系化理解
- 对大型分布式训练(DP/TP/PP/MoE)、GPU/多机通信优化(NCCL、RDMA、通信拓扑)、训练框架/执行引擎研发、大模型训练性能与稳定性优化中任一方向有深入经验或潜力
- 对前沿训练问题有明确兴趣,如scaling law、混合并行策略、优化器系统、极致显存压缩,以及量化训练、KV cache aware training、speculative training等推理端协同方向
- 有千卡至万卡大规模模型训练经验者优先
- 有顶会论文、开源贡献或能展示能力的工程项目是加分项,但非必要
加分项
- 为什么加入我们
- 你将直接参与 领先通用大模型的核心训练体系,工作成果会快速转化为真实产品力
- 足够高的解决问题自由度,我们的工作不仅局限于特定scope,也不受限于特定工程算法方案,只要能够挑战更高的极限,可以放下当前所有的约束
- 和有“偏执工程美学”的伙伴一起,把“更快、更稳、更大规模”做成一种乐趣
福利待遇
- 直接参与领先通用大模型的核心训练体系,工作成果会快速转化为真实产品力
- 拥有足够高的解决问题自由度,工作不局限于特定scope,也不受限于特定工程算法方案,只要能够挑战更高极限,可以放下当前所有约束
- 与具有偏执工程美学的伙伴一起,把更快、更稳、更大规模做成一种乐趣
工作地址
北京海淀区蓟门壹号8楼