分布式训练算法工程师
岗位摘要
设计并实现大模型分布式训练方案,提升训练效率与稳定性;优化通信算法与计算图,降低多机多卡通信开销;基于DeepSpeed、Megatron-LM等框架进行二次开发与性能调优;跟踪前沿模型加速技术,持续改进训练与推理性能
岗位职责
- 设计并实现大模型分布式训练方案,提升训练效率与稳定性
- 优化通信算法与计算图,降低多机多卡通信开销
- 基于DeepSpeed、Megatron-LM等框架进行二次开发与性能调优
- 跟踪前沿模型加速技术,持续改进训练与推理性能
- 与算法、硬件团队协作,推动算法工程化落地
任职要求
- 硕士及以上学历,3年以上分布式训练或高性能计算经验
- 熟悉PyTorch,深入理解LLM/VLM/视频生成训练流程
- 熟练使用DeepSpeed、Megatron-LM等分布式训练框架
- 掌握NCCL、RDMA等通信原理,具备通信优化经验
- 具备优秀Python/C++编程能力,熟悉GPU并行计算
福利待遇
- 月薪30-60K,具体面议
- 北京望京国际研发园办公,地铁直达
- 弹性工作制,远程与现场灵活结合
- 六险一金、年度体检、带薪年假
- 技术大咖带教,参与国家级AI项目
工作地址
北京朝阳区望京国际研发园I座