分布式训练算法工程师
岗位摘要
设计并实现大模型分布式训练方案,提升训练效率与稳定性;优化通信算法与计算图,降低多机多卡通信开销;基于DeepSpeed、Megatron-LM等框架进行二次开发与性能调优;跟踪前沿模型加速技术,持续改进训练与推理性能
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并实现大模型分布式训练方案,提升训练效率与稳定性
- 优化通信算法与计算图,降低多机多卡通信开销
- 基于DeepSpeed、Megatron-LM等框架进行二次开发与性能调优
- 跟踪前沿模型加速技术,持续改进训练与推理性能
- 与算法、硬件团队协作,推动算法工程化落地
任职要求
- 硕士及以上学历,3年以上分布式训练或高性能计算经验
- 熟悉PyTorch,深入理解LLM/VLM/视频生成训练流程
- 熟练使用DeepSpeed、Megatron-LM等分布式训练框架
- 掌握NCCL、RDMA等通信原理,具备通信优化经验
- 具备优秀Python/C++编程能力,熟悉GPU并行计算
福利待遇
- 月薪30-60K,具体面议
- 北京望京国际研发园办公,地铁直达
- 弹性工作制,远程与现场灵活结合
- 六险一金、年度体检、带薪年假
- 技术大咖带教,参与国家级AI项目
工作地址
北京朝阳区望京国际研发园I座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。