大模型分布式训练框架开发工程师
岗位摘要
负责大模型分布式训练框架的开发和优化,构建一流和稳定的分布式能力,包括功能特性开发、通信和计算性能优化等;参与大模型训练各个环节的工程开发,处理训练过程中遇到的技术挑战;跟进和引入业界先进的分布式训练相关的技术,做前沿的技术创新
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型分布式训练框架的开发和优化,构建一流和稳定的分布式能力,包括功能特性开发、通信和计算性能优化等
- 参与大模型训练各个环节的工程开发,处理训练过程中遇到的技术挑战
- 跟进和引入业界先进的分布式训练相关的技术,做前沿的技术创新
任职要求
- 熟悉常见的深度学习训练框架,如PyTorch、Megatron、Deepspeed等,并具有相关分布式3D并行训练开发和调试经验
- 熟悉NVIDIA CUDA的开发流程和kernel优化,对常用GPU Library有使用和开发经验,如cuDNN/cuBlas/NCCL/Cutlass等
- 有大模型训练的项目开发经验,熟悉常见的Transformer架构实现
- 具有良好的团队合作精神和管理能力,能够跨团队紧密合作,共同推动项目的成功
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。