分布式训练算法工程师
岗位摘要
参与万卡集群分布式训练开发,提升集群训练性能并进行理论分析;研究并实现单GPU及分布式训练技术,包括并行与异构计算的设计、开发与性能优化;结合分布式训练技术,探索并优化前沿语言/多模态大模型算法及模型适配
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与万卡集群分布式训练开发,提升集群训练性能并进行理论分析
- 研究并实现单GPU及分布式训练技术,包括并行与异构计算的设计、开发与性能优化
- 结合分布式训练技术,探索并优化前沿语言/多模态大模型算法及模型适配
任职要求
- 对国产新算力设备及AI研究有浓厚兴趣
- 深入理解深度学习与分布式优化基本算法
- 具备扎实编程、代码阅读与调试能力
- 熟练使用PyTorch,熟悉megatron、deepspeed、colossalai、fsdp等大模型框架
加分项
- 熟悉分布式优化方法,具有大规模集群训练经验
- 具有较强的科研能力,曾在顶级会议发表论文
- 有竞赛刷榜经历或 ACM 竞赛获奖经历
- 张辰 半年前活跃
福利待遇
- 年薪16薪,20-40K区间,具备竞争力
- 深圳南山科兴科学园优质办公环境
- 参与万卡级大规模集群前沿项目,技术成长快
- 与顶级研究团队共事,发表论文及竞赛获奖机会多
工作地址
深圳南山区南山科兴科学园11口
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。