AI基础设施工程师
岗位摘要
参与万卡GPU集群分布式训练系统开发,提升集群训练性能并进行理论分析;研究并实现单卡及分布式训练并行与异构计算技术,持续优化性能;结合分布式训练技术,探索并优化前沿语言/多模态大模型算法与适配方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与万卡GPU集群分布式训练系统开发,提升集群训练性能并进行理论分析
- 研究并实现单卡及分布式训练并行与异构计算技术,持续优化性能
- 结合分布式训练技术,探索并优化前沿语言/多模态大模型算法与适配方案
任职要求
- 对国产新算力设备及AI研究有浓厚兴趣
- 深入理解深度学习与分布式优化基础算法
- 具备扎实编程、代码阅读与调试能力
- 熟练使用PyTorch,熟悉Megatron、DeepSpeed、ColossalAI、FSDP等大模型框架
加分项
- 熟悉分布式优化方法,具有大规模集群训练经验
- 具有较强的科研能力,曾在顶级会议发表论文
- 有竞赛刷榜经历或 ACM 竞赛获奖经历
- 摩尔线程 · tl
福利待遇
- 优先接触万卡级大规模集群训练实战
- 参与顶级会议论文发表与技术创新
- 竞赛刷榜及ACM获奖经历者优先考虑
- 深圳南山科兴科学园优质办公环境
工作地址
深圳南山区科兴科学园B2单元11楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。