AI分布式训练工程师/研究员
岗位摘要
参与分布式训练开发,支援万卡集群训练,提高集群训练性能,对集群性能进行理论分析;参与机器学习单GPU以及分布式训练技术的研究与实现,如各种并行与异构计算技术的设计、开发以及与性能优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与分布式训练开发,支援万卡集群训练,提高集群训练性能,对集群性能进行理论分析
- 参与机器学习单GPU以及分布式训练技术的研究与实现,如各种并行与异构计算技术的设计、开发以及与性能优化
- 结合分布式训练技术进行前沿的语言/多模态大模型优化算法/分布式算法探索和模型/算法适配
任职要求
- 对新算力设备/国产算力设备和 AI 领域研究抱有兴趣
- 对深度学习和分布式优化方向的基本算法有较好的理解
- 具备扎实的编程、代码阅读及调试能力
- 熟悉 PyTorch;了解大模型框架,如 megatron、deepspeed、colossalai、fsdp 等
- 熟悉分布式优化方法,具有大规模集群训练经验(加分项)
- 具有较强的科研能力,曾在顶级会议发表论文(加分项)
- 有竞赛刷榜经历或 ACM 竞赛获奖经历(加分项)
加分项
- 熟悉分布式优化方法,具有大规模集群训练经验
- 具有较强的科研能力,曾在顶级会议发表论文
- 有竞赛刷榜经历或 ACM 竞赛获奖经历
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。