分布式训练开发工程师
岗位摘要
支持万卡集群分布式训练性能稳定性优化和精度对齐;针对具体训练模型拆解优化算法,达成性能优化目标;研究适配优化常见分布式训练框架;研究和实现前沿大模型性能优化算法;数学、自动化、计算机、软件、通信等相关专业
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 支持万卡集群分布式训练性能稳定性优化和精度对齐
- 针对具体训练模型拆解优化算法,达成性能优化目标
- 研究适配优化常见分布式训练框架
- 研究和实现前沿大模型性能优化算法
任职要求
- 数学、自动化、计算机、软件、通信等相关专业
- 对新算力设备、国产算力设备和AI领域研究抱有兴趣
- 对深度学习和分布式优化方向的基本算法有较好理解,具有大规模集群训练和调优经验
- 具备扎实的编程、代码阅读及调试能力
- 熟悉PyTorch,了解大模型框架如Megatron、DeepSpeed、ColossalAI、FSDP等
- 了解稠密、稀疏、多模态模型训练和推理算法
加分项
- 具有较强的科研能力, 曾在顶级会议发表论文
- 有竞赛刷榜经历或, ACM 竞赛获奖经历
- 刘女士 刚刚活跃
福利待遇
- 薪资范围30-60K·16薪
- 工作地点在北京朝阳区望京国际研发园
- 经验不限,本科及以上学历
- 有机会参与前沿大模型性能优化研究
工作地址
北京朝阳区望京国际研发园
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。