AI infra 训练框架开发
岗位摘要
负责大模型训练的系统性能分析及解决方案制定,高效分析业务瓶颈,研究并跟进大模型训练性能与内存优化手段,提升大模型训练效率;跟进业界大模型训练前沿工作,对MoE、长序列、文生图等场景有深刻理解,熟练掌握并行策略的通信计算模式,根据业务特点持续优化已有并行策略
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型训练的系统性能分析及解决方案制定,高效分析业务瓶颈,研究并跟进大模型训练性能与内存优化手段,提升大模型训练效率
- 跟进业界大模型训练前沿工作,对MoE、长序列、文生图等场景有深刻理解,熟练掌握并行策略的通信计算模式,根据业务特点持续优化已有并行策略
- 熟悉大模型训练整体流程及评价指标,完成大模型训练中的监控与稳定性训练等业务支持与开发工作
- 设计并建设大模型训练性能内存评估方法,分析性能原因、通信比例、内存占用及计算资源消耗等问题
任职要求
- 本科及以上学历,计算机相关专业,熟悉大模型训练框架 Megatron-LM / DeepSpeed 等
- 具备良好编程能力,熟练掌握性能分析工具和方法,熟悉 PyTorch 等性能分析工具
- 逻辑思维清晰,具有良好沟通能力、抗压能力和责任心
- 具有实际开发或优化并行策略经验者优先考虑
- 加分项:具备千卡以上训练经验
福利待遇
- 具有竞争力的薪酬待遇,30-50K·15薪
- 参与前沿大模型训练技术研究与实践
- 完善的职业发展通道与培训体系
- 工作地点位于北京海淀区北航致真大厦,交通便利
工作地址
北京海淀区北航致真大厦D座16层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。