大模型训练并行计算工程师
岗位摘要
负责大模型训练的系统性能分析及解决方案的制定,高效分析业务瓶颈,跟进和研究大模型训练性能和内存的优化手段,提升大模型训练效率;负责跟进业界大模型训练的前沿工作,对MoE、长序列、文生图等场景有深刻理解,熟练掌握并行策略的通信计算模式,根据业务特点不断优化分析已有的各种并行策略
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型训练的系统性能分析及解决方案的制定,高效分析业务瓶颈,跟进和研究大模型训练性能和内存的优化手段,提升大模型训练效率
- 负责跟进业界大模型训练的前沿工作,对MoE、长序列、文生图等场景有深刻理解,熟练掌握并行策略的通信计算模式,根据业务特点不断优化分析已有的各种并行策略
- 熟悉大模型训练整体流程,熟悉大模型训练的评价指标,能够完成大模型训练中的监控、稳定性训练等业务的支持和开发工作
- 设计和建设大模型训练的性能内存评估方法,能够分析性能原因、通信比例情况、内存占用、计算资源消耗等问题
任职要求
- 本科及以上学历,计算机相关专业,熟悉大模型训练框架Megatron-LM/DeepSpeed等
- 具备良好的编程能力,熟练掌握性能分析工具和方法,熟悉torch的性能分析工具等
- 逻辑思维清晰,具有良好的沟通能力、抗压能力和责任心
- 具有实际开发或优化并行策略的优先
- 加分项:具备千卡以上训练经验
加分项
- 刘先生 刚刚活跃
福利待遇
- 薪资范围:30-60K·15薪
- 工作地点:北京海淀区致真大厦
- 提供五险一金及补充福利
- 参与前沿大模型技术研发
工作地址
北京海淀区致真大厦北京市海淀区知春路7号致真大厦D座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。