大模型训练系统研发工程师
岗位摘要
参与AI大模型训练框架的研发适配工作,分析优化性能热点,分析内存瓶颈,优化大模型训练框架;调研分析大模型最新技术和性能优化方案,跟进社区演进方向,持续优化大模型训练瓶颈问题;进行性能分析的理论计算及预估,对计算、通信时间和内存占比能够进行合理性分析,并提出优化方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与AI大模型训练框架的研发适配工作,分析优化性能热点,分析内存瓶颈,优化大模型训练框架
- 调研分析大模型最新技术和性能优化方案,跟进社区演进方向,持续优化大模型训练瓶颈问题
- 进行性能分析的理论计算及预估,对计算、通信时间和内存占比能够进行合理性分析,并提出优化方案
- 充分理解分布式训练全过程,优化预训练及后训练阶段性能,不断提高大规模场景下的训练稳定性
任职要求
- 硕士及以上学历,微电子、计算机、通信、自动化、应用数学、物理等相关专业
- 熟悉PyTorch的使用,熟悉大模型相关的训练方法和技巧,如MoE、长序列、多模态等
- 熟悉Linux/Unix系统环境,能够熟练使用C++/Python
- 熟悉计算机体系结构,熟悉多层内存结构,熟悉操作系统概念
- 良好的沟通能力和团队协作能力,良好的学习能力和自驱能力
- 熟悉Megatron-LM/FSDP/DeepSpeed/Transformers/Verl等任意一种框架者优先
- 有大模型训练开发经验或者框架开发优化经验者优先
- 熟悉Nsight System、DLProf等性能分析工具使用经验者优先
工作地址
北京海淀区北航致真大厦D座16层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。