大模型算法/分布式训练工程师
岗位摘要
研究并实现超大规模GPU集群分布式训练技术,提升MOE大模型及强化学习训练MFU;研发并持续优化大模型训练框架与推理框架性能;跟进前沿算法,将最新研究成果快速转化为工程实践;与团队协作,解决分布式训练中的性能瓶颈与稳定性问题
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 研究并实现超大规模GPU集群分布式训练技术,提升MOE大模型及强化学习训练MFU
- 研发并持续优化大模型训练框架与推理框架性能
- 跟进前沿算法,将最新研究成果快速转化为工程实践
- 与团队协作,解决分布式训练中的性能瓶颈与稳定性问题
任职要求
- 硕士及以上学历,计算机、人工智能等相关专业
- 熟练掌握C++或Python,具备扎实算法与计算机基础,代码规范良好
- 深入理解深度学习及大模型训练相关算法
- 熟练使用PyTorch、TensorFlow、Paddle等深度学习框架
- 具备强烈责任心、优秀学习能力、沟通能力和自驱力
- 实习需保证全职3个月以上
加分项
- 熟悉分布式训练技术,如多维并行、计算通信overlap等技术的深入研究与开发者可优先考虑
- 有大规模GPU集群性能优化和训练经验优先
- 熟悉大模型训练框架和推理框架,包括不限于Megatron/DeepSpeed/ColossalAI/sglang/vllm等
- 熟悉大模型强化学习算法,熟悉大模型相关的前沿研究
- 熟悉GPU相关开发,如CUDA,NCCL等
- 在顶级会议发表论文或有竞赛经验优先考虑
- 张辰 半年前活跃
福利待遇
- 优先接触多维并行、计算通信重叠等分布式训练核心技术
- 参与大规模GPU集群性能调优,积累顶级工程经验
- 深度使用Megatron、DeepSpeed、vLLM等行业主流框架
- 探索大模型强化学习前沿算法,发表顶会论文机会
- 提供GPU CUDA、NCCL底层开发实战平台
- 北京朝阳核心办公区,与顶尖研究团队并肩成长
工作地址
北京朝阳区摩尔科技
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。