返回岗位列表

摩尔线程

大模型算法/分布式训练工程师

地点:北京 薪资:30-50K 日期:2026-03-03

岗位摘要

研究并实现超大规模GPU集群分布式训练技术,提升MOE大模型及强化学习训练MFU;研发并持续优化大模型训练框架与推理框架性能;跟进前沿算法,将最新研究成果快速转化为工程实践;与团队协作,解决分布式训练中的性能瓶颈与稳定性问题

岗位职责

  • 研究并实现超大规模GPU集群分布式训练技术,提升MOE大模型及强化学习训练MFU
  • 研发并持续优化大模型训练框架与推理框架性能
  • 跟进前沿算法,将最新研究成果快速转化为工程实践
  • 与团队协作,解决分布式训练中的性能瓶颈与稳定性问题

任职要求

  • 硕士及以上学历,计算机、人工智能等相关专业
  • 熟练掌握C++或Python,具备扎实算法与计算机基础,代码规范良好
  • 深入理解深度学习及大模型训练相关算法
  • 熟练使用PyTorch、TensorFlow、Paddle等深度学习框架
  • 具备强烈责任心、优秀学习能力、沟通能力和自驱力
  • 实习需保证全职3个月以上

加分项

  • 熟悉分布式训练技术,如多维并行、计算通信overlap等技术的深入研究与开发者可优先考虑
  • 有大规模GPU集群性能优化和训练经验优先
  • 熟悉大模型训练框架和推理框架,包括不限于Megatron/DeepSpeed/ColossalAI/sglang/vllm等
  • 熟悉大模型强化学习算法,熟悉大模型相关的前沿研究
  • 熟悉GPU相关开发,如CUDA,NCCL等
  • 在顶级会议发表论文或有竞赛经验优先考虑
  • 张辰 半年前活跃

福利待遇

  • 优先接触多维并行、计算通信重叠等分布式训练核心技术
  • 参与大规模GPU集群性能调优,积累顶级工程经验
  • 深度使用Megatron、DeepSpeed、vLLM等行业主流框架
  • 探索大模型强化学习前沿算法,发表顶会论文机会
  • 提供GPU CUDA、NCCL底层开发实战平台
  • 北京朝阳核心办公区,与顶尖研究团队并肩成长

工作地址

北京朝阳区摩尔科技