返回岗位列表

寒武纪

大规模训练并行计算工程师

地点:北京 薪资:40-60K 日期:2026-03-03

岗位摘要

参与AI大模型训练框架的研发适配工作,针对芯片特点实现混合并行策略;分析优化性能热点,分析内存瓶颈,优化大模型训练框架;调研分析大模型最新技术和性能优化方案,跟进社区演进方向,持续优化大模型训练瓶颈问题

岗位职责

  • 参与AI大模型训练框架的研发适配工作,针对芯片特点实现混合并行策略
  • 分析优化性能热点,分析内存瓶颈,优化大模型训练框架
  • 调研分析大模型最新技术和性能优化方案,跟进社区演进方向,持续优化大模型训练瓶颈问题
  • 进行性能分析的理论计算及预估,对计算、通信时间和内存占比进行合理性分析,并提出优化方案
  • 充分理解分布式训练全过程,优化预训练及后训练阶段性能,不断提高大规模场景下的训练稳定性

任职要求

  • 硕士及以上学历,微电子、计算机、通信、自动化、应用数学、物理等相关专业
  • 熟悉PyTorch的使用,熟悉大模型相关的训练方法和技巧,如MoE、长序列、多模态等
  • 熟悉Linux/Unix系统环境,能够熟练使用C++/Python
  • 熟悉计算机体系结构,熟悉多层内存结构,熟悉操作系统概念
  • 思维缜密、执行力强、抗压能力强
  • 良好的沟通能力和团队协作能力,良好的学习能力和自驱能力
  • 熟悉Megatron-LM/FSDP/DeepSpeed/Transformers/Verl等任意一种框架者优先
  • 有大模型训练开发经验或深度学习框架开发优化经验者优先
  • 熟悉Nsight System、DLProf等性能分析工具使用经验者优先

工作地址

北京海淀区北京航空航天大学学院路校区致真大厦致真大厦D座