大模型系统优化工程师(国产AI芯片方向)
岗位摘要
基于Megatron-LM完成大模型在国产AI芯片的端到端适配,移植并调优DP/TP/PP/EP等多维并行策略;针对国产芯片硬件特性优化GEMM、Attention、MoE、AllReduce等关键算子,提升训练吞吐与MFU
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于Megatron-LM完成大模型在国产AI芯片的端到端适配,移植并调优DP/TP/PP/EP等多维并行策略
- 针对国产芯片硬件特性优化GEMM、Attention、MoE、AllReduce等关键算子,提升训练吞吐与MFU
- 深度集成PyTorch与国产芯片软件栈(CANN、MLU-SDK),解决兼容性并优化AMP、ZeRO、梯度检查点
- 构建性能分析工具链,定位通信/显存/计算瓶颈,提出软硬协同优化方案
- 与芯片、框架、算法团队协同,推动国产生态工具链迭代与完善
- 输出技术文档、性能报告与最佳实践,支撑客户交付与内部研发
任职要求
- 计算机/电子/数学等相关专业硕士及以上学历,3年以上高性能计算或AI系统研发经验
- 深度掌握PyTorch内部机制(Autograd、Dynamo、Custom Op、AMP)
- 熟悉Megatron-LM源码,有自定义并行策略或通信优化经验
- 具备GPU或国产AI芯片(昇腾/寒武纪/壁仞等)开发经验
- 熟练使用Nsight、NCU、Perf等性能分析工具
- 扎实的C++/Python编程能力,熟悉Linux与CUDA/HIP/自定义kernel开发
- 有千卡级大模型训练调优经验优先
- 熟悉NCCL/RCCL/CCL或国产HCCL等集合通信库优先
- 参与过AI编译器(Triton/TVM/MLIR)或自研通信库开发者优先
- 在MLPerf Training或公开大模型榜单有性能记录者优先
- 有GPU/国产AI超算平台运维与调度(Slurm/K8s)经验优先
加分项
- 有 千卡级大模型训练(如 LLaMA
- 2/3, Qwen, DeepSeek) 调优经验
- 熟悉 NCCL、RCCL、CCL 等集合通信库原理或国产替代方案(如 HCCL)
- 参与过 AI 编译器(Triton、TVM、MLIR) 或 通信库(如自研 AllReduce) 开发
- 在 MLPerf Training 或 公开大模型榜单 中有性能记录
- 有 GPU 集群或国产 AI 超算平台运维与调度经验(Slurm/K8s)
- 乔女士 刚刚活跃
福利待遇
- 日薪200-300元,杭州滨江区海威天地T3座28楼办公
- 每周5天,实习期6个月,提供深入参与国产大模型生态建设机会
- 与芯片厂商、框架团队、算法专家紧密协作,积累稀缺国产化优化经验
- 输出技术文档与最佳实践,提升个人行业影响力
工作地址
杭州滨江区海威天地T3座28楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。