返回岗位列表

壁仞科技

大模型系统优化工程师(国产AI芯片方向)

地点:杭州 薪资:200-300元/天 日期:2026-03-03

岗位摘要

基于Megatron-LM完成大模型在国产AI芯片的端到端适配,移植并调优DP/TP/PP/EP等多维并行策略;针对国产芯片硬件特性优化GEMM、Attention、MoE、AllReduce等关键算子,提升训练吞吐与MFU

岗位职责

  • 基于Megatron-LM完成大模型在国产AI芯片的端到端适配,移植并调优DP/TP/PP/EP等多维并行策略
  • 针对国产芯片硬件特性优化GEMM、Attention、MoE、AllReduce等关键算子,提升训练吞吐与MFU
  • 深度集成PyTorch与国产芯片软件栈(CANN、MLU-SDK),解决兼容性并优化AMP、ZeRO、梯度检查点
  • 构建性能分析工具链,定位通信/显存/计算瓶颈,提出软硬协同优化方案
  • 与芯片、框架、算法团队协同,推动国产生态工具链迭代与完善
  • 输出技术文档、性能报告与最佳实践,支撑客户交付与内部研发

任职要求

  • 计算机/电子/数学等相关专业硕士及以上学历,3年以上高性能计算或AI系统研发经验
  • 深度掌握PyTorch内部机制(Autograd、Dynamo、Custom Op、AMP)
  • 熟悉Megatron-LM源码,有自定义并行策略或通信优化经验
  • 具备GPU或国产AI芯片(昇腾/寒武纪/壁仞等)开发经验
  • 熟练使用Nsight、NCU、Perf等性能分析工具
  • 扎实的C++/Python编程能力,熟悉Linux与CUDA/HIP/自定义kernel开发
  • 有千卡级大模型训练调优经验优先
  • 熟悉NCCL/RCCL/CCL或国产HCCL等集合通信库优先
  • 参与过AI编译器(Triton/TVM/MLIR)或自研通信库开发者优先
  • 在MLPerf Training或公开大模型榜单有性能记录者优先
  • 有GPU/国产AI超算平台运维与调度(Slurm/K8s)经验优先

加分项

  • 有 千卡级大模型训练(如 LLaMA
  • 2/3, Qwen, DeepSeek) 调优经验
  • 熟悉 NCCL、RCCL、CCL 等集合通信库原理或国产替代方案(如 HCCL)
  • 参与过 AI 编译器(Triton、TVM、MLIR) 或 通信库(如自研 AllReduce) 开发
  • 在 MLPerf Training 或 公开大模型榜单 中有性能记录
  • 有 GPU 集群或国产 AI 超算平台运维与调度经验(Slurm/K8s)
  • 乔女士 刚刚活跃

福利待遇

  • 日薪200-300元,杭州滨江区海威天地T3座28楼办公
  • 每周5天,实习期6个月,提供深入参与国产大模型生态建设机会
  • 与芯片厂商、框架团队、算法专家紧密协作,积累稀缺国产化优化经验
  • 输出技术文档与最佳实践,提升个人行业影响力

工作地址

杭州滨江区海威天地T3座28楼