返回岗位列表

面壁智能

大模型训练与分布式优化工程师

地点:北京 薪资:40-70K 日期:2026-05-08

岗位摘要

分布式训练引擎研发:将算法逻辑高效转化为大规模分布式系统实现,深度定制训练底座;异构算力性能优化:针对NVIDIA H系列或国产算力优化NCCL/HCCL通信策略,极致提升MFU;并行策略开发:深度调优3D并行(TP/PP/DP),引入序列并行(SP)、上下文并行(CP)等技术

岗位职责

  • 分布式训练引擎研发:将算法逻辑高效转化为大规模分布式系统实现,深度定制训练底座
  • 异构算力性能优化:针对NVIDIA H系列或国产算力优化NCCL/HCCL通信策略,极致提升MFU
  • 并行策略开发:深度调优3D并行(TP/PP/DP),引入序列并行(SP)、上下文并行(CP)等技术
  • 底层算子研发:利用Triton或CUDA提升核心算子效率,推进FP8混合精度及Transformer Engine落地
  • 训练鲁棒性保障:设计自动化容错与恢复机制,优化DistCP性能,实现无感断点续练与自愈

任职要求

  • 计算机相关专业本科及以上,对计算机体系结构、高性能网络(RDMA/InfiniBand)有深刻理解
  • 精通分布式训练核心原理,有Megatron-LM或DeepSpeed源码级二次开发经验
  • 具备优秀算子优化背景,熟练运用Triton或CUDA进行内核开发,理解显存优化与通信隐藏
  • 具备千卡以上规模实战背景,熟悉国产算力(如昇腾910B)的分布式适配与调优
  • 能够独立排查NCCL死锁、网络拥塞、显存碎片化等复杂系统级问题

加分项

  • 在 PyTorch, Megatron
  • LM, FlashAttention 等开源社区有核心贡献
  • 熟悉端侧小模型(Small Language Models)的训练特性与蒸馏/剪枝工程实现
  • 具备大规模训练集群的可观测性体系建设(如算力热图、流水线画像分析)经验
  • 谭女士 刚刚活跃

工作地址

北京海淀区科建大厦6层