返回岗位列表

面壁智能

大模型训练引擎研发工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责公司大模型训练引擎的研发,将算法逻辑高效转化为大规模分布式系统实现;在千卡/万卡规模集群上,针对NVIDIA H系列或国产算力优化NCCL/HCCL通信策略,极致提升集群的MFU

岗位职责

  • 负责公司大模型训练引擎的研发,将算法逻辑高效转化为大规模分布式系统实现
  • 在千卡/万卡规模集群上,针对NVIDIA H系列或国产算力优化NCCL/HCCL通信策略,极致提升集群的MFU
  • 深度调优3D并行(TP/PP/DP),并引入序列并行、上下文并行等技术,解决超长文本训练时的系统工程瓶颈
  • 利用Triton或CUDA提升核心算子效率,负责FP8混合精度训练及Transformer Engine在生产环境的落地
  • 设计自动化的容错与恢复机制,优化分布式Checkpoint性能,实现训练任务的“无感”断点续练与自愈
  • 优化大规模多模态数据下的存储读取与预处理流水线,确保计算资源不因系统IO损耗而闲置

任职要求

  • 计算机相关专业本科及以上学历,对计算机体系结构、高性能网络有深刻理解,具备将数学公式转化为高性能并行代码的能力
  • 精通分布式训练核心原理,有Megatron-LM或DeepSpeed源码级二次开发经验
  • 具备优秀的算子优化背景,能够熟练运用Triton或CUDA进行内核开发,理解显存优化与通信隐藏
  • 熟悉大规模GPU集群下的工程痛点,能够独立排查NCCL死锁、网络拥塞、显存碎片化等复杂的系统级问题
  • 具备千卡以上规模的实战背景,熟悉针对国产算力的分布式适配与调优
  • 加分项:在PyTorch、Megatron-LM、FlashAttention等开源社区有核心贡献
  • 加分项:熟悉端侧小模型的训练特性与蒸馏/剪枝工程实现
  • 加分项:具备大规模训练集群的可观测性体系建设经验

加分项

  • 在 PyTorch, Megatron-LM, FlashAttention 等开源社区有核心贡献
  • 熟悉端侧小模型(Small Language Models)的训练特性与蒸馏/剪枝工程实现
  • 具备大规模训练集群的可观测性体系建设(如算力热图、流水线画像分析)经验