大模型训练与分布式优化工程师
岗位摘要
分布式训练引擎研发:将算法逻辑高效转化为大规模分布式系统实现,深度定制训练底座;异构算力性能优化:针对NVIDIA H系列或国产算力优化NCCL/HCCL通信策略,极致提升MFU;并行策略开发:深度调优3D并行(TP/PP/DP),引入序列并行(SP)、上下文并行(CP)等技术
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 分布式训练引擎研发:将算法逻辑高效转化为大规模分布式系统实现,深度定制训练底座
- 异构算力性能优化:针对NVIDIA H系列或国产算力优化NCCL/HCCL通信策略,极致提升MFU
- 并行策略开发:深度调优3D并行(TP/PP/DP),引入序列并行(SP)、上下文并行(CP)等技术
- 底层算子研发:利用Triton或CUDA提升核心算子效率,推进FP8混合精度及Transformer Engine落地
- 训练鲁棒性保障:设计自动化容错与恢复机制,优化DistCP性能,实现无感断点续练与自愈
任职要求
- 计算机相关专业本科及以上,对计算机体系结构、高性能网络(RDMA/InfiniBand)有深刻理解
- 精通分布式训练核心原理,有Megatron-LM或DeepSpeed源码级二次开发经验
- 具备优秀算子优化背景,熟练运用Triton或CUDA进行内核开发,理解显存优化与通信隐藏
- 具备千卡以上规模实战背景,熟悉国产算力(如昇腾910B)的分布式适配与调优
- 能够独立排查NCCL死锁、网络拥塞、显存碎片化等复杂系统级问题
加分项
- 在 PyTorch, Megatron
- LM, FlashAttention 等开源社区有核心贡献
- 熟悉端侧小模型(Small Language Models)的训练特性与蒸馏/剪枝工程实现
- 具备大规模训练集群的可观测性体系建设(如算力热图、流水线画像分析)经验
- 谭女士 刚刚活跃
工作地址
北京海淀区科建大厦6层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。