大模型训练引擎研发工程师
岗位摘要
负责公司大模型训练引擎的研发,将算法逻辑高效转化为大规模分布式系统实现;在千卡/万卡规模集群上,针对NVIDIA H系列或国产算力优化NCCL/HCCL通信策略,极致提升集群的MFU
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责公司大模型训练引擎的研发,将算法逻辑高效转化为大规模分布式系统实现
- 在千卡/万卡规模集群上,针对NVIDIA H系列或国产算力优化NCCL/HCCL通信策略,极致提升集群的MFU
- 深度调优3D并行(TP/PP/DP),并引入序列并行、上下文并行等技术,解决超长文本训练时的系统工程瓶颈
- 利用Triton或CUDA提升核心算子效率,负责FP8混合精度训练及Transformer Engine在生产环境的落地
- 设计自动化的容错与恢复机制,优化分布式Checkpoint性能,实现训练任务的“无感”断点续练与自愈
- 优化大规模多模态数据下的存储读取与预处理流水线,确保计算资源不因系统IO损耗而闲置
任职要求
- 计算机相关专业本科及以上学历,对计算机体系结构、高性能网络有深刻理解,具备将数学公式转化为高性能并行代码的能力
- 精通分布式训练核心原理,有Megatron-LM或DeepSpeed源码级二次开发经验
- 具备优秀的算子优化背景,能够熟练运用Triton或CUDA进行内核开发,理解显存优化与通信隐藏
- 熟悉大规模GPU集群下的工程痛点,能够独立排查NCCL死锁、网络拥塞、显存碎片化等复杂的系统级问题
- 具备千卡以上规模的实战背景,熟悉针对国产算力的分布式适配与调优
- 加分项:在PyTorch、Megatron-LM、FlashAttention等开源社区有核心贡献
- 加分项:熟悉端侧小模型的训练特性与蒸馏/剪枝工程实现
- 加分项:具备大规模训练集群的可观测性体系建设经验
加分项
- 在 PyTorch, Megatron-LM, FlashAttention 等开源社区有核心贡献
- 熟悉端侧小模型(Small Language Models)的训练特性与蒸馏/剪枝工程实现
- 具备大规模训练集群的可观测性体系建设(如算力热图、流水线画像分析)经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。