深度学习训练框架研发工程师
岗位摘要
负责深度学习训练框架研发,包括框架的内核开发、算子适配、功能迭代及性能优化,定位并修复框架底层问题;负责大模型分布式训练系统研发,设计并优化数据并行、张量并行、流水线并行、序列并行、专家并行、ZeRO/FSDP等并行策略,提升超大规模模型训练效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责深度学习训练框架研发,包括框架的内核开发、算子适配、功能迭代及性能优化,定位并修复框架底层问题
- 负责大模型分布式训练系统研发,设计并优化数据并行、张量并行、流水线并行、序列并行、专家并行、ZeRO/FSDP等并行策略,提升超大规模模型训练效率
- 负责大模型训练性能优化,包括CUDA Kernel优化、通信优化、显存优化、低精度训练、激活重计算等,持续提升训练吞吐
- 负责大模型训练稳定性建设,包括训练指标监控与分析、Loss/Grad异常定位、性能瓶颈分析及故障排查等,保障大规模训练稳定运行
- 协同算法团队推进大模型训练方案落地,对公司内、业界开源的新结构、算法进行实现和优化,支撑新模型和新算法快速迭代
任职要求
- 熟练掌握C++、Python,具备扎实的计算机体系结构、操作系统、Linux及并发编程基础
- 熟悉CUDA编程及GPU架构,具备CUDA Kernel开发与性能优化经验
- 熟悉PyTorch深度学习框架,了解Autograd、ATen、Dispatcher等核心机制,具备框架开发或自定义算子开发经验
- 熟悉分布式训练原理,掌握至少一种大模型训练框架或并行方案,如Megatron-LM、DeepSpeed等
- 具备大规模模型训练、训练性能优化或训练稳定性问题定位经验,有Loss不收敛、通信瓶颈、显存优化等问题解决经验者优先
- 加分项:有千亿参数大模型、千卡及以上规模全流程训练经验;有PyTorch、DeepSpeed、Megatron-LM等开源项目贡献经验;有OSDI、SOSP、NSDI、MLSys等AI系统相关顶会论文发表经验
加分项
- 有千亿参数大模型、千卡及以上规模全流程训练经验有 PyTorch、DeepSpeed、Megatron
- 有 OSDI、SOSP、NSDI、MLSys等 AI 系统相关顶会论文发表经验
- 有千亿参数大模型、千卡及以上规模全流程训练经验
- 有 PyTorch、DeepSpeed、Megatron-LM 等开源项目贡献经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。