大模型训练框架研发工程师
岗位摘要
基于PyTorch、DeepSpeed、Megatron-LM等技术,参与大模型训练框架的设计、开发与优化,提升模型训练的效率、稳定性与扩展性,支撑大规模模型的高效训练和部署;解决万卡集群中大模型训练中的关键技术难题,包括分布式训练通信、内存显存优化、数据加载与预处理加速等,保障训练高效稳定,降低…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于PyTorch、DeepSpeed、Megatron-LM等技术,参与大模型训练框架的设计、开发与优化,提升模型训练的效率、稳定性与扩展性,支撑大规模模型的高效训练和部署
- 解决万卡集群中大模型训练中的关键技术难题,包括分布式训练通信、内存显存优化、数据加载与预处理加速等,保障训练高效稳定,降低资源消耗
- 开展大模型框架性能评估和调优工作,构建并完善性能监控体系,通过实时监测训练指标,定位性能瓶颈,提出优化方案,确保在不同硬件上达到最优性能
任职要求
- 3-5年高性能计算/分布式训练/深度学习系统研发经验
- 熟练阅读并修改PyTorch/DeepSpeed/Megatron-LM核心源码,有线上调优案例
- 熟练使用nsight/NCCL profiler分析任务训练性能瓶颈
- 熟悉InfiniBand/RoCEv2网络拓扑,能独立调优DP/TP/PP/EP切分策略,解决大规模下通信-计算重叠问题
- 具备Python/C++混合开发能力,CI/CD意识
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。