大模型训练系统实习生
岗位摘要
参与大模型训练框架的适配与开发,利用性能分析工具定位瓶颈,进行针对性的性能热点优化;追踪大模型领域前沿技术(如Megatron-LM、Verl、Triton等),调研社区最新性能优化方案并推动落地
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与大模型训练框架的适配与开发,利用性能分析工具定位瓶颈,进行针对性的性能热点优化
- 追踪大模型领域前沿技术(如Megatron-LM、Verl、Triton等),调研社区最新性能优化方案并推动落地
- 解决训练过程中的显存墙、通信墙等瓶颈问题
- 负责模型训练的理论性能计算与预估,量化分析计算/通信开销占比,提出合理的架构调整或算子优化建议
任职要求
- 硕士及以上学历在读,计算机、微电子、通信、自动化、应用数学、物理等相关专业,2027届毕业生
- 熟练使用PyTorch,理解大模型(LLM)的主流训练方法(如RL、Pre-training)及混合精度训练技巧
- 熟悉Linux开发环境,具备扎实的C/C++与Python编程功底,代码风格规范
- 具备良好的逻辑思维与抗压能力,善于团队协作,拥有强烈的技术好奇心和自驱力
- 至少实习6个月,每周出勤4天及以上
- 有大模型分布式训练(Verl/Fsdp2/Megatron-LM)或AI框架底层开发经验者优先
- 熟练使用Nsight Systems、DLProf或Torch Profiler等性能分析工具,有实际调优案例者优先
福利待遇
- 日薪200-250元,待遇丰厚
- 参与前沿大模型训练系统核心研发,积累业界领先经验
- 与行业顶尖技术团队紧密协作,快速提升技术深度与广度
- 工作地点位于北京海淀区北航致真大厦,交通便利
工作地址
北京海淀区北航致真大厦D座16层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。