大模型训练Infra工程师(实习可转正)
岗位摘要
负责大规模预训练框架的研发、优化和维护;根据业务需求持续改进训练框架和策略,提升模型训练效率;分析和定位训练中的性能瓶颈,实施针对性优化措施;提升训练效率和稳定性;跟进业界技术进展,不断同步与集成最新训练优化策略
岗位职责
- 负责大规模预训练框架的研发、优化和维护
- 根据业务需求持续改进训练框架和策略,提升模型训练效率
- 分析和定位训练中的性能瓶颈,实施针对性优化措施
- 提升训练效率和稳定性
- 跟进业界技术进展,不断同步与集成最新训练优化策略
任职要求
- 对自然语言处理、计算机视觉和多模态算法有深入理解
- 熟悉主流的LLM和VLM模型架构
- 精通Python编程语言
- 熟悉PyTorch深度学习框架
- 熟悉Megatron分布式训练框架
- 有大规模预训练优化/MoE训练优化经验的优先考虑
- 在ACM、NOI、IOI、超算比赛中有获奖经历者优先
- 具有CUDA算子优化/profiling能力者优先
加分项
- 在ACM、NOI、IOI、超算比赛中有获奖经历者优先
- 具有 cuda 算子优化/profiling 能力者优先
福利待遇
- 薪资35-65K·16薪
- 实习可转正机会
工作地址
北京海淀区搜狐网络大厦11层