训练Infra工程师(26届校招)
岗位摘要
参与训练框架研发与优化,协助团队进行大规模分布式训练框架的设计、实现与维护,支持大语言模型及多模态模型的高效训练;在导师指导下进行性能调优与效率提升,优化训练过程中的内存管理、计算资源调度和分布式通信效率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与训练框架研发与优化,协助团队进行大规模分布式训练框架的设计、实现与维护,支持大语言模型及多模态模型的高效训练
- 在导师指导下进行性能调优与效率提升,优化训练过程中的内存管理、计算资源调度和分布式通信效率
- 学习并应用业界前沿训练加速技术(offload、动态分布式并行/流水线排布),确保框架的先进性和竞争力
- 与算法工程师紧密配合,提高训练效率,降低研发成本,提升整体交付能力
任职要求
- 熟练掌握Python和C++编程语言,具备扎实的数据结构、算法和操作系统基础
- 熟悉至少一种主流深度学习框架(如PyTorch、TensorFlow),了解其基本实现原理和机制
- 了解GPU编程(如CUDA)或并行计算,有相关的课程项目或实验经验
- 对Transformer架构及主流大模型(如GPT、Llama等)的训练特性有基本理解
- 了解分布式训练的基本原理(如数据并行、模型并行、流水并行)和常见挑战
- 有分布式训练框架(如DeepSpeed、Megatron-LM、PyTorch Lightning、FSDP等)的使用或初步研究经验者优先
- 了解大模型训练相关优化技术(如混合精度训练、梯度checkpoint、LoRA微调、量化感知训练等)者优先
- 在相关领域顶会发表论文或优秀开源项目经历者优先
福利待遇
- 薪资待遇优厚,30-60K·16薪,竞争力薪酬
- 加入头部AI大模型团队,接触前沿AI技术
- 与顶级算法团队深度协作,积累大模型训练全链路经验
- 参与大规模训练基础设施建设,技术成长空间大
工作地址
北京海淀区搜狐网络大厦11层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。