MOE训练/推理Infra工程师
岗位摘要
设计并开发支持大规模分布式训练和推理的MOE框架,确保其在各种硬件配置下的高效运行;通过算法优化、并行计算、缓存策略等方式优化训练和推理性能,缩短时间提高效率;研究和实现有效的专家选择算法,确保模型在训练和推理过程中的稳定性和准确性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并开发支持大规模分布式训练和推理的MOE框架,确保其在各种硬件配置下的高效运行
- 通过算法优化、并行计算、缓存策略等方式优化训练和推理性能,缩短时间提高效率
- 研究和实现有效的专家选择算法,确保模型在训练和推理过程中的稳定性和准确性
- 解决负载均衡问题,通过动态调整专家网络的负载分配,提高系统资源利用率
- 优化通信过程,减少分布式训练和推理中的通信开销,提高数据传输效率
- 与算法团队保持密切沟通,根据需求调整和优化训练和推理基础设施
- 跟踪业界最新技术动态,引入适合项目需求的新技术、新方法
任职要求
- 掌握分布式训练框架(如Horovod、PyTorch Distributed)的使用和优化
- 具备设计和实现高效分布式训练系统的能力
- 熟悉GPU、TPU等硬件架构,能够进行硬件级性能调优
- 了解CUDA、cuDNN等相关技术,能够利用硬件加速提升训练和推理效率
- 了解量化、剪枝、压缩等模型优化方法,能够在实际项目中应用以优化模型大小和推理速度
- 能够设计高效的负载均衡策略和通信机制,应对MOE模型的稀疏性挑战
- 具备分布式系统设计经验,能够解决大规模模型训练和推理中的工程问题
- 能够设计和实现高可用、高扩展性的系统架构
- 计算机科学、软件工程、人工智能或相关领域的本科及以上学历
- 熟悉至少一种深度学习框架,如TensorFlow、PyTorch等
- 具备扎实的分布式系统和高性能计算的相关知识,熟悉MPI、NCCL等通信库
- 熟悉Linux操作系统及常用命令,具备良好的脚本编写能力(如Bash、Python等)
- 具备良好的问题解决能力和团队协作精神,能够承受工作压力
- 良好的英语阅读和写作能力,能够阅读和理解英文技术文档
- 具有MOE或相关领域(如分布式训练、模型并行等)的开发经验者优先
- 在相关领域发表过高质量论文或拥有相关专利者优先
工作地址
北京海淀区搜狐网络大厦搜狐网络大厦11层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。