分布式机器学习系统工程师
岗位摘要
基于公司生态,针对NLP、CV、音视频、多模态、推广搜等场景,构建大规模的分布式机器学习系统;负责解决业务交付流程中遇到的单机多卡、多机多卡的精度与性能问题;基于公司生态,研究行业领先的超大规模分布式策略,解决在大模型落地当中遇到的分布式工程挑战
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于公司生态,针对NLP、CV、音视频、多模态、推广搜等场景,构建大规模的分布式机器学习系统
- 负责解决业务交付流程中遇到的单机多卡、多机多卡的精度与性能问题
- 基于公司生态,研究行业领先的超大规模分布式策略,解决在大模型落地当中遇到的分布式工程挑战
任职要求
- 计算机、电子、数学及相关专业,2年以上相关工作经验
- 熟练C++/Python编程,有CUDA编程经验者优先
- 熟悉TensorFlow、PyTorch、Paddle以及其他国产机器学习框架,有相关框架开发经验者优先
- 熟悉CUDA生态,有NCCL、RDMA开发经验者优先
- 了解常见的大规模分布式训练优化策略,熟悉Megatron、DeepSpeed、Accelerate、Galvatron者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。