机器学习平台研发工程师
岗位摘要
负责MiniMax机器学习平台的研发,聚焦AI算法工程师的体验与超大规模集群资源利用率;从机器学习系统、云原生、云计算架构等多个层面进行技术探索和攻坚,实现高性能、高资源利用率的机器学习平台
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责MiniMax机器学习平台的研发,聚焦AI算法工程师的体验与超大规模集群资源利用率
- 从机器学习系统、云原生、云计算架构等多个层面进行技术探索和攻坚,实现高性能、高资源利用率的机器学习平台
- 设计和实现机器学习相关的基础设施/算法框架/工具链等,并推动落地到业务中
- 覆盖机器学习系统多个子方向领域的工作,包括:资源调度、任务编排、模型训练、模型管理、数据集管理、工作流编排、ML for System等
- 负责机器学习系统前瞻技术的调研和引入,比如:最新硬件架构、异构计算系统、GPU优化技术的引入落地
任职要求
- 统招本科及以上学历,985/211院校或硕士优先,大厂背景,3年以上工作经验
- 熟悉Linux平台下的分布式系统的开发及运维,三年及以上Golang/Python/C/C++的开发经验,ACM/ICPC/Codeforces等获奖者优先
- 掌握分布式系统原理,参与过大规模分布式系统的设计、开发和维护
- 熟悉容器技术,具有Docker、Kubernetes开发或使用经验
- 有机器学习平台研发经验,有大规模训练任务和推理服务的编排、在离线混部及资源调度经验者优先
- 熟悉Pytorch/Tensorflow/JAX/PaddlePaddle/Mindspore等机器学习框架、GPU/NPU/ARM等最新异构计算系统与架构、RDMA高性能网络,有相关系统研发经验者优先
- 发表算法相关优秀论文者优先
工作地址
北京海淀区蓟门壹号8层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。