分布式训练工程师
岗位摘要
基于公司生态,为NLP/CV/音视频/多模态/推广搜等场景搭建大规模分布式机器学习系统;解决业务交付中单机多卡、多机多卡的精度与性能瓶颈;研究并落地行业领先的超大规模分布式训练策略,应对大模型工程挑战
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于公司生态,为NLP/CV/音视频/多模态/推广搜等场景搭建大规模分布式机器学习系统
- 解决业务交付中单机多卡、多机多卡的精度与性能瓶颈
- 研究并落地行业领先的超大规模分布式训练策略,应对大模型工程挑战
任职要求
- 计算机、电子、数学等相关专业硕士及以上学历,2年以上相关经验
- 精通C++/Python,具备CUDA编程能力者优先
- 熟悉TensorFlow/PyTorch/Paddle等主流及国产机器学习框架,有框架开发经验优先
- 熟悉CUDA生态,具备NCCL、RDMA开发经验者优先
- 了解Megatron/Deepspeed/Accelerate/Galvatron等分布式训练优化策略
福利待遇
- 与行业顶尖团队共事,参与大模型核心技术攻关
- 上海核心区办公,交通便利
- 具有竞争力的25-50K月薪
- 硕士学历不限经验,开放成长空间
工作地址
上海闵行区壁仞科技m
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。