大模型训练系统工程师
岗位摘要
探索业界前沿的机器学习相关技术,为模型开发、训练和推理提供可靠有效的支持;负责模型全生命周期运维,针对训练过程开发管理和诊断工具,为训练任务保驾护航;提高训练产出和GPU利用率,快速分析和定位问题,解决训练过程中的各种软硬件故障
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 探索业界前沿的机器学习相关技术,为模型开发、训练和推理提供可靠有效的支持
- 负责模型全生命周期运维,针对训练过程开发管理和诊断工具,为训练任务保驾护航
- 提高训练产出和GPU利用率,快速分析和定位问题,解决训练过程中的各种软硬件故障
- 负责模型系统层级端到端优化,完成从机器、网络、存储到模型的全链优化工作
- 合作搭建模型预训练、后训练、智能体以及推理相关的配套系统
任职要求
- 统招研究生及以上学历,人工智能或相关领域专业,两年及以上相关工作经验
- 具备系统和模型的综合知识,能深入理解业务,可技术自驱赋能业务增长
- 掌握扎实的机器学习技术基础和前沿的AI技术,有不错的工程实践经验优先
- 在深度学习框架上有不错的研究,非常熟悉PyTorch/Tensorflow
- 熟悉常用的分布式加速库包括但不限于Megatron、DeepSpeed等,有较强的实践能力,有二次开发经验者优先
- 了解混合精度训练、分布式训练等训练加速方法优先
- 熟悉常用的深度学习代码库包括Huggingface/Transformers、Fairseq、Gluon NLP/CV、PaddlePaddle、Mindspore等,并且有丰富的开发经验
- 有国产卡型训练和推理适配及优化经验者优先
- 具有独立解决问题的能力,良好的团队合作精神
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力
- 有优秀的工作文档写作能力,有相关顶会论文者优先
工作地址
上海徐汇区西岸智塔AI Tower30
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。