大模型平台训练工程师
岗位摘要
与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化;打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性;提升训练任务的运行和开发效率;进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化
- 打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性
- 提升训练任务的运行和开发效率
- 进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位
任职要求
- 熟练掌握Linux环境下的C/C++、Go、Python语言
- 熟悉容器化技术、K8S及相关生态的DevOps
- 有以下至少一项的熟练使用经验:MySQL、Redis、MongoDB、Elasticsearch、Kafka等
- 具有独立解决问题的能力,良好的团队合作精神
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力
- 有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档
- 掌握并应用MLOps和任务调度框架(Kubeflow、MLFlow、Volcano或类似自研项目)优先
- 使用或运维过一种机器学习框架(TensorFlow/PyTorch或其他框架)优先
- 有大规模分布式训练任务的运维及排错经验,熟悉CUDA和NCCL相关问题的调研和排错,熟悉GPU和RoCE设备的配置和检测优先
- 有研究生或博士阶段的计算机系统方向(包含分布式系统、并行计算、网络、存储等)研究背景优先
- 深入了解大语言模型相关技术及应用,有AI工程落地经验者优先
加分项
- 掌握并应用一下MLOps和任务调度框架:Kubeflow,MLFlow,Volcano,或类似自研项目
- 使用或运维过一种机器学习框架(Tensorflow / PyTorch 或其他框架)
- 有大规模分布式训练任务的运维及排错经验,熟悉CUDA和NCCL相关问题的调研和排错,熟悉GPU和RoCE设备的配置和检测
- 有研究生或博士阶段的计算机系统方向(包含分布式系统,并行计算,网络,存储等)研究背景
- 深入了解大语言模型相关技术及应用,有 AI 工程落地经验者优先
- 张女士 刚刚活跃
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。