返回岗位列表

阶跃星辰

大模型平台训练工程师

地点:上海 薪资:35-65K 日期:2026-03-05

岗位摘要

与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化;打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性;提升训练任务的运行和开发效率;进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位

岗位职责

  • 与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的联合优化
  • 打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性
  • 提升训练任务的运行和开发效率
  • 进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位

任职要求

  • 熟练掌握Linux环境下的C/C++、Go、Python语言
  • 熟悉容器化技术、K8S及相关生态的DevOps
  • 有以下至少一项的熟练使用经验:MySQL、Redis、MongoDB、Elasticsearch、Kafka等
  • 具有独立解决问题的能力,良好的团队合作精神
  • 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力
  • 有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档
  • 掌握并应用MLOps和任务调度框架(Kubeflow、MLFlow、Volcano或类似自研项目)优先
  • 使用或运维过一种机器学习框架(TensorFlow/PyTorch或其他框架)优先
  • 有大规模分布式训练任务的运维及排错经验,熟悉CUDA和NCCL相关问题的调研和排错,熟悉GPU和RoCE设备的配置和检测优先
  • 有研究生或博士阶段的计算机系统方向(包含分布式系统、并行计算、网络、存储等)研究背景优先
  • 深入了解大语言模型相关技术及应用,有AI工程落地经验者优先

加分项

  • 掌握并应用一下MLOps和任务调度框架:Kubeflow,MLFlow,Volcano,或类似自研项目
  • 使用或运维过一种机器学习框架(Tensorflow / PyTorch 或其他框架)
  • 有大规模分布式训练任务的运维及排错经验,熟悉CUDA和NCCL相关问题的调研和排错,熟悉GPU和RoCE设备的配置和检测
  • 有研究生或博士阶段的计算机系统方向(包含分布式系统,并行计算,网络,存储等)研究背景
  • 深入了解大语言模型相关技术及应用,有 AI 工程落地经验者优先

工作地址

上海徐汇区西岸智塔西塔楼30F