返回岗位列表

摩尔线程

AI集群解决方案与服务工程师

地点:北京 薪资:30-60K 日期:2026-05-08

岗位摘要

负责AI算力集群及多形态算力设施总体部署方案,包括机柜布局规划、服务器设备上架规划、GPU服务器机柜密度规划及机柜功率容量规划;负责AI训练环境部署,包括Linux系统安装、GPU驱动安装、系统环境部署及AI框架环境部署

岗位职责

  • 负责AI算力集群及多形态算力设施总体部署方案,包括机柜布局规划、服务器设备上架规划、GPU服务器机柜密度规划及机柜功率容量规划
  • 负责AI训练环境部署,包括Linux系统安装、GPU驱动安装、系统环境部署及AI框架环境部署
  • 负责AI算力集群部署,包括Docker/Kubernetes部署、分布式训练环境配置及GPU资源调度
  • 负责GPU服务器问题排查,包括GPU硬件异常、驱动异常及服务器硬件问题分析
  • 负责存储系统接入,包括NFS/Ceph/Lustre及AI训练数据存储管理
  • 支持AI训练任务测试,包括NCCL测试、分布式训练测试及推理测试

任职要求

  • 本科及以上学历,计算机、自动化、电子信息相关专业
  • 3~5年相关工作经验
  • 熟悉Linux系统(Ubuntu、CentOS)
  • 熟悉服务器运维,包括RAID、BIOS、BMC、PXE
  • 熟悉GPU服务器运维,NVIDIA及国产GPU优先
  • 了解CUDA及GPU Driver原理
  • 熟悉Docker、Kubernetes等集群技术
  • 了解PyTorch、TensorFlow、NCCL等AI训练框架
  • 能够进行单机训练测试和多机训练测试

福利待遇

  • 薪资范围30-60K,16薪
  • 工作地点位于北京朝阳区望京国际研发园

工作地址

北京朝阳区望京国际研发园I座