AI集群解决方案与服务工程师
岗位摘要
负责AI算力集群及多形态算力设施总体部署方案,包括机柜布局规划、服务器设备上架规划、GPU服务器机柜密度规划及机柜功率容量规划;负责AI训练环境部署,包括Linux系统安装、GPU驱动安装、系统环境部署及AI框架环境部署
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责AI算力集群及多形态算力设施总体部署方案,包括机柜布局规划、服务器设备上架规划、GPU服务器机柜密度规划及机柜功率容量规划
- 负责AI训练环境部署,包括Linux系统安装、GPU驱动安装、系统环境部署及AI框架环境部署
- 负责AI算力集群部署,包括Docker/Kubernetes部署、分布式训练环境配置及GPU资源调度
- 负责GPU服务器问题排查,包括GPU硬件异常、驱动异常及服务器硬件问题分析
- 负责存储系统接入,包括NFS/Ceph/Lustre及AI训练数据存储管理
- 支持AI训练任务测试,包括NCCL测试、分布式训练测试及推理测试
任职要求
- 本科及以上学历,计算机、自动化、电子信息相关专业
- 3~5年相关工作经验
- 熟悉Linux系统(Ubuntu、CentOS)
- 熟悉服务器运维,包括RAID、BIOS、BMC、PXE
- 熟悉GPU服务器运维,NVIDIA及国产GPU优先
- 了解CUDA及GPU Driver原理
- 熟悉Docker、Kubernetes等集群技术
- 了解PyTorch、TensorFlow、NCCL等AI训练框架
- 能够进行单机训练测试和多机训练测试
福利待遇
- 薪资范围30-60K,16薪
- 工作地点位于北京朝阳区望京国际研发园
工作地址
北京朝阳区望京国际研发园I座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。