算力平台开发/运维工程师
岗位摘要
负责GPU算力平台的开发、运维、监控告警与故障排查,保障平台稳定运行;开发和维护运维自动化工具,提升运维效率,降低人工干预成本;参与算力平台的容量规划、性能调优与资源调度优化;搭建和完善监控体系、日志系统与故障诊断平台
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责GPU算力平台的开发、运维、监控告警与故障排查,保障平台稳定运行
- 开发和维护运维自动化工具,提升运维效率,降低人工干预成本
- 参与算力平台的容量规划、性能调优与资源调度优化
- 搭建和完善监控体系、日志系统与故障诊断平台
- 参与CI/CD流水线建设,保障训练任务的高效交付
任职要求
- 本科及以上学历,计算机、软件工程等相关专业,3年以上运维开发经验
- 精通Linux系统管理、Shell/Python脚本开发,具备扎实的编程能力
- 精通Kubernetes、Docker等容器化技术,有K8s集群运维经验
- 了解GPU服务器架构,熟悉NVIDIA驱动、CUDA环境配置与调试
- 熟悉Prometheus、Grafana、ELK等监控日志系统
- 具备良好的问题定位和故障排查能力,能够快速响应和处理线上问题
- 有大规模GPU集群运维经验(千卡以上规模)优先
- 了解RDMA/InfiniBand网络运维,有高性能网络故障排查经验优先
- 有SRE相关工作经验,熟悉可观测性体系建设优先
加分项
- 有大规模GPU集群运维经验(千卡以上规模)
- 了解RDMA/InfiniBand网络运维,有高性能网络故障排查经验
- 有SRE相关工作经验,熟悉可观测性体系建设
- 薛明畅 刚刚活跃
工作地址
北京海淀区科建大厦301
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。