返回岗位列表

面壁智能

GPU算力平台运维开发工程师

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责GPU算力平台的日常运维、监控告警与故障排查,保障平台稳定运行;开发和维护运维自动化工具,提升运维效率,降低人工干预成本;参与算力平台的容量规划、性能调优与资源调度优化;搭建和完善监控体系、日志系统与故障诊断平台

岗位职责

  • 负责GPU算力平台的日常运维、监控告警与故障排查,保障平台稳定运行
  • 开发和维护运维自动化工具,提升运维效率,降低人工干预成本
  • 参与算力平台的容量规划、性能调优与资源调度优化
  • 搭建和完善监控体系、日志系统与故障诊断平台
  • 参与CI/CD流水线建设,保障训练任务的高效交付

任职要求

  • 本科及以上学历,计算机、软件工程等相关专业,3年以上运维开发经验
  • 精通Linux系统管理、Shell/Python脚本开发,具备扎实的编程能力
  • 精通Kubernetes、Docker等容器化技术,有K8s集群运维经验
  • 了解GPU服务器架构,熟悉NVIDIA驱动、CUDA环境配置与调试
  • 熟悉Prometheus、Grafana、ELK等监控日志系统
  • 具备良好的问题定位和故障排查能力,能够快速响应和处理线上问题
  • 有大规模GPU集群运维经验(千卡以上规模)
  • 了解RDMA/InfiniBand网络运维,有高性能网络故障排查经验
  • 有SRE相关工作经验,熟悉可观测性体系建设

加分项

  • 有大规模GPU集群运维经验(千卡以上规模)
  • 了解RDMA/InfiniBand网络运维,有高性能网络故障排查经验
  • 有SRE相关工作经验,熟悉可观测性体系建设