返回岗位列表

DeepSeek

AI超算集群运维工程师

地点:杭州 薪资:30-60K 日期:2026-05-08

岗位摘要

负责AI超算集群中前沿服务器、加速卡等基础设施的日常运维工作,包括巡检、维修、故障定位与生命周期管理,缩短平均故障恢复时间(MTTR),保障集群持续稳定运行;负责新一代计算资源的快速交付与上线,完成节点的基线检查与性能验证工作,确保资源能够高质量高性能投入生产

岗位职责

  • 负责AI超算集群中前沿服务器、加速卡等基础设施的日常运维工作,包括巡检、维修、故障定位与生命周期管理,缩短平均故障恢复时间(MTTR),保障集群持续稳定运行
  • 负责新一代计算资源的快速交付与上线,完成节点的基线检查与性能验证工作,确保资源能够高质量高性能投入生产
  • 负责建设和优化面向AI超算集群的监控、告警与可观测性体系,实现集群健康状态的实时感知
  • 构建自动化运维工具链,提升故障自愈率与运维效率,降低人工干预成本

任职要求

  • 本科及以上学历,计算机、电子、通信、自动化或相关专业优先
  • 具备Linux服务器运维经验,熟悉集群环境下的系统管理、故障排查与性能分析
  • 熟悉GPU/AI加速卡服务器、RDMA网络等相关基础设施,有实际运维经验者优先
  • 具备良好的脚本或自动化能力,能够使用Shell、Python、LLM等工具提升运维效率
  • 具备良好的沟通协作能力、责任心和现场问题推动能力,能在跨团队协同场景下高效推进问题解决

加分项

  • 有大规模AI超算集群(千卡以上)运维经验
  • 有机房交付、批量上架、集群 bring
  • up、验收测试经验
  • 有 GPU 服务器压测、性能基线建立、异常案例归因和优化经验
  • 具备监控体系建设经验(如Prometheus、Grafana等),有可观测性平台落地经验者优先

福利待遇

  • 有大规模AI超算集群(千卡以上)运维经验
  • 有机房交付、批量上架、集群bring-up、验收测试经验
  • 有GPU服务器压测、性能基线建立、异常案例归因和优化经验
  • 具备监控体系建设经验(如Prometheus、Grafana等),有可观测性平台落地经验者优先

工作地址

杭州拱墅区汇金国际A座