返回岗位列表

月之暗面

GPU集群SRE工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责月之暗面大规模GPU训练与推理集群的稳定性保障,支撑业务7×24高可用运行;负责Kubernetes及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发以及疑难问题的排查解决

岗位职责

  • 负责月之暗面大规模GPU训练与推理集群的稳定性保障,支撑业务7×24高可用运行
  • 负责Kubernetes及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发以及疑难问题的排查解决
  • 负责GPU节点硬件故障的自动化巡检、自愈体系与告警治理
  • 参与OnCall值班,响应集群级突发事件(网络拥塞、调度热点、训练任务失败)

任职要求

  • 3年以上大规模分布式系统或云原生基础设施SRE经验,有1000+节点Kubernetes集群的运维或建设经历
  • 了解Kubernetes及生态,理解Operator、Device Plugin或CNI/CSI插件的工作原理
  • 熟悉Prometheus / Grafana / Loki / ELK等可观测体系,具备基于eBPF或NVIDIA Nsight进行性能剖析与故障定位的能力
  • 具备Go / Python / Rust至少一门语言的开发能力,能独立完成自动化运维工具、Operator或监控Exporter的开发
  • 具备良好沟通合作能力和扎实的工程素养