机器学习平台 SRE 工程师
岗位摘要
负责月之暗面大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行;负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发以及疑难问题的排查解决
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责月之暗面大规模 GPU 训练与推理集群的稳定性保障,支撑业务 7×24 高可用运行
- 负责 Kubernetes 及云原生周边系统(监控、日志、镜像分发、存储)的运维保障与平台化工具开发以及疑难问题的排查解决
- 负责 GPU 节点硬件故障的自动化巡检、自愈体系与告警治理
- 参与 OnCall 值班,响应集群级突发事件(网络拥塞、调度热点、训练任务失败)
任职要求
- 3 年以上大规模分布式系统或云原生基础设施 SRE 经验,有 1000+ 节点 Kubernetes 集群的运维或建设经历
- 了解 Kubernetes 及生态,理解 Operator、Device Plugin 或 CNI/CSI 插件的工作原理
- 熟悉 Prometheus / Grafana / Loki / ELK 等可观测体系,具备基于 eBPF 或 NVIDIA Nsight 进行性能剖析与故障定位的能力
- 具备 Go / Python / Rust 至少一门语言的开发能力,能独立完成自动化运维工具、Operator 或监控 Exporter 的开发
- 具备良好沟通合作能力和扎实的工程素养
福利待遇
- 薪资范围:25-50K·16薪
- 工作地点:北京海淀区京东科技大厦13层
工作地址
北京海淀区京东科技大厦13层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。