返回岗位列表

MiniMax

SRE运维研发工程师-云原生

地点:北京 薪资:30-60K 日期:2026-09-18

岗位摘要

负责公司 Kubernetes 集群及云原生周边系统的日常运维保障、稳定性建设和自动化工具开发;深入分析业务在 Kubernetes 集群中的部署、运行、资源使用和性能表现,持续跟踪容量、稳定性及资源效率问题

岗位职责

  • 负责公司 Kubernetes 集群及云原生周边系统的日常运维保障、稳定性建设和自动化工具开发
  • 深入分析业务在 Kubernetes 集群中的部署、运行、资源使用和性能表现,持续跟踪容量、稳定性及资源效率问题
  • 结合业务架构、使用场景和发展需求,制定并推动容器化部署、资源配置、调度、弹性伸缩及性能优化等解决方案落地
  • 与研发团队协作,定位和解决业务运行中的云原生相关问题,沉淀最佳实践、标准规范及平台化能力
  • 建设和完善可观测性、自动化运维、容量管理和故障应急机制,提升业务系统的可靠性和交付效率
  • 参与 On-Call 值班,响应线上突发事件,推动问题复盘和长期改进

任职要求

  • 具备 Kubernetes 生产环境运维经验,熟悉 Docker、Kubernetes 及常见云原生基础组件
  • 熟悉 Linux、网络、存储等基础知识,具备较强的问题分析、性能定位和故障排查能力
  • 熟悉监控、日志、告警、服务发现、网络、存储等云原生相关技术或开源方案,并有实际落地经验
  • 能够理解业务架构和实际使用场景,不局限于基础设施运维,能够从稳定性、性能、容量和资源效率角度提出并推动优化方案
  • 具备良好的跨团队沟通和协作能力,有较强的责任心、服务意识和问题闭环能力
  • 加分项:熟悉 Kubernetes 调度机制,具备 Volcano、Kueue 等调度组件的使用或优化经验
  • 加分项:有大规模 GPU 集群、AI 训练/推理业务或批处理任务平台的运维和优化经验
  • 加分项:有资源利用率优化、容量管理、混部、成本治理或 SLO 建设经验

加分项

  • 熟悉 Kubernetes 调度机制,具备 Volcano、Kueue 等调度组件的使用或优化经验
  • 有大规模 GPU 集群、AI 训练/推理业务或批处理任务平台的运维和优化经验
  • 有资源利用率优化、容量管理、混部、成本治理或 SLO 建设经验
  • 李明基 刚刚活跃

福利待遇

  • 提供30-60K·16薪薪酬

工作地址

北京海淀区蓟门壹号8楼