SRE运维研发工程师-云原生
岗位摘要
负责Minimax线上K8S及云原生周边系统的运维保障和工具开发;负责公司内部大规模K8S集群的建设和稳定性保障;负责监控/日志/网络/存储等原生基础设施的保障和工具开发;负责业务容器化部署、互联互通以及疑难问题的排查解决
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责Minimax线上K8S及云原生周边系统的运维保障和工具开发
- 负责公司内部大规模K8S集群的建设和稳定性保障
- 负责监控/日志/网络/存储等原生基础设施的保障和工具开发
- 负责业务容器化部署、互联互通以及疑难问题的排查解决
- 参与OnCall值班,第一时间响应并与研发团队共同解决各类突发事件,保障核心系统的稳定性
任职要求
- 具有大规模K8S系统的建设和运维经验,熟悉Linux、网络等系统运维技能
- 对大规模分布式集群的部署架构设计、分析、故障排查有强烈兴趣
- 熟悉Docker/Kubernetes容器生态核心开源项目和周边服务生态项目,如监控、日志、网络等方案,精通或者有实施经验
- 具有K8S二次开发经验,有自定义Operator的开发经验,或者CSI/CNI插件的经验(加分项)
- 对K8S调度系统深入研究,熟悉Volcano、Kueue等组件(加分项)
- 具有大规模GPU集群运维经验(加分项)
加分项
- 具有 k8s 二次开发经验,有自定义 operator 的开发经验,或者csi/cni插件的经验
- 对 k8s 调度系统深入研究,熟悉 volcano,kueue 等组件
- 李先生 刚刚活跃
工作地址
北京海淀区蓟门壹号1
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。