运维工程师
岗位摘要
负责TOC相关业务的稳定性建设,包括Web服务、APP后端、API网关等;负责Kubernetes集群的建设与稳定性保障,包括版本升级、故障排查、资源利用率优化;设计高可用架构,解决APIServer性能瓶颈、etcd存储压力等大规模集群特有问题
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责TOC相关业务的稳定性建设,包括Web服务、APP后端、API网关等
- 负责Kubernetes集群的建设与稳定性保障,包括版本升级、故障排查、资源利用率优化
- 设计高可用架构,解决APIServer性能瓶颈、etcd存储压力等大规模集群特有问题
- 主导容器化架构调优,包括Pod调度策略、网络插件选型、存储方案设计,优化资源请求/限制配置以减少资源争用
- 建立容器安全防护体系,包括漏洞扫描、运行时安全监控、合规审计
- 深度参与自动化运维工具链建设,CI/CD流水线、混沌工程测试、智能扩缩容(HPA/VPA)
- 推动AIOps落地,基于时序数据分析预测集群负载并实现自愈
- 解决生产环境疑难问题,如OOM、网络延迟、存储性能瓶颈,输出标准化SOP文档
- 协同研发团队优化微服务架构,推动ServiceMesh等新技术落地
任职要求
- 统招本科及以上学历,计算机、软件工程、云计算相关专业优先
- 3年以上容器运维经验,主导或深度参与过千级Pod规模的集群维护
- 熟悉生产环境容器化全生命周期管理,包括部署、监控、扩缩容、故障恢复等场景
- 有多云环境/混合云管理经验,头部互联网/云计算大厂优先
- 精通Kubernetes架构及生态工具,如Etcd、Calico、Istio,具备集群性能调优经验
- 熟练使用Docker、Prometheus、Grafana、ELK、CI/CD等工具链,熟悉云原生安全体系
- 具备运维开发能力,能使用Python/Go开发自动化工具,如自定义Operator、监控告警脚本
工作地址
北京海淀区搜狐网络大厦11
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。