高级站点可靠性工程师(SRE)
岗位摘要
制定并执行全组织的SRE最佳实践和标准;在AWS和其他云环境中架构和管理可扩展系统,重点关注高可用性和弹性;使用Terraform实施和维护基础设施即代码;设置和完善监控、日志记录和警报系统
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 制定并执行全组织的SRE最佳实践和标准
- 在AWS和其他云环境中架构和管理可扩展系统,重点关注高可用性和弹性
- 使用Terraform实施和维护基础设施即代码
- 设置和完善监控、日志记录和警报系统
- 推动事件管理和根本原因分析以提高系统可靠性
- 倡导SRE原则并指导初级团队成员
任职要求
- 与开发团队合作以增强CI/CD流水线
- 有扩展资源密集型系统的经验,无论是存储、网络还是计算
- 具备Kubernetes或其他容器扩展解决方案的知识和经验
- 有软件开发或自动化脚本编写的背景
- 熟悉Grafana、ELK堆栈或类似工具
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。