返回岗位列表

Stability AI

高级站点可靠性工程师(SRE)

地点:美国 薪资:薪资未公开 日期:2026-01-30

岗位摘要

制定并执行全组织的SRE最佳实践和标准;在AWS和其他云环境中架构和管理可扩展系统,重点关注高可用性和弹性;使用Terraform实施和维护基础设施即代码;设置和完善监控、日志记录和警报系统

岗位职责

  • 制定并执行全组织的SRE最佳实践和标准
  • 在AWS和其他云环境中架构和管理可扩展系统,重点关注高可用性和弹性
  • 使用Terraform实施和维护基础设施即代码
  • 设置和完善监控、日志记录和警报系统
  • 推动事件管理和根本原因分析以提高系统可靠性
  • 倡导SRE原则并指导初级团队成员

任职要求

  • 与开发团队合作以增强CI/CD流水线
  • 有扩展资源密集型系统的经验,无论是存储、网络还是计算
  • 具备Kubernetes或其他容器扩展解决方案的知识和经验
  • 有软件开发或自动化脚本编写的背景
  • 熟悉Grafana、ELK堆栈或类似工具