站点可靠性工程师
岗位摘要
维护生产服务并确保其正常运行;开发工具、仪器和自动化以监控和优化服务的性能和可靠性;开发、实施和维护自动化工具和流程,以防止和减轻服务中断;与开发团队合作设计和实施可扩展、可靠的系统,以及部署的CI/CD流程
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 维护生产服务并确保其正常运行
- 开发工具、仪器和自动化以监控和优化服务的性能和可靠性
- 开发、实施和维护自动化工具和流程,以防止和减轻服务中断
- 与开发团队合作设计和实施可扩展、可靠的系统,以及部署的CI/CD流程
- 建立并支持我们网站的SLAs和SLOs
- 提供系统监控和事件警报
- 参与值班轮换,为关键事件和中断提供支持
- 制定站点可靠性和灾难恢复计划
任职要求
- 5年以上在以开发为重点的DevOps/SRE角色中的经验,所在技术组织具有显著规模
- 在使用Python和Golang开发软件工具和自动化方面有深厚经验并取得过成功
- 精通SQL、Linux、CI/CD、Kubernetes、Terraform,以支持大型多节点基础设施和不断增长的用户基础
- 必须有多云计算平台(如GCP)的工作经验
- 具备跨多种平台和系统成功可靠地解决技术问题和挑战的经验
- 优秀候选人将具备以下一项或多项:熟悉GPU集群和/或HPC环境;有使用Prometheus和Grafana等监控和日志工具的经验;有从早期到超增长阶段扩展消费者产品的实际经验
福利待遇
- 加入我们,成为建立这一新娱乐范式并塑造消费者AI未来的一部分!
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。