站点可靠性工程师
岗位摘要
参与值班轮换(Pagerduty),响应生产事件;使用Ansible、Terraform和Kubernetes构建和运行基础设施,以支持海量并发用户;构建监控系统,确保为客户提供最高质量的服务
岗位职责
- 参与值班轮换(Pagerduty),响应生产事件
- 使用Ansible、Terraform和Kubernetes构建和运行基础设施,以支持海量并发用户
- 构建监控系统,确保为客户提供最高质量的服务
- 设计和实施运维流程(如部署和升级)
- 调试所有服务和各层级的生产问题
- 从可靠性、性能和可用性角度识别产品架构的改进点
- 规划Together AI基础设施的增长
任职要求
- 2年以上专业SRE或相关经验
- 计算机科学或相关领域学士学位或同等工作经验
- 精通编程/脚本语言
- 具备监控和可观测性实践的直接经验
- 能够在涉及不同利益相关者和主题专家的协作环境中茁壮成长
福利待遇
- 具有竞争力的薪酬
- 初创公司股权
- 其他具有竞争力的福利