站点可靠性工程师
岗位摘要
参与值班轮换(Pagerduty),响应生产事件;使用Ansible、Terraform和Kubernetes构建和运行基础设施,以支持海量并发用户;构建监控系统,确保为客户提供最高质量的服务
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与值班轮换(Pagerduty),响应生产事件
- 使用Ansible、Terraform和Kubernetes构建和运行基础设施,以支持海量并发用户
- 构建监控系统,确保为客户提供最高质量的服务
- 设计和实施运维流程(如部署和升级)
- 调试所有服务和各层级的生产问题
- 从可靠性、性能和可用性角度识别产品架构的改进点
- 规划Together AI基础设施的增长
任职要求
- 2年以上专业SRE或相关经验
- 计算机科学或相关领域学士学位或同等工作经验
- 精通编程/脚本语言
- 具备监控和可观测性实践的直接经验
- 能够在涉及不同利益相关者和主题专家的协作环境中茁壮成长
福利待遇
- 具有竞争力的薪酬
- 初创公司股权
- 其他具有竞争力的福利
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。