AI基础设施工程师(SRE)
岗位摘要
参与PagerDuty轮班值守,响应影响可用性的事件;使用Ansible、Terraform和Kubernetes构建和运行基础设施,以支持大规模并发用户;构建监控系统,确保为客户提供最高质量的服务
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与PagerDuty轮班值守,响应影响可用性的事件
- 使用Ansible、Terraform和Kubernetes构建和运行基础设施,以支持大规模并发用户
- 构建监控系统,确保为客户提供最高质量的服务
- 设计和实施运维流程(如部署和升级)
- 调试所有服务和堆栈各层的生产问题
- 从可靠性、性能和可用性角度识别产品架构的改进点
- 规划Together AI基础设施的增长
任职要求
- 7年以上专业SRE或相关经验
- 计算机科学或相关领域学士学位,或同等工作经验
- 精通Ansible(角色、剧本)、Terraform和Kubernetes
- 熟练掌握编程/脚本语言
- 具备监控和可观测性实践的直接经验
- 深入了解云服务
- 能够在涉及不同利益相关者和主题专家的协作环境中高效工作
福利待遇
- 加入充满激情的研究人员和工程师团队
- 参与构建下一代AI基础设施
- 平等就业机会,无歧视
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。