返回岗位列表

Together AI

站点可靠性工程团队负责人/经理(阿姆斯特丹)

地点:荷兰 薪资:薪资未公开 日期:2026-07-20

岗位摘要

参与PagerDuty轮班待命,响应影响可用性的事件;管理、培养和指导SRE团队;使用Ansible、Terraform和Kubernetes构建和运行基础设施,支持大规模并发用户扩展

岗位职责

  • 参与PagerDuty轮班待命,响应影响可用性的事件
  • 管理、培养和指导SRE团队
  • 使用Ansible、Terraform和Kubernetes构建和运行基础设施,支持大规模并发用户扩展
  • 构建监控系统,确保为客户提供最高质量的服务
  • 设计和实施运营流程(如部署和升级)
  • 调试所有服务和堆栈层级的生产问题
  • 从可靠性、性能和可用性角度识别产品架构改进点
  • 规划Together AI基础设施的增长

任职要求

  • 7年以上专业SRE或相关经验
  • 最好有2年SRE领导经验
  • 计算机科学或相关领域学士学位,或同等工作经验
  • 精通Ansible(角色、剧本)、Terraform和Kubernetes
  • 熟练掌握编程/脚本语言
  • 具备监控和可观测性实践的直接经验
  • 深入了解云服务
  • 能够在涉及不同利益相关者和主题专家的协作环境中茁壮成长

福利待遇

  • 加入充满激情的研究人员和工程师团队
  • 参与构建下一代AI基础设施
  • 平等就业机会
  • 隐私政策详见官网