返回岗位列表

Together AI

AI基础设施工程师(SRE)

地点:印度 薪资:薪资未公开 日期:2026-07-20

岗位摘要

参与PagerDuty轮值待命,响应影响可用性的事件;使用Ansible、Terraform和Kubernetes构建并运行基础设施,支持大规模并发用户;构建监控系统,确保为客户提供最高质量的服务

岗位职责

  • 参与PagerDuty轮值待命,响应影响可用性的事件
  • 使用Ansible、Terraform和Kubernetes构建并运行基础设施,支持大规模并发用户
  • 构建监控系统,确保为客户提供最高质量的服务
  • 设计并实施运维流程(如部署和升级)
  • 调试所有服务和堆栈各层的生产问题
  • 从可靠性、性能和可用性角度识别产品架构的改进点
  • 规划Together AI基础设施的增长

任职要求

  • 7年以上专业SRE或相关经验
  • 必须具备操作支持机器学习训练和推理工作负载的GPU Kubernetes集群或AI基础设施的经验
  • 计算机科学或相关领域学士学位,或同等工作经验
  • 精通Ansible(角色、剧本)、Terraform和Kubernetes
  • 熟练掌握编程/脚本语言
  • 具备监控和可观测性实践的直接经验
  • 深入了解云服务
  • 能够在涉及不同利益相关者和主题专家的协作环境中茁壮成长

福利待遇

  • 加入研究驱动型AI公司的机会
  • 参与前沿开源研究、模型和数据集
  • 与热情的研究人员和工程师团队合作
  • 平等就业机会
  • 隐私政策保障