返回岗位列表

Together AI

平台工程师(模型定制方向)

地点:美国 薪资:$200,000-$290,000 日期:2026-09-18

岗位摘要

设计并构建 Together 的模型定制系统与基础设施,涵盖面向用户的功能与内部优化;参与平台可靠性改进,加入值班轮换机制,并持续完善事故响应流程;创建并改进用于部署、持续集成与可观测性的内部工具

岗位职责

  • 设计并构建 Together 的模型定制系统与基础设施,涵盖面向用户的功能与内部优化
  • 参与平台可靠性改进,加入值班轮换机制,并持续完善事故响应流程
  • 创建并改进用于部署、持续集成与可观测性的内部工具
  • 构建跨多个数据中心、支持高度异构硬件环境的作业编排平台
  • 与开发内部服务的团队合作,共同设计这些服务并将其集成到 Together 构建的系统中

任职要求

  • 3 年以上基础设施或生产服务后端组件的构建经验
  • 具备设计、运维与排障生产级 Linux 环境和基于 Kubernetes 平台的丰富经验
  • 扎实的软件工程背景,精通 Python 或 Go
  • 熟悉基础设施自动化工具(Terraform、Ansible)、监控与可观测性技术栈(Prometheus、Grafana)以及 CI/CD 流水线(GitHub Actions、ArgoCD)
  • 具备云环境(如 AWS、GCP、Azure)管理经验,有裸金属与云混合环境经验者优先
  • 出色的沟通能力,愿意记录系统与流程,并能与技术背景各异的同事协作
  • 能够胜任从集群运维、基础设施自动化到后端服务开发的全栈工作
  • 加分项:具备大规模、高可靠性生产系统的开发经验
  • 加分项:熟悉流水线编排框架(如 Kubeflow、Argo Workflows、Flyte)
  • 加分项:有在 HPC 集群上管理 GPU 工作负载的经验,最好具备 NVIDIA 网络栈(如 NCCL、Mellanox 固件、GPUDirect RDMA)的实操经验
  • 加分项:有 AI 训练或推理服务的部署经验
  • 加分项:掌握网络基础知识,包括 TCP/IP、DNS、路由、负载均衡、TLS 及网络调试工具
  • 加分项:维护或参与过开源项目