返回岗位列表

Together AI

机器学习运维负责人

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责生产环境中推理和微调服务在无服务器和专用部署中的可用性与性能SLA;负责改进多集群ML基础设施的测试、部署、配置管理和监控实践,并与基础设施SRE紧密合作;构建自助式工具和自动化流程,以减少运营负担,并赋能内部用户(MLOps、客户体验)及自助服务产品

岗位职责

  • 负责生产环境中推理和微调服务在无服务器和专用部署中的可用性与性能SLA
  • 负责改进多集群ML基础设施的测试、部署、配置管理和监控实践,并与基础设施SRE紧密合作
  • 构建自助式工具和自动化流程,以减少运营负担,并赋能内部用户(MLOps、客户体验)及自助服务产品
  • 定义并强制执行推理引擎(vLLM、tvLLM、Pulsar)的配置最佳实践,以防止运行时问题
  • 领导事件响应,进行事后分析,并推动可靠性改进
  • 招聘、指导并发展MLOps工程团队
  • 与基础设施和ML工程团队合作,提高系统可靠性和成本效益

任职要求

  • 5年以上大规模生产ML推理或训练系统的运营经验
  • 2年以上领导工程团队的经验,有从零开始组建团队的经验
  • 精通Kubernetes、多集群编排和ML服务框架
  • 拥有负责生产SLA(如可用性、TTFT、TPS)的良好记录
  • 具有LLM推理服务系统(vLLM、TRT-LLM或类似)的经验
  • 具备影响跨职能团队并做出部署/架构决策的能力