返回岗位列表

Together AI

客户成功工程师(GPU集群)

地点:美国 薪资:260-290K 日期:2026-07-20

岗位摘要

担任指定战略客户的技术联系人,全面负责计算、网络、存储和设施领域的技术关系;通过定期状态报告、技术指导会议、季度业务回顾(QBR)和执行业务回顾(EBR)推动结构化互动;将客户运营反馈转化为工程、产品和基础设施路线图的可行输入

岗位职责

  • 担任指定战略客户的技术联系人,全面负责计算、网络、存储和设施领域的技术关系
  • 通过定期状态报告、技术指导会议、季度业务回顾(QBR)和执行业务回顾(EBR)推动结构化互动
  • 将客户运营反馈转化为工程、产品和基础设施路线图的可行输入
  • 与支持、SRE、数据中心运营和工程团队合作,领导跨所有基础设施领域的问题生命周期管理、升级和根本原因分析
  • 负责端到端的RMA协调和硬件生命周期管理,包括验收测试、备件库存管理和大规模GPU部署的硬件健康报告
  • 保持对客户基础设施栈(GPU计算、高速网络和大规模存储系统)的深厚技术专长,提供配置、运营最佳实践和事件解决建议
  • 负责客户环境的可观测性策略,包括告警策略定义、仪表板开发和跨所有基础设施层的主动健康管理
  • 与内部团队和托管提供商协调数据中心运营和设施事件,确保SLA合规和集群可用性
  • 担任所有容量扩展的项目经理,管理从货运接收到生产验收的完整节点部署生命周期

任职要求

  • 5年以上面向客户的技术角色经验,其中2年以上专门负责大规模AI或HPC基础设施的技术客户管理或解决方案架构
  • 在GPU基础设施方面具有深厚专长,包括GPU健康诊断、RMA工作流程和硬件验收测试
  • 具备大规模以太网和InfiniBand网络架构的实践经验
  • 了解企业存储系统,包括高密度NVMe、并行文件系统和元数据基础设施
  • 具有数据中心运营、设施协调和托管提供商SLA管理经验
  • 具备事件管理、根本原因分析编写和面向高管的客户沟通的强烈主人翁意识
  • 熟练使用基础设施监控和可观测性工具(Prometheus、Grafana或同等工具)
  • 具备以超大规模标准严格管理多个并行工作流的能力
  • 优先考虑精通Python、Bash或基础设施自动化工具

福利待遇

  • 具有竞争力的薪酬
  • 初创公司股权