客户成功工程师(GPU集群)
岗位摘要
担任指定战略客户的技术联系人,全面负责计算、网络、存储和设施领域的技术关系;通过定期状态报告、技术指导会议、季度业务回顾(QBR)和执行业务回顾(EBR)推动结构化互动;将客户运营反馈转化为工程、产品和基础设施路线图的可行输入
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 担任指定战略客户的技术联系人,全面负责计算、网络、存储和设施领域的技术关系
- 通过定期状态报告、技术指导会议、季度业务回顾(QBR)和执行业务回顾(EBR)推动结构化互动
- 将客户运营反馈转化为工程、产品和基础设施路线图的可行输入
- 与支持、SRE、数据中心运营和工程团队合作,领导跨所有基础设施领域的问题生命周期管理、升级和根本原因分析
- 负责端到端的RMA协调和硬件生命周期管理,包括验收测试、备件库存管理和大规模GPU部署的硬件健康报告
- 保持对客户基础设施栈(GPU计算、高速网络和大规模存储系统)的深厚技术专长,提供配置、运营最佳实践和事件解决建议
- 负责客户环境的可观测性策略,包括告警策略定义、仪表板开发和跨所有基础设施层的主动健康管理
- 与内部团队和托管提供商协调数据中心运营和设施事件,确保SLA合规和集群可用性
- 担任所有容量扩展的项目经理,管理从货运接收到生产验收的完整节点部署生命周期
任职要求
- 5年以上面向客户的技术角色经验,其中2年以上专门负责大规模AI或HPC基础设施的技术客户管理或解决方案架构
- 在GPU基础设施方面具有深厚专长,包括GPU健康诊断、RMA工作流程和硬件验收测试
- 具备大规模以太网和InfiniBand网络架构的实践经验
- 了解企业存储系统,包括高密度NVMe、并行文件系统和元数据基础设施
- 具有数据中心运营、设施协调和托管提供商SLA管理经验
- 具备事件管理、根本原因分析编写和面向高管的客户沟通的强烈主人翁意识
- 熟练使用基础设施监控和可观测性工具(Prometheus、Grafana或同等工具)
- 具备以超大规模标准严格管理多个并行工作流的能力
- 优先考虑精通Python、Bash或基础设施自动化工具
福利待遇
- 具有竞争力的薪酬
- 初创公司股权
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。