返回岗位列表

Together AI

高级软件工程师,GPU基础设施生命周期管理

地点:美国 薪资:$240,000-$280,000 日期:2026-07-20

岗位摘要

构建配置状态机:设计并实现软件,对物理主机的完整生命周期(从发现、推理启动、GPU驱动/CUDA堆栈、健康验证到退役/RMA)进行建模,作为显式、版本化的状态和转换;构建自助服务API:设计声明式API和控制平面,使推理团队能够通过一次API调用请求、扩展和拆除推理集群,无需工单或人工介入

岗位职责

  • 构建配置状态机:设计并实现软件,对物理主机的完整生命周期(从发现、推理启动、GPU驱动/CUDA堆栈、健康验证到退役/RMA)进行建模,作为显式、版本化的状态和转换
  • 构建自助服务API:设计声明式API和控制平面,使推理团队能够通过一次API调用请求、扩展和拆除推理集群,无需工单或人工介入
  • 自动化自愈:检测降级或故障节点,安全地将其排除,触发修复或更换,并自动将健康容量重新引入池中
  • 负责管道的可靠性:实现幂等性、重试、回滚和漂移检测,使配置系统像任何其他生产服务一样可靠
  • 与推理/ML平台团队合作:了解他们所需的集群形态(拓扑、互连、调度约束),并将其作为平台中的一等抽象进行编码
  • 像软件一样进行工程化:对基础设施代码实施强类型、自动化测试、代码审查、版本控制和CI/CD——这是一个产品,而不是Ansible剧本的集合

任职要求

  • 扎实的软件工程背景,精通Go、Python、Rust或类似语言——您以编写和测试真正的软件为生
  • 具有使用Temporal、Cadence或等效的持久工作流编排工具的经验,以运行长生命周期、清单驱动的工作流,这些工作流能在故障后存活并从中断处恢复执行
  • 具有构建软件控制平面或编排系统的经验,这些系统能对状态进行建模并随时间协调状态(例如,Kubernetes控制器/操作器、自定义协调循环、工作流引擎)
  • 具有事件驱动系统的经验——围绕消息队列、事件流或发布/订阅(例如Kafka、NATS、SQS)设计和构建软件,而不是轮询或cron驱动的脚本
  • 具备产品思维。您曾构建过被其他工程团队使用的内部平台或API,并关心所交付产品的开发者体验
  • 加分项:熟悉裸金属配置(PXE/iPXE、Redfish/IPMI、BMC)和/或网络基础知识(VLAN、BGP、网络结构设计),或GPU/加速器

福利待遇

  • 参与构建下一代AI基础设施的核心系统
  • 与顶尖的工程团队合作,解决具有挑战性的技术问题
  • 拥有从设计到运营的端到端所有权
  • 在快速发展的AI领域产生直接影响