高级软件工程师,GPU基础设施生命周期管理
岗位摘要
构建配置状态机:设计并实现软件,对物理主机的完整生命周期(从发现、推理启动、GPU驱动/CUDA堆栈、健康验证到退役/RMA)进行建模,作为显式、版本化的状态和转换;构建自助服务API:设计声明式API和控制平面,使推理团队能够通过一次API调用请求、扩展和拆除推理集群,无需工单或人工介入
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建配置状态机:设计并实现软件,对物理主机的完整生命周期(从发现、推理启动、GPU驱动/CUDA堆栈、健康验证到退役/RMA)进行建模,作为显式、版本化的状态和转换
- 构建自助服务API:设计声明式API和控制平面,使推理团队能够通过一次API调用请求、扩展和拆除推理集群,无需工单或人工介入
- 自动化自愈:检测降级或故障节点,安全地将其排除,触发修复或更换,并自动将健康容量重新引入池中
- 负责管道的可靠性:实现幂等性、重试、回滚和漂移检测,使配置系统像任何其他生产服务一样可靠
- 与推理/ML平台团队合作:了解他们所需的集群形态(拓扑、互连、调度约束),并将其作为平台中的一等抽象进行编码
- 像软件一样进行工程化:对基础设施代码实施强类型、自动化测试、代码审查、版本控制和CI/CD——这是一个产品,而不是Ansible剧本的集合
任职要求
- 扎实的软件工程背景,精通Go、Python、Rust或类似语言——您以编写和测试真正的软件为生
- 具有使用Temporal、Cadence或等效的持久工作流编排工具的经验,以运行长生命周期、清单驱动的工作流,这些工作流能在故障后存活并从中断处恢复执行
- 具有构建软件控制平面或编排系统的经验,这些系统能对状态进行建模并随时间协调状态(例如,Kubernetes控制器/操作器、自定义协调循环、工作流引擎)
- 具有事件驱动系统的经验——围绕消息队列、事件流或发布/订阅(例如Kafka、NATS、SQS)设计和构建软件,而不是轮询或cron驱动的脚本
- 具备产品思维。您曾构建过被其他工程团队使用的内部平台或API,并关心所交付产品的开发者体验
- 加分项:熟悉裸金属配置(PXE/iPXE、Redfish/IPMI、BMC)和/或网络基础知识(VLAN、BGP、网络结构设计),或GPU/加速器
福利待遇
- 参与构建下一代AI基础设施的核心系统
- 与顶尖的工程团队合作,解决具有挑战性的技术问题
- 拥有从设计到运营的端到端所有权
- 在快速发展的AI领域产生直接影响
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。