返回岗位列表

OpenAI

站点可靠性工程师,前沿系统基础设施

地点:美国 薪资:$255K-$490K 日期:2026-01-29

岗位摘要

启动和扩展大型Kubernetes集群,包括自动化配置、引导和集群生命周期管理;构建软件抽象层,统一多个集群并为训练工作负载提供无缝接口;负责从裸机到固件升级的节点启动,确保大规模快速、可重复的部署

岗位职责

  • 启动和扩展大型Kubernetes集群,包括自动化配置、引导和集群生命周期管理
  • 构建软件抽象层,统一多个集群并为训练工作负载提供无缝接口
  • 负责从裸机到固件升级的节点启动,确保大规模快速、可重复的部署
  • 改进操作指标,如减少集群重启时间(例如从几小时缩短到几分钟)和加速固件或操作系统升级周期
  • 集成网络和硬件健康系统,提供跨服务器、交换机和数据中心基础设施的端到端可靠性
  • 开发监控和可观测性系统,及早发现问题并在极端负载下保持集群稳定
  • 需要达到与软件工程师相同的执行水平

任职要求

  • 在大型或高可用性环境中担任基础设施、系统或分布式系统工程师的经验
  • 深入了解Kubernetes内部机制、集群扩展模式和容器化工作负载
  • 精通云基础设施概念(计算、网络、存储、安全)以及自动化集群或数据中心操作
  • 有GPU工作负载、固件管理或高性能计算背景者优先