返回岗位列表

OpenAI

可靠性工程师

地点:美国 薪资:薪资未公开 日期:2025-10-17

岗位摘要

设计和实施解决方案,确保基础设施的可扩展性以满足快速增长的需求;构建和维护负载、混沌及合成测试软件,供开发团队使用,以提升其设计和运营系统的可靠性;构建和维护自动化工具,以简化重复性任务并提高系统可靠性

岗位职责

  • 设计和实施解决方案,确保基础设施的可扩展性以满足快速增长的需求
  • 构建和维护负载、混沌及合成测试软件,供开发团队使用,以提升其设计和运营系统的可靠性
  • 构建和维护自动化工具,以简化重复性任务并提高系统可靠性
  • 构建和维护CPU/存储、GPU及网络生命周期管理平台,以提高效率、明确责任并支持资源的动态优化
  • 实施容错和弹性设计模式,以最小化服务中断
  • 制定和维护服务级别目标(SLO)与服务级别指标(SLI),以衡量和确保系统可靠性
  • 与研究人员、工程师、产品经理和设计师合作,将新功能和研究能力推向世界
  • 参与待命轮班,响应关键事件并确保系统7x24小时可用性

任职要求

  • 拥有通过出色的工具和系统赋能同事、加速工程可靠性的良好记录
  • 具备谦逊的态度、乐于帮助同事的意愿,以及为团队成功不惜一切代价的决心
  • 能够端到端地负责问题,并愿意学习任何所需知识以完成任务
  • 乐于寻找并解决系统中的瓶颈和性能改进领域
  • 运用基础设施即代码(IaC)原则来自动化基础设施配置和配置管理
  • 具备与跨职能团队协作的经验,以确保可靠性和可扩展性被纳入考量