返回岗位列表

OpenAI

培训性能工程师

地点:美国 薪资:$250K-$460K 日期:2026-01-29

岗位摘要

分析端到端训练运行,识别计算、通信和存储中的性能瓶颈;优化大规模分布式模型训练的GPU利用率和吞吐量;与运行时和系统工程师合作,提高内核效率、调度和集体通信性能;实施模型图转换以提高端到端吞吐量

岗位职责

  • 分析端到端训练运行,识别计算、通信和存储中的性能瓶颈
  • 优化大规模分布式模型训练的GPU利用率和吞吐量
  • 与运行时和系统工程师合作,提高内核效率、调度和集体通信性能
  • 实施模型图转换以提高端到端吞吐量
  • 构建工具以监控和可视化集群中的MFU、吞吐量和正常运行时间
  • 与研究人员合作,确保新模型架构在预训练期间高效扩展
  • 参与基础设施决策,提高大型训练作业的可靠性和效率

任职要求

  • 热爱性能优化,深入系统了解每一层的交互
  • 具备Python和C++的扎实编程技能(Rust或CUDA为加分项)
  • 有在多GPU系统或HPC集群上运行分布式训练作业的经验
  • 喜欢调试复杂的分布式系统并严格测量效率
  • 接触过PyTorch、JAX或TensorFlow等框架,了解大规模训练循环的构建方式
  • 能够跨团队协作,将原始分析数据转化为实际的工程改进

加分项

  • 有在多GPU系统或HPC集群上运行分布式训练作业的经验
  • 喜欢调试复杂的分布式系统并严格测量效率
  • 接触过PyTorch、JAX或TensorFlow等框架,了解大规模训练循环的构建方式

福利待遇

  • 提供搬迁援助
  • 混合工作模式(每周三天在办公室)